LiteRT-LM 上手指南语言模型边缘推理库在手机上实测有多快【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LMLiteRT-LM 是谷歌开源的语言模型边缘推理库让你把大语言模型直接跑在手机、电脑甚至树莓派上不用依赖云端 API。本文用官方实测数据帮你判断速度够不够用并说清上手前要注意的限制适合想本地跑大模型的开发者。为什么要在自己设备上跑模型以前想在应用里用上大模型基本只有两条路调云端 API或者自己搭一套推理环境。前者每次请求都等网络往返、按量计费代码和聊天记录还得离开你的设备后者配置麻烦普通项目用不起。LiteRT-LM 就是来解决这个问题的。它把模型加载、推理调度、硬件加速这些脏活累活都包了你拿到一个现成的.litertlm模型文件就能直接跑数据全程留在本地。它基于 LiteRT可以理解为谷歌的轻量级模型运行时做编排模型文件里打包了推理所需的全部组件量化版本还能进一步压缩体积。实测有多快官方数据速览先说结论小模型在端侧的速度完全够用GPU 主要加速预填充一次性处理输入文本的阶段解码逐字生成输出提升有限。模型设备后端预填充 tokens/秒解码 tokens/秒Gemma3-1BM3 MacBook ProCPU603.883.0Gemma3-1B三星 S24 UltraGPU2369.052.5Gemma3n-E2BM3 MacBook ProCPU232.527.6Gemma3n-E2B三星 S24 UltraGPU816.415.6Gemma3n-E4B三星 S24 UltraGPU548.09.4几个可以直接带走的判断1B 小模型在手机 CPU 上就能跑出每秒 50 字的解码速度日常对话场景没问题。4B 级别的模型手机上解码约每秒 9 字能看但别指望秒回。想再快一点可以开 MTP 多 token 预测草稿器官方称推理速度最高能提升 3 倍。哪些设备、哪些场景能用平台覆盖广Android、iOS、Web、桌面macOS / Windows / Linux和树莓派这类 IoT 设备都能跑。硬件加速GPU 和 NPU 都能用同一份模型在不同设备上自动挑合适的后端。多模态除了文本还支持图片、音频输入仓库里甚至带了语音识别和 TTS 的实验模块。工具调用内置 function calling 支持模型能直接调你应用里的函数做本地 Agent 不用绕云端。多语言 APIC、Python、Kotlin 已稳定Swift、JavaScript 处于早期预览还有社区维护的 Flutter 绑定。手机端实际跑起来大致是这个效果仓库自带的 Android 演示动画想深入看源码的话运行时核心代码、Python 封装、支持的模型模板 都在仓库里目录结构很清晰。上手前要知道的事最快上手方式是 CLI两行命令就能跑通不用写代码uv tool install litert-lm装好工具再用litert-lm run加上 Hugging Face 仓库名和一句话提示词即可。模型支持是精选制目前覆盖 Gemma、Gemma3n、Qwen、Llama、Phi-4 等家族不是所有模型都能直接塞进去用之前先确认你的模型在支持列表里。API 成熟度分档Python、Kotlin、C 是稳定版Swift 和 JavaScript 还是早期预览生产环境用它们要留好踩坑时间。项目本身很成熟它已经在 Chrome、Chromebook Plus、Pixel Watch 这些谷歌产品上跑着不算实验性玩具但个别后端比如 NPU 路径还在迭代遇到兼容问题先看发行说明。总的来说如果你的需求是数据不出设备、离线可用、按自己的节奏迭代LiteRT-LM 是目前端侧跑语言模型最省事的路线之一。先用 CLI 跑一个小模型试试速度比看十篇文章都直观。【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
