尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

LiteRT-LM 路线图解读:从 v0.7 到 v0.16 的完整版本演进全景

LiteRT-LM 路线图解读:从 v0.7 到 v0.16 的完整版本演进全景 LiteRT-LM 路线图解读从 v0.7 到 v0.16 的完整版本演进全景【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LMLiteRT-LM 是 Google 开源的生产级端侧 LLM 推理框架用于在 Android、iOS、Web、桌面与 IoT 设备上高性能本地运行 Gemma、Llama、Qwen 等大模型。它已驱动 Chrome、Chromebook Plus 与 Pixel Watch 的端侧 AI 能力。本文带你完整解读 LiteRT-LM 从 v0.7 到 v0.16 的路线图每个版本解决了什么问题、能力如何逐步叠加以及 v0.17 正在开发的下一站方向。 先认识 LiteRT-LM端侧大模型推理的 4 大核心能力在展开版本时间线之前用一张表快速建立整体认知——这也是理解每个版本演进的背景能力说明 跨平台Android、iOS、Web、桌面Linux/macOS/Windows、IoT树莓派 硬件加速GPUWebGPU/Metal/OpenCL与 NPU 加速器️ 多模态支持视觉与音频输入 工具调用Function Calling支撑 Agentic 工作流模型支持Gemma、Llama、Phi-4、Qwen 等主流开源模型。️语言 API仓库内对应源码目录语言状态源码位置Python✅ 稳定python/litert_lm/Kotlin✅ 稳定kotlin/C✅ 稳定c/Swift 早期预览swift/JavaScript (Web) 早期预览js/packages/core/Flutter 社区维护第三方封装️ 版本演进全景一张时间线看懂 v0.7 → v0.16基于 git 标签与官方发布说明10 个版本的演进脉络如下版本发布时间核心更新v0.72025-06Gemma 模型 NPU 加速性能基线确立v0.82025-11/12桌面端 GPU 支持 多模态视觉、音频首次亮相v0.92026-03Function Calling 能力升级应用性能稳定性改进v0.102026 上半年支持 Gemma 4LiteRT-LM CLI 命令行工具首次亮相v0.112026 上半年Gemma 4 MTP 多 token 预测加速CLI 原生支持 Windowsv0.122026 上半年Swift 与 Web JavaScript API 早期预览Flutter 社区支持v0.132026 上半年Gemma4 12B 支持Android Agent 技能OpenAI 兼容 API 服务v0.142026-06Python/CLI 支持 Android实时流式工具调用与 Agentic 能力v0.152026-08-03Apple Foundation Framework 适配config.json统一配置v0.162026-08-11全平台 C API 预编译库实验性 YNNPACK 委托整体演进可以归纳为三个阶段性能与多模态奠基 → 生态扩张 → Agent 化与生产级集成。️ 阶段一v0.7–v0.9性能与多模态奠基v0.7Gemma 模型 NPU 加速端侧性能破局v0.7 是路线图的第一块基石为 Gemma 模型引入NPU 硬件加速。NPU 是专为神经网络设计的芯片单元让端侧推理摆脱纯 CPU 瓶颈为后续所有版本的性能表现打下基础。v0.8桌面 GPU 支持 多模态首次亮相v0.8 带来两个关键能力桌面 GPU 支持Linux、macOS、Windows 桌面端可启用 GPU 加速推理多模态Multi-Modality模型不再只懂文字开始支持视觉与音频输入。下图是仓库中用于视觉前处理测试的示例输入图直观展示了 LiteRT-LM 视觉多模态的输入形态v0.9Function Calling 能力升级v0.9 聚焦**函数调用Function Calling**质量改进与应用性能稳定性——这是后文 Agent 能力v0.14 流式工具调用的前置铺垫。 阶段二v0.10–v0.12CLI 与多语言生态扩张v0.10Gemma 4 支持 LiteRT-LM CLI 首次亮相v0.10 是体验拐点正式部署Gemma 4模型并首次引入LiteRT-LM CLI命令行工具源码位于python/litert_lm_cli/。从此无需写代码两条命令即可在终端跑起本地大模型。v0.11MTP 多 token 预测推理最高约 3 倍加速v0.11 引入面向 Gemma 4 的**单位置多 token 预测MTP**草稿器——官方数据显示推理速度最高可达约 3 倍提升。同时 CLI 扩展到Windows 原生运行CPU/GPU 双后端。v0.12Swift 与 JavaScript API 早期预览v0.12 把 API 版图铺到原生 iOS/macOSSwift与浏览器Web JavaScript并引入社区版 Flutter 支持CLI 在 Linux、macOS、Windows 上补齐完整的 CPU/GPU 后端支持。多语言生态自此成型。 阶段三v0.13–v0.16Agent 能力与生产级集成v0.13Gemma4 12B OpenAI 兼容 API 服务支持更大的Gemma4 12B模型Android 演示应用新增Agent 技能支持见agents/skills/CLI 内置OpenAI API 兼容服务serve命令可无缝对接现有应用Swift 包新增 macOS 支持。v0.14实时流式工具调用Agentic 能力全面落地v0.14 是 Agent 化里程碑实时流式工具调用在 C、Swift、JavaScript 三套 API 中同时启用Python 与 CLI 也落地 Android多模态新增自动后端选择。LiteRT-LM 的工具调用Tool Calling工作流是一个完整闭环——应用声明工具、模型发起调用、应用执行并把结果回传给模型循环直至模型用自然语言作答在工程实现上工具声明经FormatTools格式化后注入提示词模型输出的工具调用字符串由ToMessage解析为标准 JSON 交给应用执行结果再由MessageToTemplateInput格式化回灌模型相关接口文档可参考docs/api/cpp/tool-use.md。v0.15Apple 生态深化 配置集中化v0.15 新增Apple Foundation Framework 适配swift/apple_fm/让 iOS/macOS 应用可直接调用系统级 AI 能力CLI 引入config.json集中配置模式定义见python/litert_lm_cli/config_schema.jsonJavaScript API 增强包含 AutoToolChat 等流式能力。v0.16C API 预编译库全平台原生集成v0.16 主打生产集成发布首个带版本号0.1.0的C API 预编译共享库覆盖全部支持平台开发者无需自行编译即可做语言绑定与原生集成各平台预编译产物统一放在prebuilt/目录含 android、ios、macos、linux、windows 五端。此外为 Linux arm64 启用实验性YNNPACK 委托进一步提升 CPU 推理性能。 前瞻 v0.17LiteRT-LM 下一步去哪里当前仓库开发版本号已推进到v0.17.0见 version.bzl从近期提交记录看下一阶段的四大方向已经清晰方向正在开发的内容结构化输出 / 约束解码将 logit 处理器重构为统一的 Constraint 体系CompositeConstraint、LogitMask配合 llguidance 引擎实现严格符合 JSON Schema 的引导生成Embedding 向量引擎新增 C 与 Python 的 Embedding APICLIserve命令提供 OpenAI/v1/embeddings兼容端点端侧 RAG 闭环调试与可观测性Session/Conversation 调试产物debug artifactsAPI、RuntimeDebugger让端侧推理可看见️模型与 NPU 扩展Qwen3 提示模板与元数据models/qwen3/NPU 组件复用、文件描述符加载与 AOT 编译支持⚡ 快速上手两条命令跑起本地 LLM 推理理解了路线图后立即用 LiteRT-LM CLI 体验当前版本能力uv tool install litert-lm litert-lm run \ --from-huggingface-repogoogle/gemma-3n-E2B-it-litert-lm \ gemma-3n-E2B-it-int4 \ --promptWhat is the capital of France?想深入源码或文档构建指南在docs/getting-started/cmake.md模型转换工具见python/litert_lm_builder/核心运行时在runtime/。 总结一条主线三个阶段回顾 LiteRT-LM 从 v0.7 到 v0.16 的完整演进主线非常清晰v0.7–v0.9奠基NPU 加速、桌面 GPU、多模态与 Function Calling解决能不能跑得又快又全v0.10–v0.12扩张Gemma 4、CLI 工具、MTP 加速与 Swift/JS/Flutter 多语言 API解决好不好用、能不能到处跑v0.13–v0.16生产化Agent 技能、实时流式工具调用、OpenAI 兼容服务与 C API 预编译库解决能不能直接进生产。随着 v0.17 聚焦结构化输出与端侧 EmbeddingLiteRT-LM 正在从端侧跑 LLM走向端侧完整的 AI Agent 运行时——这正是这条路线图最值得关注的下一步。【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表