尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

LiteRT-LM 模型评估实战指南:一条命令对接 lm-evaluation-harness 拿下完整基准分数

LiteRT-LM 模型评估实战指南:一条命令对接 lm-evaluation-harness 拿下完整基准分数 LiteRT-LM 模型评估实战指南一条命令对接 lm-evaluation-harness 拿下完整基准分数【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LMLiteRT-LM 是 Google 开源的、面向边缘设备的生产级大语言模型LLM推理框架。其内置的评估工具litert_lm_eval可以直接对接业界标准的lm-evaluation-harness基准框架让你用一条命令就能在端侧.litertlm模型上运行 MMLU、GSM8K 等评测任务快速量化端侧大模型的能力。本文带你完成 LiteRT-LM 对接 lm-evaluation-harness 的完整实战流程。一、为什么端侧 LLM 需要 litert_lm_eval云端大模型评测工具五花八门但 LiteRT-LM 打包后的端侧模型一直没有统一、好用的评测入口。litert_lm_eval正是为此设计的统一评估入口统一参数不同评测框架的命令行参数各不相同它提供一套固定参数模型路径、任务列表、后端等降低上手成本框架无感解析统一参数后自动映射到底层框架所需参数并委托执行目前默认对接lm-evaluation-harness端侧友好支持 CPU / GPU 后端自动套用模型的 chat template甚至支持多模态图片输入入口脚本位于 python/litert_lm_eval/litert_lm_eval.py核心逻辑只有 150 行左右非常适合阅读。LiteRT-LM 端侧大语言模型Edge LLM的工具调用流程图体现其在边缘设备上的推理能力二、对接 lm-evaluation-harness 前的 3 项准备✅第 1 步获取 LiteRT-LM 源码git clone https://gitcode.com/GitHub_Trending/li/LiteRT-LM✅第 2 步准备一个 .litertlm 模型文件评估对象是 LiteRT-LM 格式的模型文件扩展名.litertlm。如果手上只有 Hugging Face 上的原始模型可以先用项目内置的构建工具转换构建逻辑位于python/litert_lm_builder/目录。✅第 3 步确认 Python 依赖评估依赖业界标准的 lm-evaluation-harness包名lm-eval。项目根目录的requirements.txt已锁定版本lm-eval0.4.11按该文件安装即可保证行为一致。三、快速上手一条命令跑 MMLU 与 GSM8K准备好模型后在项目根目录执行参数直接来自官方入口脚本的用法说明bazel run //python/litert_lm_eval:litert_lm_eval \ --model-path /path/to/model.litertlm \ --tasks mmlu,gsm8k \ --backend CPU \ --output-path /path/to/save/results.json \ --apply-chat-template 执行成功后评测结果会以 JSON 格式打印在控制台并自动写入--output-path指定的文件方便后续对比不同模型、不同后端的分数。 提示--apply-chat-template是必带参数。因为 LiteRT-LM 的对话引擎内部会统一处理会话格式并自动套用模型自带的 chat template评估入口会强制校验该开关。四、常用参数速查表参数说明示例--model-path模型文件路径必填/path/to/model.litertlm--tasks任务列表逗号分隔必填mmlu,gsm8k--backend推理后端默认 CPUCPU/GPU--num-fewshotFew-shot 示例数量5--limit每个任务的样本数支持整数或比例调试神器10/0.1--framework-args透传给模型构造函数的逃生舱参数limit10--output-path结果 JSON 保存路径results.json--apply-chat-template启用 chat template必须为 True—五、用 framework-args 逃生舱做快速调试不想改动代码、又要临时传参数--framework-args就是你的快速配置方法——它以keyvalue形式透传给底层模型构造函数bazel run //python/litert_lm_eval:litert_lm_eval \ --model-path /path/to/model.litertlm \ --tasks mmlu \ --framework-args max_length1024,vision_backendGPU \ --apply-chat-template例如可以透传max_length控制生成长度或用vision_backendGPU为视觉任务单独指定 GPU 后端。其余未识别的参数如--write_out也会被python/litert_lm_eval/utils.py中的工具函数自动解析并转发给simple_evaluate基本覆盖了 lm-evaluation-harness 的常用能力。六、原理拆解评分与生成两条链路适配层的核心是python/litert_lm_eval/runners/lm_eval_runner/litert_lm_model.py。它通过register_model(litert_lm)向 harness 注册了一个名为litert_lm的模型运行器内部封装了 LiteRT-LM 的 Python APILiteRT-LM 模型LLM工具格式与解析流程示意展示推理框架的内部处理能力打分链路loglikelihoodMMLU 这类选择题走打分路径——先run_prefill构建上下文再调用run_text_scoring计算选项的 log 概率并自动缓存重复上下文以加速生成链路generate_untilGSM8K 这类开放问答走生成路径——通过Conversation接口发送消息并按任务的until停止序列截断输出多模态支持文本中的image占位符会被自动替换为真实图片数据支持图文混合评测七、常见问题 FAQQ1为什么--apply-chat-template必须设置入口脚本会assert校验该参数。LiteRT-LM 运行器内部统一处理会话格式评估时必须保持开启否则任务格式会错位。Q2完整跑一轮 MMLU 太慢怎么办加--limit 10只抽 10 条样本或加--framework-args limit0.1跑 10% 的数据非常适合回归验证。Q3GPU 后端可用吗可用--backend GPU即可如需视觉任务单独走 GPU通过--framework-args vision_backendGPU指定。Q4per-token 逐词概率评测支持吗loglikelihood_rolling暂未实现源码中抛出NotImplementedError等待逐 token logprob 能力开放MMLU、GSM8K 等主流任务不受影响。八、总结相关文件清单模块作用python/litert_lm_eval/litert_lm_eval.py统一评估入口解析参数并委托 lm-evaluation-harnesspython/litert_lm_eval/runners/lm_eval_runner/litert_lm_model.pylitert_lm模型运行器实现打分/生成/多模态链路python/litert_lm_eval/utils.py命令行参数解析工具python/litert_lm_builder/模型构建工具产出.litertlm文件requirements.txtPython 依赖清单含lm-eval一句话回顾litert_lm_eval让端侧 LLM 评测变得和云端一样简单——一条bazel run命令、统一参数、JSON 出分。现在就可以给你的端侧模型做一次完整的体检用数据说话吧【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表