别再被跑分骗了:大模型 Benchmark 到底在考什么
Kimi K3 发布那周3万亿参数的新闻铺满了科技媒体各种 benchmark 数字看得人眼花缭乱。每次新模型出来都会带一串分数MMLU 90、GSM8K 95、HumanEval 超越 GPT-4但真正拿到手里用的时候体感和跑分之间总有一段说不清的距离。这段距离不是模型虚标也不是用户错觉它来自 benchmark 本身的测量边界。MMLU 覆盖57个学科的选择题从高中数学到法学到医学都有它确实能反映一个模型的知识广度和选择题作答能力但它不测长文本连贯性不测多轮对话里的上下文保持不测指令遵循在边缘 case 下的稳定性。GSM8K 和 MATH 测数学推理链chain-of-thought 能力强的模型在这两个榜上分数好看可真实工作中遇到的数学问题从来不是小明有三个苹果那样条件清晰的格式条件是模糊的、信息是冗余的、你甚至要先判断该不该算。HumanEval 给一个函数签名和 docstring 让模型补全实现函数体通常不到20行输入输出定义明确这和工程师日常面对的读三万行代码找到 bug 再决定怎么改之间差了好几个量级。SWE-bench 在这方面进了一步给真实 GitHub issue 让模型生成 patch但它提供的是干净的 issue 描述和完整代码上下文不需要你自己去复现问题不需要和人讨论需求边界不需要考虑改动的连锁影响。我们在做 Mano-P 的过程中对这个问题有比较直接的感受。Mano-P 是跑在端侧的 GUI-VLA 模型核心 benchmark 是 OSWorld测试 GUI Agent 能否在真实桌面环境里完成指定操作。目前 Mano-P 在 OSWorld 专项榜上以 58.2% 的成功率排名第一比第二名 opencua-72b 的 45.0% 高出13.2个百分点WebRetriever Protocol I 上是41.7 NavEval超过 Gemini 2.5 Pro Computer Use 的40.9和 Claude 4.5 Computer Use 的31.3。这些数字是真实的、可复现的但我们内部评估的时候从来不会只看这两个数。OSWorld 的任务是预设的环境是干净的不会突然弹出系统通知不会遇到网络超时不会出现应用闪退而这些情况在真实使用中每天都在发生。benchmark 污染是另一个行业里公开讨论多年但很少在发布稿里被提及的问题。测试集公开之后训练数据爬取过程中很容易把 benchmark 题目和答案一起包含进去模型不是在推理是在复述。Hugging Face Open LLM Leaderboard 过去两年做过多次测试集更新每次换题之后之前霸榜的模型都会出现不同程度的分数回落这个现象本身就说明了问题。判断污染没有绝对标准但有几个经验信号某个 benchmark 发布半年后分数集体暴涨且涨幅远超同期模型能力的自然提升曲线通常意味着测试题已进入训练数据一个模型在标准集上分数极高但换一种表述方式或稍微变形题目后表现骤降往往说明它对原题有记忆。LiveCodeBench 这类持续更新题目的榜单之所以被业内更看重原因就在这里——题目一直在换污染窗口短分数更接近真实能力。端侧模型的 benchmark 解读还多了一层硬件依赖。同样的模型、同样的量化方案跑在 A100 上和跑在 M4 Mac mini 上是完全不同的速度和体验内存占用差一个 GB 就可能决定它能不能在用户的设备上跑起来。Mano-P 的4B模型配合 Cider SDK 做 W8A8 激活量化在 M5 Pro 上 prefill 比 MLX W4A16 基线快1.4到2.2倍但这组数字换到 M3 或 Intel 芯片上参考价值就很有限。端侧场景下 tokens/s 和峰值内存往往比成功率更直接地影响用户体感——一个响应快但偶尔出错的 Agent很多时候比一个慢三秒才给出完美结果的 Agent 更实用因为前者的交互节奏接近人的操作习惯。SWE-bench 看 Verified 子集比看完整版靠谱完整版里有大量标注噪音。MMLU 不要只看总分STEM 分项和人文分项拆开看差异会很大一个文科拉分的模型和一个理科拉分的模型适用场景完全不同。OSWorld 这种领域专项榜要区分 specialized 和 general 两个类别Claude Computer Use 在综合榜上72.1%的成绩是云端 API 大模型跑出来的和端侧专项模型放在同一个数字里比较意义不大。LMSYS Chatbot Arena 用 ELO 对战制人工偏好投票比单一客观题测试更能反映对话体验但它的局限在于评分者的偏好本身带有主观性。我们团队内部评估模型用三层方式先看相关 benchmark 做初筛只看和目标场景直接对应的那些榜单然后用自建的 eval set 跑一轮题目来自真实业务场景50到100条覆盖不同难度按人工标注的标准判定合格与否最后小范围试用一周收集实际使用中的反馈。自建测试集这一步尤其重要Mano-P 除了跑公开的 OSWorld内部一直维护着一套中文界面和本地化应用的测试集里面大量是企业软件场景和中文交互流程这些在公开 benchmark 里几乎没有覆盖。benchmark 是标准化测量工具它在自己的设计范围内是有效的超出范围就不具备参考价值。它能帮你快速筛掉明显不行的模型但不能替你做最终判断。拿真实任务跑半天得到的信息比看一周排行榜要多。Mano-P 代码和模型权重在 GitHub 开源https://github.com/Mininglamp-AI/Mano-P OSWorld 和 WebRetriever 的成绩都可以复现。