Kimi K3 发布那周,3万亿参数的新闻铺满了科技媒体,各种 benchmark 数字看得人眼花缭乱。每次新模型出来都会带一串分数,MMLU 90+、GSM8K 95+、HumanEval 超越 GPT-4,但真正拿到手里用的时候,体感和跑分之间总有一段说不清的距离。

这段距离不是模型虚标,也不是用户错觉,它来自 benchmark 本身的测量边界。

MMLU 覆盖57个学科的选择题,从高中数学到法学到医学都有,它确实能反映一个模型的知识广度和选择题作答能力,但它不测长文本连贯性,不测多轮对话里的上下文保持,不测指令遵循在边缘 case 下的稳定性。GSM8K 和 MATH 测数学推理链,chain-of-thought 能力强的模型在这两个榜上分数好看,可真实工作中遇到的数学问题从来不是"小明有三个苹果"那样条件清晰的格式,条件是模糊的、信息是冗余的、你甚至要先判断该不该算。HumanEval 给一个函数签名和 docstring 让模型补全实现,函数体通常不到20行,输入输出定义明确,这和工程师日常面对的"读三万行代码找到 bug 再决定怎么改"之间,差了好几个量级。SWE-bench 在这方面进了一步,给真实 GitHub issue 让模型生成 patch,但它提供的是干净的 issue 描述和完整代码上下文,不需要你自己去复现问题,不需要和人讨论需求边界,不需要考虑改动的连锁影响。

我们在做 Mano-P 的过程中对这个问题有比较直接的感受。Mano-P 是跑在端侧的 GUI-VLA 模型,核心 benchmark 是 OSWorld,测试 GUI Agent 能否在真实桌面环境里完成指定操作。目前 Mano-P 在 OSWorld 专项榜上以 58.2% 的成功率排名第一,比第二名 opencua-72b 的 45.0% 高出13.2个百分点;WebRetriever Protocol I 上是41.7 NavEval,超过 Gemini 2.5 Pro Computer Use 的40.9和 Claude 4.5 Computer Use 的31.3。这些数字是真实的、可复现的,但我们内部评估的时候从来不会只看这两个数。OSWorld 的任务是预设的,环境是干净的,不会突然弹出系统通知,不会遇到网络超时,不会出现应用闪退,而这些情况在真实使用中每天都在发生。

benchmark 污染是另一个行业里公开讨论多年但很少在发布稿里被提及的问题。测试集公开之后,训练数据爬取过程中很容易把 benchmark 题目和答案一起包含进去,模型不是在推理,是在复述。Hugging Face Open LLM Leaderboard 过去两年做过多次测试集更新,每次换题之后之前霸榜的模型都会出现不同程度的分数回落,这个现象本身就说明了问题。判断污染没有绝对标准,但有几个经验信号:某个 benchmark 发布半年后分数集体暴涨且涨幅远超同期模型能力的自然提升曲线,通常意味着测试题已进入训练数据;一个模型在标准集上分数极高,但换一种表述方式或稍微变形题目后表现骤降,往往说明它对原题有记忆。LiveCodeBench 这类持续更新题目的榜单之所以被业内更看重,原因就在这里——题目一直在换,污染窗口短,分数更接近真实能力。

端侧模型的 benchmark 解读还多了一层硬件依赖。同样的模型、同样的量化方案,跑在 A100 上和跑在 M4 Mac mini 上是完全不同的速度和体验,内存占用差一个 GB 就可能决定它能不能在用户的设备上跑起来。Mano-P 的4B模型配合 Cider SDK 做 W8A8 激活量化,在 M5 Pro 上 prefill 比 MLX W4A16 基线快1.4到2.2倍,但这组数字换到 M3 或 Intel 芯片上参考价值就很有限。端侧场景下 tokens/s 和峰值内存往往比成功率更直接地影响用户体感——一个响应快但偶尔出错的 Agent,很多时候比一个慢三秒才给出完美结果的 Agent 更实用,因为前者的交互节奏接近人的操作习惯。

SWE-bench 看 Verified 子集比看完整版靠谱,完整版里有大量标注噪音。MMLU 不要只看总分,STEM 分项和人文分项拆开看差异会很大,一个文科拉分的模型和一个理科拉分的模型适用场景完全不同。OSWorld 这种领域专项榜要区分 specialized 和 general 两个类别,Claude Computer Use 在综合榜上72.1%的成绩是云端 API 大模型跑出来的,和端侧专项模型放在同一个数字里比较意义不大。LMSYS Chatbot Arena 用 ELO 对战制,人工偏好投票,比单一客观题测试更能反映对话体验,但它的局限在于评分者的偏好本身带有主观性。

  • 我们团队内部评估模型用三层方式:先看相关 benchmark 做初筛,只看和目标场景直接对应的那些榜单;然后用自建的 eval set 跑一轮,题目来自真实业务场景,50到100条,覆盖不同难度,按人工标注的标准判定合格与否;最后小范围试用一周,收集实际使用中的反馈。自建测试集这一步尤其重要,Mano-P 除了跑公开的 OSWorld,内部一直维护着一套中文界面和本地化应用的测试集,里面大量是企业软件场景和中文交互流程,这些在公开 benchmark 里几乎没有覆盖。

benchmark 是标准化测量工具,它在自己的设计范围内是有效的,超出范围就不具备参考价值。它能帮你快速筛掉明显不行的模型,但不能替你做最终判断。拿真实任务跑半天,得到的信息比看一周排行榜要多。

更多推荐