下午想挑个 Agent 模型定稿,顺手开了两个榜单页对比,结果被整不会了——同一个 Claude,一个站点给到 69.2% 的 SWE-bench Pro 分数,另一个标准化榜单上最高的 Claude 也才 51.9%。差了整整 17 个点,两个都是"诚实上报的真实数字",没有谁造假。我盯着屏幕愣了几秒,脑子里只有一个念头:那我到底该信哪张表?

这不是我第一次踩这个坑,但这次我决定把这笔烂账从头捋一遍。为啥同一个模型在同一年、同一个 benchmark 上,能差出将近 20 分?大模型榜单到底哪一环出了问题?

问题出在一个被大多数人忽略的环节——测评口径的分叉。SWE-bench 系的评测看着标准统一,实际在三个地方悄悄分家:任务集是 filtered(人工筛过)还是 complete(全量)、评测用的基座严格度不一样、判定器(验证器)对"修复是否通过"的判别松紧不同。这有点像两张卷子都是"100 分制",可一张评分标准宽,一张开头五道题还不一样,最后的分数自然没法比。很多排行把它做成一个"总分"摆出来,恰恰把最关键的口径差异给抹掉了。

而比口径更糟的,是评测方开始自己动权重。有网友扒过著名评测平台 Artificial Analysis 的调整动作:开源模型 Qwen 3.8 max 一度登顶 Agentic 智能体指数第一,平台随后发布调权后的 v4.1.1 版本,排名就变了。你说这是"更科学的修正"还是"为了榜单自洽做的回归",见仁见智。但一个残酷的事实是:榜单发布方既是运动员又是裁判,权重怎么调、调完发不发,几乎没有外部约束。这类事件多了以后,榜单在你心里就成了"某个组织想让你看到的排名",而不是"模型真实能力的客观投影"。

再往深一层,连榜单最底层的题目都在老化。SWE-bench Verified 当年被捧上神坛,是因为它足够"真实"、贴近工程。可到 2026 年,公开 GitHub 的修复方案大概率已经被模型在预训练阶段吃进去了,数据污染只是时间问题;测试用例又只能验证那一个参考修复,真. 工程里"多解"的场景它根本测不到。所以今年业内已经在往"原创、长周期、真实 Agent 工作流"的方向转,比如 7 月发布的 DeepSWE——113 个原创长周期软件工程任务,跨 91 个活跃开源仓、5 种语言,用人工编写的验证器判分。方向是对的,但代价是评测成本暴涨,能认真做的机构反而是少数。

这让我想起早年做 CI 时的经验:没有哪条流水线是"测的越多越好",关键是搞清楚你在测什么。大模型榜单的初心我们没忘——它是开发者做技术选型的第一道筛子,帮你在几十个模型里快速圈出候选。但把它当成"官方的最终裁决",就是本末倒置。我现在更愿意把榜单读成"证据"而不是"排名":同一张榜单里横向比、同口径下看趋势,比拿不同榜单的绝对分去跨表断高下靠谱得多。

那你平时挑模型,榜单和实测到底信哪个?你遇到过两张榜单对同一个模型给出完全相反结论的情况吗?欢迎评论区说说你踩过的坑。

更多推荐