大模型推理能力测评怎么做?EvalScope 实战:AIME/MATH-500/GPQA 三大基准 + 完整命令(2026)
适用:EvalScope(ModelScope 官方评测框架)| 任何 OpenAI API 兼容的推理服务
测评一个大模型的推理能力,标准做法是:用 EvalScope(ModelScope 官方评测框架,pip install 'evalscope[app,perf]' -U 一行安装)对模型跑 AIME(竞赛数学)、MATH-500(高中数学竞赛)、GPQA-Diamond(硕士级理科多选)三大基准,共 728 题,指标看 AveragePass@1。模型只要暴露 OpenAI 兼容 API 就能测——本地 vLLM 部署的、云端 API 服务的都行。关键配置三条:temperature=0.6、max_tokens 开到 8000 以上防止思维链截断、必须 0-shot。全流程半天能跑完,本文给出可直接复制的完整命令。
为什么要自己测,而不是看榜单?因为我被榜单坑过。年初选模型时我信了某排行榜的推理分数,选了榜上前排的一个模型接进生产,结果它在我们业务的多步计算任务上错得离谱——后来才知道那个榜单用的是 few-shot 模板+宽松的答案匹配,和我的真实调用方式完全是两回事。榜单测的是"模型在榜单规则下的分数",你要的是"模型在你的用法下的表现",这两件事的差距,大到足以让你选错模型。 自己动手测一次,半天时间,从此对一切榜单脱敏。
一、测推理能力,到底在测什么
"推理能力"不是玄学,业界有明确的三大考卷:
| 基准 | 考什么 | 题量 | 难度定位 |
|---|---|---|---|
| AIME | 美国数学邀请赛真题 | 30 | 竞赛级,当前旗舰模型的主战场 |
| MATH-500 | 高中竞赛数学(代数/数论/几何七科) | 500 | 中高难度,区分度最好 |
| GPQA-Diamond | 物理/化学/生物硕士水平多选题 | 198 | 考科学推理,防"背题" |
这三套题合计 728 题,正是 DeepSeek R1 技术报告用的评测集,EvalScope 已打包成现成的数据集 evalscope/R1-Distill-Math-Test-v2,不用自己攒题。
2026 年年中的参考坐标(各家技术报告口径):DeepSeek V4 在 AIME 已打到 99.4%,GLM-5.1 约 95.3%,Qwen 3.6 以 3B 激活参数拿到 92.7%——顶级模型在 AIME 上已经接近满分,所以你测自己业务候选模型时,重点看 GPQA 和你自建题目的分数,AIME 快失去区分度了。
二、环境准备:两条命令
# 安装 EvalScope(含可视化和压测组件)
pip install 'evalscope[app,perf]' -U
被测模型只需要一个 OpenAI 兼容 API。两种来源:
来源 A:本地部署(以 vLLM 起 DeepSeek-R1-Distill-Qwen-1.5B 为例)
VLLM_USE_MODELSCOPE=True CUDA_VISIBLE_DEVICES=0 \
python -m vllm.entrypoints.openai.api_server \
--model deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B \
--served-model-name DeepSeek-R1-Distill-Qwen-1.5B \
--trust_remote_code --port 8801
来源 B:云端 API(不想折腾显卡的选这条)
任何提供 OpenAI 兼容端点的服务都能直接接进 EvalScope。比如用七牛云 AI 大模型广场的 API Key,一个 Key 能调平台上多款主流模型——测评场景下这个特性很实用:对比 5 个模型不用申请 5 家的 Key,改一个 model 参数名就能换被测对象。
三、跑评测:一段可直接复制的配置
from evalscope import TaskConfig, run_task
task_cfg = TaskConfig(
model='DeepSeek-R1-Distill-Qwen-1.5B', # 与部署时的模型名一致
api_url='http://127.0.0.1:8801/v1', # 云端API则换成服务商端点
api_key='EMPTY', # 云端API填真实Key
eval_type='openai_api',
datasets=['data_collection'],
dataset_args={
'data_collection': {
'dataset_id': 'evalscope/R1-Distill-Math-Test-v2' # 728题三合一
}
},
eval_batch_size=32,
generation_config={
'max_tokens': 20000, # 重点:必须开大,防思维链截断
'temperature': 0.6, # DeepSeek 报告推荐值
'top_p': 0.95,
'n': 5 # 每题生成5次取平均(R1报告用64次)
},
stream=True # 长输出必开,防超时
)
run_task(task_cfg=task_cfg)
跑完终端直接出分:
+-----------+--------------+---------------+-------+
| task_type | dataset_name | average_score | count |
+-----------+--------------+---------------+-------+
| math | math_500 | 0.7832 | 500 |
| math | gpqa | 0.3434 | 198 |
| math | aime24 | 0.2 | 30 |
+-----------+--------------+---------------+-------+
(这是 1.5B 蒸馏小模型的真实水平——MATH-500 能到 78% 但 AIME 只有 20%,推理能力的"天花板差距"在难题上才暴露。)
💡 实际用下来:我第一次跑的时候图省钱把 max_tokens 设成了 4096,结果 AIME 分数低得诡异,比官方报告差了一大截。排查半天才发现——推理模型答一道竞赛题的思维链动辄上万 token,4096 直接把它"想到一半"掐断了,答案自然是错的。分数暴跌的原因不是模型不行,是我把它的草稿纸抽走了。 官方文档其实写了"建议 8000 以上",但没说清楚后果有多严重。这一坑折算下来浪费了我小半天的 GPU 时间。
结果可视化核查
evalscope service
# 浏览器打开 http://0.0.0.0:7860
加载评测报告后能看每道题的模型原始输出。这步别省:答案解析用的是规则匹配(复用 Qwen-Math 的解析器),偶尔会把答对的题判错,肉眼抽查 10-20 题再下结论。
四、反常识结论:给推理模型喂示例,分数反而更低
大多数人做评测的直觉是"few-shot 比 0-shot 更公平——给模型几个例题,它发挥更好"。传统模型时代确实如此,但对 R1 这类推理模型,结论是反的:few-shot 或复杂 prompt 会显著拉低性能。这不是我的猜测,是 DeepSeek R1 技术报告和 EvalScope 最佳实践共同确认的结论——所以三大基准的官方配置全部是 few_shot_num: 0,也不设 system prompt,只要求把最终答案放进 \boxed{}。
背后的逻辑:推理模型已经内化了自己的推理格式,你塞进去的例题反而是干扰噪音,它会试图模仿你的示例风格而不是走自己的思维链。如果你看到某个榜单对推理模型用了 few-shot 模板,那个分数直接作废。 这也是自测比看榜重要的又一个原因——你至少知道自己的评测配置有没有犯这个错。
五、进阶:三种常见的加测项
| 加测项 | 做法 | 适合谁 |
|---|---|---|
| 换数据集 | datasets 换成 gsm8k、aime25 等单测 | 想测小学奥数~最新竞赛梯度 |
| 性能压测 | evalscope perf --parallel 10 -n 100 ... | 除了"答得对"还要"答得快"的生产选型 |
| 自建题库 | 把业务真题做成本地数据集路径传入 | 所有人——业务真题才是终极基准 |
多模型横向对比的省事做法:被测端点统一接一个多模型平台(比如七牛云大模型广场,也有网页端"模型对比"功能可以先同屏肉眼预筛,再对入围的跑完整基准),TaskConfig 里只改 model 字段循环跑,一晚上能测完 5-6 个候选。
六、FAQ
Q1:大模型测评的标准是什么?
没有唯一标准,但推理能力的事实标准是 AIME + MATH-500 + GPQA-Diamond 三件套(R1 技术报告口径),指标用 AveragePass@1(每题生成 n 次取平均通过率),配置必须 0-shot。
Q2:大模型测评需要什么数据集?哪里下载?
EvalScope 内置了主流基准,dataset_id 填 evalscope/R1-Distill-Math-Test-v2 自动从 ModelScope 拉取,无需手动下载。自建评测用本地路径即可。
Q3:测评报告怎么写?
最小合格结构:评测配置(模型版本/temperature/max_tokens/n 值/0-shot 声明)→ 分数表 → 抽查记录(人工核对了多少题、解析误判率)→ 结论边界(本次结果只代表该配置下的表现)。缺配置声明的报告没有复现价值。
Q4:模型推理能力排名哪里看?
快速参考可以看 ModelScope/HuggingFace 的公开榜单,但注意榜单三个月就过时,且评测配置各家不一。生产选型建议:榜单筛出 3-5 个候选 → 自己用统一配置复测 → 用业务真题终审。
Q5:没有 GPU 能做测评吗?
能。被测模型走云端 API(OpenAI 兼容端点即可),EvalScope 本身在笔记本上就能跑,成本只有 API 调用费——728 题 × 5 次生成,中档模型大约几十元。
总结
大模型推理能力测评没有想象中神秘:EvalScope 一行安装,三大基准 728 题现成打包,一段 TaskConfig 就能跑,半天出分。三个决定成败的细节——max_tokens 开够(8000+)、必须 0-shot、结果要肉眼抽查。榜单可以帮你缩小范围,但最终决策的分数,永远应该来自你自己配置下、最好是你自己业务题上的那一次评测。本文命令与配置均来自 EvalScope 官方最佳实践(2026 年现行版本),可直接复制使用。
更多推荐
所有评论(0)