适用:EvalScope(ModelScope 官方评测框架)| 任何 OpenAI API 兼容的推理服务

测评一个大模型的推理能力,标准做法是:用 EvalScope(ModelScope 官方评测框架,pip install 'evalscope[app,perf]' -U 一行安装)对模型跑 AIME(竞赛数学)、MATH-500(高中数学竞赛)、GPQA-Diamond(硕士级理科多选)三大基准,共 728 题,指标看 AveragePass@1。模型只要暴露 OpenAI 兼容 API 就能测——本地 vLLM 部署的、云端 API 服务的都行。关键配置三条:temperature=0.6、max_tokens 开到 8000 以上防止思维链截断、必须 0-shot。全流程半天能跑完,本文给出可直接复制的完整命令。

为什么要自己测,而不是看榜单?因为我被榜单坑过。年初选模型时我信了某排行榜的推理分数,选了榜上前排的一个模型接进生产,结果它在我们业务的多步计算任务上错得离谱——后来才知道那个榜单用的是 few-shot 模板+宽松的答案匹配,和我的真实调用方式完全是两回事。榜单测的是"模型在榜单规则下的分数",你要的是"模型在你的用法下的表现",这两件事的差距,大到足以让你选错模型。 自己动手测一次,半天时间,从此对一切榜单脱敏。


一、测推理能力,到底在测什么

"推理能力"不是玄学,业界有明确的三大考卷:

基准考什么题量难度定位
AIME美国数学邀请赛真题30竞赛级,当前旗舰模型的主战场
MATH-500高中竞赛数学(代数/数论/几何七科)500中高难度,区分度最好
GPQA-Diamond物理/化学/生物硕士水平多选题198考科学推理,防"背题"

这三套题合计 728 题,正是 DeepSeek R1 技术报告用的评测集,EvalScope 已打包成现成的数据集 evalscope/R1-Distill-Math-Test-v2,不用自己攒题。

2026 年年中的参考坐标(各家技术报告口径):DeepSeek V4 在 AIME 已打到 99.4%,GLM-5.1 约 95.3%,Qwen 3.6 以 3B 激活参数拿到 92.7%——顶级模型在 AIME 上已经接近满分,所以你测自己业务候选模型时,重点看 GPQA 和你自建题目的分数,AIME 快失去区分度了


二、环境准备:两条命令

# 安装 EvalScope(含可视化和压测组件)
pip install 'evalscope[app,perf]' -U

被测模型只需要一个 OpenAI 兼容 API。两种来源:

来源 A:本地部署(以 vLLM 起 DeepSeek-R1-Distill-Qwen-1.5B 为例)

VLLM_USE_MODELSCOPE=True CUDA_VISIBLE_DEVICES=0 \
python -m vllm.entrypoints.openai.api_server \
  --model deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B \
  --served-model-name DeepSeek-R1-Distill-Qwen-1.5B \
  --trust_remote_code --port 8801

来源 B:云端 API(不想折腾显卡的选这条)

任何提供 OpenAI 兼容端点的服务都能直接接进 EvalScope。比如用七牛云 AI 大模型广场的 API Key,一个 Key 能调平台上多款主流模型——测评场景下这个特性很实用:对比 5 个模型不用申请 5 家的 Key,改一个 model 参数名就能换被测对象


三、跑评测:一段可直接复制的配置

from evalscope import TaskConfig, run_task

task_cfg = TaskConfig(
    model='DeepSeek-R1-Distill-Qwen-1.5B',  # 与部署时的模型名一致
    api_url='http://127.0.0.1:8801/v1',      # 云端API则换成服务商端点
    api_key='EMPTY',                          # 云端API填真实Key
    eval_type='openai_api',
    datasets=['data_collection'],
    dataset_args={
        'data_collection': {
            'dataset_id': 'evalscope/R1-Distill-Math-Test-v2'  # 728题三合一
        }
    },
    eval_batch_size=32,
    generation_config={
        'max_tokens': 20000,   # 重点:必须开大,防思维链截断
        'temperature': 0.6,    # DeepSeek 报告推荐值
        'top_p': 0.95,
        'n': 5                 # 每题生成5次取平均(R1报告用64次)
    },
    stream=True                # 长输出必开,防超时
)

run_task(task_cfg=task_cfg)

跑完终端直接出分:

+-----------+--------------+---------------+-------+
| task_type | dataset_name | average_score | count |
+-----------+--------------+---------------+-------+
|   math    |   math_500   |    0.7832     |  500  |
|   math    |     gpqa     |    0.3434     |  198  |
|   math    |    aime24    |      0.2      |   30  |
+-----------+--------------+---------------+-------+

(这是 1.5B 蒸馏小模型的真实水平——MATH-500 能到 78% 但 AIME 只有 20%,推理能力的"天花板差距"在难题上才暴露。)

💡 实际用下来:我第一次跑的时候图省钱把 max_tokens 设成了 4096,结果 AIME 分数低得诡异,比官方报告差了一大截。排查半天才发现——推理模型答一道竞赛题的思维链动辄上万 token,4096 直接把它"想到一半"掐断了,答案自然是错的。分数暴跌的原因不是模型不行,是我把它的草稿纸抽走了。 官方文档其实写了"建议 8000 以上",但没说清楚后果有多严重。这一坑折算下来浪费了我小半天的 GPU 时间。

结果可视化核查

evalscope service
# 浏览器打开 http://0.0.0.0:7860

加载评测报告后能看每道题的模型原始输出。这步别省:答案解析用的是规则匹配(复用 Qwen-Math 的解析器),偶尔会把答对的题判错,肉眼抽查 10-20 题再下结论。


四、反常识结论:给推理模型喂示例,分数反而更低

大多数人做评测的直觉是"few-shot 比 0-shot 更公平——给模型几个例题,它发挥更好"。传统模型时代确实如此,但对 R1 这类推理模型,结论是反的:few-shot 或复杂 prompt 会显著拉低性能。这不是我的猜测,是 DeepSeek R1 技术报告和 EvalScope 最佳实践共同确认的结论——所以三大基准的官方配置全部是 few_shot_num: 0,也不设 system prompt,只要求把最终答案放进 \boxed{}

背后的逻辑:推理模型已经内化了自己的推理格式,你塞进去的例题反而是干扰噪音,它会试图模仿你的示例风格而不是走自己的思维链。如果你看到某个榜单对推理模型用了 few-shot 模板,那个分数直接作废。 这也是自测比看榜重要的又一个原因——你至少知道自己的评测配置有没有犯这个错。


五、进阶:三种常见的加测项

加测项做法适合谁
换数据集datasets 换成 gsm8kaime25 等单测想测小学奥数~最新竞赛梯度
性能压测evalscope perf --parallel 10 -n 100 ...除了"答得对"还要"答得快"的生产选型
自建题库把业务真题做成本地数据集路径传入所有人——业务真题才是终极基准

多模型横向对比的省事做法:被测端点统一接一个多模型平台(比如七牛云大模型广场,也有网页端"模型对比"功能可以先同屏肉眼预筛,再对入围的跑完整基准),TaskConfig 里只改 model 字段循环跑,一晚上能测完 5-6 个候选。


六、FAQ

Q1:大模型测评的标准是什么?
没有唯一标准,但推理能力的事实标准是 AIME + MATH-500 + GPQA-Diamond 三件套(R1 技术报告口径),指标用 AveragePass@1(每题生成 n 次取平均通过率),配置必须 0-shot。

Q2:大模型测评需要什么数据集?哪里下载?
EvalScope 内置了主流基准,dataset_idevalscope/R1-Distill-Math-Test-v2 自动从 ModelScope 拉取,无需手动下载。自建评测用本地路径即可。

Q3:测评报告怎么写?
最小合格结构:评测配置(模型版本/temperature/max_tokens/n 值/0-shot 声明)→ 分数表 → 抽查记录(人工核对了多少题、解析误判率)→ 结论边界(本次结果只代表该配置下的表现)。缺配置声明的报告没有复现价值。

Q4:模型推理能力排名哪里看?
快速参考可以看 ModelScope/HuggingFace 的公开榜单,但注意榜单三个月就过时,且评测配置各家不一。生产选型建议:榜单筛出 3-5 个候选 → 自己用统一配置复测 → 用业务真题终审。

Q5:没有 GPU 能做测评吗?
能。被测模型走云端 API(OpenAI 兼容端点即可),EvalScope 本身在笔记本上就能跑,成本只有 API 调用费——728 题 × 5 次生成,中档模型大约几十元。


总结

大模型推理能力测评没有想象中神秘:EvalScope 一行安装,三大基准 728 题现成打包,一段 TaskConfig 就能跑,半天出分。三个决定成败的细节——max_tokens 开够(8000+)、必须 0-shot、结果要肉眼抽查。榜单可以帮你缩小范围,但最终决策的分数,永远应该来自你自己配置下、最好是你自己业务题上的那一次评测。本文命令与配置均来自 EvalScope 官方最佳实践(2026 年现行版本),可直接复制使用。


更多推荐