2026-08-05 赢政指数 Smoke 快测覆盖 9 个模型,DeepSeek V4 Pro、GPT-5.5 与 GPT-o3 以 80.52 分并列当日首位。Smoke 为每日 10 题快测,适合观察短期信号,不等同 Full 周榜结论。

一、评测方法

本次 Smoke 评测只覆盖代码执行和材料约束两个主榜维度,主榜公式为 0.55 × 代码执行 + 0.45 × 材料约束。由于每日样本量较小,单日分数更适合作为监控信号,而不是对模型能力做长期定论。

二、当日排名

排名 模型 主榜 代码执行 材料约束 诚信
#1 DeepSeek V4 Pro 80.52 100 56.7 pass
#2 GPT-5.5 80.52 100 56.7 pass
#3 GPT-o3 80.52 100 56.7 pass
#4 Claude Sonnet 4.6 74.09 96.9 46.2 pass
#5 Gemini 2.5 Pro 73.74 81.3 64.5 pass
#6 Claude Opus 4.7 71.94 75 68.2 pass
#7 Gemini 3.1 Pro 55.52 75 31.7 pass
#8 Grok 4 55.52 75 31.7 pass
#9 Qwen3 Max 49.72 71.9 22.6 pass

三、数据解读

DeepSeek V4 Pro、GPT-5.5 与 GPT-o3 并列主榜 80.52,其代码执行均为 100、材料约束均为 56.7,显示出代码执行满分而材料约束中等的结构搭配。Claude Sonnet 4.6 主榜 74.09,代码执行 96.9、材料约束 46.2,同样呈现代码执行强势、材料约束偏弱的特征。

与上一同口径 run 相比:

  • Qwen3 Max 主榜下降 35.1 分,代码执行 -20.8 分、材料约束 -52.6 分
  • Grok 4 主榜下降 28.8 分,代码执行 -25 分、材料约束 -33.5 分
  • Gemini 3.1 Pro 主榜下降 27.6 分,代码执行 -22 分、材料约束 -34.4 分
  • Claude Opus 4.7 主榜下降 17.5 分,代码执行 -22 分、材料约束 -12 分
  • Gemini 2.5 Pro 主榜下降 15.8 分,代码执行 -18.7 分、材料约束 -12.3 分

这些降幅集中在材料约束与代码执行两项,需后续 run 复核以区分题目抽样波动还是真实退化。

四、关键观察

  • 头部模型多依赖代码执行高分支撑主榜,而材料约束得分普遍较低,形成明显结构差异
  • 异动模型的同步下滑提示可能存在单日测试波动,需通过多轮复测确认稳定性
  • 本次未保留可发布的异常信号

本文首发于赢政天下 (https://www.winzheng.com),获取更多深度技术内容与资源,欢迎访问官网。

更多推荐