摘要:7 月 31 日,DeepSeek 发布 V4-Flash-0731 正式版,取代预览版。本文基于官方发布说明,逐项计算对比了它在 9 个基准上相比 Flash 预览版、V4-Pro 预览版以及闭源模型 Opus-4.8 的提升幅度——DeepSWE 提升 645%、Cybergym 几乎翻倍、9 项基准全部反超 V4-Pro。不涉及部署教程,纯性能解读。


7 月 31 日,DeepSeek 正式发布了 DeepSeek-V4-Flash-0731,取代此前的预览版本。官方宣称其智能体(Agentic)能力大幅增强,并且在大多数公开基准上全面超越了参数量远大于它的 DeepSeek-V4-Pro(预览版)

官方公告里的数字都是"干巴巴的分数",很多人看完只知道"变强了",但不知道强了多少。本文基于官方发布说明整理,逐项算出提升幅度,只聚焦一个核心问题:它到底比之前强了多少?

数据来源:DeepSeek-V4-Flash-0731 官方发布说明(Hugging Face)

一、一句话结论

在所有 9 个基准上,0731 正式版相比 Flash 预览版全部大幅提升,平均提升超过 20 个百分点;与 V4-Pro(预览版)相比,9 项基准全部领先;与最强的闭源模型 Opus-4.8 相比,多数任务差距已缩小到个位数百分点以内。

二、先看懂这些英文指标:每个测什么

表里的分数背后是九个测法完全不同的基准,先搞清楚每个在测什么,数字才有意义:

指标 测什么 说明
Terminal Bench 2.1 终端环境里的真实任务 89 个任务,覆盖软件工程、系统管理、数据处理、模型训练、安全等领域,在容器终端环境中完成(如调试异步代码、修复安全漏洞),用程序化测试验证结果
NL2Repo 从自然语言生成完整代码仓库 即 NL2Repo-Bench(arXiv:2512.12730):只给一份自然语言需求文档和一个空工作区,智能体要自主设计架构、管理依赖、实现多模块逻辑,产出一个可安装的完整 Python 库;目前最强智能体平均测试通过率也不到 40%
Cybergym 网络安全漏洞利用 ICLR 2026 论文基准(见官网 github.com/sunblaze-ucb/cybergym):1507 个实例,源自 188 个真实开源项目的已修复漏洞(多数来自 OSS-Fuzz),智能体拿到漏洞描述和未打补丁的代码库,需写出能复现漏洞的 PoC(概念验证代码)并通过验证
DeepSWE 深度软件工程 arXiv:2607.07946:113 个原创长时程软件工程任务,覆盖 91 个活跃开源仓库、5 种语言。任务从零编写、不回灌上游,规避了 SWE-bench 类基准"训练数据泄漏"问题;用人工编写的验证器判定,不依赖随修复提交的测试
Toolathlon-Verified 多应用工具调用 ICLR 2026(arXiv:2510.25726):32 个真实软件应用、604 个工具(多来自 MCP 服务器)、108 个任务,平均约 20 轮交互才能完成,每任务用确定性脚本严格验证;Verified 为当前最终版
Agents’ Last Exam 专家级知识 + 工具链 Scale AI 出品的智能体版"终极考试":横跨多学科的专家级难题,要求智能体通过搜索、工具、推理综合作答
AutomationBench Public 跨应用流程自动化 arXiv:2604.18934:基于 Zapier 真实工作流模式,任务横跨销售、市场、运营、支持、财务、HR,要求智能体自行发现 API 端点、遵守策略文档、跨应用编排(如 CRM+邮箱+日历),只按最终落库状态程序化判定;目前最强前沿模型得分也不到 10%
DSBench-FullStack † 内部 · 全栈开发 DeepSeek 内部测试集:从需求到前后端完整落地的全栈开发任务
DSBench-Hard † 内部 · 高难度编程 DeepSeek 内部测试集:面向智能体的高难度编程问题

两个提醒:

  1. 可复现性不同:Terminal Bench 2.1、Toolathlon、Cybergym、Agents’ Last Exam、AutomationBench 等为公开基准;DSBench 两项为 DeepSeek 内部集,其分数不可与其他家的公开数字直接横向比较
  2. 难度差异大:Cybergym 76.7 分和 AutomationBench 25.1 分不代表前者更容易——这些基准的任务形态、验证严格程度完全不同,看趋势比看绝对值更靠谱

三、相比 Flash 预览版:全面且大幅的跨越

基准 0731 正式版 Flash 预览版 提升(百分点) 相对提升
Terminal Bench 2.1 82.7 61.8 +20.9 +34%
NL2Repo 54.2 39.4 +14.8 +38%
Cybergym 76.7 38.7 +38.0 +98%
DeepSWE 54.4 7.3 +47.1 +645%
Toolathlon-Verified 70.3 49.7 +20.6 +41%
Agents’ Last Exam 25.2 15.8 +9.4 +60%
AutomationBench Public 25.1 10.8 +14.3 +132%
DSBench-FullStack † 68.7 37.0 +31.7 +86%
DSBench-Hard † 59.6 25.8 +33.8 +131%

† DSBench-FullStack 为内部全栈开发测试集;DSBench-Hard 为内部高难度编程智能体测试集。

几个关键观察:

  • 没有一项基准原地踏步——最小的提升(Agents’ Last Exam)也有 9.4 个百分点;
  • 编程智能体是提升最大的领域:DeepSWE 从 7.3 直接冲到 54.4(提升 645%),AutomationBench 翻了一倍多,Cybergym 几乎翻倍;
  • 这意味着预览版到正式版之间,模型在长链路工具调用、代码仓库操作、终端命令执行等智能体核心能力上发生了质变,而不是简单的微调式改进。

四、相比 V4-Pro(预览版):以小博大

更值得注意的是,Flash 正式版的激活参数量远小于 V4-Pro,却在所有基准上反超:

基准 V4-Flash-0731 V4-Pro (预览) 领先(百分点)
Terminal Bench 2.1 82.7 72.1 +10.6
NL2Repo 54.2 38.5 +15.7
Cybergym 76.7 52.7 +24.0
DeepSWE 54.4 12.8 +41.6
Toolathlon-Verified 70.3 55.9 +14.4
Agents’ Last Exam 25.2 16.5 +8.7
AutomationBench Public 25.1 12.8 +12.3
DSBench-FullStack † 68.7 41.8 +26.9
DSBench-Hard † 59.6 31.1 +28.5

尤其 DeepSWE 领先 41.6 个百分点、Cybergym 领先 24 个百分点——在"小而强"这件事上,0731 正式版几乎是在用更小的模型教大模型做事。这背后离不开它附带的 DSpark 投机解码模块:以草稿模型加速生成,让"小参数 + 高推理效率"成为可能。

五、与闭源最强模型 Opus-4.8 的差距:已相当接近

基准 V4-Flash-0731 Opus-4.8 差距
Terminal Bench 2.1 82.7 85.0 -2.3
NL2Repo 54.2 69.7 -15.5
Cybergym 76.7 83.1 -6.4
DeepSWE 54.4 58.0 -3.6
Toolathlon-Verified 70.3 76.2 -5.9
Agents’ Last Exam 25.2 25.7 -0.5
AutomationBench Public 25.1 27.2 -2.1
DSBench-FullStack † 68.7 71.6 -2.9
DSBench-Hard † 59.6 71.7 -12.1

9 项基准中,7 项差距在 6.4 个百分点以内,其中 Agents’ Last Exam 仅差 0.5 分、AutomationBench 差 2.1 分。唯一差距明显的 NL2Repo(-15.5)和 DSBench-Hard(-12.1)集中在"从自然语言直接生成完整仓库"和"高难度编程问题"这类任务上——这说明通用智能体能力已经追平,但极限编程深度仍是下一阶段的攻坚方向

六、性能数字是怎么来的?

要正确解读上述数据,需要注意评估条件(官方说明):

  • 公开基准的 Code Agent 任务使用即将发布的 DeepSeek Harness 最小模式(minimal mode) 作为智能体框架;
  • 采样参数为 temperature = 1.0top_p = 0.95,并使用推理努力(reasoning_effort)等级(low / high / max,控制模型作答前的思考量);
  • DSBench 两项为内部测试集,非公开复现基准。

因此,表中数字反映的是"在官方 Harness 框架下的上限表现",不同智能体框架下的实际效果会有浮动。

七、结语

如果用一句话总结 DeepSeek-V4-Flash-0731 的性能提升:它对预览版是一次跨代升级,对 Pro 版本是一次以小博大,对闭源最强模型则是一次贴身紧逼。 三个维度放在一起,Flash 正式版已经用数据证明——智能体能力与推理效率的结合,正在成为比单纯堆参数更重要的竞争维度。

接下来我会继续关注它的实际部署体验和第三方复测数据,也欢迎大家在评论区分享自己的实测结果。


参考链接


数据整理基于 DeepSeek 官方发布说明,数据版权归 DeepSeek-AI 所有,MIT License 允许转载,转载注明出处即可。

更多推荐