DeepSeek-V4-Flash-0731 正式发布:性能暴涨 6 倍?一文看懂它比预览版强在哪
摘要:7 月 31 日,DeepSeek 发布 V4-Flash-0731 正式版,取代预览版。本文基于官方发布说明,逐项计算对比了它在 9 个基准上相比 Flash 预览版、V4-Pro 预览版以及闭源模型 Opus-4.8 的提升幅度——DeepSWE 提升 645%、Cybergym 几乎翻倍、9 项基准全部反超 V4-Pro。不涉及部署教程,纯性能解读。
7 月 31 日,DeepSeek 正式发布了 DeepSeek-V4-Flash-0731,取代此前的预览版本。官方宣称其智能体(Agentic)能力大幅增强,并且在大多数公开基准上全面超越了参数量远大于它的 DeepSeek-V4-Pro(预览版)。
官方公告里的数字都是"干巴巴的分数",很多人看完只知道"变强了",但不知道强了多少。本文基于官方发布说明整理,逐项算出提升幅度,只聚焦一个核心问题:它到底比之前强了多少?
数据来源:DeepSeek-V4-Flash-0731 官方发布说明(Hugging Face)
一、一句话结论
在所有 9 个基准上,0731 正式版相比 Flash 预览版全部大幅提升,平均提升超过 20 个百分点;与 V4-Pro(预览版)相比,9 项基准全部领先;与最强的闭源模型 Opus-4.8 相比,多数任务差距已缩小到个位数百分点以内。
二、先看懂这些英文指标:每个测什么
表里的分数背后是九个测法完全不同的基准,先搞清楚每个在测什么,数字才有意义:
| 指标 | 测什么 | 说明 |
|---|---|---|
| Terminal Bench 2.1 | 终端环境里的真实任务 | 89 个任务,覆盖软件工程、系统管理、数据处理、模型训练、安全等领域,在容器终端环境中完成(如调试异步代码、修复安全漏洞),用程序化测试验证结果 |
| NL2Repo | 从自然语言生成完整代码仓库 | 即 NL2Repo-Bench(arXiv:2512.12730):只给一份自然语言需求文档和一个空工作区,智能体要自主设计架构、管理依赖、实现多模块逻辑,产出一个可安装的完整 Python 库;目前最强智能体平均测试通过率也不到 40% |
| Cybergym | 网络安全漏洞利用 | ICLR 2026 论文基准(见官网 github.com/sunblaze-ucb/cybergym):1507 个实例,源自 188 个真实开源项目的已修复漏洞(多数来自 OSS-Fuzz),智能体拿到漏洞描述和未打补丁的代码库,需写出能复现漏洞的 PoC(概念验证代码)并通过验证 |
| DeepSWE | 深度软件工程 | arXiv:2607.07946:113 个原创长时程软件工程任务,覆盖 91 个活跃开源仓库、5 种语言。任务从零编写、不回灌上游,规避了 SWE-bench 类基准"训练数据泄漏"问题;用人工编写的验证器判定,不依赖随修复提交的测试 |
| Toolathlon-Verified | 多应用工具调用 | ICLR 2026(arXiv:2510.25726):32 个真实软件应用、604 个工具(多来自 MCP 服务器)、108 个任务,平均约 20 轮交互才能完成,每任务用确定性脚本严格验证;Verified 为当前最终版 |
| Agents’ Last Exam | 专家级知识 + 工具链 | Scale AI 出品的智能体版"终极考试":横跨多学科的专家级难题,要求智能体通过搜索、工具、推理综合作答 |
| AutomationBench Public | 跨应用流程自动化 | arXiv:2604.18934:基于 Zapier 真实工作流模式,任务横跨销售、市场、运营、支持、财务、HR,要求智能体自行发现 API 端点、遵守策略文档、跨应用编排(如 CRM+邮箱+日历),只按最终落库状态程序化判定;目前最强前沿模型得分也不到 10% |
| DSBench-FullStack † | 内部 · 全栈开发 | DeepSeek 内部测试集:从需求到前后端完整落地的全栈开发任务 |
| DSBench-Hard † | 内部 · 高难度编程 | DeepSeek 内部测试集:面向智能体的高难度编程问题 |
两个提醒:
- 可复现性不同:Terminal Bench 2.1、Toolathlon、Cybergym、Agents’ Last Exam、AutomationBench 等为公开基准;DSBench 两项为 DeepSeek 内部集,其分数不可与其他家的公开数字直接横向比较
- 难度差异大:Cybergym 76.7 分和 AutomationBench 25.1 分不代表前者更容易——这些基准的任务形态、验证严格程度完全不同,看趋势比看绝对值更靠谱
三、相比 Flash 预览版:全面且大幅的跨越
| 基准 | 0731 正式版 | Flash 预览版 | 提升(百分点) | 相对提升 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | +20.9 | +34% |
| NL2Repo | 54.2 | 39.4 | +14.8 | +38% |
| Cybergym | 76.7 | 38.7 | +38.0 | +98% |
| DeepSWE | 54.4 | 7.3 | +47.1 | +645% |
| Toolathlon-Verified | 70.3 | 49.7 | +20.6 | +41% |
| Agents’ Last Exam | 25.2 | 15.8 | +9.4 | +60% |
| AutomationBench Public | 25.1 | 10.8 | +14.3 | +132% |
| DSBench-FullStack † | 68.7 | 37.0 | +31.7 | +86% |
| DSBench-Hard † | 59.6 | 25.8 | +33.8 | +131% |
† DSBench-FullStack 为内部全栈开发测试集;DSBench-Hard 为内部高难度编程智能体测试集。
几个关键观察:
- 没有一项基准原地踏步——最小的提升(Agents’ Last Exam)也有 9.4 个百分点;
- 编程智能体是提升最大的领域:DeepSWE 从 7.3 直接冲到 54.4(提升 645%),AutomationBench 翻了一倍多,Cybergym 几乎翻倍;
- 这意味着预览版到正式版之间,模型在长链路工具调用、代码仓库操作、终端命令执行等智能体核心能力上发生了质变,而不是简单的微调式改进。
四、相比 V4-Pro(预览版):以小博大
更值得注意的是,Flash 正式版的激活参数量远小于 V4-Pro,却在所有基准上反超:
| 基准 | V4-Flash-0731 | V4-Pro (预览) | 领先(百分点) |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 72.1 | +10.6 |
| NL2Repo | 54.2 | 38.5 | +15.7 |
| Cybergym | 76.7 | 52.7 | +24.0 |
| DeepSWE | 54.4 | 12.8 | +41.6 |
| Toolathlon-Verified | 70.3 | 55.9 | +14.4 |
| Agents’ Last Exam | 25.2 | 16.5 | +8.7 |
| AutomationBench Public | 25.1 | 12.8 | +12.3 |
| DSBench-FullStack † | 68.7 | 41.8 | +26.9 |
| DSBench-Hard † | 59.6 | 31.1 | +28.5 |
尤其 DeepSWE 领先 41.6 个百分点、Cybergym 领先 24 个百分点——在"小而强"这件事上,0731 正式版几乎是在用更小的模型教大模型做事。这背后离不开它附带的 DSpark 投机解码模块:以草稿模型加速生成,让"小参数 + 高推理效率"成为可能。
五、与闭源最强模型 Opus-4.8 的差距:已相当接近
| 基准 | V4-Flash-0731 | Opus-4.8 | 差距 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 85.0 | -2.3 |
| NL2Repo | 54.2 | 69.7 | -15.5 |
| Cybergym | 76.7 | 83.1 | -6.4 |
| DeepSWE | 54.4 | 58.0 | -3.6 |
| Toolathlon-Verified | 70.3 | 76.2 | -5.9 |
| Agents’ Last Exam | 25.2 | 25.7 | -0.5 |
| AutomationBench Public | 25.1 | 27.2 | -2.1 |
| DSBench-FullStack † | 68.7 | 71.6 | -2.9 |
| DSBench-Hard † | 59.6 | 71.7 | -12.1 |
9 项基准中,7 项差距在 6.4 个百分点以内,其中 Agents’ Last Exam 仅差 0.5 分、AutomationBench 差 2.1 分。唯一差距明显的 NL2Repo(-15.5)和 DSBench-Hard(-12.1)集中在"从自然语言直接生成完整仓库"和"高难度编程问题"这类任务上——这说明通用智能体能力已经追平,但极限编程深度仍是下一阶段的攻坚方向。
六、性能数字是怎么来的?
要正确解读上述数据,需要注意评估条件(官方说明):
- 公开基准的 Code Agent 任务使用即将发布的 DeepSeek Harness 最小模式(minimal mode) 作为智能体框架;
- 采样参数为
temperature = 1.0、top_p = 0.95,并使用推理努力(reasoning_effort)等级(low/high/max,控制模型作答前的思考量); - DSBench 两项为内部测试集,非公开复现基准。
因此,表中数字反映的是"在官方 Harness 框架下的上限表现",不同智能体框架下的实际效果会有浮动。
七、结语
如果用一句话总结 DeepSeek-V4-Flash-0731 的性能提升:它对预览版是一次跨代升级,对 Pro 版本是一次以小博大,对闭源最强模型则是一次贴身紧逼。 三个维度放在一起,Flash 正式版已经用数据证明——智能体能力与推理效率的结合,正在成为比单纯堆参数更重要的竞争维度。
接下来我会继续关注它的实际部署体验和第三方复测数据,也欢迎大家在评论区分享自己的实测结果。
参考链接
- DeepSeek-V4-Flash-0731 官方发布说明:https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
- Terminal-Bench 2.1(官网 / 数据集):https://www.tbench.ai/ · https://github.com/harbor-framework/terminal-bench-2-1
- NL2Repo-Bench(论文):https://arxiv.org/abs/2512.12730
- Cybergym(官网 / 论文):https://github.com/sunblaze-ucb/cybergym
- DeepSWE(论文 / 官网):https://arxiv.org/abs/2607.07946 · https://deepswe.datacurve.ai/
- Toolathlon(论文 / 仓库):https://arxiv.org/abs/2510.25726 · https://github.com/hkust-nlp/toolathlon
- AutomationBench(论文):https://arxiv.org/abs/2604.18934
数据整理基于 DeepSeek 官方发布说明,数据版权归 DeepSeek-AI 所有,MIT License 允许转载,转载注明出处即可。
更多推荐


所有评论(0)