DeepSeek V4-Flash 正式版:架构没动,后训练把 Agent 能力拉了一截

7 月 31 日下午,DeepSeek 通过 API 文档更新日志放出了 V4-Flash 正式版(0731)。之前传的是 8 月 3 日,提前了三天,没有预热,没有发布会。模型 ID 是 deepseek-v4-flash,当前指向 0731 版本。这次只升了 Flash 的 API,Pro 的 API 和 App/Web 端都没动,Pro 正式版预计 8 月初。

先把结论放前面:模型架构一个参数没改,纯靠重做后训练,在 Agent 任务上全面反超自家 1.6T 旗舰的预览版——而且这一点已被第三方独立评测复现。 这件事比跑分本身更值得聊。

架构没动,只换了调音师

V4-Flash-0731 和 preview 版在模型结构、参数规模上完全一致:2840 亿总参数,130 亿激活,256 个专家,100 万上下文,384K 最大输出,MoE 架构,FP4+FP8 混合精度,MIT 许可。变了的只有后训练。

DeepSeek 的后训练分两步:先按领域——推理、编码、数学、世界知识、Agent 工具使用——分别用 SFT + GRPO 训出专家模型;然后合并模型不是简单看专家的输出分布,而是观察专家的行为分布做在线策略蒸馏,学的不只是"专家说了什么",而是"专家怎么思考的"。这次 Agent 能力暴涨,就是在第二步里专门强化了 Agent 与工具使用方向的蒸馏力度。同一台引擎,换了个调音师,声音就完全不一样了。

跑分:先看官方完整对照表,再挑刺眼的说

官方 9 项基准对照表

官方这张表把 Flash-0731、Flash-Preview、Pro-Preview、GLM-5.2、Opus-4.8 五列并排,正好可以把"提升"拆成三个干净的维度,避免把不同对比对象混为一谈。

第一维,自我跃迁(0731 vs Flash-Preview)。 DeepSWE(软件工程 Agent)7.3 → 54.4,约 7.5 倍——这个幅度已经不是"优化"能解释的,更像是把 Agent 长链任务里的工具调用规划这门课从"没上"补到了"精通"。Terminal Bench 2.1 从 61.8 涨到 82.7(+20.9),Toolathlon-Verified 从 49.7 涨到 70.3(+20.6),DSBench-Hard 从 25.8 涨到 59.6。

第二维,反超 1.6T 的 Pro-Preview。 9 项全部反超。注意对比对象是 Pro-Preview 自己的数:DeepSWE 12.8 → 54.4(4 倍多),Terminal Bench 2.1 72.1 → 82.7(+10.6),Toolathlon-Verified 55.9 → 70.3(+14.4),DSBench-Hard 31.1 → 59.6(近翻倍)。一个 284B / 13B 激活的模型,在 Agent 任务上把自家 1.6T / 49B 激活的旗舰预览版逐项压住,参数量差近六倍、激活参数差近四倍——按常理该反过来。

第三维,横向定位。 对 GLM-5.2,9 项全部领先(Cybergym 其无数据),印证"在 Agent / 编码场景已反超 GLM-5.2"。对 Opus-4.8,则要诚实:Opus 仍逐项领先,但多数项差距已收窄到个位数,其中 Agents’ Last Exam 几乎追平(25.2 vs 25.7)、AutomationBench 仅差 2.1;真正的短板是 NL2Repo(−15.5)与 DSBench-Hard(−12.1)。换句话说,Flash 已经咬住了 Opus 的衣角,但还没咬住咽喉。

另外几个 preview 没测或测不全的:NL2Repo 54.2,Cybergym 76.7(网络安全 Agent),Agents’ Last Exam 25.2,DSBench-FullStack 68.7。方向很明确——DeepSeek 在往"能真正干活"的 Agent 场景上押重注,而不是只刷聊天和问答类 benchmark。

横着比:第三方综合智能指数怎么说

官方自测难免"既当运动员又当裁判",所以第三方独立评测的读数更值得看。

Artificial Analysis Intelligence Index 柱状图
在 Artificial Analysis 的综合智能指数(v4.1,9 项评测加权)上,V4-Flash-0731 = 50,与 Gemini 3.6 Flash 并列,排在全行业约第 12–13 位,正卡在"第一梯队尾部 / 第二梯队头部"的分界线上。这张图给出了三个比官方跑分更硬的信号:

其一,第三方独立复现了"Flash 反超 Pro"。 同榜上 DeepSeek V4 Pro (max) 只有 44,0731 比自家旗舰高 6 分。官方说"基准测试远超 V4-Pro-Preview",这里由独立评测盖了章。

其二,同 lineage 的纯后训练增益可量化。 榜上同时保留了旧 DeepSeek V4 Flash (max) = 40,0731 比它高 10 分——同一架构、同一预训练权重,仅换后训练,综合智能指数 +10。

其三,对 GLM 与头部的定位要校准。 GLM-5.2 在综合指数上是 51,仍比 0731 高 1 分,所以"反超 GLM"严格说只成立在 Agent / 编码基准上,综合智能上二者基本持平。头部 Claude Opus 5(61)、GPT-5.6 Sol(59)、Kimi K3(57)则领先 0731 达 9–11 分,差距是实打实的规模代差,不是几句"摸到尾巴"能抹平的。

把官方表(图0)和这张第三方榜(图1)叠起来看,结论才完整:在"干活"的 Agent 维度上 0731 已跻身一线、甚至压过自家旗舰;在"什么都知道一点"的综合智能维度上,它站在一线门口,与 GLM 并肩,距真正的头部还差一个身位。

价格,以及把性能和价格画在一张图上

跑分再漂亮,贵得离谱也没意义。每百万 token:输入缓存命中 $0.0028,缓存未命中 $0.14,输出 $0.28。V4-Pro 对应是 $0.0036 / $0.435 / $0.87——Flash 大约是它的三分之一到四分之一。对比 Claude Opus 4.7 的输出价,Flash 只有约八十九分之一。并发 Flash 给到 2500,Pro 是 500,对要批量跑 Agent 的团队来说,这个并发差比单价差更要命。

但"便宜"和"聪明"分开看都没意义,得画在一张图上。
Artificial Analysis 智能指数 vs 单任务成本 散点图
这张图的左上角是"Most attractive quadrant"(最具吸引力象限:高智能 + 低成本)。图中的蓝色箭头,把旧 Flash(约 $0.023 / 40 分)指向了 0731 的位置——成本几乎没动,智能垂直跃迁到 50+,于是 0731 直接落进了最优象限。 这才是"性价比"三个字最干净的画法。

落到倍数上更直观。在 50 分这一档智能上,Gemini 3.6 Flash 单任务成本约 $0.55,是 0731 的约 20 倍;GLM-5.2(53 分)约 $0.28,是约 10 倍。反过来,在 $0.02–0.03 这一档成本上,GPT-5.6 Luna 的 medium 档只有 38 分、low 档 33 分,花一样的钱,0731 给的智能高出一大截。 而且别忘了,0731 的定价与旧 Flash 完全相同——它不是靠降价挤进最优象限的,而是靠后训练把分子(智能)抬高、分母(成本)不动,硬生生把性价比曲线垂直拉了上去。

⚠️ 一个提醒:官方宣布要上峰谷定价,高峰时段(北京时间 9:00–12:00、14:00–18:00)价格翻倍。截至 7 月 31 日还没生效,但窗口期不会太长。有大量调用需求的,现在就是锁价的时机。

顺手送的两个新功能

Responses API:V4-Flash-0731 原生支持,V4-Pro 要等 8 月初。这是更贴近 Agent 工作流的 API 设计,不只是 ChatCompletions 换皮。Codex 适配:针对 OpenAI Codex 做了专门适配,写代码、读代码、重构的体验应该会更好。另外别忘了,旧的 deepseek-chatdeepseek-reasoner 在 7 月 24 日已经停用,调用会直接 HTTP 报错,新 ID 是 deepseek-v4-flash

自部署:前沿开源模型第一次够得着消费级硬件

这条可能是最值得私藏的。FP4+FP8 混合精度加上 CSA/HCA 混合注意力,推理效率压得很低。INT4 量化大约 100GB 显存就能跑,两张 RTX 6000 Ada(48GB)就够,1M 上下文时 KV-Cache 只有标准 GQA 的 1.4% 左右。100GB 显存意味着什么?这是前沿竞争力开源模型第一次落到消费级邻近硬件能部署的门槛上。手里有两张 48G 显卡的,这个模型值得认真跑一跑。

我比较在意的两件事

第一,后训练的天花板可能比很多人想的高——而且现在有了第三方证据。 初稿这只是推测,但图1 把它量化了:同一架构、同一预训练权重,仅换后训练,综合智能指数从 40 拉到 50、并反超自家 Pro 的 44。这暗示我们今天看到的"模型能力",很可能只是后训练策略的函数,而非架构本身的极限。当然也要补一句限定:后训练能放大的是预训练已埋下的潜力,世界知识这类靠数据量的能力,Flash 仍明显逊于闭源顶级——后训练是杠杆,不是无中生有。V4-Pro 正式版 8 月初就要来,若 Flash 后训练能涨这么多,Pro 的涨幅只会更夸张。

第二,Agent 正在变成真正的战场。 这一点连评测机构都在用脚投票——Artificial Analysis 在综合榜之外,已经单设了 Agentic Index 维度。过去两年大模型卷的是聊天、写作、代码生成,V4-Flash 这一波把战火明确引到了"能不能真干活":终端操作、工具调用、软件工程、网络安全。这些 benchmark 不讨巧,但更接近真实场景,也正是 0731 后训练重点蒸馏的方向。

总结

没有"一句话总结",因为这事本来就不是一句话能说清的。一个 284B 的模型用一套后训练,把 1.6T 旗舰预览版在 Agent 任务上逐项压住、在第三方综合榜上反超 6 分,同时把输出价格压到 $0.28/M、并发开到 2500、协议选 MIT、还顺手把自部署门槛踩到消费级附近,并凭"成本不动、智能垂直跃迁"挤进了性价比最优象限。

它验证的不只是 DeepSeek 自己的后训练范式,更像是在问整个行业一个问题:之前是不是把太多精力花在"把模型做大"上了?当然,也要清醒——在综合智能的绝对高度上,0731 仍站在一线门口,距 Opus 5、GPT-5.6 Sol、Kimi K3 还有 9–11 分的规模代差。后训练是杠杆,规模仍是底座,二者并不矛盾。

数据来源:DeepSeek 官方 API 更新日志与定价页、HuggingFace 技术分析、Artificial Analysis(Intelligence Index v4.1,2026-07-31)、IT 之家、快科技、财联社。跑分与榜单数据截至 2026-07-31。


更多推荐