deepseek-v4-flash-正式版深度评测
DeepSeek-V4-Flash 正式版深度评测:13B 激活参数的"轻量版",凭什么反超自家 Pro、逼近 Opus 4.8
一句话结论:这是 2026 年上半年性价比最离谱的模型发布——但不是给普通用户准备的。对做 Agent、做自动化、做编码流水线的团队,现在就该切;对 App/Web 端的普通用户,体感为零,等 V4-Pro。
摘要(30 秒版)
7 月 31 日,DeepSeek 在 API 文档里悄悄上线了 DeepSeek-V4-Flash 正式版(内部代号 V4-Flash-0731)。模型结构、尺寸与 4 月的预览版完全一致,仅重做了一轮后训练,但 9 项 Agent 基准全面反超自家 V4-Pro-Preview:
- DeepSWE 长程软件工程:7.3 → 54.4(7.5 倍)
- Terminal Bench 2.1 终端操作:61.8 → 82.7
- Cybergym 安全攻防:38.7 → 76.7
第三方独立评测同步验证:Artificial Analysis 智能指数 50 分,仅比 GPT-5.6 Luna(51)低 1 分;Arena.ai 前端代码竞技场 1594 分,开放类别第 3。价格上,缓存命中输入 0.02 元/百万 tokens,成本约为旗舰闭源模型的 1/90。
但注意:本次升级只覆盖 V4-Flash 的 API 接口,V4-Pro 与 App/Web 端全部未动。官方表示 V4-Pro 正式版 8 月初发布。
目录
- 一个"以下犯上"的正式版
- 先给结论:为什么说这是"换头手术"而不是"闪一下"
- 规格没变,变的只有一件事:后训练
- 九项 Agent 基准,逐项翻译成人话
- 跟谁比:反超 Pro 预览、压过 GLM-5.2、逼近 Opus 4.8
- 独立第三方怎么打分:Artificial Analysis 与 Arena.ai
- 价格账本:为什么它被叫做"性价比之王"
- 开发者最关心的一步:Responses API + Codex 接入
- 泼冷水:五个你必须知道的限制
- 该不该用:一张决策表
- FAQ
- 结论
1. 一个"以下犯上"的正式版
7 月 31 日下午,开发者小陈照常打开 DeepSeek 的 API 文档查参数,发现更新日志里多了一行字:“DeepSeek-V4-Flash 正式版 API 上线公测。”
没有发布会,没有通稿,甚至没有一条微博。但看懂那串基准数字的开发者,半小时后就把这个话题送上了知乎热搜第一。
原因是这四个字——“倒反天罡”。
按照 DeepSeek 一贯的分层逻辑,Pro 是旗舰,Flash 是轻量、便宜、快的"低配版"。结果这次,一个激活参数只有 13B 的轻量版,在 Agent 能力上把激活参数 490B 的自家 Pro 预览版按在地上摩擦。这不是小步快跑,是换头手术。
时间线补全一下:
- 2026-04-24:DeepSeek-V4 系列预览版发布并开源(MIT 协议),原生多模态 + 1M 上下文,Flash 与 Pro 双剑齐出。
- 2026-06:完成首轮外部融资,超 74 亿美元,投后估值超 500 亿美元。这是融资后的第一轮技术兑现。
- 2026-07-24:旧模型名
deepseek-chat、deepseek-reasoner正式停用,全面切换到 V4 接口。 - 2026-07-31:正式版原本说 7 月中旬发,一路跳票到 7 月最后一天,终于落地。
为什么拖到最后一天? 没有官方解释。但结合"仅重做了后训练"这个事实,合理的猜测是:DeepSeek 在等后训练管线跑到满意为止——他们宁可跳票,也不发一个丢人的正式版。从结果看,这波值。
2. 先给结论:为什么说这是"换头手术"而不是"闪一下"
名字里带 Flash,很多人的第一反应是"不就快一点、便宜一点吗?"。这是对这次发布最深的误读。
评测之前,先把立场摆清楚:
这不是一次"更快更便宜"的例行更新。这是一次把"轻量版"直接推进旗舰能力地带的越级发布。 它用分数证明了:Agent 能力的杠杆不在参数规模,而在后训练配方。
支撑这个判断的三条证据,后面逐节展开:
- 同样的骨架:284B 总参 / 13B 激活,与预览版一字未改,连上下文长度都是同一个 1M。
- 能力翻天覆地:DeepSWE 从 7.3 到 54.4、Cybergym 从 38.7 到 76.7——这不是"提升",是"换了一个物种"。
- 越级压制:9 项基准全部超过 V4-Pro-Preview,整体超过 744B 总参的 GLM-5.2,逼近 Claude Opus 4.8。
一句话:DeepSeek 没有造一个新的 Flash,它把 Flash 的后训练重做了一遍,顺便把"后训练"这件事的定义给改了。
3. 规格没变,变的只有一件事:后训练
官方更新日志里有一句看似平淡、实则震撼的话:
“DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。”
把它翻译成人话:模型骨架没动,参数没动,连显存占用都没变,只换了一套"怎么把能力调出来"的训练配方。
大模型的能力来源可以粗暴分成两阶段:
- 预训练:喂海量数据,学语言、学知识、学推理——决定模型的上限。
- 后训练:用 SFT、RLHF、DPO 等方法,让模型学会"正确使用自己的能力"——决定模型的实际表现。
过去一年的行业共识是:预训练决定一切,后训练只是锦上添花。V4-Flash 用一张 7.3 → 54.4 的成绩单,把这个共识打了个洞。
这意味着什么? 意味着在后训练工程化上领先的公司,可以用同样的算力和参数,造出能力差出好几个档次的模型。对中小团队,这反而是好消息——你的模型不需要越来越大,只需要被"训练得更会干活"。
黄金句:“后训练不是微调,是让模型学会’正确使用自己能力’的能力。V4-Flash 用分数证明了它的杠杆。”
4. 九项 Agent 基准,逐项翻译成人话
先上官方公布的 9 项基准(测试框架:DeepSeek Harness 极简模式,max 档位,top_p=0.95,temperature=1.0):
| 基准 | 测的是什么 | 正式版 0731 | 预览版 Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 终端 Agent:能否在真实命令行里独立完成部署、排障、写脚本 | 82.7 | 61.8 |
| DeepSWE | 长程软件工程:理解仓库、定位问题、跨文件修改、跑测试 | 54.4 | 7.3 |
| NL2Repo | 代码仓库理解与修改 | 54.2 | — |
| Cybergym | 安全 Agent:攻防演练、漏洞修复 | 76.7 | 38.7 |
| Toolathlon Verified | 工具调用:多工具编排的正确率 | 70.3 | — |
| Agent Last Exam | 综合 Agent 现实任务 | 25.2 | — |
| Automation Bench (Public) | 自动化任务 | 25.1 | — |
| DSBench-FullStack | 全栈开发(内部基准) | 68.7 | — |
| DSBench-Hard | 高难度 Coding Agent(内部基准) | 59.6 | — |

图 1 | 官方更新日志截图:九项 Agent 基准 —— 来源:api-docs.deepseek.com/zh-cn/updates/(截图于 2026-08-06)
数字单独看没感觉,逐个翻译:
DeepSWE:7.3 → 54.4,最疯狂的一跳。 DeepSWE 是 2026 年推出的长程软件工程测试集,113 个任务,每个都要"读仓库 → 定位 Bug → 跨文件改代码 → 跑测试验证 → 失败再修"。预览版得分 7.3,基本等于睁眼瞎——它会在没搞懂任务的情况下编造结果扔给你。正式版 54.4,意味着它能真正自主完成多步修复。7.5 倍的提升,不是因为模型变大了,而是因为它终于"学会干活了"。
Terminal Bench 2.1:82.7。 这是"AI 替代运维"的核心指标:给 AI 一个真实 Linux 终端,让它自己搞定端到端任务。82.7 分,在命令行世界里已经接近人类中级工程师的干活水平。
Cybergym:38.7 → 76.7。 网络安全模拟环境,攻防演练、漏洞修复。这个数字说明 AI 安全工程化不再是 PPT 里的概念,而是可执行的实战能力。
Toolathlon Verified:70.3。 工具调用是 Agent 的"手脚",这个分数意味着多工具编排的正确率已经过了"能用"的红线。
顺手做个实验:把你仓库里那个最让人头大的自动化任务,原封不动丢给它跑一遍,再回来告诉我结果——你的完成率大概率比 DeepSWE 的 54.4 更能说明问题。
黄金句:模型竞争的下半场,从"谁参数大"转向"谁会干活"。
5. 跟谁比:反超 Pro 预览、压过 GLM-5.2、逼近 Opus 4.8
评测的意义在对比。官方这次毫不客气,直接拿 Flash 去对标自家 Pro 预览版和行业旗舰:
| 模型 | 总参数 | 激活参数 | Terminal Bench 2.1 |
|---|---|---|---|
| DeepSeek-V4-Flash 0731 | 284B | 13B | 82.7 |
| DeepSeek-V4-Pro-Preview | 1.6T | 490B | 72.1 |
| GLM-5.2 | 744B | 400B | 81.0 |
| Claude Opus 4.8 | — | — | 85.0 |
两个值得注意的细节:
第一,V4-Flash 干翻了比自己大一个数量级的模型。 GLM-5.2 总参数 744B、激活 400B,是 V4-Flash 的 30 倍和 30 倍(激活比 13B vs 400B,约 1/30)。结果 Flash 整体表现超过 GLM-5.2。这已经不是在比参数,是在比训练效率。
第二,逼近 Opus 4.8。 在 Terminal Bench 2.1 上,V4-Flash 82.7 距离 Opus 4.8 的 85.0 只差 2.3 分。第三方评测机构甚至给出一个更激进的说法:V4-Flash 是首个被团队直接投入真实 Agent 流水线、作为 Anthropic/OpenAI 级别前沿模型替代品的开源权重模型,并在 SWE-bench Verified 上取得开源权重模型最高分,匹配 GPT-5.5 级别的 Agent 性能。
必须说明的严谨性问题:Terminal Bench 2.0 与 2.1 不是同一个版本的测试集,跨版本直接对比并不完全公平。V4-Pro-Preview 的 72.1 是在 2.1 上测的,但 2.0 时代 Pro 预览版只有 67.9。我的判断是:无论哪个口径,一个激活参数 13B 的轻量版追平自家 490B 旗舰,这件事本身就很离谱。
黄金句:这不是性价比,这是降维打击。
6. 独立第三方怎么打分:Artificial Analysis 与 Arena.ai
官方自报家门的 benchmark 要打折看,这是评测的基本素养。好在这次两大独立平台同步跟进,给了交叉验证:
Artificial Analysis(智能指数 AII):V4-Flash 0731 得 50 分,比 4 月的 Flash 预览版高出 10 分,比 V4-Pro 预览版高出 6 分,仅比 GPT-5.6 Luna 的最高 51 分低 1 分。更关键的是成本结论:即使 OpenAI 已经把 GPT-5.6 Luna 的价格下调了 80%,V4-Flash 在自己的 API 上的单任务成本仍然比 Luna 低约 60%。

图 2 | 真实平台截图:Artificial Analysis 智能指数对比(官方模型页) —— 来源:artificialanalysis.ai/models/deepseek-v4-flash(截图于 2026-08-02)

图 3 | 真实平台截图:模型概览(智能 / 速度 / 价格 / 缓存命中价格) —— 来源:artificialanalysis.ai/models/deepseek-v4-flash(截图于 2026-08-02)
Arena.ai(Frontend Code Arena / WebDev 前端代码竞技场):V4-Flash-High 以 1594 分重塑榜单,总排名第 8、开放类别第 3;相比 Flash-High-Preview 提升 165 分,相比 V4-Pro-Preview 提升 132 分。前端代码领域的"黄金标准"评测,人类开发者双盲盲测,这个分数含金量不低。

图 4 | Arena.ai 前端代码竞技场:正式版 1594 分、总排名第 8 —— 来源:lmarena.ai/leaderboard/code/webdev/frontend(榜单数据 Aug 5, 2026;截图于 2026-08-06)
为什么成本能压这么狠? 关键在缓存:DeepSeek 给自己的 API 提供了约 98% 的缓存命中折扣,而行业主流通常是 90%。这意味着在对话复用、代码补全这类高缓存场景,V4-Flash 的成本曲线被压到了一个离谱的位置。
两套独立数据,同一个结论:这不是 DeepSeek 自嗨,是真的能打。
7. 价格账本:为什么它被叫做"性价比之王"
官方定价(单位:元 / 百万 tokens):
| 场景 | V4-Flash 正式版 |
|---|---|
| 输入(命中缓存) | 0.02 |
| 输入(未命中缓存) | 1 |
| 输出 | 2 |
| 前端竞技场参考价 | $0.14 / $0.28 每 MToken |

图 5 | 价格账本:缓存命中输入低至 0.02 元/百万 tokens —— 来源:DeepSeek 官方定价页(截图于 2026-08-06)
翻译一下这个价格意味着什么:
- 成本约为旗舰闭源模型的 1/90(社区口径)。一亿次对话的账单,可能还没人家一个月的实验费贵。
- 单任务成本比降价 80% 后的 GPT-5.6 Luna 还低约 60%(Artificial Analysis 口径)。
- 对高并发、高缓存命中率的 Agent 服务,真实成本还能再往下压一个台阶。
但别急着高兴,官方已预告将引入峰谷定价,高峰时段价格翻倍。现在的"地板价"不是永久状态,接生产前要把这一点算进 TCO。
8. 开发者最关心的一步:Responses API + Codex 接入
接口层的变化,是这次发布对开发者最实质的利好:
- 原生支持 OpenAI Responses API 格式:不用再套一层转换层。
- 针对性适配 Codex 生态:一次配置,就能在 Codex CLI、ChatGPT 桌面端、VS Code 的 Codex 插件里直接调用。
- 零迁移成本:
base_url不变,把模型名切到deepseek-v4-flash即可。官方文档直接给出了配置路径(见 api-docs.deepseek.com 的 Codex 集成文档)。
迁移示意(具体以官方文档为准):
# 假设你之前已经在用 V4-Flash 预览版接 Codex
# base_url 保持不变,只需切换模型名
export OPENAI_API_BASE_URL="https://api.deepseek.com"
export OPENAI_MODEL_NAME="deepseek-v4-flash"
场景化想象一下:一个 6 人小团队,想在 Codex 里跑代码 Agent,预算紧张。之前要么上闭源旗舰、账单一个月顶一个新人工资;要么用开源模型自己折腾桥接层。现在,改一行模型名,接上 V4-Flash,一个"便宜到能当 CI 常驻工具用"的编码 Agent 就上线了。
注意:目前只有 V4-Flash 能接 Codex,V4-Pro 要等到 8 月初。
9. 泼冷水:五个你必须知道的限制
评测文章不能只吹。以下是必须正视的五盆冷水:
- 仅限 API,App/Web 体感为零。 普通用户今天打开 DeepSeek 对话窗口,体验和昨天一模一样。如果你是被标题吸引的聊天用户,这次发布与你无关。
- benchmark 是"自报家门"。 官方数据用的是自家 DeepSeek Harness,参数设置也是官方定的。虽然第三方平台交叉验证了整体趋势,但细节分数仍需独立复现后再信。
- “全能"的真相是"偏科”。 看综合 Agent 基准 Agent Last Exam 只有 25.2、Automation Bench 只有 25.1——Agent 能力在特定工程场景突飞猛进,但离"通用数字员工"还有很长一段路。
- 成本优势不是永久的。 峰谷定价在路上,98% 缓存折扣能持续多久是未知数。生产环境别按地板价做长期预算。
- 数据污染风险仍在。 开源权重意味着测试集可能进入训练数据。对 DeepSWE、Cybergym 这类新基准,这是所有开源模型共同面对的问题,不能单独苛责 V4-Flash,但也不能无视。
最诚实的一句话:如果你要的是"能跑就行、成本越低越好"的生产级 Agent,它现在是近乎无解的选择;如果你要的是"推理上限最高"的旗舰,那它不是,请等 V4-Pro。
10. 该不该用:一张决策表
用它:
- 你在做 Agent / 工具调用 / 终端自动化 / 全栈编码流水线
- 你要的是"高并发、低成本、能干实事"的生产模型
- 你想在真实 Agent 流水线里替换闭源旗舰,省下 90%+ 的调用成本
- 你能接受 benchmark 以官方数据为主,愿意自己跑一轮复现
等一等:
- 你只是 App/Web 聊天用户 → 本次与你无关,等 V4-Pro 正式版
- 你要的是复杂数学、竞赛级推理的上限 → Flash 不是旗舰,Pro 才是
- 你的团队对"自报 benchmark"零容忍 → 等独立评测铺开再迁移
- 你的业务对成本有严格长期预算 → 先算清峰谷定价后的 TCO
11. FAQ
DeepSeek-V4-Flash 正式版和预览版有什么区别?
结构、尺寸、上下文完全一致(284B 总参 / 13B 激活 / 1M),仅重做了一轮后训练。结果 Agent 能力天翻地覆:DeepSWE 从 7.3 提到 54.4,Terminal Bench 2.1 从 61.8 提到 82.7。
DeepSeek-V4-Flash 正式版多少钱?
输入缓存命中 0.02 元、未命中 1 元、输出 2 元(每百万 tokens)。约为旗舰闭源模型的 1/90,单任务成本比降价 80% 后的 GPT-5.6 Luna 还低约 60%。注意峰谷定价即将上线。
V4-Flash 能在 Codex / ChatGPT 里用吗?
能。正式版原生支持 Responses API 并针对性适配 Codex,在 Codex CLI、ChatGPT 桌面端、VS Code Codex 插件里一次配置即可使用,base_url 不变,改模型名即可。
DeepSeek-V4-Flash 和 Claude Opus 4.8 谁更强?
V4-Flash 在多项 Agent 基准上逼近 Opus 4.8(如 Terminal Bench 2.1 82.7 vs 85.0),超过 GLM-5.2,是开源权重模型里最接近前沿闭源的选择。但旗舰推理上限仍是 Opus 4.8 更高,且 Flash 成本只有其约 1/90。
DeepSeek-V4-Pro 正式版什么时候发布?
官方表示"尽快发布",预计 8 月初(Responses API 对 Pro 的支持同步跟进)。App/Web 端与 Pro API 目前均未更新。
V4-Flash 的 benchmark 可信吗?有独立评测吗?
官方数据用自家 Harness,建议打折看。但 Artificial Analysis(智能指数 50 分)与 Arena.ai(前端代码 1594 分、开放类别第 3)两大独立平台已交叉验证,整体结论一致:Agent 能力确实越级。
12. 结论
回到开头那句:这不是一次"更快更便宜"的更新,是一次能力的越级。
DeepSeek-V4-Flash 正式版最值得记住的一件事,不是 82.7 或 54.4 这些数字本身,而是它证明了一个此前被低估的判断:模型竞争已经进入"训练配方"时代——谁能在相同的算力和参数下,把模型训练得更会干活,谁就是赢家。 它用一个 13B 激活参数的"轻量版",把自家 490B 的 Pro 预览版按在地上摩擦,这件事本身就是对整个行业"堆参数"路线的一次公开否定。
对开发者:它是一份诚意十足的生产级选择,现在就可以接进你的流水线,成本低到可以当 CI 常驻工具用。
对行业:真正的变量在 8 月的 V4-Pro——当 Flash 已经逼近 Opus 4.8,我们实在没法不好奇 Pro 会掏出什么。
最后一个问题留给你:
你打算什么时候把 V4-Flash 接进自己的流水线?是今天,还是等 V4-Pro? 评论区聊聊你的场景,或者把这篇转给那个还在纠结选型的朋友。
数据截至 2026-08-06,来源:DeepSeek 官方 API 发布日志、Artificial Analysis、Arena.ai 及公开报道。本文为公开数据评测,不含作者实测;benchmark 官方数据请以官方披露与独立复现为准。
更多推荐
所有评论(0)