DeepSeek-V4-Flash 正式版深度评测:13B 激活参数的"轻量版",凭什么反超自家 Pro、逼近 Opus 4.8

一句话结论:这是 2026 年上半年性价比最离谱的模型发布——但不是给普通用户准备的。对做 Agent、做自动化、做编码流水线的团队,现在就该切;对 App/Web 端的普通用户,体感为零,等 V4-Pro。


摘要(30 秒版)

7 月 31 日,DeepSeek 在 API 文档里悄悄上线了 DeepSeek-V4-Flash 正式版(内部代号 V4-Flash-0731)。模型结构、尺寸与 4 月的预览版完全一致,仅重做了一轮后训练,但 9 项 Agent 基准全面反超自家 V4-Pro-Preview:

  • DeepSWE 长程软件工程:7.3 → 54.4(7.5 倍)
  • Terminal Bench 2.1 终端操作:61.8 → 82.7
  • Cybergym 安全攻防:38.7 → 76.7

第三方独立评测同步验证:Artificial Analysis 智能指数 50 分,仅比 GPT-5.6 Luna(51)低 1 分;Arena.ai 前端代码竞技场 1594 分,开放类别第 3。价格上,缓存命中输入 0.02 元/百万 tokens,成本约为旗舰闭源模型的 1/90。

但注意:本次升级只覆盖 V4-Flash 的 API 接口,V4-Pro 与 App/Web 端全部未动。官方表示 V4-Pro 正式版 8 月初发布。


目录

  1. 一个"以下犯上"的正式版
  2. 先给结论:为什么说这是"换头手术"而不是"闪一下"
  3. 规格没变,变的只有一件事:后训练
  4. 九项 Agent 基准,逐项翻译成人话
  5. 跟谁比:反超 Pro 预览、压过 GLM-5.2、逼近 Opus 4.8
  6. 独立第三方怎么打分:Artificial Analysis 与 Arena.ai
  7. 价格账本:为什么它被叫做"性价比之王"
  8. 开发者最关心的一步:Responses API + Codex 接入
  9. 泼冷水:五个你必须知道的限制
  10. 该不该用:一张决策表
  11. FAQ
  12. 结论

1. 一个"以下犯上"的正式版

7 月 31 日下午,开发者小陈照常打开 DeepSeek 的 API 文档查参数,发现更新日志里多了一行字:“DeepSeek-V4-Flash 正式版 API 上线公测。”

没有发布会,没有通稿,甚至没有一条微博。但看懂那串基准数字的开发者,半小时后就把这个话题送上了知乎热搜第一

原因是这四个字——“倒反天罡”

按照 DeepSeek 一贯的分层逻辑,Pro 是旗舰,Flash 是轻量、便宜、快的"低配版"。结果这次,一个激活参数只有 13B 的轻量版,在 Agent 能力上把激活参数 490B 的自家 Pro 预览版按在地上摩擦。这不是小步快跑,是换头手术。

时间线补全一下:

  • 2026-04-24:DeepSeek-V4 系列预览版发布并开源(MIT 协议),原生多模态 + 1M 上下文,Flash 与 Pro 双剑齐出。
  • 2026-06:完成首轮外部融资,超 74 亿美元,投后估值超 500 亿美元。这是融资后的第一轮技术兑现。
  • 2026-07-24:旧模型名 deepseek-chatdeepseek-reasoner 正式停用,全面切换到 V4 接口。
  • 2026-07-31:正式版原本说 7 月中旬发,一路跳票到 7 月最后一天,终于落地。

为什么拖到最后一天? 没有官方解释。但结合"仅重做了后训练"这个事实,合理的猜测是:DeepSeek 在等后训练管线跑到满意为止——他们宁可跳票,也不发一个丢人的正式版。从结果看,这波值。


2. 先给结论:为什么说这是"换头手术"而不是"闪一下"

名字里带 Flash,很多人的第一反应是"不就快一点、便宜一点吗?"。这是对这次发布最深的误读。

评测之前,先把立场摆清楚:

这不是一次"更快更便宜"的例行更新。这是一次把"轻量版"直接推进旗舰能力地带的越级发布。 它用分数证明了:Agent 能力的杠杆不在参数规模,而在后训练配方。

支撑这个判断的三条证据,后面逐节展开:

  1. 同样的骨架:284B 总参 / 13B 激活,与预览版一字未改,连上下文长度都是同一个 1M。
  2. 能力翻天覆地:DeepSWE 从 7.3 到 54.4、Cybergym 从 38.7 到 76.7——这不是"提升",是"换了一个物种"。
  3. 越级压制:9 项基准全部超过 V4-Pro-Preview,整体超过 744B 总参的 GLM-5.2,逼近 Claude Opus 4.8。

一句话:DeepSeek 没有造一个新的 Flash,它把 Flash 的后训练重做了一遍,顺便把"后训练"这件事的定义给改了。


3. 规格没变,变的只有一件事:后训练

官方更新日志里有一句看似平淡、实则震撼的话:

“DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练。”

把它翻译成人话:模型骨架没动,参数没动,连显存占用都没变,只换了一套"怎么把能力调出来"的训练配方。

大模型的能力来源可以粗暴分成两阶段:

  • 预训练:喂海量数据,学语言、学知识、学推理——决定模型的上限。
  • 后训练:用 SFT、RLHF、DPO 等方法,让模型学会"正确使用自己的能力"——决定模型的实际表现。

过去一年的行业共识是:预训练决定一切,后训练只是锦上添花。V4-Flash 用一张 7.3 → 54.4 的成绩单,把这个共识打了个洞。

这意味着什么? 意味着在后训练工程化上领先的公司,可以用同样的算力和参数,造出能力差出好几个档次的模型。对中小团队,这反而是好消息——你的模型不需要越来越大,只需要被"训练得更会干活"。

黄金句:“后训练不是微调,是让模型学会’正确使用自己能力’的能力。V4-Flash 用分数证明了它的杠杆。”


4. 九项 Agent 基准,逐项翻译成人话

先上官方公布的 9 项基准(测试框架:DeepSeek Harness 极简模式,max 档位,top_p=0.95,temperature=1.0):

基准 测的是什么 正式版 0731 预览版 Preview
Terminal Bench 2.1 终端 Agent:能否在真实命令行里独立完成部署、排障、写脚本 82.7 61.8
DeepSWE 长程软件工程:理解仓库、定位问题、跨文件修改、跑测试 54.4 7.3
NL2Repo 代码仓库理解与修改 54.2
Cybergym 安全 Agent:攻防演练、漏洞修复 76.7 38.7
Toolathlon Verified 工具调用:多工具编排的正确率 70.3
Agent Last Exam 综合 Agent 现实任务 25.2
Automation Bench (Public) 自动化任务 25.1
DSBench-FullStack 全栈开发(内部基准) 68.7
DSBench-Hard 高难度 Coding Agent(内部基准) 59.6

DeepSeek 官方 API 更新日志页面截图:2026-07-31 条目列出 V4-Flash 正式版九项 Agent 基准,含 Terminal Bench 2.1 82.7、NL2Repo 54.2、Cybergym 76.7、DeepSWE 54.4、Toolathlon 70.3、Agent Last Exam 25.2、Automation Bench 25.1、DSBench-FullStack 68.7、DSBench-Hard 59.6

图 1 | 官方更新日志截图:九项 Agent 基准 —— 来源:api-docs.deepseek.com/zh-cn/updates/(截图于 2026-08-06)

数字单独看没感觉,逐个翻译:

DeepSWE:7.3 → 54.4,最疯狂的一跳。 DeepSWE 是 2026 年推出的长程软件工程测试集,113 个任务,每个都要"读仓库 → 定位 Bug → 跨文件改代码 → 跑测试验证 → 失败再修"。预览版得分 7.3,基本等于睁眼瞎——它会在没搞懂任务的情况下编造结果扔给你。正式版 54.4,意味着它能真正自主完成多步修复。7.5 倍的提升,不是因为模型变大了,而是因为它终于"学会干活了"。

Terminal Bench 2.1:82.7。 这是"AI 替代运维"的核心指标:给 AI 一个真实 Linux 终端,让它自己搞定端到端任务。82.7 分,在命令行世界里已经接近人类中级工程师的干活水平。

Cybergym:38.7 → 76.7。 网络安全模拟环境,攻防演练、漏洞修复。这个数字说明 AI 安全工程化不再是 PPT 里的概念,而是可执行的实战能力。

Toolathlon Verified:70.3。 工具调用是 Agent 的"手脚",这个分数意味着多工具编排的正确率已经过了"能用"的红线。

顺手做个实验:把你仓库里那个最让人头大的自动化任务,原封不动丢给它跑一遍,再回来告诉我结果——你的完成率大概率比 DeepSWE 的 54.4 更能说明问题。

黄金句:模型竞争的下半场,从"谁参数大"转向"谁会干活"。


5. 跟谁比:反超 Pro 预览、压过 GLM-5.2、逼近 Opus 4.8

评测的意义在对比。官方这次毫不客气,直接拿 Flash 去对标自家 Pro 预览版和行业旗舰:

模型 总参数 激活参数 Terminal Bench 2.1
DeepSeek-V4-Flash 0731 284B 13B 82.7
DeepSeek-V4-Pro-Preview 1.6T 490B 72.1
GLM-5.2 744B 400B 81.0
Claude Opus 4.8 85.0

两个值得注意的细节:

第一,V4-Flash 干翻了比自己大一个数量级的模型。 GLM-5.2 总参数 744B、激活 400B,是 V4-Flash 的 30 倍和 30 倍(激活比 13B vs 400B,约 1/30)。结果 Flash 整体表现超过 GLM-5.2。这已经不是在比参数,是在比训练效率。

第二,逼近 Opus 4.8。 在 Terminal Bench 2.1 上,V4-Flash 82.7 距离 Opus 4.8 的 85.0 只差 2.3 分。第三方评测机构甚至给出一个更激进的说法:V4-Flash 是首个被团队直接投入真实 Agent 流水线、作为 Anthropic/OpenAI 级别前沿模型替代品的开源权重模型,并在 SWE-bench Verified 上取得开源权重模型最高分,匹配 GPT-5.5 级别的 Agent 性能。

必须说明的严谨性问题:Terminal Bench 2.0 与 2.1 不是同一个版本的测试集,跨版本直接对比并不完全公平。V4-Pro-Preview 的 72.1 是在 2.1 上测的,但 2.0 时代 Pro 预览版只有 67.9。我的判断是:无论哪个口径,一个激活参数 13B 的轻量版追平自家 490B 旗舰,这件事本身就很离谱。

黄金句:这不是性价比,这是降维打击。


6. 独立第三方怎么打分:Artificial Analysis 与 Arena.ai

官方自报家门的 benchmark 要打折看,这是评测的基本素养。好在这次两大独立平台同步跟进,给了交叉验证:

Artificial Analysis(智能指数 AII):V4-Flash 0731 得 50 分,比 4 月的 Flash 预览版高出 10 分,比 V4-Pro 预览版高出 6 分,仅比 GPT-5.6 Luna 的最高 51 分低 1 分。更关键的是成本结论:即使 OpenAI 已经把 GPT-5.6 Luna 的价格下调了 80%,V4-Flash 在自己的 API 上的单任务成本仍然比 Luna 低约 60%

Artificial Analysis 官网模型页实况截图:DeepSeek V4 Flash 0731 的 Artificial Analysis Intelligence Index 对比图,横向条形图按智能指数排序,DeepSeek 系模型为蓝色、对标模型为红色

图 2 | 真实平台截图:Artificial Analysis 智能指数对比(官方模型页) —— 来源:artificialanalysis.ai/models/deepseek-v4-flash(截图于 2026-08-02)

Artificial Analysis 模型概览截图:Intelligence、Speed、Price、Cache Hit Price 四项指标条形对比

图 3 | 真实平台截图:模型概览(智能 / 速度 / 价格 / 缓存命中价格) —— 来源:artificialanalysis.ai/models/deepseek-v4-flash(截图于 2026-08-02)

Arena.ai(Frontend Code Arena / WebDev 前端代码竞技场):V4-Flash-High 以 1594 分重塑榜单,总排名第 8、开放类别第 3;相比 Flash-High-Preview 提升 165 分,相比 V4-Pro-Preview 提升 132 分。前端代码领域的"黄金标准"评测,人类开发者双盲盲测,这个分数含金量不低。

Arena.ai WebDev Frontend Code Arena 榜单实况截图:deepseek-v4-flash-high 以 1594 分位列总榜第 8(DeepSeek · MIT,Preliminary,$0.14 / $0.28);上方 glm-5.2-max 1595 分、claude-opus-5-max 1710 分等

图 4 | Arena.ai 前端代码竞技场:正式版 1594 分、总排名第 8 —— 来源:lmarena.ai/leaderboard/code/webdev/frontend(榜单数据 Aug 5, 2026;截图于 2026-08-06)

为什么成本能压这么狠? 关键在缓存:DeepSeek 给自己的 API 提供了约 98% 的缓存命中折扣,而行业主流通常是 90%。这意味着在对话复用、代码补全这类高缓存场景,V4-Flash 的成本曲线被压到了一个离谱的位置。

两套独立数据,同一个结论:这不是 DeepSeek 自嗨,是真的能打。


7. 价格账本:为什么它被叫做"性价比之王"

官方定价(单位:元 / 百万 tokens):

场景 V4-Flash 正式版
输入(命中缓存) 0.02
输入(未命中缓存) 1
输出 2
前端竞技场参考价 $0.14 / $0.28 每 MToken

DeepSeek 官方定价页截图:deepseek-v4-flash 输入命中缓存 0.02 元、未命中 1 元、输出 2 元(元/百万 tokens),并发 2500;deepseek-v4-pro 0.025 / 3 / 6 元,并发 500,并注明峰谷定价说明

图 5 | 价格账本:缓存命中输入低至 0.02 元/百万 tokens —— 来源:DeepSeek 官方定价页(截图于 2026-08-06)

翻译一下这个价格意味着什么:

  • 成本约为旗舰闭源模型的 1/90(社区口径)。一亿次对话的账单,可能还没人家一个月的实验费贵。
  • 单任务成本比降价 80% 后的 GPT-5.6 Luna 还低约 60%(Artificial Analysis 口径)。
  • 对高并发、高缓存命中率的 Agent 服务,真实成本还能再往下压一个台阶。

但别急着高兴,官方已预告将引入峰谷定价,高峰时段价格翻倍。现在的"地板价"不是永久状态,接生产前要把这一点算进 TCO。


8. 开发者最关心的一步:Responses API + Codex 接入

接口层的变化,是这次发布对开发者最实质的利好:

  • 原生支持 OpenAI Responses API 格式:不用再套一层转换层。
  • 针对性适配 Codex 生态:一次配置,就能在 Codex CLI、ChatGPT 桌面端、VS Code 的 Codex 插件里直接调用。
  • 零迁移成本:base_url 不变,把模型名切到 deepseek-v4-flash 即可。官方文档直接给出了配置路径(见 api-docs.deepseek.com 的 Codex 集成文档)。

迁移示意(具体以官方文档为准):

# 假设你之前已经在用 V4-Flash 预览版接 Codex
# base_url 保持不变,只需切换模型名
export OPENAI_API_BASE_URL="https://api.deepseek.com"
export OPENAI_MODEL_NAME="deepseek-v4-flash"

场景化想象一下:一个 6 人小团队,想在 Codex 里跑代码 Agent,预算紧张。之前要么上闭源旗舰、账单一个月顶一个新人工资;要么用开源模型自己折腾桥接层。现在,改一行模型名,接上 V4-Flash,一个"便宜到能当 CI 常驻工具用"的编码 Agent 就上线了。

注意:目前只有 V4-Flash 能接 Codex,V4-Pro 要等到 8 月初。


9. 泼冷水:五个你必须知道的限制

评测文章不能只吹。以下是必须正视的五盆冷水:

  1. 仅限 API,App/Web 体感为零。 普通用户今天打开 DeepSeek 对话窗口,体验和昨天一模一样。如果你是被标题吸引的聊天用户,这次发布与你无关。
  2. benchmark 是"自报家门"。 官方数据用的是自家 DeepSeek Harness,参数设置也是官方定的。虽然第三方平台交叉验证了整体趋势,但细节分数仍需独立复现后再信。
  3. “全能"的真相是"偏科”。 看综合 Agent 基准 Agent Last Exam 只有 25.2、Automation Bench 只有 25.1——Agent 能力在特定工程场景突飞猛进,但离"通用数字员工"还有很长一段路。
  4. 成本优势不是永久的。 峰谷定价在路上,98% 缓存折扣能持续多久是未知数。生产环境别按地板价做长期预算。
  5. 数据污染风险仍在。 开源权重意味着测试集可能进入训练数据。对 DeepSWE、Cybergym 这类新基准,这是所有开源模型共同面对的问题,不能单独苛责 V4-Flash,但也不能无视。

最诚实的一句话:如果你要的是"能跑就行、成本越低越好"的生产级 Agent,它现在是近乎无解的选择;如果你要的是"推理上限最高"的旗舰,那它不是,请等 V4-Pro。


10. 该不该用:一张决策表

用它:

  • 你在做 Agent / 工具调用 / 终端自动化 / 全栈编码流水线
  • 你要的是"高并发、低成本、能干实事"的生产模型
  • 你想在真实 Agent 流水线里替换闭源旗舰,省下 90%+ 的调用成本
  • 你能接受 benchmark 以官方数据为主,愿意自己跑一轮复现

等一等:

  • 你只是 App/Web 聊天用户 → 本次与你无关,等 V4-Pro 正式版
  • 你要的是复杂数学、竞赛级推理的上限 → Flash 不是旗舰,Pro 才是
  • 你的团队对"自报 benchmark"零容忍 → 等独立评测铺开再迁移
  • 你的业务对成本有严格长期预算 → 先算清峰谷定价后的 TCO

11. FAQ

DeepSeek-V4-Flash 正式版和预览版有什么区别?

结构、尺寸、上下文完全一致(284B 总参 / 13B 激活 / 1M),仅重做了一轮后训练。结果 Agent 能力天翻地覆:DeepSWE 从 7.3 提到 54.4,Terminal Bench 2.1 从 61.8 提到 82.7。

DeepSeek-V4-Flash 正式版多少钱?

输入缓存命中 0.02 元、未命中 1 元、输出 2 元(每百万 tokens)。约为旗舰闭源模型的 1/90,单任务成本比降价 80% 后的 GPT-5.6 Luna 还低约 60%。注意峰谷定价即将上线。

V4-Flash 能在 Codex / ChatGPT 里用吗?

能。正式版原生支持 Responses API 并针对性适配 Codex,在 Codex CLI、ChatGPT 桌面端、VS Code Codex 插件里一次配置即可使用,base_url 不变,改模型名即可。

DeepSeek-V4-Flash 和 Claude Opus 4.8 谁更强?

V4-Flash 在多项 Agent 基准上逼近 Opus 4.8(如 Terminal Bench 2.1 82.7 vs 85.0),超过 GLM-5.2,是开源权重模型里最接近前沿闭源的选择。但旗舰推理上限仍是 Opus 4.8 更高,且 Flash 成本只有其约 1/90。

DeepSeek-V4-Pro 正式版什么时候发布?

官方表示"尽快发布",预计 8 月初(Responses API 对 Pro 的支持同步跟进)。App/Web 端与 Pro API 目前均未更新。

V4-Flash 的 benchmark 可信吗?有独立评测吗?

官方数据用自家 Harness,建议打折看。但 Artificial Analysis(智能指数 50 分)与 Arena.ai(前端代码 1594 分、开放类别第 3)两大独立平台已交叉验证,整体结论一致:Agent 能力确实越级。


12. 结论

回到开头那句:这不是一次"更快更便宜"的更新,是一次能力的越级。

DeepSeek-V4-Flash 正式版最值得记住的一件事,不是 82.7 或 54.4 这些数字本身,而是它证明了一个此前被低估的判断:模型竞争已经进入"训练配方"时代——谁能在相同的算力和参数下,把模型训练得更会干活,谁就是赢家。 它用一个 13B 激活参数的"轻量版",把自家 490B 的 Pro 预览版按在地上摩擦,这件事本身就是对整个行业"堆参数"路线的一次公开否定。

对开发者:它是一份诚意十足的生产级选择,现在就可以接进你的流水线,成本低到可以当 CI 常驻工具用。

对行业:真正的变量在 8 月的 V4-Pro——当 Flash 已经逼近 Opus 4.8,我们实在没法不好奇 Pro 会掏出什么。

最后一个问题留给你:

你打算什么时候把 V4-Flash 接进自己的流水线?是今天,还是等 V4-Pro? 评论区聊聊你的场景,或者把这篇转给那个还在纠结选型的朋友。


数据截至 2026-08-06,来源:DeepSeek 官方 API 发布日志、Artificial Analysis、Arena.ai 及公开报道。本文为公开数据评测,不含作者实测;benchmark 官方数据请以官方披露与独立复现为准。

更多推荐