轻量逆袭:DeepSeek V4-Flash 用 13B 参数撕掉「便宜没好货」的标签
一块 2840 亿参数的 MOE 模型,每次推理只唤醒其中 130 亿。没有发布会,没有预热海报,官网上多了一行更新日志——然后整个开发者圈子就炸了。
一行日志引发的连锁反应
2026 年 7 月 31 日下午,DeepSeek 官网 API 文档的更新日志里静悄悄地出现了一句话:「DeepSeek-V4-Flash 正式版 API 上线公测」。没有直播,没有 PPT,连自家公众号都没发推送。
但接下来发生的事,让这句话变成了 8 月第一周 AI 圈最密集的谈资:
- 知乎热搜登顶,开发者群里转发量超过了过去三个月任何一篇文章。
- 次日 A 股开盘,阿里、MiniMax 等国产大模型概念股集体大涨,东方证券连夜出了行业周报。
- 最微妙的时间线是——就在同一天,OpenAI 宣布 GPT-5.6 Luna 降价 80%。
两件事撞在同一天,不是巧合。
反常之处:架构一点没变,只改了「后半截」
在 AI 行业的默认剧本里,「模型升级」基本等于「堆更多参数、烧更多算力」。但 V4-Flash 正式版走了一条截然不同的路。
官方更新日志写得明明白白:模型结构、尺寸和 Preview 版完全一致——2840 亿总参数的 MOE 架构,每次推理只激活 130 亿。唯一的变化是「仅重新进行了后训练(post-training)」。
翻译成人话:发动机没换,车身没改,就是把「驾驶技术」重新练了一遍。
然后发生了什么?来看数据。
这张成绩单,够狠
DeepSeek 公布了 9 项 Agent 任务的基准测试分数,每一项都超过了自家的 V4-Pro 预览版。一个叫 Flash 的轻量模型,把同门师兄 Pro 按在了地上。
| 基准测试 | V4-Flash 正式版 | V4-Pro Preview | 说明 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 72.1 | 真实终端环境实操:改配置、跑脚本、修 bug |
| DeepSWE | 54.4 | 7.3* | 真实 GitHub 仓库:读 issue → 定位代码 → 写补丁 → 跑测试 |
| Cybergym | 76.7 | — | 网络攻防自动化场景 |
| Toolathlon | 70.3 | — | 多工具选择与调用能力 |
| NL2Repo | 54.2 | — | 一句话生成完整代码仓库 |
| DSBench-FullStack | 68.7 | — | 全栈开发任务 |
| Agent Last Exam | 25.2 | — | 综合 Agent 能力(地狱级难度卷) |
* DeepSWE 的 Preview 版分数为 7.3,官方未在本次更新日志中列出,来自社区回溯对比。
最扎眼的是 DeepSWE 这一项:Preview 版 7.3 → 正式版 54.4,Agent 编程能力提升了超过 6 倍。
DeepSWE 是什么?把 AI 扔进真实的 GitHub 仓库,让它自己读 issue、找到相关代码、写出补丁、跑测试直到通过。全程不能有人插手。7.3 分是什么概念?基本上「不能用」——大部分任务要么死循环,要么产出一堆没法跑的代码。而 54.4 分意味着它可以作为「初级到中级编程助手」独立完成中等复杂度的开发任务了。
作为对比:社区流传的横向数据中,Claude 3.5 Sonnet 同一指标约 49%,GPT-4o 约 38%——这些可都是参数规模远超 Flash 的旗舰模型。
独立评测机构 Artificial Analysis 的智能指数也验证了这一点:V4-Flash 0731 拿到 50 分,比自家 V4 Pro 高 6 分,距离 OpenAI 最高分的 GPT-5.6 Luna(51 分)只差 1 分。
一个 130 亿激活参数的轻量模型,咬住了千亿级旗舰的脚后跟。
后训练的「魔法」:Agent 不是训出来的,是调教出来的
这里触及了一个正在重塑行业认知的核心问题。
传统大模型训练的路径是「预训练 → 监督微调 → RLHF」。但 Agent 任务有一个根本性的尴尬:互联网上的文本,不会告诉你「当你调一个 API 返回 403 错误时,应该先检查认证头还是先检查请求格式」。这些「操作直觉」,在预训练语料里根本不存在。
V4-Flash 正式版的做法,类似于给一个已经学会开车的司机做特训——不在驾校里转圈,而是直接扔到赛道上跑圈。让模型在模拟环境中反复执行 Agent 任务,从每一次成功和失败中学习:
- 工具调用稳定性:Preview 版常见的「死循环」(反复调用同一个工具但提取不到有用信息)和「JSON 格式错误」被基本消灭。在需要 35 次工具调用的复杂任务中,正式版可以一次跑通。
- 长程记忆:Agent 在执行第 20 步操作时,仍然记得第 3 步获取的关键信息——不是「做完就忘」。
- 智能重试:当工具返回错误时,不是「放弃」或「换个方向硬怼」,而是分析错误原因、调整参数、在必要时更换策略。
这四个维度的提升没靠加参数,全靠高质量的后训练数据。它释放了一个清晰的信号:对于 Agent 任务来说,后训练阶段的价值被行业严重低估了。好的后训练,比堆十倍的预训练算力更管用。
藏在角落里的两个「暗棋」
跑分之外,有两件事被很多人忽略了,但它们的影响可能比跑分更大。
第一颗暗棋:Harness 框架浮出水面
V4-Flash 官方公告里出现了一个此前只在 DeepSeek 招聘页面见过的名字——DeepSeek Harness,一个内部开发的 Agent 执行框架。
Harness 的设计哲学和 Anthropic 的 Computer Use、OpenAI 的 Codex CLI 完全不同。它的核心思路叫「极简模式」:去掉所有不必要的中间抽象层,让模型的输出直接映射为工具的 API 调用。每少一层翻译,就少一层信息损耗。
更有意思的是 Harness 团队负责人——崔添翼,浙大计算机系出身,6 枚 ACM 亚洲区域赛金牌,在顶级量化机构 Jane Street 干了九年之后,今年 3 月加入 DeepSeek。量化交易对系统延迟和可靠性的要求,远超普通软件开发——这个背景决定了 Harness 的基因:追求极致的执行效率和鲁棒性。
从 5 月开始,DeepSeek 大量招聘 Agent 方向工程师,覆盖工具调用、任务规划、浏览器自动化、代码执行安全等多个子方向。Harness 此次公开亮相,说明这个内部框架已经达到了可以对外展示的成熟度。考虑到 DeepSeek 一贯的开源传统——V3、R1 都全量开源了——如果 Harness 也开源,将对 LangChain、CrewAI、AutoGen 等现有 Agent 框架格局产生直接冲击。
第二颗暗棋:用 OpenAI 的协议,撬 OpenAI 的墙角
更新日志里还有一句不起眼但分量极重的话:「V4-Flash 原生支持 Responses API 格式,并针对性适配了 Codex。」
Responses API 是 OpenAI 去年推出的新一代接口规范,Codex CLI、Agent SDK、ChatGPT 编程订阅、Cursor/Copilot 后端都走这套协议。以前想把国产模型接入 Codex 生态,中间必须垫一层协议转换——模型的推理过程、工具调用这些结构化信息,转一道就「压扁」了,丢精度。
现在不用了。开发者只要把 base_url 指向 DeepSeek,模型名换成 deepseek-v4-flash,现有代码一行不用改,直接就能跑。
这不是技术细节,是商业策略。Codex 是 OpenAI 把 GPT 系列变现的核心入口。DeepSeek 用同一套协议把Flash塞进去,等于对所有 Codex 用户说了一句话:「你可以继续用 OpenAI 的姿势干活,但付 DeepSeek 的价钱。」
价格战的新范式:不降单价,降任务成本
来看看价格这一仗打得有多狠。
| 模型 | 输入($/百万Token) | 输出($/百万Token) |
|---|---|---|
| DeepSeek V4-Flash | 0.14 | 0.28 |
| GPT-5.6 Luna(刚降80%) | 0.20 | 1.20 |
| GPT-5.6 Sol | 5.00 | 30.00 |
| Claude Sonnet 5 | 2.00 | 10.00 |
单看输入价格,差距似乎不大。但 Agent 场景的秘密藏在另一个地方:缓存命中折扣。
Agent 任务有个特点——系统提示词、工具定义、前几轮对话历史,每一轮请求都在重复发送。这部分内容如果能命中缓存,实际账单和不命中能差出几十倍。DeepSeek 给自家 API 的缓存命中折扣是 约 98%,而行业大多数厂商给的是 90% 左右。
别小看这 8 个百分点的差距。在 Agent 高频调用场景下,这几个点乘以几千次调用,就是一笔实打实的成本差异。据社区开发者测算,在 DeepSeek 自有 API 上跑 Agent 任务,单任务实际成本比已经降价 80% 的 GPT-5.6 Luna 还低约 60%。
而且这次 DeepSeek 没有走「直接降价」的老路。能力涨了这么多,单价一分没动。降的是任务完成成本——模型在同样价格下把活干得更好,重试更少,浪费的 token 更少。这比直接降价更难对付,因为对手没法简单跟进:你的模型不会因为降价就突然学会怎么调工具。
对个人开发者意味着什么
说到底,普通开发者不关心宏观格局,关心的是三件事:我能用吗?好用吗?花多少钱?
三件事的答案都很实在。
关于「能用吗」:如果你已经在用 OpenAI 的 Chat Completions 或 Responses API,迁移成本几乎为零——换 base_url 和模型名就行,一行新代码不用写。Codex CLI 只需要三条命令就能切过去。如果你在用 Cursor、Copilot 这些 IDE 插件——V4-Flash 已经适配好了。
关于「好用吗」:实话实说,聊天、写作这些通用能力未必追上旗舰。但 Agent 编程能力——长代码库分析、多工具链协调、自动化脚本——已经够用了。一个开发者社区的经典评价是:「以前需要上旗舰模型才敢接的活,现在 Flash 就能跑,账单还不到旗舰的零头。」
关于「花多少钱」:有人上个月刚把主力模型从「一家贵的」换成国产混搭,月开销从 1200 美金降到了 4000 人民币。当时还有人留言说「便宜是便宜,难的活还是得上强模型」——这个判断依然成立,但「必须上强模型」的任务范围,在按月缩小。
还有一件事值得关注:DeepSeek 已经在定价页预告了峰谷定价——北京时间每天 9:00-12:00 和 14:00-18:00,价格为平时的 2 倍。把批量任务、自动化脚本挪到夜间和周末跑,账单还能再砍一刀。
行业格局的三个变化
这次发布不是孤立事件。把几条线叠在一起看,能读出三个正在发生的行业变化。
第一,「轻量 = 便宜 + 牺牲性能」这个公式被打破了。 过去两年,GPT-4o-mini、Claude Haiku、Gemini Flash 都遵循同一套逻辑:日常对话够用,专业任务就差一截。V4-Flash 用 130 亿激活参数跑出 Pro 级 Agent 成绩,直接把这个等式踩进了土里。100 万 token 上下文的全仓库代码分析、企业级 Agent 自动化——这些过去只有 Pro 才能跑的任务,现在 Flash 都能稳稳接住。
第二,Agent 能力的竞争从「堆参数」转向了「精调优 + 生态兼容」。 V4-Flash 释放的信号很清楚:一个好的后训练流程,价值远超十倍参数堆叠。再加上原生 Responses API 支持和 Codex 生态适配,竞争维度正在从「谁的模型更强」变成「谁的工作流开箱即用」。这和当年 iPhone 替代功能机的逻辑如出一辙——不是通话质量更好,而是整个生态体验更顺畅。
第三,价格战进入了「不降单价、只降任务成本」的高级阶段。 直接降价谁都会。但通过后训练让模型在同样价格下把活干得更好——重试少了、浪费少了、开发者不用再为了省钱在第一梯队和第二梯队之间来回切换——这是更高级的竞争手段,对手极难跟进。
一个正在形成的默认选项
V4-Flash 正式版发布的时间点很微妙:老 API 全线停用、代码生态默认接入、Pro 正式版还未发布。从今天起,调 deepseek-v4-flash 不再是「试一试」——对于大量开发者来说,它已经是默认选项。
一个社区传出来的说法挺有意思:「等到 9 月各家开发者做下半年规划的时候,估计很多人会突然发现自己根本没做过『选型决策』——他们的 Agent 系统已经深度绑在了这个 130 亿激活参数的小模型上。不是选的,是被默认的。」
至于更大的悬念——V4-Pro 正式版——官方的原话是「尽快发布」。Flash 已经这副样子了,Pro 正式版会拿出什么?大概接下来一个月,整个行业都在等这个答案。
成文时间:2026 年 8 月 4 日
数据来源:DeepSeek API 官方文档、Artificial Analysis 独立评测、Arena 人类偏好盲测、开发者社区实测反馈。文中价格与接口信息以官方页面实时数据为准。
更多推荐
所有评论(0)