DeepSeek-V4-Flash-0731:284B参数“小模型”,后训练逆袭,Agent能力暴涨6倍!
当整个AI行业都在用更大的模型、更多的参数堆砌“智能天花板”时,DeepSeek选择了一条截然不同的路——它问了一个看似简单却极其硬核的问题:如果模型架构和参数规模完全不变,只靠重新打磨后训练,能不能让Agent能力暴涨6倍,甚至反超自家Pro预览版?
模型地址:https://www.modelscope.cn/models/deepseek-ai/DeepSeek-V4-Flash-0731
一、为什么这个模型值得你停下来读?
如果你接触过大模型(LLM)Agent应用,你一定对这样的困境习以为常:想要好的Agent能力?得上千亿甚至万亿参数的“巨无霸”。但大模型推理成本高、延迟大,Agent往往需要调用模型数十次甚至上百次才能完成一个任务——成本直接爆炸。
但DeepSeek-V4-Flash-0731给出了一个颠覆性的答案:
用2840亿总参数、每次仅激活130亿参数的MoE架构,在Terminal Bench 2.1上拿到82.7分,DeepSWE从7.3分暴涨到54.4分——Agent能力相比预览版提升了超过6倍,甚至超越了自家V4-Pro预览版。
更绝的是——模型架构和参数规模和4月发布的预览版完全一致,仅重新进行了后训练。
DeepSeek没有通过增加参数和重新预训练来提高模型的Agent能力。它用事实证明了:到了Agent阶段,模型规模并非决定性因素——训练方法和数据质量的权重,正在上升。
这不是在现有模型上做点微调——它是从训练策略层面重新定义了“模型能力提升”的路径。
二、核心亮点:三大杀手锏
2.1 ★ 284B参数MoE架构,每次只激活13B
DeepSeek-V4-Flash是DeepSeek V4系列中的“效率担当”:
| 维度 | V4-Flash | V4-Pro |
|---|---|---|
| 总参数量 | 2840亿(284B) | 1.6万亿(1.6T) |
| 每次激活参数 | 130亿(13B) | 490亿(49B) |
| 架构 | MoE(混合专家) | MoE |
| 上下文窗口 | 100万token | 100万token |
数据来源:
效果:拥有284B模型的“知识储备”,却只有13B模型的推理成本。这就是MoE的魔力——参数多但不贵,能力强但不慢。
2.2 ★ 同一副“骨架”,后训练让Agent能力暴涨6倍
这是DeepSeek-V4-Flash-0731最令人震撼的地方:
| 基准测试 | V4-Flash预览版 | V4-Flash-0731 | 提升幅度 |
|---|---|---|---|
| DeepSWE | 7.3 | 54.4 | +645%(6倍+) |
| Terminal Bench 2.1 | — | 82.7 | 逼近Claude Opus 4.8(85.0) |
| NL2Repo | — | 54.2 | — |
| Cybergym | — | 76.7 | — |
| Toolathlon Verified | — | 70.3 | — |
| DSBench-FullStack | — | 68.7 | — |
数据来源:
关键洞察:V4-Pro预览版在Terminal Bench 2.0上得分67.9。而Flash-0731在更难的2.1版本上拿了82.7——一个激活参数仅130亿的“小模型”,在Agent能力上反超了自家Pro预览版。
这意味着:你不需要激活490亿参数的Pro来做Agent任务。13B就够了,而且更好、更快、更便宜。
2.3 ★ 第三方智能指数50分,追平Gemini 3.6 Flash
在Artificial Analysis Intelligence Index(智能指数) 这个第三方综合榜单上:
| 模型 | 智能指数 |
|---|---|
| GPT-5.6 Luna | 51分(最高) |
| DeepSeek V4 Flash 0731 | 50分 |
| Gemini 3.6 Flash | 50分 |
| DeepSeek V4 Pro | 44分 |
| DeepSeek V4 Flash(预览版) | 40分 |
数据来源:
DeepSeek V4 Flash 0731以13B激活参数,追平了Gemini 3.6 Flash,在162个可比模型里排第2。而且价格仅为竞品的零头——输入$0.14/百万token,输出$0.27/百万token。
更关键的是成本优势:DeepSeek为其自有API提供了约98%的缓存命中折扣。即使OpenAI将GPT-5.6 Luna价格下调80%,DeepSeek V4 Flash 0731的单任务成本仍然比GPT-5.6 Luna低约60%。
三、技术解析:为什么后训练能让能力暴涨?
3.1 大模型训练的两个阶段
大模型的训练可以分为两个阶段:
- 预训练:模型通过大量文本和代码学习知识,形成基础能力。这个阶段决定了模型“知道多少”。
- 后训练:针对具体工作进行专项训练,让模型学会怎样回答问题、怎样调用工具、怎样完成任务。
DeepSeek这次没有重新设计模型架构,也没有扩大参数规模,而是在原有模型上重新进行了后训练。
这有点像同一辆车没有更换发动机,却重新调整了变速箱、控制系统和驾驶策略——车本身没有变大,但在特定道路上的表现可能明显改善。
3.2 Agent能力为何大涨?
DeepSeek的Agent Harness团队组建于今年3月,挂帅者崔添翼是90后,浙大计算机出身,手握6枚ACM亚洲区域赛金牌,曾在顶级量化机构Jane Street任职九年。
DeepSeek正在回答一个新的问题:到了Agent阶段,一家公司最需要的,究竟是一个能力最强的模型,还是一个足够强、足够快、也足够便宜的模型?
过去,大模型公司的主要竞争发生在预训练阶段——谁有更多算力、更多数据,谁就有机会训练出参数更大的模型。但进入Agent阶段后,模型能力不再完全由预训练决定。一个模型会不会使用终端,能不能在数百次交互中维持任务状态,遇到错误后能否修正——这些能力越来越依赖后训练、强化学习和模型外部的执行框架。
3.3 Responses API + Codex适配
此次更新还有一个重要变化:V4-Flash开始原生支持Responses API,并针对Codex进行了适配。
Responses API可以理解为一套更适合Agent的通信接口——它可以更统一地处理模型回复、推理状态、工具调用和执行结果。它本身不会让模型突然变得更聪明,但可以减少模型接入Codex等Agent工具时的适配工作,让开发者更容易把模型放进真实的软件开发流程。
四、快速上手
4.1 模型下载
# ModelScope 下载
git lfs install
git clone https://www.modelscope.cn/models/deepseek-ai/DeepSeek-V4-Flash-0731
4.2 API调用(官方公测)
DeepSeek-V4-Flash-0731的API已于2026年7月31日下午启动公开测试:
# API调用方式保持不变,只需将model名称设置为:
model = "deepseek-v4-flash-0731"
官方推荐参数(Code Agent任务):
reasoning_effort:maxtemperature:1.0top_p:0.95
数据来源:
4.3 本地部署
社区已有多篇本地部署教程。模型权重已在Hugging Face开源,总大小约167GB。
性能参考(本地部署):
- 峰值速度:78 tok/s
- 典型速度:~55 tok/s
- 需要Patch 4,否则速度减半
数据来源:
4.4 在线体验
8月1日,超聚变宣布DeepSeek-V4-Flash-0731正式版已登陆超聚变AI Lab平台,可通过PC端访问并在线体验。
五、总结与思考
DeepSeek-V4-Flash-0731的价值,远不止于“又出了一个新模型”。它真正值得深思的地方在于:
第一,它证明了“后训练比堆参数更关键” 。模型架构和参数规模完全不变,仅靠重新后训练,就让Agent能力暴涨6倍。训练方法和数据质量的权重,正在超越模型规模的权重。
第二,它解决了Agent落地的成本痛点。大模型推理本就昂贵,Agent还要调用数十次——成本翻倍。V4-Flash用13B激活参数达到甚至超越Pro预览版的Agent能力,直接让Agent的推理成本断崖式下降。
第三,它展示了“性价比”的极致追求。284B总参数、13B激活参数、100万上下文,智能指数追平Gemini 3.6 Flash,价格仅其零头——DeepSeek正在把“性价比之王”从通用能力领域打到Agent领域。
第四,它揭示了AI竞赛的新阶段。2023年是“拼通用能力”,2024年是“拼长上下文”,2026年的关键词,毫无疑问是Agent。而Agent能力的竞争,已经从“谁有更大的模型”转向了“谁能更好地训练模型使用工具、执行任务”。
当然,目前公布的成绩仍需谨慎看待。部分结果来自DeepSeek内部测试集;Code Agent测试使用了尚未公开的DeepSeek Harness;Terminal Bench 2.0与2.1并非同一版本测试集,直接对比并不完全公平。正式版V4-Flash究竟比预览版进步了多少,还需要等待独立评测以及真实开发场景验证。
但它打开了一扇门:如果Agent模型的未来不一定是“更大”,而是“更聪明的后训练 + 更极致的性价比”呢?
模型地址:https://www.modelscope.cn/models/deepseek-ai/DeepSeek-V4-Flash-0731
欢迎下载、部署、调用——一起探索Agent模型“四两拨千斤”的无限可能。
更多推荐


所有评论(0)