DeepSeek V4正式版开源:1.6T参数、1M上下文、价格不到GPT的3.5%——开源大模型第一次追上Opus 4.8
摘要:DeepSeek V4 GA正式版全量上线,1.6万亿参数MoE架构、MIT协议开源、1M上下文窗口。正式版相比Preview推理速度提升60~85%、Agent完成率提升21%、首次原生支持多模态。V4-Flash输出价格仅$0.28/百万token,是Claude Fable 5的0.56%。架构核心创新包括mHC(流形约束超连接)和DSA(稀疏注意力),1M上下文下KV Cache仅V3.2的10%。本文拆解Preview→GA的变化、极致低价的MoE稀疏化经济学、8家国产芯片去CUDA化适配、以及开源协同进化的行业叙事。
2026年7月24日,DeepSeek把旧接口 deepseek-chat 和 deepseek-reasoner 永久停用,全量切换到V4正式版。
没有发布会,没有直播,没有路线图。HuggingFace开源模型榜,V4-Pro稳居榜首。API定价页,V4-Flash输出每百万token 0.28美元——同期Claude Fable 5是50美元,GPT-5.6 Sol是30美元。V4-Flash的价格是Fable 5的0.56%。
7月15日GA正式版上线后,开发者实测反馈综合能力接近Anthropic Opus 4.8,编码能力接近GPT-5.6 Sol。而V4是MIT协议开源,权重直接下,训练技术报告直接公开。
这篇文章拆解正式版到底补了什么、凭什么这个价格能打这个性能、以及对整个AI行业意味着什么。
一、Preview vs GA:三个月差在哪
先看时间线:
- 4月24日:V4 Preview版发布。Pro(1.6T/49B激活)和Flash(284B/13B激活)双版,1M上下文,MIT开源。纯文本,推理速度一般,Agent能力有短板。
- 7月15日:GA正式版全量上线。
- 7月24日:旧接口退役,V4时代正式开始。
GA相比Preview的核心改进:
推理速度:+60%~85%。 DSA(DeepSeek Sparse Attention)在长上下文场景下表现大幅提升:V4-Pro在1M上下文时,KV Cache只有V3.2的10%,单token推理FLOPs只有V3.2的27%。
Agent能力:+21%完成率。 GA版重点优化了工具调用触发灵敏度和长程任务的一致性。V4现在已经可以驱动DeepSeek自己内部的编码Agent了。
原生多模态:从无到有。 Preview纯文本,GA首次原生支持图像推理。
峰谷分时定价:行业首创。 工作日9:00-12:00和14:00-18:00,API价格翻倍。对个人开发者影响不大,但对跑24/7 Agent的企业来说,批量任务和评估脚本需要挪到晚上跑。
二、凭什么这么便宜:MoE稀疏化的经济学
V4能维持极端低价,核心原因是MoE的极端稀疏化。
| 版本 | 总参数 | 激活参数 | 稀疏比 |
|---|---|---|---|
| V4-Pro | 1,600B | 49B | 32.7:1 |
| V4-Flash | 284B | 13B | 21.8:1 |
总参数量决定知识上限,激活参数决定每次推理成本。V4-Pro存了1.6万亿参数的知识,但每次推理只激活49B——相当于一座图书馆每次只翻一页,成本按"这一页"算。
架构上两个关键创新:
mHC(流形约束超连接)。 传统Transformer靠残差连接保证深层网络的信息流动,但到万亿参数级别会放大训练不稳定。mHC用数学约束每层间的信号传递——不简单相加,而是沿受约束的"流形"传递。V4训练全程无Loss Spike。
DSA稀疏注意力 + Token-wise压缩。 传统注意力在1M窗口下KV Cache开销是灾难性的。DSA通过稀疏化——每个token只关注最相关的部分token——把KV Cache砍到传统方案的10%。加上Token-wise压缩,两层省钱。
三、去CUDA化:绑定8家国产芯片
V4正式版是DeepSeek第一个"去CUDA化"的正式版。上线当天同步适配了8家国产AI芯片:华为昇腾、寒武纪、海光、摩尔线程、沐曦、昆仑芯、平头哥、天数智芯。
路透社原话:“DeepSeek-V4与华为昇腾的适配,表明中国正在加速减少对美国尖端芯片的依赖。”
这对开源生态意味着模型可以开源,但如果你买不到NVIDIA卡,开源也没用。 V4的去CUDA化解决了这个死锁。
四、开发者实测:惊艳和吐槽并存
长上下文:行业顶级。 用户用V4-Flash处理10MB epub电子书,提取几万关键词生成JSON,2分钟完成,花费0.5元。百万token全量代码库测试,V4-Pro一次性完成全仓库架构理解、漏洞排查和功能迭代。
Agent编码:有惊喜有槽点。 Replit CEO高度评价V4架构创新。智东西实测V4-Pro能连续自主编程60分钟+。但在Claude Code联动中,有开发者反馈工具调用触发灵敏度不如部分国产头部模型。
"过度思考"是通病。 大量用户反馈简单任务中V4回答冗余、推理步骤繁琐。DeepSeek自己也很坦诚:技术报告明确说与最前沿闭源模型"仍有约3-6个月的差距"。
五、开源协同进化:中国AI的独特路径
V4正式版引入的Muon优化器,最早在Kimi K2上被大规模验证——Kimi团队在K2训练中实现了"零Loss Spike"。反过来,Kimi K2.6采用了DeepSeek开源的MLA注意力机制。
这不是"你抄我我抄你"的零和博弈,而是开源协同进化:A公司开源底层技术,B公司采用并优化,优化结果反哺整个生态。硅谷在"造墙",中国开源在"修路"。
总结
DeepSeek V4定义了2026年开源大模型的三个新基准:
- 性能:接近Opus 4.8,编码接近GPT-5.6 Sol,MIT开源
- 价格:V4-Flash $0.28/百万token = Fable 5的0.56%
- 生态:从底层芯片(8家国产NPU)到上层模型(MIT权重)到部署(1M上下文+峰谷定价)的全栈自主
DeepSeek在技术报告结尾引用了荀子的"不诱于誉,不恐于诽,率道而行"——2026年7月,开源大模型正式进入了"真·可用"时代。
📱 更多AI开源项目深度解读
每周解读 GitHub/HuggingFace 最新热门AI项目,从架构原理到工程落地,从开发者实测到行业启示。
微信搜索 「圈圈的AI工程笔记」,和数万开发者一起看懂AI前沿。
标签:DeepSeek 大模型 开源 MoE AI编程 国产芯片
更多推荐


所有评论(0)