为什么你该关心一个"百万上下文"的AI?

前言:

说句有点矫情的话

我上午在飞书群里看到消息的时候,手都在抖。

DeepSeek V4,终于来了。

没有发布会,没有预告,没有直播,就一个周五的上午,悄无声息地扔出来。

两个模型,同步开源,同步上线官网和APP,同步更新API。

连发布稿结尾都只引了一句荀子的话:

不诱于誉,不恐于诽,率道而行,端然正己。

不被赞誉诱惑,不被诽谤吓到,按自己认定的道往前走。

半年了。

从年初到现在,中文AI圈、英文AI圈,关于V4"跳票"的传言来回跑了不知道多少轮。

有人说春节前发,有人说被Claude蒸馏了,有人说DeepSeek已经不行了。

他们一次都没回应。

然后,今天。

DeepSeek V4,可能带来的是个新转折点。

不是因为它又拿了多少个第一,而是因为它干了一件事:

把"百万级上下文"从"实验室技术"变成了"普通人能用上的东西"


两个版本,一个态度

V4这次一口气发了两个版本:

  • DeepSeek-V4-Pro:1.6万亿参数,激活490亿
  • DeepSeek-V4-Flash:2840亿参数,激活130亿

翻译成人话——

Pro是旗舰版,干重活的,对标GPT-5.4、Claude Opus 4.6这种顶级选手。

Flash是经济版,轻巧省钱,简单任务够用,API价格更便宜。

两个版本有一个共同点:100万token上下文。

100万token是什么概念?

大概相当于75万字。

一本《三体》的字数,一次性全塞进去,它都能记得住。

你想想看,你现在跟AI对话,聊个十来轮它就开始"忘事"了。

100万token意味着什么?

意味着你可以把

  • 一整本书
  • 一整个项目的文档
  • 甚至几个月的聊天记录

全部丢进去,它一个字都不会忘。

以前这玩意儿是Gemini的独门绝技,其他闭源模型要么128K要么200K,开源这边几乎没人玩得起。

DeepSeek直接把它从"高端功能"变成了"水电煤"。

而且,开源。


Pro到底强在哪?

我直接说结论,不绕弯。

DeepSeek官方给的判断,三条:

1. Agent能力:已经超过Claude Sonnet 4.5

这话说出来挺狠的。

官方原话是:V4-Pro已经成了DeepSeek内部员工使用的Agentic Coding模型

体验优于Sonnet 4.5,交付质量接近Opus 4.6非思考模式。

注意,我说的Agent不是那种"帮我写个邮件"的聊天机器人。

我说的是Claude Code那种级别的——能自己读代码、改代码、跑测试、修bug的AI程序员。

DeepSeek说,我们自己的员工已经不用Claude了,用V4-Pro。

2. 世界知识:开源最强,接近闭源天花板

在世界知识测评里,V4-Pro大幅领先所有开源模型,只比Gemini 3.1 Pro差一点点。

🎉

啥意思呢?

你问它

"2024年诺贝尔物理学奖是谁"

"中国的GDP是多少""李白哪年出生的"

这种需要大量"死知识"的问题

它比以前准太多了。

3. 推理能力:数学、STEM、竞赛代码,全面超越所有已公开的开源模型

在数学和编程竞赛级别的测评里,V4-Pro直接追平了世界顶级闭源模型。

坦率的讲,我之前用DeepSeek写代码,最大的感受就是

——够用,但跟Claude Code比还有差距。现在这个差距,至少在官方数据层面,已经抹平了。


Flash呢?便宜版会不会很拉?

怎么说呢...

不拉。

Flash的世界知识储备确实比Pro差一截,但推理能力居然跟Pro差不多。

尤其是在简单任务上,Flash跟Pro几乎旗鼓相当。

差距主要体现在高难度的Agent任务上

——复杂的代码重构、多步骤推理这种,Flash还是会露怯。

但它便宜啊。

对于大多数日常使用场景

写文案、查资料、简单代码、翻译、总结文档

Flash完全够用。

我个人的建议是:日常用Flash省钱,遇到复杂任务切Pro。


100万上下文,它是怎么做到的?

这部分是技术含量最高的,但我不打算用技术术语轰炸你。

我只说一件事。

传统AI模型的注意力机制,有一个根本性的问题:算力随上下文长度平方增长。

什么意思呢?

上下文翻一倍,算力需求不是翻一倍,是翻四倍。

所以以前做到100万token,成本高到没几个公司玩得起。

DeepSeek V4做了一件事——

它发明了一种全新的注意力机制,叫混合注意力(CSA + HCA)。

粗略理解就是:不是每个字都同等对待,而是把信息"压缩"后再处理。

打个比方——

传统方式像是一个人从头到尾逐字读一本75万字的书,读完一遍要花很长时间。

DeepSeek V4的方式是:先把这本书浓缩成一份详细的摘要,然后在需要的时候再去翻具体章节。

结果呢?

在100万token的上下文下,V4-Pro的计算量只需要传统方法的27%,内存占用只需要10%。

Flash更夸张——计算量只要10%,内存只要7%。

这就是为什么它能把百万上下文做成标配。

一年前,这还是Gemini独家的王牌功能。

现在,开源,免费,人人可用。


和华为的合作:这事儿比模型本身更重要

发布稿里有一个细节,很多人可能忽略了——

下半年批量上华为算力。

我之前在一篇分析Hermes的文章里说过一句话:AI竞争的下半场,不是模型的竞争,是算力和生态的竞争。

DeepSeek一直用的是英伟达的卡,这在当前的地缘政治环境下,始终是一把悬在头上的刀。

现在明确要上华为昇腾,这意味着什么?

意味着从芯片到模型到应用,整个链条都在国产化。

这已经不是技术问题了,这是战略问题。

而且DeepSeek还特意在技术报告里提到,他们的通信-计算重叠方案在昇腾平台上实现了1.50~1.73倍加速。

也就是说,不是简单地把模型搬过去跑,而是专门为华为芯片做了深度优化。

这一步,很重要。


对我们普通用户意味着什么?

说实话,这才是我最关心的。

我不管你参数是1.6万亿还是2840亿,我只关心一件事:我能用它干什么?

三个层面:

1. 日常对话:直接去官网或APP体验

地址:chat.deepseek.com 改版了,现在直接就是V4。

你不用改任何设置,打开就能用。

试试让它读一篇长文章然后做总结,或者丢一本PDF进去让它帮你找关键信息,体验一下100万token的"记忆力"。

2. API调用:改一个参数就行

📚

如果你已经在用DeepSeek的API,好消息!

base_url不用改

只需要把model参数从deepseek-chat改成deepseek-v4-pro或deepseek-v4-flash就行。

支持OpenAI和Anthropic两套接口。

思考模式支持两档:high和max。复杂Agent场景建议直接上max。

3. 旧模型迁移:三个月缓冲期

deepseek-chat和deepseek-reasoner这两个老名字,将在2026年7月24日停用。

目前这两个名字会自动指向V4-Flash的非思考和思考模式。

所以你不用急,但有三个月的时间把生产环境迁移过去。


背后的一些"看不见的东西"

作为一个每天都在跟AI打交道的人,我想聊几个技术报告里的细节。

这些细节不在发布会的大字标题上,但我觉得才是真正让DeepSeek走到今天的底气。

第一,Muon优化器。

这个名字听起来很学术,但它解决的是一个实际问题:大模型训练的"收敛速度"。

传统的大模型训练用的是AdamW优化器,已经用了快十年了。

DeepSeek这次大部分模块改用了Muon,让训练更快更稳。

你想想看,别人还在用十年前的老引擎,DeepSeek换了新引擎,跑得又快又稳——差距就是这么拉开的。

第二,FP4量化。

简单说就是把模型的"精度"从高精度降低到极低精度,换取巨大的速度提升和内存节省。

但这个降精度不是随便降的

DeepSeek在训练阶段就模拟了FP4的效果

然后用一种叫"Straight-Through Estimator"的技术确保梯度正确回传。

结果就是:推理的时候直接用FP4权重,又快又省内存,还不掉精度。

第三,后训练范式变了。

V4的后训练不再是传统的"一个模型打天下"。

它先为数学、编码、Agent、指令跟随等每个领域独立训练专家模型

然后用一种叫"同策蒸馏"(OPD)的技术,把所有专家的能力合并到一个统一模型里。

有点像...先让不同领域的专家各自修炼,然后再通过某种方式把所有功夫融为一体。

而且它把传统的"标量奖励模型"换成了"生成式奖励模型"

不再给一个冷冰冰的分数,而是直接生成评估文本。这相当于从"打分制"变成了"写评语"。


🐵

一个"没出现在发布会上的细节"

DeepSeek V4的技术报告里有这么一句话:

"DeepSeek-V4-Pro-Max在百万token窗口下的学术基准上,甚至超过了Gemini-3.1-Pro。"

你品品这句话。

Gemini-3.1-Pro是目前公认的长上下文天花板。

DeepSeek V4在100万token的窗口下,表现比它还好。

这事儿没有出现在任何官方宣传的大字标题上。

它就安静地躺在技术报告的某个角落里。

怎么说呢...这很像DeepSeek的风格。

不吹牛,不炒作,闷头干,干完了扔出来。

然后说一句:"率道而行,端然正己。"


我的一些判断

最后说几点我自己的看法,不是DeepSeek官方的立场。

第一,V4不是终点,是起点。

技术报告里明确写了,多模态能力正在整合,未来会支持图片、视频等多模态输入。

这意味着V4的"大脑"已经就位,"眼睛和耳朵"在路上了。

第二,开源这件事的长期价值比短期的参数竞赛更重要。

1.6万亿参数听起来很猛,但半年后可能就不是最猛的了。

但开源意味着整个社区都能在上面做创新

有人会拿它做Agent,有人会拿它做垂直领域的微调,有人会拿它做本地部署。

这些创新是闭源模型给不了的。

第三,下半年上华为算力这个信号,比模型发布本身更值得重视。

如果国产算力+国产模型这条链条真的跑通了,那中国AI产业就不再受制于人了。

这不是一个技术判断,这是一个产业判断。

第四,对AI学习的小伙伴来说,现在是最好的入局时机。

模型越来越好用,成本越来越低,上下文越来越长。

半年前你用AI写代码可能还要反复折腾,现在丢一个完整项目进去它就能理解。

门槛在降低,但机会窗口不会永远开着。


总结:

为什么你该关心?

DeepSeek V4不是一个"更好的聊天机器人"。

它是**AI从"玩具"到"工具"**的一个转折点。

以前,AI像个健忘的聊天对象——你说啥它回啥,但聊着聊着就忘了你说什么。

现在,AI像个读过整个图书馆的专家——你能问它任何一本书的任何细节,它都能答上来。

这不只是"技术进步",而是"使用方式"的变革。

而且,它是国产的、开源的。

这意味着:

  • 研究者可以免费用它做实验
  • 开发者可以基于它做应用
  • 企业可以私有化部署(数据不出门)

👍

开源不是"免费",是"更多人能参与创新"。

如果你问我这事儿跟你有什么关系?

我会说:

下次你想让AI读完一本书、一个项目、一堆文档时,你可以选DeepSeek V4了。

而且,它可能比你想象中更便宜。


写在最后

AI行业有个现象:每次有人发布"最强模型",总有人说"又是营销"。

但DeepSeek V4不一样。

它是开源的、可验证的、真的能跑的。

而且,它在"百万上下文"这个点上,真的做到了世界第一。

国产AI,正在一步步往前走。

值得我们持续关注。

感谢你的阅读,点个关注,


相关链接:

  • DeepSeek官网:chat.deepseek.com
  • 开源权重:https://huggingface.co/collections/deepseek-ai/deepseek-v4

https://modelscope.cn/collections/deepseek-ai/DeepSeek-V4

  • 技术报告:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf
  • API文档:api-docs.deepseek.com

文章信息

  • 预计字数:2800字
  • 阅读时间:8分钟
  • 难度等级:小白友好(技术概念配类比)
  • 核心价值:DeepSeek V4为什么重要,普通人怎么用

作者:大象 #AI #AI-Agent #DeepSeek

公众号:大象AI共学

更多推荐