DeepSeek 再发重磅更新 ——“万亿参数时代” 的另一种打法
当整个行业陷入万亿参数军备竞赛,一场关于大模型发展路线的争论正在上演。
2026 年,多家厂商持续刷新参数纪录:万亿、1.6 万亿、2.4 万亿、2.8 万亿…… 稠密大模型、超大 MoE 模型轮番登场,行业默认逻辑仿佛只有一条:想要更强 AI 能力,就要持续堆砌总参数、投入海量算力。“大力出奇迹” 再度成为主流叙事。
就在这场参数内卷愈演愈烈时,DeepSeek 迎来重磅更新,交出了一套截然不同的答卷。
一边是自家 1.6 万亿总参数的 V4-Pro 预览版,代表 “容量优先” 的路线;另一边,全新升级的 V4-Flash 没有扩大模型规模,底座架构、总参数量维持不变,仅依靠高质量后训练、对齐优化、推理工程调优,就在智能体、代码等核心基准测试中,实现性能反超万亿参数旗舰预览版本。
这件事的意义,远不止一次跑分突破。它撕开了一个真相:万亿参数赛道,不止 “疯狂堆规模” 这一条路。
一、行业困局:堆参数的边际效益正在快速衰减
传统稠密模型(Dense)存在先天短板:每一次推理,全部参数都要参与运算。当参数跨入万亿级别,训练集群、显存带宽、电力成本指数级上涨,但性能提升幅度持续收窄。
即如今火热的 MoE 混合专家模型,很多厂商也陷入简单扩容误区:不断增加专家数量拉高总参数,却忽略专家路由均衡性、KV 缓存开销、真实落地推理成本。
很多超大万亿 MoE 模型,纸面总参数十分惊人,但激活参数庞大、长文本推理昂贵,很难面向企业大规模商用。简单追求 “参数数字”,正在演变为一场难以落地的算力消耗战。
市场已经出现明显分化:大厂可以不计成本打造旗舰模型冲击技术上限;但绝大多数客户需要的,是可控成本、稳定吞吐、适合智能体长期任务的可用模型。一味比拼总参数,正在脱离真实产业需求。
二、DeepSeek 的差异化路线:区分 “总参数” 与 “激活参数”
DeepSeek 整套技术逻辑的核心,是把两个概念彻底分开:模型知识容量(总参数)≠推理计算成本(激活参数)。
依托自研 DeepSeekMoE 细粒度混合专家架构,模型可以拥有庞大的总参数储备,容纳海量多元知识;但通过动态路由机制,每一段文本只调度对应领域的专家参与计算,不用唤醒全部参数。
简单来说:如同一家大型医院,拥有上百个专科(总参数),患者就诊只需要调动对应科室(激活参数),不需要全院同步运转。
本次更新进一步放大这条路线的优势:
双线产品布局,不盲目 all in 超大参数
V4-Pro 定位能力天花板,探索万亿级模型的能力边界;而 V4-Flash 聚焦产业落地,控制激活参数,压低推理价格,优先解决长上下文、Agent 任务成本难题。两条路线并行,不再单一追逐参数数字。
性能提升不只依靠预训练堆数据
这次 V4-Flash 升级没有启动新一轮昂贵的大规模预训练。依靠后训练优化、多教师蒸馏、智能体对齐、长上下文缓存工程优化,在固定参数规模内挖掘性能上限。
向行业证明:模型能力提升存在第二曲线,不必永远依靠烧钱扩大模型尺寸。
架构创新持续降低长文本门槛
叠加 CSA+HCA 混合压缩注意力技术,大幅压缩 KV Cache 占用。在百万 Token 超长上下文场景,推理计算量相比前代模型大幅下降,解决万亿级模型最头疼的 “长文本贵、速度慢” 痛点。
三、两种路线对决:未来 AI 拼规模,还是拼效率?
当前行业形成两条清晰路线:
路线 A:规模优先。持续冲击更高总参数,依靠超大算力预训练,追求通用能力极限,适合少数头部厂商。
优势:上限更高;短板:投入巨大、推理成本高昂,商业化门槛极高。
路线 B:效率优先。以 MoE 稀疏架构为底座,平衡容量与算力投入,持续优化路由、注意力、对齐方案,在可控激活参数内实现更强能力。
DeepSeek 选择深耕后者。这条路线更适合规模化落地:中小企业、云服务商、AI 应用开发者,不需要动辄万亿激活参数的重型模型,更加看重 API 单价、并发吞吐量、超长文档处理成本。
但也要客观认清边界:效率路线不是否定超大参数模型。在极致通用知识、跨领域复杂开放式任务上,超大容量模型依然具备天然优势。二者并非对立,而是适配不同场景。
真正的变革在于:评判大模型好坏的标尺正在改写。过去只看参数大小,未来要看 “同等算力下能释放多少能力”。
四、对产业的启示:告别参数崇拜
这场更新给整个行业带来几个关键启示:
参数数字只是表象,激活成本才是商业化核心指标
对外宣传的万亿总参数参考意义有限,开发者必须重点关注:单次推理激活参数、显存占用、长文本计价标准。脱离落地成本的参数竞赛,最终只会沦为技术噱头。
架构创新、工程优化,和扩大模型规模同等重要
行业不能陷入 “唯规模论”。注意力机制、专家路由、缓存优化、对齐技术的持续迭代,可以持续打开性能空间,为预算有限的玩家留出赛道。
智能体时代,模型评价标准发生转移
随着 Agent 应用普及,代码执行、工具调用、长链条逻辑、百万上下文连续任务,权重持续上升。很多超大模型在基础问答表现亮眼,却在连续智能体任务上暴露出短板。赛道竞争重心正在转移。
万亿参数时代已经到来,但这不代表所有人都要挤上同一条赛道。
有人选择不断把模型做 “更大”,探索 AI 能力的边界;而 DeepSeek 走出了另一条路:把模型做 “更聪明、更高效”,追求能力与成本的平衡。
规模法则没有失效,但它不再是唯一答案。当狂热的参数浪潮慢慢降温,行业终将意识到:能够低成本稳定落地、支撑万千应用生长的模型路线,才能够走得更远。
更多推荐

所有评论(0)