7.1 MoE 的未来

MoE 是 DeepSeek-V3 的核心架构之一,它通过稀疏激活的方式,在保持高性能的同时大

幅降低了计算资源需求。

DeepSeek 解决了 MoE 存在的诸多问题,如负载不均衡、通信时间长等,并给出了确

定专家个数的经验方法,这展现出 MoE 的巨大发展潜力。预计未来在大模型领域会掀起对

MoE 研究的热潮,继续深挖 MoE 的潜力。

7.1.1 专家数量与规模的优化

DeepSeek-V3 已经展示了如何通过增加专家数量和降低单个专家规模来提升模型性能的

有效性。未来,MoE 模型可能会继续探索这种优化方向,通过更多的小专家实现更高的稀疏

性和更灵活的模型扩展。同时,研究人员可能会进一步优化专家的协作机制,以提高模型的

整体性能。

7.1.2 MoE 分布式训练工具进一步完善

随着更多的研究机构和企业投入 MoE 模型的研究,MoE 模型的分布式训练的工具将得

到进一步完善。目前,清华大学发布的 FastMoE、FasterMoE、SmartMoE 等一系列分布式训

练系统,能够显著提升 MoE 模型的训练速度,并优化模型的训练性能。微软的 DeepSpeed 系

统提供了端到端的 MoE 训练和推理解决方案,结合模型压缩等技术,可提供更快、更便宜的

MoE 模型推理服务。未来,类似于 MoE 的分布式训练框架会越来越多,并且越来越完善。DeepSeek 核心技术揭秘

7.1.3 门控算法的改进

DeepSeek 的实践表明,通过改进门控算法或调整训练策略,能有效提升 MoE 模型的稳

定性及性能。据报道,目前有许多类似的研究在进行。

AdvMoE 通过算法优化将门控模型和专家模型分开训练,显著提高了 MoE 模型的对抗

鲁棒性和整体效率。

普林斯顿大学和 Meta AI 联合提出了一种 Lory 方法。该方法引入了因果分段路由策略和

基于相似性的数据批处理技术,根据相似性将输入数据分组,采用因果分段的方式路由,使

模型能够高效地处理大规模数据,并提高了专家的专业能力。这种门控算法的改进有助于提

升 MoE 模型在多任务学习和大规模数据处理任务中的性能。

7.1.4 跨领域应用与融合

MoE 模型不仅适用于自然语言处理任务,还可以扩展到计算机视觉、多模态学习等领域。

通过跨领域的应用和融合,MoE 模型可以更好地利用不同领域的数据和特征,在更广泛的场

景中得到应用。例如,在多模态学习中,MoE 模型可以分别处理文本、图像和视频等模态的

数据,通过跨模态的专家协作,生成更准确的输出。

7.2 MLA 的未来

在推理阶段,大模型最大的问题是推理时间和序列长度的平方正相关。虽然采用 KV Cache

可以解决这个问题,但这会造成显存占用率过高的瓶颈。因此,这是一个典型的用空间换时

间的算法。

MLA 通过压缩技术,大幅减轻了显存压力。未来,MLA 模型可能会进一步优化缓存管

理策略,以实现更高效的内存利用。例如,通过引入更精细的缓存压缩技术,可以在不显著

影响模型性能的情况下,进一步降低显存占用率。此外,研究人员可能会探索新的缓存更新

机制,以更好地适应动态变化的输入数据。

7.3 大模型训练方法的发展趋势

本节分析大模型训练方法的发展趋势。

7.3.1 三阶段训练法的普及

未来的 AI 大模型训练可能会普遍采用三阶段训练法。例如,通过海量数据的预训练

(Pre-Training)、序列长度扩展(Sequence Length Expansion)和后训练(Post Training),

包括有监督微调、强化学习和知识蒸馏,模型可以更好地学习语言知识和推理能力。这种训

练模式不仅提高了模型的性能,还显著降低了训练成本。

7.3.2 混合精度训练的推广

混合精度训练是大模型训练的趋势,能够提高计算速度,降低显存压力,减少通信成本。

未来的大模型训练必将更广泛地采用混合精度训练。随着英伟达、AMD 等硬件厂商支持力

度的增大,混合精度训练的性能将不断提高,并集成更多自动化的精度调整机制。这方面的

研究可能会集中在智能算法上,通过分析不同部分对精度的需求,自动选择最优的精度配置,

保持精度和性能的有效平衡。

FP8 等低精度格式的训练会得到进一步发展,主要的发展方向将是找到使 FP8 训练在绝

大多数案例下稳定收敛的方法,达到与高精度训练相近的效果。有可能采取更细粒度的规模

化配方(Scaling Recipe),如 Block Scaling 和 Per-Channel Scaling,以每个块或每行为一组,

分别计算绝对最大值及缩放因子,在保证不出现上溢的前提下,减小下溢的比例。

7.3.3 并行策略的优化

未来的大模型训练会进一步优化并行策略,综合采用流水线并行、张量并行和数据并行

等技术,软件与硬件协同,优化并行策略的实现细节(如降低通信开销、提高计算效率),

从而进一步提高训练效率。

7.4 推理部署的发展趋势

未来的大模型推理部署可能会在以下两个方面取得进一步发展。

7.4.1 PD 分离模式的普及

DeepSeek-V3 在推理部署中采用了 PD 分离模式,将推理过程分为预填充和解码两个阶

段,并分别进行了优化。PD 分离模式不仅提高了推理效率,还降低了显存占用率。未来,

PD 分离模式可能会进一步普及,通过引入更多的优化策略和并行机制,进一步提高推理效率

并降低成本。

7.4.2 集群化推理的优化与推理加速技术研究

DeepSeek-V3 在推理阶段采用了大规模的 GPU 集群,通过优化集群的通信协议和计算策

略,显著提高了推理效率。未来,集群化推理可能会进一步发展,如通过引入更高效的通信

协议和计算策略,进一步提高推理效率并降低成本。

DeepSeek-V3 在推理阶段引入了 MTP 预测和双批次运算等加速技术,显著提高了推理速

度和吞吐量。未来,这方面的加速策略和优化算法会得到进一步的研究和发展。

7.5 GPU 硬件的未来发展

从 DeepSeek-V3 和 DeepSeek-R1 两款大模型的训练过程,可以窥见 GPU 硬件发展的方

向和趋势。

7.5.1 软硬件协同升级

DeepSeek 工程实践的一个突出特点就是模型设计与硬件紧密协同。GPU 硬件厂商也会

借鉴这种思路,在硬件设计上迎合大模型的计算需求和特点。例如,英伟达自 Hopper 架构

开始引入 Transformer 引擎以提升算法的计算性能,并利用启发式算法实现数据精度动态切换

(Blackwell 架构二代 Transformer 引擎已支持 FP8、FP6、FP4 等多种低精数据),在保证性

能的前提下降低计算总量;芯片创业公司 Etched 推出仅支持 Transformer 架构的 Sohu 芯片,

虽然牺牲了编程能力,但提高了计算速度,推理吞吐量达到 H100 的 20 倍;AMD ROCm 6.2

更新并扩展了专门为大模型设计的 vLLM 库,提升了 Instinct 系列加速器的 AI 推理能力;英

伟达参与 FlashAttention 3 注意力算法设计,充分利用 H100 芯片动态 warp 寄存器分配、FP8

精度支持等特性,相当于将 FlashAttention 2 的速度提高了约 2 倍。

7.5.2 存储与通信能力的优化

随着大模型的参数量持续增加、输入和输出数据的长度快速增长,模型参数和计算缓存

KV 值消耗的内存空间呈指数级增长,存储和通信成为主要瓶颈。在芯片单位面积算力接近

“天花板”且性能相对过剩的背景下,头部硬件厂商创新升级的重点将从算力向内存、通信

转变。例如,AMD 在宣传 MI300X 时已淡化算力色彩,重点突出显存和通信指标;英伟达

B200 的显存容量和显存带宽提升幅度(240%×H100)均超过算力提升幅度(220%×H100@

FP16)。

GPU 的通信能力,特别是节点间通信和节点内通信,将得到重点关注。例如,通过引入

高效的通信协议和优化算法,可以显著降低通信延迟,提高通信效率。这将为大模型的分布

式训练和推理提供更高效的通信支持。

7.5.3 低精度计算的支持

GPU 将更好地支持低精度计算,如 FP8 和 FP16 等。通过引入高效的量化技术和优化算

法,可以显著降低计算成本和显存占用率,同时保持较高的计算精度。这将为大模型的混合

精度训练和推理提供更有效的支持。

7.5.4 异构计算的支持

未来,CPU 将更好地支持异构计算,并通过与 GPU 等加速器的协同工作,实现更高效

的计算。例如,CPU 通过引入高效的异构计算框架和优化算法,可以显著提高计算效率并降

低成本。这将为大模型的训练和推理提供更强大的计算支持。

7.6 从 LLaMA 4 看推理模型的发展

DeepSeek-R1 的成功,让研究人员重新梳理增强大模型推理能力的实现方式,不再盲

目追随 OpenAI o1 的技术路线,形成了百花齐放的局面,尤其在利用纯强化学习训练模

型开展推理方面,会有更多、更深入的研究。例如,Hugging Face 宣布开展 Open-R1 项

目,计划填补 DeepSeek-R1 未开源的部分组件的空白(虽然 DeepSeek 使用的权重是已知的,

但用于训练模型的数据集和代码是未知的)。

2025 年 4 月 6 日,Meta 推出了全新的开源大模型 LLaMA 4。LLaMA 4 原生的多模态特

性引人瞩目,能够无缝处理文本、图像、视频、音频等多种数据,自由地实现不同格式数据

的内容转换。LLaMA 4 不仅在性能上取得了显著的突破,还在技术架构上接过了 MoE 模型

的接力棒,开启了大模型发展的新篇章。

7.6.1 LLaMA 4 简介

1.性能评估

(1)语言知识与常识问答

在语言知识与常识问答领域,LLaMA 4 在多个基准测试中取得了优异的成绩。以

MMLU 测试为例,这是一个涵盖 57 个学科的多选问答平台,广泛用于衡量模型的知识广度

和推理能力。在 5-shot 设置下,LLaMA 4 Maverick 取得了 85.5 的高分,LLaMA 4 Scout 的得

分也达到 79.6。这一成绩超越 LLaMA 3,接近 GPT-4 的水平。在更为严格的 MMLU-Pro 测

试中,LLaMA 4 Maverick 得到 62.9 分,LLaMA 4 Scout 得到 58.2 分,显示出 LLaMA 4 在专

业知识问答方面的强大实力。在 GPQA Diamond 测试中,LLaMA 4 Maverick 的准确率达到

69.8%,LLaMA 4 Scout 的准确率为 57.2%,相较于前代模型有了显著提升。

这些数据表明,LLaMA 4 在语言知识与常识问答领域已经达到了顶尖水平,能够为用户

提供准确、全面的知识解答。

(2)数学和逻辑推理

数学和逻辑推理能力一直是大模型发展的难点。LLaMA 4 在这一领域表现突出。在

MATH Dataset 测试中,LLaMA 4 Maverick 的准确率达到 61.2%,LLaMA 4 Scout 的准确率为

50.3%,相较于前代模型有了显著提升。在 MathVista 测试中,LLaMA 4 Maverick 的 Pass@1

达到 73.7%,LLaMA 4 Scout 的 Pass@1 为 70.7%,显示出其在数学推理方面的强大能力。

这些成绩的取得,得益于在训练过程中引入的大量与数学有关的数据,以及 LLaMA 4

Behemoth 模型的代码 / 算术蒸馏能力。通过知识蒸馏,小模型能够学到超大规模模型在多步

推理、复杂算式处理等方面的技巧,从而在数学和逻辑推理能力上实现突破。

(3)编程和代码生成

在编程和代码生成领域,LLaMA 4 展现了卓越的性能。在 MBPP 测试中,LLaMA 4

Maverick 的 Pass@1 达 到 77.6%,LLaMA 4 Scout 的 Pass@1 为 67.8%, 均 超 越 前 代 模 型。 在

LiveCodeBench 测 试 中,Maverick 的 Pass@1 达 到 43.4%,LLaMA 4 Scout 的 Pass@1 为

32.8%,显示出强大的实时编码能力。

LLaMA 4 在编程领域的表现达到了行业顶尖水平,甚至在某些方面已超越 GPT-4。这得

益于其在训练过程中引入的大量编程数据,以及精心设计的蒸馏策略。通过知识蒸馏,小模

型能够继承超大规模模型的编程能力,在代码生成、翻译等任务上表现出色。

(4)多语言与多模态任务

LLaMA 4 是一个多语言模型,支持多达 200 种语言的训练。在 TydiQA 基准测试中,

LLaMA 4 Maverick 的平均 F1 值约为 31.7,LLaMA 4 Scout 的平均 F1 值约为 31.5,显示出

LLaMA 4 在多语言任务上的实力。在多模态任务方面,LLaMA 4 在 MMMU 基准测试中表现

出色,LLaMA 4 Maverick 的准确率为 73.4%,LLaMA 4 Scout 的准确率为 69.4%。在具体的

视觉问答基准测试(如 ChartQA、DocVQA)中,LLaMA 4 也取得了高分,显示出其在多模

态融合方面的强大能力。

LLaMA 4 的多模态能力使其能够处理图像、视频、音频等多种数据,实现不同模态之间

的自由转换。这一能力为人工智能开辟了更为广阔的应用前景。

2.模型版本与参数规模

LLaMA 4 系列已公布了两个主要模型版本:LLaMA 4 Scout 和 LLaMA 4 Maverick。此外,

预告了一款正在训练的超大规模模型 LLaMA 4 Behemoth。每个版本在定位和规模上均有独

特之处。

(1)LLaMA 4 Scout

LLaMA 4 Scout 被定位为“小尺寸但性能强劲的模型”。其活跃参数量约为 170 亿个,

内部包含 16 个专家,总参数量高达 1090 亿个。LLaMA 4 Scout 能在单个 NVIDIA H100 GPU

上顺畅运行(量化到 int4 精度时),展现了超高的计算效率。LLaMA 4 Scout 原生支持多模态,

拥有业界领先的超长上下文窗口,能够在满足相对紧凑的计算需求的同时,展现出强大的表

达能力。

(2)LLaMA 4 Maverick

LLaMA 4 Maverick 被定位为“同级别中最佳的多模态模型”。其活跃参数量约为 170 亿

个,内部包含多达 128 个专家,总参数量高达 4000 亿个。LLaMA 4 Maverick 在多个基准测

试中击败了 GPT-4、Gemini 2.0 等强劲对手,在推理和编码能力上接近某些规模更大的最新

模型,活跃参数量却不到后者的一半,性价比极佳。

(3)LLaMA 4 Behemoth

LLaMA 4 Behemoth 是一款尚未完全训练完毕的超大规模模型。它拥有 2880 亿个活跃参

数,采用 16 个专家,总参数高达 2 万亿个。LLaMA 4 Behemoth 被盛赞为“Meta 迄今最强的

模型”,有望在全球顶级通用大模型领域占据一席之地。它在多个 STEM 领域的评估中表现

卓越,超越了 GPT-4.5、Claude 3.7、Gemini 2.0 Pro 等模型。LLaMA 4 Behemoth 被定位为“新

模型中的教师”,扮演了为规模较小的模型提供指导和蒸馏的关键角色。

7.6.2 LLaMA 4 的核心技术细节

1.引入 MoE

LLaMA 4 最引人瞩目的革新当属大胆引入了 MoE 架构。简单来讲,过往的 LLaMA 模

型使用 Dense 架构,而 LLaMA 4 的创新架构采用 MoE 架构,模型会借助一个路由机制,根

据输入的内容,仅选择合适的专家激活部分参数参与计算。Mate 将这一举措誉为一次“彻底

的重新设计”,这也标志着 LLaMA 系列模型成功转向 MoE 路线。据相关报道,Meta 内部

围绕是否采用 MoE 架构进行了长达一年的激烈讨论,最终他们决定“拥抱 MoE”。这也在

一定程度上受到了业界其他领先模型成功实践的启发。

值得注意的是,在 LLaMA 4 的技术文档中,经常会出现两个指标:一个是活跃参数量, 另一个是总参数量。活跃参数量是指模型在一次推理过程中实际投入使用的参数数量,总参

数量则涵盖模型使用的全部参数的数量。例如,LLaMA 4 的两个主要版本的活跃参数量均约

为 170 亿个,但由于二者包含的专家数量存在差异,所以总参数量远超活跃参数量。这彰显

了 MoE 架构的强大威力:在不增加单次计算成本的前提下,通过巧妙堆叠更多的专家,成功

扩大了模型的容量。MoE 架构的引入,使 LLaMA 4 的效率大幅提升。

2.原生多模态能力

LLaMA 4 被誉为“原生多模态大模型”,这一称谓蕴含着深刻的技术变革。从架构设计

到训练过程,LLaMA 4 与多种数据模态全方位深度交互,并将它们有机地整合起来。这种多

模态融合能力大幅扩展了 LLaMA 4 的应用场景,使其能更好地适应现实世界中的复杂任务。

(1)多模态架构设计

LLaMA 4 的多模态能力首先得益于其创新的架构设计。LLaMA 4 采用早期融合(Early

Fusion)策略,将不同模态的数据表示在模型的统一骨干架构中融合。具体来说,LLaMA 4

将图像转换为类似图像 token 的向量序列,将音频转换为文本或频谱序列,然后与文本 token

一起输入 Transformer 模型。这种架构使模型从第一层起就能同时处理多种 token,实现了统

一的多模态 Transformer。这种架构的优势在于,模型可以在不同模态之间轻松地“跨界”:

可以看图生成一段文字描述(从图像到文本),也可以根据一段文字描述生成图像的相关细

节(从文本到图像),还可以阅读长篇文章后输出概要(从文本到文本)。

(2)多模态数据的预训练

LLaMA 4 的多模态能力不仅依赖其架构设计,还与其大规模的多模态数据预训练密切

相关。在预训练阶段,LLaMA 4 使用包含文本、图片和视频帧的大规模数据。这种多模态数

据的混合训练使模型能够学到不同模态之间的关联和交互,从而更好地理解和生成多模态内

容。LLaMA 4 的预训练数据来自多种渠道,包括公开可获得的数据、授权的数据,以及 Meta

自有产品和服务中的信息。多样化的数据为模型提供了丰富的多模态学习素材,使其能够更

好地适应不同场景下的多模态任务。

目前,开源版本的 LLaMA 4 支持图像和文本双模态,音频和视频并未像图像那样直接

作为输入接口开放。后续版本的 LLaMA 4 可能会直接支持音频和视频输入,实现更自然的多

模态交互。

3.超长上下文窗口

在 LLaMA 4 之前,语言模型的上下文窗口长度通常在几千到几万个 token(如 LLaMA 2

的 4000 个 token)。这些模型在处理长文本时会遇到明显的限制:它们需要将长文本分成多

个片段,分别处理后再拼接,而这可能导致上下文信息丢失和生成结果不连贯等问题。

LLaMA 4 的一大突破性成就是其上下文窗口长度的大幅增长。iRoPE 架构是一种专门

设计用于处理极长序列的位置编码方案,是 LLaMA 4 实现超长上下文窗口的关键。LLaMA 4

Scout 的上下文窗口超过 1000 万个 token,LLaMA 4 Maverick 的上下文窗口约为 100 万个

token。这一成就让整个业界惊叹。

(1)训练过程中的长度外推

在训练过程中,LLaMA 4 的最大序列长度为 25.6 万个 token。然而,通过设计特殊的位

置编码方式,模型能够泛化到远超训练长度的序列。这种设计允许模型在推理时处理更长的

文本,而不只是在训练时看到的最大长度的文本。

(2)局部注意力与全局注意力的结合

LLaMA 4 在 Transformer 架构中结合使用局部注意力层和全局注意力层。局部注意力层

关注相对较短的上下文(如 8000 个 token),并使用旋转位置编码(RoPE)来编码位置。这

种设计确保了模型在短上下文环境下具有良好的性能,可以通过并行计算提高效率。

(3)无位置编码的全局注意力

LLaMA 4 采用全局注意力来处理长距离依赖,但不使用任何显式的位置编码。这种设

计借鉴了“无位置编码”的思想,让模型自己去推断长序列的关联,从而增强模型的长度

外推能力。

(4)推理时的全局注意力温度调整

当序列变得很长时,注意力权重矩阵可能会变得非常“平坦”,导致模型对远距离内容

的区分度不足。为了解决这一问题,LLaMA 4 在推理阶段引入了一个全局注意力的温度缩放

方案。具体来说,随着位置索引值的增大,对相应的查询向量进行缩放。这种调整增加了模

型对远距离位置的注意力权重,提升了模型在长上下文环境下的推理能力。

4.训练数据与优化策略

LLaMA 4 的预训练数据包括网页文本、图像字幕、书籍、代码等内容,为模型提供了丰

富的学习素材。LLaMA 4 采用“轻量 SFT →在线强化学习→轻量 DPO”的训练流程。

(1)轻量 SFT

在模型预训练完成后,对模型进行轻量 SFT。与传统的 SFT 不同,LLaMA 4 的 SFT 过

程强调“轻量”,即不过度使用大量简单的训练样本。Meta 让模型早期的检查点充当“批评

家”,以过滤大量过于简单的 SFT 训练样本。针对 LLaMA 4 Behemoth 模型,过滤了高达

95% 的 SFT 数据,只保留最有挑战性的 5% 用于微调;针对规模较小的模型,则过滤约 50%

的简单样本。这种自我批判式的数据筛选机制能确保模型将注意力放在困难的、有信息量的

案例上,从而避免学习“水题”、浪费容量。

(2)在线强化学习

在线强化学习是 LLaMA 4 优化策略的重要环节。在线强化学习可以理解为持续让模型

与一个环境(或模拟用户)交互,不断产生新数据并优化策略。在大语言模型的语境下,这

是指让模型与自身或另一个 AI 对话,尝试完成复杂任务,并根据效果的好坏有针对性地进行

优化。Meta 侧重使用中等难度到高难度的提示词进行强化学习训练,避免让模型反复学习简

单的内容。这种方法能够在不牺牲创造力的前提下提升模型对复杂任务的适应性。强化学习

阶段主要提升模型的推理、编码等智能能力,不过多关注聊天礼貌等“表面功夫”。

(3)轻量 DPO

直接偏好优化(DPO)是 LLaMA 4 优化策略的最后一步。DPO 可以看作 RLHF 的替代

方案,直接根据人类偏好对模型输出进行优化,但不像传统的 RLHF 那样具有高方差不稳定

性。Meta 将 DPO 控制在“点到为止”的程度,即对模型的回答格式和安全性稍加打磨,不

过度束缚模型。通过 DPO,模型能在保持智能的同时,更好地适应人类的对话习惯和偏好。

(4)智能超参数调节技术 MetaP

Meta 在 LLaMA 4 的训练过程中使用了一种智能超参数调节技术 MetaP。虽然具体细节

尚未公开,但有专家猜测,MetaP 类似于 Meta 开源的 Ax 框架中的贝叶斯优化方法,能在有

限的实验预算下自动寻找更好的训练超参数(如每层的学习率等)。MetaP 能自动调整模型

的训练参数,使训练过程更高效、更稳健,减少人工调参的成本。

153DeepSeek 核心技术揭秘

随着技术的发展和创新,LLaMA 4 有望在更多领域实现突破。例如,Meta 正在研发专

注于推理能力提升的 LLaMA 4 Reasoning 模型,以弥补 LLaMA 4 在事实核查推理方面的不足。

此外,随着开源社区的发展,开发者有望通过先进的技术手段训练出继承 LLaMA 4 知识精髓

的小模型,以满足用户的多样化需求。


(由于知乎平台稿件格式问题,公式格式不能正确写上;如若读写困难可后台私信我要完整电子版)

对机器学习感兴趣的读者可以去主页关注我;本人著有《速通深度学习》以及《速通机器学习数学基础》二书,想要完整版电子档可以后台私信我;实体版已出版在JD上有售,有兴趣的同学可以自行搜索了解

更多推荐