1. 大模型训练中的计算资源分配困境

在构建大型语言模型(LLM)的过程中,计算资源的分配策略往往决定了项目的成败。传统做法是将大部分计算预算投入最终的模型训练阶段,而数据相关工作通常只获得少量资源。这种分配方式导致我们花费巨额计算成本只产生一组权重参数,而非用于提升数据质量。

最近的研究结果表明,对数据工作的大量投入可以匹配甚至超越开放前沿模型的性能,同时显著减少训练计算量。例如:

  • AI2的OLMo 3模型在训练token数量减少约6倍的情况下,性能与Qwen-3 32B相当
  • FineWeb-Edu通过质量过滤实现了约8倍的token效率提升
  • BeyondWeb报告显示,通过系统性的网页文档改写,训练速度提高了7.7倍

这些都不是边际收益,而是计算效率的成倍提升。更重要的是,数据投资展现出训练投资所缺乏的持久性:2024年整理的数据集可以用于2024、2025甚至2026年的模型训练,而2024年初训练的模型很可能在同一年内就被超越。

2. 数据计算的核心模式解析

2.1 选择计算(Selection Compute)

选择计算涵盖模型驱动的数据筛选过程,包括基于LLM的标注、学习评分模型和大规模过滤决策。FineWeb-Edu就是一个典型案例:

  1. 使用Llama-3 70B标注45万份文档,生成"教育价值"信号
  2. 训练一个小型编码器模型对网络规模文档进行评分
  3. 通过设定阈值过滤15T token的FineWeb语料库

这一过程实现了约8倍的token效率提升,其多语言版本FineWeb-2也证实了类似的增益。评分和过滤15万亿token消耗了约6,000 H100 GPU小时,整个项目(包括所有实验)需要约80,000 H100 GPU小时。

关键提示:80,000 GPU小时仅相当于典型500万GPU小时训练预算的1.6%。这种不对称性表明存在系统性投资不足——如果前沿计算预算的1.6%就能产生多倍的效率提升,那么扩展选择计算就是额外GPU小时最高回报的用途之一。

当前实践仍然保守,主要依赖小型模型(如FastText分类器或轻量级编码器模型)来提高吞吐量。然而,选择可能是数据集构建中最关键的决策:应用于十亿文档规模的单个文档分数可以塑造整个训练分布。

2.2 转换计算(Transformation Compute)

转换计算涵盖文档改写、格式提升、提取和结构强加。BeyondWeb展示了目标转换的成效:相比原始网络数据,训练速度提高了7.7倍。效率提升来自多个相互作用机制:

  • 改写将知识压缩成更密集的token
  • 风格转换(如转换为问答或指导格式)缩小了网络密集预训练分布与会话部署之间的差距
  • 多样化转换策略维持了规模效率:单一策略(如仅问答)会很快达到平台期,而格式、重组和风格修改的多样化组合能在更长时间内持续改进

Nemotron-CC采用分层方法:

  • 对低质量页面使用类似维基百科的改写来降噪
  • 对高质量页面应用更激进的转换(问答生成、蒸馏、知识提取)以产生更密集、更有结构的token

2.3 生成计算(Generation Compute)

生成计算从零开始或最小种子生成合成语料库。当高质量自然文本耗尽时(估计公共人类生成文本可能在2026-2032年耗尽),合成生成提供了继续扩展的途径。

SYNTH项目展示了生成计算的潜力:

  • 从仅5万篇维基百科文章衍生出750亿token的合成语料库
  • 约95%的项目计算分配给数据管道工作(合成生成、验证、整理)
  • 仅5%用于最终训练
  • 所得模型在其规模类别中实现了最先进的性能

重要警示:合成生成存在模型崩溃(model collapse)风险——在合成数据上训练的模型可能失去多样性并退化。有效的合成管道需要验证基础设施:多样性约束、真实数据锚点和漂移检测。

3. 筛选后增强的必要性

如果像FineWeb-Edu这样的过滤能产生8倍的token效率,为什么还要投资更昂贵的合成数据生成?答案在于一个基本矛盾:

过滤提高了训练token效率但减少了数据集规模

FineWeb-Edu和Nemotron-CC都通过丢弃大部分token来实现效率提升。从原始的15T和4.5T token语料库中,激进的质量过滤产生了仅553B和1.3T token的小得多的高质量子集。这形成了一个天花板:你无法通过过滤获得任意大的高质量数据集,因为过滤本质上是减法。

合成数据生成是解决这一矛盾的机制。它是扩展数据集同时保持质量过滤效率增益的方法。数据中心的完整流程应该是:

  1. 积极过滤:使用质量分类器识别高效用token,接受这会大幅减少数据集规模
  2. 系统增强:使用转换和生成(改写、问答对生成、知识提取)将过滤后的语料库扩展回前沿规模
  3. 持续验证:使用消融实验验证所得token保持效率乘数

4. 计算分配的经济学分析

4.1 效率乘数定义

token效率乘数是指改进的数据管道减少达到特定目标能力或基准性能所需训练计算的因子。设:

  • C_base:使用基线数据管道达到目标能力所需的训练计算
  • C_improved:使用改进管道所需的计算(保持模型和训练方法不变)

定义效率乘数m = C_base / C_improved。等效地,假设训练计算与处理的token成比例,m可以解释为有效token乘数:改进的管道将原始token D映射为质量调整后的token D_eff = m·D。

4.2 盈亏平衡分配

给定效率乘数m,可以投入多少计算到数据工作?使用基线训练计算C_base和数据改进产生的m倍训练token效率,达到相同目标所需的训练计算变为C_base/m。因此,我们可以在数据工作上"花费"最多C_base - C_base/m的计算,同时匹配基线总计算。

这产生了盈亏平衡份额: α_max = 1 - 1/m

例如:

  • m=1.2 ⇒ α_max=17%
  • m=2 ⇒ α_max=50%
  • m=6 ⇒ α_max=83%
  • m=9 ⇒ α_max=89%

4.3 实证效率乘数

多个独立项目报告的效率乘数在6-9倍范围内:

项目 指标 m α_max
FineWeb-Edu Tokens ~7.9x 87%
BeyondWeb Speed ~7.7x 87%
OLMo 3 Tokens ~6x 83%
FineWeb2-HQ Speed ~6x 83%
SYNTH Tokens ~10-50x 90-98%

5. 数据投资的持久性优势

5.1 模型权重与数据集的贬值对比

模型权重贬值速度快:

  • Llama-1到Llama-2间隔5个月
  • Llama-2到Llama-3间隔9个月
  • 2023年发布了149个基础模型,是2022年的两倍多

相比之下,数据集可以跨越多代模型:

  • FineWeb(2024年中发布)持续更新并产生多个衍生版本
  • Nemotron 3是第三代基于Nemotron-CC训练的模型
  • Dolma经历了三个主要版本,Dolma 3用于训练OLMo 3

5.2 数据投资的复合机制

数据投资通过多种方式复合:

  1. 精心整理的数据集可以训练多代模型,包括小型变体和领域专用微调
  2. 数据集产生衍生品:质量过滤子集、格式转换版本和领域特定提取
  3. 当数据集公开时,其价值在整个生态系统中倍增

相比之下,训练计算产生单一产物,每代新模型都需要完整的训练运行。数据集维护是增量的(添加爬取、更新过滤器、刷新分类器),而模型"维护"需要完全重新训练。

6. 实践建议与实施步骤

6.1 推荐分配:80%给数据

鉴于独立项目中6-9倍乘数的一致性,我建议将80%作为默认策略。这是保守估计:

  • m=6 ⇒ α_max=83%
  • m=9 ⇒ α_max=89%

因此80%位于盈亏平衡点以下3-9个百分点。SYNTH的95/5分配表明,对于种子多样性受限的推理任务,更激进的分配也可能是可行的。

6.2 实施三步流程

  1. 通过比较基线和整理数据管道的小规模代理实验估计m,包括依赖数据质量的扩展规律推导
  2. 应用盈亏平衡公式确定α_max = 1 - 1/m
  3. 在α_max以下分配安全边际,以考虑乘数估计和管道成本的不确定性

6.3 模式间分配

在数据计算预算内:

  • 选择计算每个token便宜但杠杆率高
  • 转换和生成计算昂贵但对规模必要

不规定固定比例,因为最优分配高度依赖可用源数据的质量和规模:

  • 从高质量源(如整理领域语料库)开始的项目可能在生成上投入更多
  • 从嘈杂网络爬取开始的项目可能需要先进行大量选择和转换

7. 对常见反对意见的回应

7.1 "训练规模已经足够"

反对观点:实验室应将大部分计算分配给训练,因为规模是能力提升的主要驱动力。

我的回应:

  • 即使是看似暴力的方法也大量投资数据质量
  • 经典扩展规律回答"给定数据分布,如何在模型大小和token之间分配计算"
  • 这里的观点是正交的:优化用于改变分布的计算本身会改变前沿
  • 对于没有前沿资源的实验室,数据效率是唯一可行的路径

7.2 "合成数据不能超越其来源"

反对观点:用模型X生成的合成数据训练的模型不能超越X。

我的回应:

  • 蒸馏类比具有误导性,因为蒸馏转移分布,而生成-验证从候选中选择
  • 关键区别是可靠性与覆盖范围:在难题上准确率5%的生成器其输出分布中仍包含正确解
  • 验证选择这些正确输出,即使生成器不能可靠产生它们
  • DeepSeek-R1-Zero的5倍能力提升证明生成-验证可以超越基础模型的监督学习表现

7.3 "后训练才是计算应该投入的地方"

反对观点:鉴于基础模型商品化,最高价值的计算应该用于可验证奖励的强化学习(RLVR),而非预训练数据。

我的回应:

  • 同意RLVR是高杠杆的,但认为它支持而非反驳这一论点
  • RLVR的杠杆来自将计算投入信号质量(验证器设计、任务分布、轨迹选择)而非纯扩展
  • 然而RLVR需要具有可验证目标的任务(数学、代码、形式证明)
  • 预训练数据质量普遍相关
  • 弱预训练限制了RLVR增益:你无法通过RL微调摆脱差的基础模型

8. 行动呼吁与研究展望

8.1 给实践者的建议

重新思考计算分配:

  1. 通过代理实验估计token效率乘数
  2. 应用盈亏平衡公式
  3. 相应分配计算

训练应主导预算的默认假设已经过时且次优。我推荐的80%数据计算反映了记录乘数的保守底线。

8.2 研究发展方向

  1. 扩展规律研究应纳入数据管道,形式化有效token如何依赖数据计算投资
  2. 数据选择研究应探索扩展标注器和评分器,使用能力强的LLM而非轻量级分类器
  3. 合成数据生成研究应探索如何在万亿token规模上产生多样化合成token而不导致分布崩溃

在实际操作中,我发现数据质量与模型性能之间存在明显的正相关关系。一个经过精心筛选和增强的数据集往往能带来超出预期的模型表现提升。这不仅仅是理论上的效率乘数,而是实实在在的模型能力跃升。