预训练数据采集实战:大模型到底吃什么长大

通俗易懂版。一句话先说结论:大模型不是凭空变聪明的,是"喂"出来的——喂什么语料,它就长成什么样子。本文把预训练数据这件事讲透:22 类常见语料各自的优缺点、去哪搞公开数据集、现有大模型配了多少数据、小模型和大模型分别该怎么喂,以及一线的避坑注意事项。文末附 arXiv 前沿论文核验清单。


0. 先破一个误区:模型的能力 = 数据的能力

很多人以为"大模型强是因为模型结构厉害"。其实对一个固定架构来说,预训练数据决定下限,数据质量决定上限

打个比方:模型结构像大脑容量,预训练数据像从小到大读过的书。一个脑子好但只读过垃圾信息的人,和一个普通脑子但啃完百科全书的人,谁更"懂行"?后者。

所以"预训练数据采集"这件事,本质是在回答一个问题:用什么文本,把一个通用大脑养成你想要的样子。


1. 三类数据,各管一阶段(别混为一谈)

大模型训练分三步,每一步吃的数据完全不同。下面这张图把关系理清:

原始文本海洋

预训练数据
万亿 token 通识

微调数据
任务样本对

对齐数据
人类偏好

基座模型
通识大脑

任务模型
会干活

对齐模型
三观正 听话

阶段吃什么像什么数据量本文重点
预训练海量无标注文本通识教育(从小学读到大学)万亿 token✅ 本文主角
微调 SFT(输入→输出) 样本对岗前培训(学具体活)千~百万条上篇《个人制作数据集》讲过
对齐 RLHF人类偏好对比三观塑造(什么该说)万~十万条安全与风格

本文聚焦预训练数据——也就是那堆"无标注原始文本"怎么来、怎么选、怎么配。微调和对齐是另一回事,别把"采集小说喂模型"和"预训练"划等号。


2. 22 类常见预训练语料,各自的优缺点和作用

下面这张总表把常见的公开子集按"类别 / 内容特点 / 给模型的作用 / 优点 / 缺点"列全。这是预训练语料库的"菜单"——你搭自己的训练集时,就是从这堆里挑、然后配比。

子集类别内容特点给模型的作用优点缺点
Books1 & Books2书籍互联网书籍文本,长篇幅连贯学长文连贯、风格与叙事长文本质量高、体裁全版权风险高,Books2 来源不透明
PubMed学术生物医学预印本高度技术性学术文本专业深、术语准领域窄、非通用
Wikipedia百科维基百科条目事实性、结构化知识准确、中立、结构好偏百科体、量相对小、创意弱
OpenSubtitles字幕影视剧台词口语对话与叙事对话自然、多语噪声大、对齐差、版权有争议
ArXiv学术物数计预印本前沿学术技术文本技术深、时效强公式多、离日常远
Bibliome学术生物医学文献生命科学文本专业补充领域窄
CommonCrawl网页全网抓取海量通用覆盖规模最大、覆盖最广噪声极大、须重度清洗
CORD-19学术新冠研究集疫情相关前沿时效强极窄、过期后价值降
DM Mathematics学术数学文献抽象数学概念逻辑/推理强极窄、应用面小
Enron Emails邮件安然公开邮件商业通信风格真实商务语料隐私敏感、需脱敏
FreeLaw法律美国法律判决法律术语与逻辑专业硬领域窄、需合规
Gutenberg PG-19书籍公版经典文学长文文学语感版权清洁、经典年代旧、语体过时
NIH Exporter学术NIH 项目摘要医学健康摘要摘要级专业仅摘要、浅
OSF Preprints学术跨学科预印本多科学领域跨域广质量参差
PLOS学术公共科学图书馆文科学主题开放获取、可信领域偏科学
PubMed OA学术PubMed 开放获取更多生物医学可商用、干净领域窄
Stack Exchange社区问答帖技术与非技术问答问答结构好、实用偏技术、口语化
US Patents专利美国专利描述发明技术描述术语密、结构清极窄
Ubuntu IRC聊天IRC 日志真实用户对话口语、实时噪声大、杂乱
WebText-like网页模拟 WebText高质量网页文本质量优于原始 CC仍为网页、须筛选
YouTube Subtitles字幕视频字幕口语与视频内容多模态文本、口语噪声、版权
YFCC100M创意CC 许可文本创意内容版权清洁量小、杂

怎么读这张表:横向看,网页类(CommonCrawl / WebText)是"主食"管饱但得淘;书籍百科是"营养"提质量;学术专业是"补剂"攻特定能力;对话字幕是"口语课"学聊天。预训练集基本是"主食 + 营养 + 补剂"按配比混出来的。

一个反直觉事实:单本小说在这张表里连"一道配菜"都算不上——它更适合做微调,不是预训练主力。预训练要的是规模和多样性,不是单本深度。


3. 这些语料去哪搞?公开数据集与渠道清单

别自己从零爬。业界早把公开语料打包好了,按需取用:

语料 / 数据集提供方规模获取渠道说明
Common CrawlCommon Crawl 基金会PB 级commoncrawl.org 快照最原始,须自己清洗
C4Google (T5)数百 GBHuggingFacec4从 CC 清洗出的经典集
The PileEleutherAI800 GBhuggingface.co/EleutherAI/pile22 类混合,学术友好
RefinedWebFalcon5 T tokenshuggingface.co/tiiuae纯网页也能超 curated 集
DolmaAI23 T tokenshuggingface.co/allenai/dolma开源可复现预训练集
FineWebHuggingFace15 T tokenshuggingface.co/spaces/HuggingFaceFW/web-data清洗流水线开源
DCLMDataComp数 Thuggingface.co/DataComp数据配比实验标杆
RedPajamaTogether多 Tgithub.com/togethercomputer/RedPajama-Data复刻 LLaMA 配方
The StackBigCode代码为主huggingface.co/bigcode代码预训练
Wikipedia维基媒体数十 GBdumps.wikimedia.org事实知识
PubMed / arXivNCBI / Cornell海量各自 API / 导出学术
Project Gutenberg公版书数十 GBgutenberg.org版权清洁文学
模型社区HuggingFace / 魔塔 ModelScope国产友好、中文集多

国内渠道提醒:**魔塔社区(ModelScope)**和 HuggingFace 是两大模型/数据集枢纽,中文语料检索优先 ModelScope,能避开部分墙与合规麻烦。


4. 现有开闭源大模型,到底配了多少数据

下面这张表是"别人家孩子吃了多少"的对照。注意:token 是计量单位,1 token ≈ 0.75 个英文词(中文约 1~1.5 字/token,取决于分词器)。数字来自各模型技术报告或对应论文,为厂商公开口径,非本文实测

模型类型参数量训练数据规模数据来源重点出处
GPT-3闭源175B~300 B tokensCC+Books+Wiki+WebText2厂商报告(公开)
Chinchilla闭源70B1.4 T tokens按计算最优配比2203.15556
Llama 3开源8B~405B15 T tokens网页+代码+多语厂商报告(公开)
Qwen2.5开源0.5B~72B~18 T tokens多语+代码+数学厂商报告(公开)
DeepSeek-V3开源671B(37B激活)14.8 T tokens中英文+代码厂商报告(公开)
Phi-1闭源1.3B~7 B “教材级” tokens合成教科书+代码2306.11644
Phi-3闭源3.8B~3.3 T tokens教材级+合成+网页过滤2404.14219
OLMo开源7B3 T tokensDolma 全开放2402.00838
OLMo 2开源7B~32B~5 T tokens自研数据配方+课程2501.00656

看表说话:两条路线泾渭分明——大模型走"海量粗粮"路线(十几 T tokens 网页堆)小模型走"精选教材"路线(Phi 用合成教科书,量小但质极高)。这正是下一节要讲的"模型与数据搭配"。


5. 模型与数据怎么搭配(核心方法论)

并不是"数据越多越好、模型越大越好"。一线经验是匹配

小模型 0.5到3B

中大模型 7到70B

领域模型 医疗法律

质量

数量

目标模型多大?

精选教材级数据
质量优先 量可小

万亿级网页加专业混合
规模优先

通用底加领域数据
PubMed FreeLaw 等

Phi 路线 合成教科书
性价比高

海量清洗加去重
通用强

领域专精 通用不丢

数据质量还是数量?

少而精 胜过多而杂

重复利用也有效 但须过滤

四条可落地的搭配原则:

  1. 小模型配精粮(Phi 路线):1~3B 模型别喂脏网页,用"教科书级"合成/筛选数据(Textbooks Are All You Need 思路)。量可以不大,但每 token 都得值钱。这是个人/小团队最现实的路。
  2. 大模型配粗粮 + 补剂:7B 以上要规模,CommonCrawl 打底,叠书籍、代码、学术提升专项。质量靠清洗流水线,不靠手工挑。
  3. 领域模型 = 通用底 + 领域数据:别从零训医疗模型,拿通用基座 + PubMed/FreeLaw 等灌领域语料,专业能力和通用能力都保住。
  4. 质量 > 数量(但有下限):Chinchilla 论文给出"计算最优"配比公式——模型越大,配套数据也得越多,否则欠训练。Data-Constrained 论文则发现:数据不够时,把高质量数据重复多遍也有效,但前提是质量够高。两条合起来:先保质量,再谈规模。

中文场景特别提醒:英文网页占 CommonCrawl 绝大多数,直接拿来训中文模型会被英文"淹没"。必须专门拉高中文/多语的配比,或补中文专库(如 WuDao、SkyPile 等)。


6. arXiv 最前沿数据采集论文(已核验)

下面每条都用 arXiv API 核验过编号、作者、年份真实存在。优先列 2024–2026 前沿,经典奠基附"方法论奠基"标注:

论文作者arXiv年份/会议与本文关系链接
Scaling Data-Constrained Language ModelsMuennighoff N. et al.2305.162642023数据不够时重复高质量数据也有效;支撑第 5 节原则 4链接
The RefinedWeb Dataset for Falcon LLMPenedo G. et al.2306.011162023纯网页数据超 curated 集;支撑第 3 节网页语料链接
Dolma: An Open Corpus of 3T TokensSoldaini L. et al.2402.001592024开源可复现预训练集;支撑第 3 节链接
The FineWeb DatasetsPenedo G. et al.2406.17557202415T 网页清洗流水线开源;支撑第 3 节链接
DataComp-LM (DCLM)Li J. et al.2406.117942024数据配比实验标杆;支撑第 5 节链接
Textbooks Are All You NeedGunasekar S. et al.2306.116442023Phi-1 教材级合成数据路线;支撑第 5 节小模型配精粮链接
Phi-3 Technical ReportAbdin M. et al.2404.142192024小模型手机端 + 教材级数据;支撑第 4、5 节链接
The PileGao L. et al.2101.00027202022 类混合开源集奠基;支撑第 2、3 节链接
Exploring the Limits of Transfer Learning (T5/C4)Raffel C. et al.1910.106832019C4 清洗范式奠基;支撑第 3 节链接
Training Compute-Optimal LLMs (Chinchilla)Hoffmann J. et al.2203.155562022计算最优数据配比公式;支撑第 5 节链接
OLMoGroeneveld D. et al.2402.008382024全开放模型+数据;支撑第 4 节链接
2 OLMo 2 FuriousTeam OLMo2501.006562024开源数据配方+课程学习;支撑第 4、5 节链接
Synthetic Persona Pretraining匿名一作 et al.2608.134822026合成数据预训练前沿;支撑第 7 节合成数据风险链接

核验说明:以上编号经 export.arxiv.org API 逐条确认存在,作者与年份取自 API 返回。正文讲解为教程性质,具体数字/方法以你打开原文为准;本表未编造任何不存在的论文。


7. 注意事项:一线踩过的坑

这部分是"标题党文章不会写、但真做的人必栽"的清单。

  1. 版权与合规:Books2、OpenSubtitles 都有过诉讼。优先用 CC 授权、公版(Gutenberg)、开放获取(PubMed OA / PLOS)数据。商用前查许可。
  2. 质量过滤不是可选项:CommonCrawl 原始噪声极大,"垃圾进垃圾出"在预训练上比微调更致命。须去 boilerplate、导航栏、毒性内容、重复行。
  3. 全局去重:跨源去重,否则同一段反复出现 → 模型过拟合、且评测集泄漏(在训练里见过测试题)。
  4. 训练污染:训练集若含评测题,benchmark 分数虚高。发布模型前须做"去污染"检查。
  5. 配比不是越多越好:各源比例深刻影响能力。纯堆网页会掉推理,纯堆代码会掉语言。按目标调比例。
  6. 多语言失衡:中文模型必须专门抬升中文配比,否则被英文淹没(第 5 节提过)。
  7. 合成数据有"模型坍缩"风险:Phi 路线(用强模型造教科书)很香,但若模型只吃自己/同代模型生成的文本,能力会逐代退化(fairness collapse 现象,见 2608.04268 一类研究)。合成数据要混足量真实文本兜底。
  8. 隐私脱敏:Enron 邮件、用户日志含个人信息,须脱敏再入训。

8. 总结

预训练数据采集,一句话就是**“选对菜单、淘干净、配好比例”**:

  • 语料是"菜单":网页管饱、书籍百科提质量、学术专业攻能力、对话学口语(第 2 节 22 类)。
  • 数据集是"采购单":CommonCrawl / C4 / Dolma / FineWeb / DCLM 等公开可拿,HuggingFace 与魔塔是枢纽(第 3 节)。
  • 搭配是"食谱":小模型吃精粮(Phi 路线)、大模型吃粗粮、领域模型加补剂,质量优先于数量(第 5 节)。
  • 前沿在"数据与模型的联合优化":从 Chinchilla 配比、到 RefinedWeb 纯网页超 curated、到 DCLM 数据实验、到 2026 合成数据预训练(第 6 节)。
  • 坑在"合规与质量":版权、污染、去重、坍缩,一个都绕不开(第 7 节)。

如果你是想"用自己的一本书/一个知识库做点什么"——记住本文第 1 节的分工:单本小说/文档更适合走微调或 RAG,不是预训练主力。预训练是巨头和大数据团队的游戏;个人玩家的高性价比入口,是"小模型 + 精数据(Phi 路线)“或"通用模型 + 你的数据当上下文(RAG)”。


更多推荐