【AI基础篇03】大模型参数、算力、数据:Scaling Law的本质,为什么越大越强?
·
【AI基础篇03】大模型参数、算力、数据:Scaling Law的本质,为什么越大越强?
前言:GPT-3有1750亿参数,GPT-4估计有1.8万亿,DeepSeek-V3有6710亿。为什么模型要做这么大?训练一次要烧几千万美元,真的值得吗?本文用Scaling Law告诉你答案——模型性能的提升,其实是有规律可循的。
📋 目录
- 一、Scaling Law:AI领域的"摩尔定律"
- 二、三个维度:参数、数据、算力
- 三、参数规模:模型越大越聪明?
- 四、数据量:多少数据才够?
- 五、计算量:训练一次要多少钱?
- 六、Chinchilla最优:参数和数据的平衡
- 七、Scaling Law的边界:能一直Scaling吗?
- 八、新的Scaling方向:Test-time Compute
- 九、实用指南:如何选择模型规模?
一、Scaling Law:AI领域的"摩尔定律"
1.1 什么是Scaling Law?
Scaling Law(缩放定律) 是OpenAI在2020年提出的规律:模型性能随规模(参数、数据、算力)的增长而可预测提升。
简单说:只要堆得够多,模型就会变强,而且这个提升是有规律的。
传统软件工程:
更多代码 ≠ 更好性能
需要算法创新
大模型训练:
更多参数 + 更多数据 + 更多算力 = 可预测的性能提升
不需要架构创新,只需要"堆规模"
1.2 Scaling Law的核心公式
模型性能 L(N, D) ∝ N^(-α) + D^(-β)
其中:
N = 模型参数量(Parameters)
D = 训练数据量(Tokens)
α ≈ 0.076, β ≈ 0.095(经验常数)
通俗理解:
- 参数翻倍 → 损失下降约7%
- 数据翻倍 → 损失下降约9%
1.3 为什么Scaling Law重要?
在没有Scaling Law之前:
"我要训练一个更好的模型"
→ 尝试各种架构创新
→ 试错成本高,方向不确定
有了Scaling Law之后:
"我要训练一个更好的模型"
→ 计算需要多少参数和数据
→ 预估训练成本
→ 按规划执行,结果可预测
Scaling Law把AI训练从"炼丹"变成了"工程"
二、三个维度:参数、数据、算力
Scaling Law涉及三个核心维度,它们相互制约又相互促进:
┌─────────────────────────────────────────────────────────┐
│ Scaling Law 三角 │
│ │
│ 参数量 (N) │
│ / \ │
│ / \ │
│ / \ │
│ / \ │
│ 数据量 (D) ───────── 计算量 (C) │
│ │
│ 关系:C ≈ 6ND (训练一次需要的浮点运算次数) │
└─────────────────────────────────────────────────────────┘
三个维度的关系
| 维度 | 符号 | 单位 | 影响 |
|---|---|---|---|
| 参数量 | N | 个(Billion) | 模型容量,决定能学什么 |
| 数据量 | D | Token数 | 见过的样本,决定学了什么 |
| 计算量 | C | FLOPs | 训练成本,决定学得多深 |
关键公式:
训练计算量 C ≈ 6 × N × D
解释:
- 每个参数在每个token上需要约6次浮点运算
- 6N D 是前向+反向传播的总计算量
示例:
GPT-3: N=175B, D=300B
C = 6 × 175B × 300B = 3.15 × 10^23 FLOPs
三、参数规模:模型越大越聪明?
3.1 参数是什么?
参数(Parameters)= 模型学到的"知识"
类比:
人脑:约860亿神经元,100万亿突触连接
大模型:数十亿到数千亿参数
每个参数是一个可学习的数字(通常是32位或16位浮点数)
存储:1B参数 × 2字节(FP16) = 2GB显存
3.2 参数规模的演进
2018年 BERT-Large: 340M (3.4亿)
2019年 GPT-2: 1.5B (15亿)
2020年 GPT-3: 175B (1750亿)
2022年 PaLM: 540B (5400亿)
2023年 GPT-4: ~1.8T (估计1.8万亿,MoE)
2024年 LLaMA 3.1: 405B (4050亿)
2025年 DeepSeek-V3: 671B (6710亿,MoE)
3.3 参数翻倍的效果
根据Scaling Law,参数翻倍(其他不变):
→ 损失下降约7%
→ 下游任务性能提升可预测
但实际中,我们通常同时增加参数和数据
所以效果比单纯7%更好
3.4 参数越多越好吗?
不是! 存在几个限制:
1️⃣ 数据不足
如果数据不够,参数再多也学不到东西
类比:给大学生看小学课本,再聪明也发挥不出来
2️⃣ 计算成本
参数量↑ → 训练成本↑↑(平方级增长)
GPT-3训练成本:约1200万美元
GPT-4训练成本:估计超过1亿美元
3️⃣ 推理成本
参数量↑ → 推理延迟↑ → 用户体验↓
用户不会等10秒才看到回复
4️⃣ 部署难度
1.8T参数需要数百张GPU才能运行
不是所有公司都负担得起
四、数据量:多少数据才够?
4.1 Token是什么?
Token = 大模型处理的最小文本单位
示例:
英文:"Hello world" → ["Hello", " world"] → 2 tokens
中文:"我爱编程" → ["我", "爱", "编", "程"] → 4 tokens
中文:"大模型" → ["大", "模型"] 或 ["大模型"](取决于分词器)
换算:
英文:约0.75个词/token
中文:约0.5个字/token
4.2 主流模型的数据量
| 模型 | 参数量 | 训练数据量 | 比例 |
|---|---|---|---|
| GPT-3 | 175B | 300B tokens | 1.7:1 |
| PaLM | 540B | 780B tokens | 1.4:1 |
| LLaMA | 65B | 1.4T tokens | 21:1 |
| LLaMA 2 | 70B | 2T tokens | 28:1 |
| DeepSeek-V3 | 671B | 14.8T tokens | 22:1 |
4.3 数据越多越好吗?
是的,但有边际递减:
数据量翻倍 → 损失下降约9%(根据Scaling Law)
但现实中:
- 低质量数据:越多越差(噪声污染)
- 高质量数据:边际递减明显
- 重复数据:没有增益
关键:数据质量 > 数据数量
4.4 数据从哪里来?
训练数据来源:
1️⃣ 网页数据(Common Crawl)
占比:约60-80%
特点:量大、质量参差不齐
处理:去重、过滤、清洗
2️⃣ 书籍(Books)
占比:约10-15%
特点:语言规范、知识密度高
代表:Gutenberg、Books3
3️⃣ 代码(Code)
占比:约10-20%
特点:逻辑严密、结构清晰
来源:GitHub、Stack Overflow
4️⃣ 学术论文
占比:约2-5%
特点:专业、前沿
来源:arXiv、PubMed
5️⃣ 其他
- 维基百科
- 新闻文章
- 社交媒体
五、计算量:训练一次要多少钱?
5.1 计算量怎么算?
训练计算量 = 6 × 参数量 × 数据量
单位:FLOPs(浮点运算次数)
示例计算:
GPT-3: 175B参数 × 300B token × 6 = 3.15 × 10^23 FLOPs
换算:
- A100 GPU: 312 TFLOPS (FP16)
- 需要GPU小时数: 3.15e23 / 3.12e14 / 3600 ≈ 280,000 GPU小时
- 按1000张A100算: 约280小时(12天)
5.2 训练成本估算
| 模型 | 参数量 | 计算量 | 估计成本 |
|---|---|---|---|
| GPT-3 | 175B | 3.1e23 FLOPs | $4.6M - $12M |
| PaLM | 540B | 2.5e24 FLOPs | $8M - $17M |
| LLaMA | 65B | 1.0e21 FLOPs | $2M - $5M |
| GPT-4 | ~1.8T | ~1e25 FLOPs | $50M - $100M |
| DeepSeek-V3 | 671B | ~6e24 FLOPs | $5.6M(官方公布) |
成本构成:
- GPU/TPU租赁费:60-70%
- 电力:10-15%
- 人力:10-20%
- 存储/网络:5-10%
5.3 为什么DeepSeek这么便宜?
DeepSeek-V3训练成本仅557.6万美元,远低于GPT-4
关键优化:
✅ 架构创新:MLA(多头潜在注意力)
✅ 专家混合:MoE,每次只激活37B参数
✅ 训练效率:FP8混合精度训练
✅ 数据质量:14.8T高质量token
✅ 工程优化:极致的并行和通信优化
结论:Scaling Law不是盲目堆规模,
架构创新和工程优化同样重要
六、Chinchilla最优:参数和数据的平衡
6.1 什么是Chinchilla最优?
2022年,DeepMind发表论文《Training Compute-Optimal Large Language Models》,提出了Chinchilla最优——给定固定计算预算,如何分配参数和数据量。
核心发现:
之前:模型太大,数据太少(欠训练)
GPT-3: 175B参数,300B token → 数据不足
Chinchilla最优:参数和数据等比例增长
最优比例:约20 tokens / 参数
即:70B参数需要约1.4T token
6.2 Chinchilla最优公式
给定计算预算 C,最优配置:
N_opt ∝ C^0.5 (参数量)
D_opt ∝ C^0.5 (数据量)
简单说:
计算预算翻倍 → 参数翻倍 + 数据翻倍
对比之前的做法:
计算预算翻倍 → 参数翻4倍 + 数据不变(❌)
6.3 Chinchilla的实际影响
Chinchilla 70B vs GPT-3 175B:
- 参数量:70B < 175B(少60%)
- 数据量:1.4T > 300B(多4.7倍)
- 计算量:相同
- 效果:Chinchilla 70B > GPT-3 175B ✅
结论:
对于固定计算预算,
"小模型+大数据" > "大模型+小数据"
6.4 实际应用建议
训练新模型时:
1. 确定计算预算(多少钱/多少GPU小时)
2. 按Chinchilla最优分配参数和数据
N = D/20,且 6ND = 预算
3. 优先保证数据质量
4. 如果数据不够,宁可减小模型规模
七、Scaling Law的边界:能一直Scaling吗?
7.1 Scaling Law的限制因素
1️⃣ 数据枯竭
高质量文本数据有限
估计:全球可用高质量文本约10-100T tokens
DeepSeek-V3已经用了14.8T
→ 数据即将成为瓶颈
2️⃣ 计算成本
训练成本指数增长
GPT-5估计需要10亿美元以上
只有极少数公司能负担
3️⃣ 推理成本
模型越大,推理越慢
用户无法等待10秒以上的响应
→ 部署成本成为限制
4️⃣ 能源消耗
训练大模型的碳排放巨大
环保压力日益增加
5️⃣ 边际递减
性能提升速度在放缓
从GPT-3到GPT-4的飞跃,可能难以复制
7.2 数据瓶颈怎么破?
解决方案:
1️⃣ 合成数据
用AI生成训练数据
风险:模型崩溃(Model Collapse)
2️⃣ 多模态数据
图像、视频、音频数据更丰富
文本+图像联合训练
3️⃣ 私有数据
企业专有数据
隐私和版权问题
4️⃣ 代码数据
代码逻辑严密,质量高
还能提升推理能力
5️⃣ 数据效率优化
更好的数据清洗
课程学习(Curriculum Learning)
重复数据去除
八、新的Scaling方向:Test-time Compute
8.1 什么是Test-time Compute?
传统Scaling:
训练时堆规模 → 推理时快速响应
问题:简单问题浪费算力,复杂问题算力不够
Test-time Compute:
训练时学"如何思考"
推理时根据难度动态分配算力
简单问题快速回答,复杂问题多想几步
8.2 o1和DeepSeek-R1的启示
o1/o3(OpenAI):
推理时使用Chain of Thought
自我验证、多步推理
数学竞赛成绩大幅提升
DeepSeek-R1:
开源推理模型
使用GRPO优化
证明了推理能力不需要天价算力
关键洞察:
"训练时Scaling" 和 "推理时Scaling" 是两条不同的路径
两者结合,才能让AI能力持续提升
未来Scaling的方向:
训练时:更大模型 + 更多数据 + 更高效率
推理时:动态算力分配 + 推理优化
九、实用指南:如何选择模型规模?
9.1 场景选型决策树
我应该用多大的模型?
┌─────────────────┐
│ 你有GPU吗? │
└────────┬────────┘
│
┌────┴────┐
│ │
有 没有
│ │
▼ ▼
┌───────────┐ ┌─────────────────┐
│ 本地部署 │ │ 使用API服务 │
│ │ │ │
│ 7B-13B: │ │ GPT-4o/Claude3.5│
│ 单卡A100 │ │ 通用能力最强 │
│ │ │ │
│ 34B-70B: │ │ DeepSeek/GLM │
│ 2-4卡 │ │ 性价比高 │
│ │ │ │
│ 100B+: │ │ 本地不可能 │
│ 需要集群 │ │ 只能用云服务 │
└───────────┘ └─────────────────┘
9.2 成本vs效果对比
| 模型规模 | 推理成本 | 效果 | 适用场景 |
|---|---|---|---|
| 7B | $0.001/1K token | 中等 | 个人项目、学习 |
| 13B | $0.003/1K token | 较好 | 小团队、简单应用 |
| 70B | $0.01/1K token | 优秀 | 企业级、复杂任务 |
| GPT-4 | ~$0.03/1K token | 最强 | 关键业务、高要求 |
| o1 | ~$0.06/1K token | 推理最强 | 数学、编程 |
9.3 实际建议
💡 如果你预算有限:
→ DeepSeek V3(开源最强,性价比最高)
💡 如果你需要最强效果:
→ GPT-4o / Claude 3.5 Sonnet
💡 如果你需要推理能力:
→ o1 / DeepSeek-R1
💡 如果你需要本地部署:
→ LLaMA 3.1 70B / Qwen 2.5 72B
💡 如果你在手机上运行:
→ Qwen 2.5 1.5B / Phi-3 Mini
📌 总结
Scaling Law的核心要点:
1️⃣ 规模越大,性能可预测提升
参数、数据、算力三维度
2️⃣ 参数翻倍 → 损失下降约7%
数据翻倍 → 损失下降约9%
3️⃣ Chinchilla最优:约20 tokens / 参数
"小模型+大数据" > "大模型+小数据"
4️⃣ Scaling有边界
数据枯竭、成本爆炸、推理瓶颈
5️⃣ 新的Scaling:Test-time Compute
推理时动态分配算力
6️⃣ 实用建议:
够用就好,不必盲目追大
🔗 延伸阅读
- 【AI基础篇01】AI大模型基础概念全景图
- 【AI基础篇02】从Transformer到GPT:生成式AI的演进史
- 【AI训练篇01】预训练数据准备与清洗实战
- 【AI训练篇04】LoRA原理与实战:从头训练一个模型
觉得有帮助?点赞收藏!下一期我们讲Tokenization——文本是如何变成数字的,以及为什么分词器这么重要。 🚀
标签:人工智能、Scaling Law、参数、算力、数据、大模型、训练成本、Chinchilla、DeepSeek
更多推荐

所有评论(0)