大模型训练成本
·
大模型训练成本和时间取决于模型参数量(Size)、训练数据量(Tokens)、训练精度(FP16/BF16/Int8)以及硬件配置(A100/H100/4090)。
我将从从零预训练(Pre-training)、**全量微调(SFT)和轻量化微调(LoRA)**三个维度,结合国内外主流模型进行拆解。
第一部分:核心公式与硬件基准
在此之前,请记住两个核心概念:
- 显存(VRAM)是门槛:决定了你能不能跑起来。
- 算力(FLOPS)是速度:决定了你要跑多久。
目前主流的硬通货显卡价格(参考租赁价):
- NVIDIA H100 (80GB): 约 $2~$4 /小时/卡(国内很难租到,稀缺)。
- NVIDIA A100 (80GB): 约 ¥15~¥25 /小时/卡(国内主流)。
- NVIDIA RTX 4090 (24GB): 约 ¥2~¥4 /小时/卡(高性价比,适合个人/小微调)。
第二部分:从零预训练 (Pre-training) —— 巨头的游戏
这是训练一个像 GPT-4 或 DeepSeek 这样的基座模型,需要消耗天文数字的算力。
1. 国际主流模型成本
- Llama 3 (Meta)
- 规模:8B, 70B, 405B 参数。
- 硬件:使用了 16,000 张 H100 同时训练。
- 时间:训练 405B 版本耗时数月。
- 预估成本:Meta 官方未披露具体电费,但硬件投入超过 5亿美元。如果按云算力租赁计算,单次训练成本在 数千万美元 级别。

- GPT-4 (OpenAI)
- 规模:推测为 1.8T (MoE架构)。
- 硬件:约 25,000 张 A100。
- 时间:90~100 天。
- 成本:Sam Altman 承认成本超过 1亿美元。

2. 国内主流模型成本(性价比之战)
-
DeepSeek-V3 (深度求索) —— 目前的“卷王”
- 规模:671B (MoE,激活37B)。
- 硬件:2048 张 H800。
- 时间:约 2 个月。
- 成本:官方披露仅 558 万美元(约 4000 万人民币)。这是极其惊人的低成本,得益于他们极强的算法优化(FP8混合精度训练)。
- 对比:相比 Llama 3 或 GPT-4,成本只有其几十分之一。
-
Qwen-2.5 (阿里通义千问) / Yi (零一万物)
- 规模:72B / 34B 等。
- 成本估算:训练一个 70B 级别的模型,如果不算硬件折旧,仅算力租赁和电费,通常在 200万~500万美元 之间,取决于数据量(通常是 10T+ Tokens)。
第三部分:全量微调 (Full Fine-Tuning) —— 企业的选择
这是指拥有基座模型后,用自己的行业数据(如医疗、法律)把所有参数重新调整一遍。效果好,但贵。
假设数据量:10万条高质量指令数据(约 500M Tokens)
| 模型规模 | 最低显存需求 (训练) | 推荐硬件配置 | 训练时间预估 | 算力成本估算 (人民币) |
|---|---|---|---|---|
| Llama-3-8B / Qwen-7B | ~120 GB | 2张 A100 (80G) | 4-8 小时 | ¥200 - ¥500 |
| Qwen-2.5-14B | ~220 GB | 4张 A100 (80G) | 8-12 小时 | ¥600 - ¥1,000 |
| Llama-3-70B / Qwen-72B | ~1200 GB | 16张 A100 (80G) (需NVLink互联) | 1-2 天 | ¥8,000 - ¥15,000 |
注:全量微调通常需要 DeepSpeed ZeRO-3 技术来切分模型,对显卡互联带宽要求极高,4090 这种消费级显卡很难做全量微调(带宽不够)。
第四部分:LoRA / QLoRA 微调 —— 个人与开发者的福音
这是目前最主流的微调方式。只训练模型中不到 1% 的参数,冻结主干。成本极低,消费级显卡即可玩转。
假设数据量:1万条指令数据
| 模型规模 | 微调方法 | 最低显存需求 | 推荐硬件 | 训练时间 | 成本 (人民币) |
|---|---|---|---|---|---|
| Llama-3-8B | LoRA (FP16) | ~16 GB | 1张 RTX 4090 / 3090 | 30分钟 - 1小时 | < ¥5 (甚至电费) |
| Llama-3-8B | QLoRA (Int4) | ~8 GB | 1张 RTX 3060 / 2080Ti | 1 - 2 小时 | 忽略不计 |
| Qwen-14B | QLoRA (Int4) | ~14 GB | 1张 RTX 4090 (24G) | 2 - 4 小时 | < ¥10 |
| Llama-3-70B | QLoRA (Int4) | ~40 GB | 2张 RTX 3090 / 4090 或 1张 A6000 | 5 - 10 小时 | ¥50 - ¥100 |
| DeepSeek-V3 | QLoRA (Int4) | ~140 GB* | 2-4张 A100 (80G) | 10 - 24 小时 | ¥500 - ¥1000 |
注:DeepSeek-V3 虽然参数巨大,但因为是 MoE 架构,且量化后显存占用相对较小,微调成本比同等参数的稠密模型低。
第五部分:总结与建议
1. 各种需求的“入场券”
- 我想自己在家玩(训练 8B 模型): 买一张 RTX 3090 (二手约¥5000) 或 RTX 4090。这是性价比之王,可以跑 8B 全量推理,或者 70B 的量化推理,以及绝大多数模型的 LoRA 微调。
- 公司要做行业垂直小模型(7B-14B): 租用或购买 2-4 张 A800/A100。如果预算有限,多张 4090 组集群做推理和轻量微调也行。
- 公司要做行业大模型(70B+): 必须上 8卡 A100/H100 服务器,一台服务器成本在 150万-250万人民币左右。
- 我想从头训练一个大模型: 除非你有 5000 万人民币以上的预算和顶级的算法团队,否则强烈不建议。
2. 核心省钱技巧
- 不要全量微调:95% 的场景下,LoRA 或 QLoRA 的效果已经足够好,成本只有全量的 1/10 甚至 1/100。
- 利用 MoE 模型:像 DeepSeek 或 Mixtral 这种混合专家模型,推理和训练成本比同参数量的 Llama 要低很多,因为每次只激活一小部分参数。
- 使用 Int4/Int8 量化:加载模型时使用 4-bit 量化(QLoRA),可以让 70B 的庞然大物在两张消费级显卡上跑起来。
3. 2025年主流模型推荐(按显存友好度排名)
- 极低成本 (8G显存): Qwen-2.5-7B-Int4, Llama-3-8B-Int4 (一张3060就能跑)。
- 高性价比 (24G显存 - 4090): Qwen-2.5-32B-Int4 (目前最强性价比尺寸), Llama-3-8B-FP16。
- 企业级入门 (80G显存 - A100): Qwen-2.5-72B-Int4, Llama-3-70B-Int4, DeepSeek-V3-Int4 (需多卡)。
更多推荐
所有评论(0)