大模型训练成本和时间取决于模型参数量(Size)训练数据量(Tokens)训练精度(FP16/BF16/Int8)以及硬件配置(A100/H100/4090)

我将从从零预训练(Pre-training)、**全量微调(SFT)轻量化微调(LoRA)**三个维度,结合国内外主流模型进行拆解。


第一部分:核心公式与硬件基准

在此之前,请记住两个核心概念:

  1. 显存(VRAM)是门槛:决定了你能不能跑起来。
  2. 算力(FLOPS)是速度:决定了你要跑多久。

目前主流的硬通货显卡价格(参考租赁价):

  • NVIDIA H100 (80GB): 约 $2~$4 /小时/卡(国内很难租到,稀缺)。
  • NVIDIA A100 (80GB): 约 ¥15~¥25 /小时/卡(国内主流)。
  • NVIDIA RTX 4090 (24GB): 约 ¥2~¥4 /小时/卡(高性价比,适合个人/小微调)。

第二部分:从零预训练 (Pre-training) —— 巨头的游戏

这是训练一个像 GPT-4 或 DeepSeek 这样的基座模型,需要消耗天文数字的算力。

1. 国际主流模型成本
  • Llama 3 (Meta)
    • 规模:8B, 70B, 405B 参数。
    • 硬件:使用了 16,000 张 H100 同时训练。
    • 时间:训练 405B 版本耗时数月。
    • 预估成本:Meta 官方未披露具体电费,但硬件投入超过 5亿美元。如果按云算力租赁计算,单次训练成本在 数千万美元 级别。

在这里插入图片描述

  • GPT-4 (OpenAI)
    • 规模:推测为 1.8T (MoE架构)。
    • 硬件:约 25,000 张 A100。
    • 时间:90~100 天。
    • 成本:Sam Altman 承认成本超过 1亿美元
      在这里插入图片描述
2. 国内主流模型成本(性价比之战)
  • DeepSeek-V3 (深度求索) —— 目前的“卷王”

    • 规模:671B (MoE,激活37B)。
    • 硬件:2048 张 H800。
    • 时间:约 2 个月。
    • 成本:官方披露仅 558 万美元(约 4000 万人民币)。这是极其惊人的低成本,得益于他们极强的算法优化(FP8混合精度训练)。
    • 对比:相比 Llama 3 或 GPT-4,成本只有其几十分之一。
  • Qwen-2.5 (阿里通义千问) / Yi (零一万物)

    • 规模:72B / 34B 等。
    • 成本估算:训练一个 70B 级别的模型,如果不算硬件折旧,仅算力租赁和电费,通常在 200万~500万美元 之间,取决于数据量(通常是 10T+ Tokens)。

第三部分:全量微调 (Full Fine-Tuning) —— 企业的选择

这是指拥有基座模型后,用自己的行业数据(如医疗、法律)把所有参数重新调整一遍。效果好,但贵。

假设数据量:10万条高质量指令数据(约 500M Tokens)

模型规模最低显存需求 (训练)推荐硬件配置训练时间预估算力成本估算 (人民币)
Llama-3-8B / Qwen-7B~120 GB2张 A100 (80G)4-8 小时¥200 - ¥500
Qwen-2.5-14B~220 GB4张 A100 (80G)8-12 小时¥600 - ¥1,000
Llama-3-70B / Qwen-72B~1200 GB16张 A100 (80G) (需NVLink互联)1-2 天¥8,000 - ¥15,000

注:全量微调通常需要 DeepSpeed ZeRO-3 技术来切分模型,对显卡互联带宽要求极高,4090 这种消费级显卡很难做全量微调(带宽不够)。


第四部分:LoRA / QLoRA 微调 —— 个人与开发者的福音

这是目前最主流的微调方式。只训练模型中不到 1% 的参数,冻结主干。成本极低,消费级显卡即可玩转。

假设数据量:1万条指令数据

模型规模微调方法最低显存需求推荐硬件训练时间成本 (人民币)
Llama-3-8BLoRA (FP16)~16 GB1张 RTX 4090 / 309030分钟 - 1小时< ¥5 (甚至电费)
Llama-3-8BQLoRA (Int4)~8 GB1张 RTX 3060 / 2080Ti1 - 2 小时忽略不计
Qwen-14BQLoRA (Int4)~14 GB1张 RTX 4090 (24G)2 - 4 小时< ¥10
Llama-3-70BQLoRA (Int4)~40 GB2张 RTX 3090 / 4090 或 1张 A60005 - 10 小时¥50 - ¥100
DeepSeek-V3QLoRA (Int4)~140 GB*2-4张 A100 (80G)10 - 24 小时¥500 - ¥1000

注:DeepSeek-V3 虽然参数巨大,但因为是 MoE 架构,且量化后显存占用相对较小,微调成本比同等参数的稠密模型低。


第五部分:总结与建议

1. 各种需求的“入场券”
  • 我想自己在家玩(训练 8B 模型): 买一张 RTX 3090 (二手约¥5000)RTX 4090。这是性价比之王,可以跑 8B 全量推理,或者 70B 的量化推理,以及绝大多数模型的 LoRA 微调。
  • 公司要做行业垂直小模型(7B-14B): 租用或购买 2-4 张 A800/A100。如果预算有限,多张 4090 组集群做推理和轻量微调也行。
  • 公司要做行业大模型(70B+): 必须上 8卡 A100/H100 服务器,一台服务器成本在 150万-250万人民币左右。
  • 我想从头训练一个大模型: 除非你有 5000 万人民币以上的预算和顶级的算法团队,否则强烈不建议
2. 核心省钱技巧
  • 不要全量微调:95% 的场景下,LoRA 或 QLoRA 的效果已经足够好,成本只有全量的 1/10 甚至 1/100。
  • 利用 MoE 模型:像 DeepSeek 或 Mixtral 这种混合专家模型,推理和训练成本比同参数量的 Llama 要低很多,因为每次只激活一小部分参数。
  • 使用 Int4/Int8 量化:加载模型时使用 4-bit 量化(QLoRA),可以让 70B 的庞然大物在两张消费级显卡上跑起来。
3. 2025年主流模型推荐(按显存友好度排名)
  1. 极低成本 (8G显存): Qwen-2.5-7B-Int4, Llama-3-8B-Int4 (一张3060就能跑)。
  2. 高性价比 (24G显存 - 4090): Qwen-2.5-32B-Int4 (目前最强性价比尺寸), Llama-3-8B-FP16。
  3. 企业级入门 (80G显存 - A100): Qwen-2.5-72B-Int4, Llama-3-70B-Int4, DeepSeek-V3-Int4 (需多卡)。

更多推荐