H100-80G-SXM5:H100 是型号代号,80G 表示 80GB 显存,SXM5 指 SXM 第五代板型(高带宽底座,需搭配专用服务器);另有 PCIe 版可插入通用插槽。
基于 Hopper 架构,以 FP8 · Transformer Engine · HBM3 · NVLink 4 为底座,把算力、带宽与多卡互联同时逼到极限,重新定义大模型训练的性能标尺。

一、开篇导读

H100 是 NVIDIA 2022 年发布的数据中心 AI 训练旗舰 GPU,基于 Hopper 架构。过去几年里,几乎所有公开的大模型背后都有它的身影——堪称「大模型时代算力」的代名词。

为什么从 H100 开篇? 因为它既是本系列「训练旗舰」编组的锚点,也是后续每一款型号(H200/A100/H800/H20,乃至国产对标卡)都绕不开的对比基准。吃透它,等于拿到了读懂整张算力地图的钥匙。

二、认知锚点:用类比看懂它

一句话类比:H100 之于大语言模型,就像一座自动化超级货运港之于海量包裹分拣——它不负责「决定每个包裹去哪」,却能让堆积如山的包裹以碾压级的吞吐速度进出港。

把数字变直觉

  • 显存 80GB:相当于货运港的「堆场面积」——能同时摊开多少集装箱。模型越大越「吃显存」,80GB 就像一座能同时堆放海量集装箱的堆场,数据不必频繁在堆场与远处仓库间来回吊运。
  • 带宽 3.35 TB/s:相当于码头的「装卸传送带速率」——每秒能从堆场搬 3.35 万亿字节上船或下船,约 1 秒传完 800 张 DVD。这是 H100 比上代 A100(2.0 TB/s)带宽高约 2/3 的关键:箱子上船够快,货船才不堵在港里。
  • FP8 算力 ~4000 TFLOPS(稀疏):相当于「分拣工人的处理速度」——一秒处理 4×10¹⁵ 件。低精度 FP8 就像让工人「先按大类粗分、不逐件细查」,省时省力,正好是大模型训练/推理的「省电模式」。

三个常见误区

  1. 显存大 = 算力强? 错。显存是「堆场面积」,算力是「分拣处理速度」,两者独立——堆场再大,分拣慢也是堵。
  2. 消费卡不能训练大模型? 能,但受显存(24GB)与互联带宽限制,只适合个人微调,万卡训练不现实。
  3. 新卡一定全面碾压老卡? 看精度。H100 的杀手锏是 FP8,老模型不用 FP8 则提升有限。

三、型号定位与代际

3.1 H100 为何而生

大模型浪潮在 2020 年后陡然加速:GPT-3(175B,2020)首次把「千亿参数」变成公开事实;随后 Megatron-Turing NLG(530B)、PaLM(540B,2022)、Chinchilla(70B,2022,提出「算力最优」Scaling Law)、LLaMA(7B–65B,2023)、GPT-4(2023)接连出现。参数规模与训练数据量呈指数攀升,训练任务对算力的需求增速,远超单卡算力的代际提升

上一代 A100 的五大痛点,H100 如何一一破解:

上一代 A100 痛点H100 的解法关键技术与量化
显存墙:80GB HBM2e,175B 模型权重 FP16 即需约 350GB,装权重就要 5–8 张卡FP8 让权重显存减半(175B FP8 ≈ 175GB),并靠高带宽减少搬运;容量瓶颈留待 H200(141GB)进一步缓解FP8 权重比 FP16 省一半
带宽瓶颈:HBM2e 2.0 TB/s,算力越快越「饿」,计算单元常空等数据HBM3 3.35 TB/s,带宽较上代 +67%3.35 TB/s vs 2.0 TB/s
训练周期以「月」计:数周乃至数月,电费/机房/人力皆成本FP8 + Transformer Engine 把 Transformer 类模型(GPT、LLaMA 等)训练吞吐最高提至约 A100 的 6 倍(NVIDIA 官方口径,理想上限,实际多在 2–4 倍)端到端吞吐,非裸算力
精度天花板:最高 TF32/FP16,缺更低精度「省电档」,单位 token 成本到顶原生 FP8 张量核心 + TE 动态混合精度,把低精度「省电省时」带入训练单位 token 成本降至 A100 的约 1/3–1/6
互联天花板:NVLink 3 代约 600 GB/s,万卡集群通信成硬约束NVLink 4 代 900 GB/s + NVSwitch,单机 8 卡全互联、跨节点可扩 256 卡万卡集群工程现实

表中所列解法,正是 H100 相对 A100 的增量所在。但还有一个问题要单独点破:同期竞品(如 AMD MI200、Google TPU)同样有大显存或高算力,为什么最终是 H100 成了大模型的标配? 根本在 CUDA 全栈生态护城河——硬件再强,没有框架、算子库、编译器与开发者习惯的沉淀也跑不动。NVIDIA 的胜出,七分在生态,三分在芯片。

3.2 代际与产品线位置

  • 架构:Hopper(命名自计算机先驱 Grace Hopper),是 Ampere(A100)的继任架构。
  • 节奏:2022-03 GTC 发布,2022-10 量产。
  • 产品线位置:上代 A100(2020)|同代衍生 H200(显存升级 141GB HBM3e)、GH200(H100 + Grace CPU 超级芯片)|下代 Blackwell B100/B200(2024 起)。

四、关键参数全景

铺垫完背景,下面进入 H100 的硬规格。这一代的分水岭不在「堆了多少晶体管」,而在 FP8 算力 + 显存带宽 两项——它们直接决定你训练一个模型要花多少钱、多少天。下面这张参数全景表是全文的重心,读懂它,就读懂了 H100 的「贵得有理」。

4.1 SXM5 与 PCIe 参数对照

下表以 H100 SXM5 80GB 为主,附 PCIe 80GB 变体对照。算力单位 TFLOPS(FP8/INT8 亦用 TOPS)。

参数H100 SXM5 80GBH100 PCIe 80GB
架构 / 制程Hopper / TSMC 4N同左
晶体管数800 亿800 亿
显存容量80 GB HBM380 GB HBM3
显存位宽5120-bit5120-bit
显存带宽3.35 TB/s2.0 TB/s
FP8(稠密/稀疏)1979 / 39581513 / 3026
FP16 / BF16(稠密/稀疏)989 / 1979756 / 1513
TF32(稠密/稀疏)495 / 990378 / 756
FP64(非张量)34 TFLOPS26 TFLOPS
INT8(稠密/稀疏)1979 / 3958 TOPS1513 / 3026
NVLink4 代,900 GB/s4 代,600 GB/s
PCIeGen5 x16Gen5 x16
TDP(功耗)700 W350 W
互联拓扑8 卡 NVSwitch 全互联单/双卡为主

注:显存带宽公式 带宽 = 位宽(bit) × 每引脚速率(Gbps) ÷ 8;H100 SXM 以 5120-bit × ~5.2 Gbps ÷ 8 ≈ 3.35 TB/s。PCIe 版与 SXM5 为同一颗 GH100 芯片,仅降频交付、并非独立型号(详见 4.2 节)。参数以 NVIDIA 官方 datasheet 为准。

4.2 SXM5 与 PCIe:同一颗芯片,两种交付形态

翻看上面的参数表,H100 同一颗 GH100 芯片却出了 SXM5 与 PCIe 两种板型,功耗还差一倍(700W 对 350W)。这并非 NVIDIA 刻意用两个版本制造混淆,而是芯片的物理极限与客户真实需求共同决定的。

两种板型先看差异:

SXM5PCIe(Gen5)
形态专用模组,焊在 NVSwitch 底座(HGX 基板)通用插槽,自带散热片/风扇
供电 / 散热整机统一供电 + 液冷/强冷,跑满 700W自供电,350W
NVLink900 GB/s 全互联通常 600 GB/s,多为双卡直连/桥接
扩展性单机 8 卡 NVSwitch 全互联单/双卡为主
代价须配专用 SXM 服务器(如 DGX H100)插进任何 PCIe Gen5 服务器即用

核心是:两种板型的算力核心(GH100 die)完全相同,区别只在功耗余量、互联带宽和扩展性。PCIe 版因降频,峰值算力约低 24%——这是封装与供电层面的取舍,不是「性能阉割」。

为什么同一芯片要分两种形态? 两层原因:

  • 物理极限:700W 的发热根本塞不进标准 PCIe 风冷插槽,必须专用底座才能释放满血性能。
  • 市场分层:云厂商要整栋「满血集群」、追极致互联;中小企业只想往旧服务器插几张卡升级,PCIe 版更便宜、易量产、易买到。两种板型恰好覆盖两类客户。

五、架构与关键技术

参数表里的 FP8 和 3.35 TB/s 不是凭空来的。H100 相对 A100 那最高约 6 倍的端到端训练吞吐,几乎全来自「精度策略 + 带宽」,而非裸算力翻倍。其中最关键的一项,就是下面要讲的 Transformer Engine——看懂它,就看懂了 H100 为什么敢用低精度还不崩。

微架构:Hopper(GH100)

  • 台积电 4N、814 mm² die、800 亿晶体管,当时最大 GPU die 之一;SM 数量较 A100 增加,每 SM 的 Tensor Core 原生支持 FP8。

关键技术创新

  1. Transformer Engine(TE):动态在 FP8 与 FP16 间切换,用「混合精度 + 自动缩放因子」保住收敛精度,专为 Transformer(大模型底座)优化。官方称:在 FP8 + TE 开启下,Transformer 类模型(GPT、LLaMA 等)训练吞吐最高可达 A100 的 约 6 倍(理想上限,实际多在 2–4 倍)。
  2. FP8 张量核心:首代数据中心 FP8,把低精度推理的「省电省时」带入训练。
  3. NVLink 4 代 / NVSwitch:卡间 900 GB/s,单节点 8 卡全互联;多节点可扩展至 256 卡,支撑「万卡集群」。
  4. HBM3 显存:带宽较 A100 的 HBM2e(2.0 TB/s)提升约 67%。
  5. NVLink-C2C:用于 GH200 把 H100 与 Grace CPU 以 900 GB/s 直连,统一内存。

与 A100 的差异:端到端训练吞吐最高约为 A100 的 2–6 倍(裸算力仅约 2 倍,增量几乎全来自 FP8 + TE + 带宽),而非单纯堆料;FP64(HPC)提升有限,故 H100 是「AI 向」而非「科学计算向」。

六、业务应用场景

看懂架构后,接下来才是大家最关心的:这张卡到底能干多少活、要花多少钱。要回答这个问题,光说「很强」没用,必须量化——你的模型装不装得下、训练要几天、推理每 token 多少钱。下面用公开可参照的示例做量级估算(假设 MFU 模型利用率约 40%,训练算力按 Chinchilla 经验 C≈6×参数量×训练token数)。

6.1 训练场景

  • 大语言模型预训练(百亿~千亿参数)、指令微调(SFT)、RLHF、LoRA 后训练、多模态与推荐系统大规模 Embedding。
  • 量化估算(以 LLaMA-70B 量级为例)
    • 显存:70B 在 FP16 权重 ≈ 140GB → 需 ≥2 张 80GB H100;量化至 INT4 ≈ 35GB 可单卡装载推理/轻量微调。
    • 训练算力(以 LLaMA-70B 训练 1T tokens 估算):
      • 总算力需求 ≈ 4.2×10²³ FLOPs(按 Chinchilla 经验 6×参数量×训练token数)。
      • 千张 H100(FP8 稠密、MFU 40%)有效算力约 7.9×10¹⁷ FLOPs/s → 理想耗时 ≈ 6 天
      • 同规模 A100 集群(FP16)约 5–6 周
      • 即 H100 把训练从「以月计」压到「以周计」。

6.2 推理场景

  • 在线低延迟:单卡即可服务中等模型;FP8 显著降低每 token 成本。
  • 离线高吞吐:靠高带宽与并发吃满算力。
  • 量化估算:70B 模型 INT4 在单张 H100 上推理吞吐可达数百~上千 tokens/s(依 batch/实现浮动);对比 A100(FP16)同模型,吞吐约为其 2–4 倍

6.3 图形与可视化

H100 定位 AI 训练与推理,并非为图形渲染设计,图形/渲染需求见 RTX / L40S 篇。

6.4 行业落地

下面用可参照的公开规格与报道做量级量化(均为公开报道口径)。

  • 行业以 8 卡为一个训练节点:国内主流云厂商(阿里云、腾讯云、华为云等)的 H100 实例均按 8 张卡为一台虚拟机对外出租,所以大家租到的「一个节点」天然就是 8 卡起——具体机型规格见 6.5 节。
  • 头部厂商部署规模:国内头部云厂商与模型厂商(阿里云、腾讯云、百度智能云、字节火山引擎等)自 2023 年起纷纷建成万卡乃至数万张 H100 级集群;据 2023–2024 年公开报道,全球范围 AWS P5 单 Region 可纵向扩展至 2 万张级超集群,Meta、Microsoft 等单家 H100 部署量级已达 10 万张以上且仍在快速扩张。
  • 市场占比:2023–2024 全球 AI 训练卡出货中,H100 在同代训练卡里估算占 60%+;若看 NVIDIA 整体在数据中心 AI 加速器份额则约 90%+(行业分析口径,含 A100/H100 等)。换句话说,这两年公开的大模型,绝大多数跑在 H100 家族上。
  • 科研 / HPC:更多利用其 AI 能力做科学 AI(如蛋白质折叠、气候建模);纯双精度 HPC 场景受 FP64 仅 34 TFLOPS 限制,不是首选。

6.5 部署形态

同一批 H100,落到不同采购与运维形态上,规模与门槛差别很大:

形态规模 / 规格适合谁
云实例(按卡/按时租赁)最小 1 卡起,常见 8 卡机型(如阿里云灵骏 / 腾讯云星脉 8 卡 H100 实例,整机 8 卡 NVSwitch 全互联)弹性试错、中小负载、不想一次性买卡的团队
裸金属 8 卡服务器(DGX H100)单机 8 卡、8U、约 10 kW,整机强冷需要独占、稳定、长周期训练的客户
超算集群(DGX SuperPOD)256 卡(32 节点),整机功耗约 300 kW+,可再扩万卡有专用机房供电、跑前沿大模型的企业
一体机(单机柜整机交付)供电/网络/存储一体,开箱即用想缩短部署周期、弱化运维的团队
自建 PCIe 服务器往现有服务器插 1–8 张 PCIe 版 H100预算与可得性优先、互联要求不高的升级场景

核心取舍:SXM 形态的集群(DGX/SuperPOD)互联满血、扩展强,但要整机底座与机房供电;PCIe 形态灵活便宜,却受互联带宽限制、难做大规模扩展(详见 4.2 节)。

6.6 成本量化小结

  • 以单卡云租 $3/小时 估算:训练 7B 小模型可能仅数小时、几百美元;百亿~千亿模型则需千卡级集群数周,账单达百万美元量级。
  • 核心账:看「每训练步成本 / 每 token 成本」,不看「每卡标价」。FP8 + TE 把单位 token 成本压到 A100 的约 1/3–1/6,这正是 H100 贵却划算的逻辑。

七、市场现状

参数再强,买不到也是零——对国内云厂商、模型厂商尤其如此,H100 的供货受美国出口管制直接约束。所以在讲价格与竞争之前,先把这条供给红线说清楚:它直接决定你能不能选 H100。

7.1 供货与渠道:H100 自 2022 起长期供不应求;受美国出口管制影响,A100/H100 自 2022 年起即需出口许可、实质禁售中国大陆,NVIDIA 先以特供版 H800(NVLink 砍至 400 GB/s)替代;2023-10 管制升级后 H800 亦被限,改由 H20 承接。当前国内合规采购主要走 H20 通道。

7.2 价格区间

  • 灵算云平台采集价格(云租赁,数据源:本平台「采集价格」,截至 2026-07-22):H100-80G-SXM5 约 15.86 元/卡·时(当日发布加权均价);近一周官方价区间约 15.86–25.18 元/卡·时,随供给收紧逐步走低。
  • 官方发售价(整卡采购,公开资料):约 $25,000–$30,000 / 卡(发布期)。
  • 市场溢价:2023–2024 高峰曾达 $40,000+,随 Blackwell 上市逐步回落。
  • 二手/拆机:波动大,需甄别来源与保修。

7.3 竞争格局:同代对标 AMD MI300X(192GB HBM3,显存/带宽更大)、国产昇腾 910B / 寒武纪 MLU590 / 壁仞 BR100;生态(CUDA)仍是 H100 最大护城河

7.4 生命周期:在售,但已进入平台期,NVIDIA 主力转向 Blackwell(B200)。新项目若预算敏感或受管制,可考虑 H200(显存更大)或特供 H20。

八、选型指南

选型没有标准答案,只有业务需求与约束的匹配。下面用一棵决策树把隐形经验显性化,帮大家按需对号入座。

适配决策树

  • 训练百亿~千亿参数 + 有合规渠道 → H100 SXM5(首选满血集群)。
  • 受出口管制(中国区)→ 选合规特供 H20(或存量 H800),或评估国产替代(910B / MLU590)。
  • 显存成瓶颈(模型装不下)→ 直接上 H200(141GB)
  • 推理为主、预算有限 → A10 / L40S 更划算,不必追 H100。
  • 个人/小团队本地微调 → RTX 4090 更经济。

兄弟型号怎么选

  • H100 vs A100:后者便宜但无 FP8/TE,训练效率差距显著,新项目优先 H100。
  • H100 vs H200:同架构,H200 显存 141GB、带宽 4.8 TB/s,模型更大/batch 更友好时选 H200。
  • H100 SXM vs PCIe:集群必选 SXM(见 4.2 节的供电/互联差异);单机试验 PCIe 即可。

成本提示:H100 单卡贵,但 FP8 把单位 token 成本压低,大规模训练总账优于堆 A100(成本算法见 6.6 节)。

避坑提示

  • 显存墙仍在:80GB 跑超大模型仍需张量并行 / 梯度检查点 / 流水线并行。
  • 供电散热:SXM 700W 需整机底座与强冷,勿按消费卡经验估算。
  • 软件兼容:老框架不支持 FP8/TE 时,H100 退化成「贵版 A100」,需升级栈才吃满。

附录:统一速查卡

项目
型号NVIDIA H100 SXM5 80GB
架构 / 制程Hopper / TSMC 4N
显存80GB HBM3,3.35 TB/s
FP8 算力1979(稠密)/ 3958(稀疏)TFLOPS
FP16/BF16989 / 1979 TFLOPS
TF32495 / 990 TFLOPS
NVLink4 代 900 GB/s
TDP700 W
定位training(大模型训练旗舰)
适合场景大模型预训练/微调、高吞吐推理、AI 集群
参考价约 15.86 元/卡·时(灵算云平台采集价格,2026-07-22)
国产对标昇腾 910B / MLU590 / BR100

下一篇建议:H200(同一架构、显存跃迁,最适合与本文对比阅读)。

更多推荐