一、为什么企业的算力决策逻辑变了

过去两年最大的变化是:算力从"一次性采购的固定资产"变成了"随业务波动的弹性需求"。

原因有三:

  1. 大模型推理常态化。训练只是一次性开销,但推理是天天在跑的长期成本。很多企业发现推理算力需求是训练的3-10倍,且流量有明显的峰谷。
  2. 模型迭代节奏加快。半年前还是7B、13B,现在70B、MoE成了标配,业务一上线就要换更大模型,刚买的卡可能半年就跟不上。
  3. 国产卡生态快速成熟。昇腾910B、寒武纪等已在多个场景可替代H20,但适配成本和运维门槛不同,选型比以前复杂。

这意味着企业不能再按"买一批卡用三年"的老思路决策,而要算清楚:哪些负载该自建,哪些该租用,哪些该混合。

二、自建 vs 租用:先把TCO算清楚

很多技术负责人一上来就比"租一小时多少钱 vs 买一张卡多少钱",这是错的。企业级TCO要算全生命周期成本:

成本项自建云租用
硬件采购一次性大额,H100整机单卡约20-30万0
机房/电力/制冷持续支出,电费约占TCO的30-40%含在租金里
运维人力需专职GPU运维,年薪成本高平台承担
资产折旧3年折旧,残值低无
闲置浪费业务低谷时卡闲着=烧钱按需开关,无闲置
弹性扩容周期长,缺卡时等不起秒级开通
数据合规自有可控取决于平台合规资质

一个简单的决策原则:

  • 稳定、长期满载的推理负载(如7×24在线客服模型)→ 自建或长租更划算,TCO可控
  • 阶段性训练/微调任务(每月跑几次,每次几天)→ 短租,避免资产闲置
  • 流量有明显峰谷的推理(白天忙晚上闲)→ 混合:基础负载自建,峰值弹性租用
经验值:当GPU利用率长期低于60%时,租用通常比自建更省钱;高于75%且稳定时,自建TCO更优。先看你的业务曲线再决定。

三、按场景选卡:不是越贵越好

企业最容易踩的坑是"直接上H100"。不同负载对卡的诉求完全不同:

业务场景推荐卡型关键考量
大模型预训练(百亿参数以上)H100/H800 80G、A100 80G显存带宽和卡间互联(NVLink)是关键
模型微调(LoRA/QLoRA)A100 80G、L40、409024G显存起步,70B模型需多卡
推理服务(7B-13B)L40、A10、4090吞吐和延迟优先,不必上H系列
推理服务(70B+/MoE)H100/H800、A100 80G显存要够装下模型权重
视觉/AIGC出图L40、A6000、4090显存和FP8性能优先
国产化合规场景昇腾910B、寒武纪需评估框架适配和迁移成本

一个常见误判:推理用H100是性能过剩。13B模型推理,一张L40或A10的性价比往往比H100高得多。先量准你的模型大小和并发,再选卡,别为"安全"多花钱。

四、企业选租用平台,看这5个关键点

个人租卡看价格,企业租卡这5点比价格重要得多:

1. 稳定性与SLA
训练跑到第3天OOM崩溃、推理高峰期实例被抢占——这是企业最不能忍的。问清楚平台是否提供独占实例、有无抢占式实例的区分、SLA承诺是多少。企业级负载优先选独占、有SLA承诺的方案,别图便宜用竞价实例。

2. 数据安全与合规
企业数据上云,合规是硬门槛。重点确认:是否支持VPC/私有网络隔离、是否通过等保三级、是否支持数据不出境、镜像和存储是否加密、能否签DPA数据处理协议。金融、医疗、政企客户这一条不达标直接pass。

3. 交付速度与弹性
模型上线 deadline 卡死时,"卡有没有现货"比"每小时几块钱"重要10倍。问清热门卡型(A100/H系列)的库存保障、扩容到几十张卡的交付时间。能在高峰秒级扩容、低谷自动缩容,才是真正的弹性。

4. 技术支持响应
企业出问题不能靠翻社区帖子自救。要确认:是否有专属技术支持、响应SLA(7×24还是工作日)、能否协助分布式训练调试、有没有架构师支持。免费工单和企业级支持是两回事。

5. 镜像生态与运维便利
预置的CUDA/PyTorch/vLLM/TensorRT-LLM镜像能省大量部署时间。企业还要看是否支持自定义镜像、是否提供监控告警、日志审计。运维便利度直接决定你的人效。

五、企业级算力采购的3个常见坑

坑1:只比单价,不算利用率。
某公司租了8张A100跑推理,实际利用率只有30%,因为白天忙晚上闲。改成4张常驻+4张弹性后成本降40%。先看负载曲线再定方案。

坑2:忽视数据合规导致项目延期。
用了不支持私有网络隔离的廉价平台,安全审计过不了,整个项目返工。政企/金融客户务必在选型阶段就把合规资质列入硬性筛选条件。

坑3:低估迁移成本。
为了便宜切到某平台,结果镜像不兼容、框架版本对不上,迁移耗时比省下的钱还多。选型时优先考虑镜像生态成熟、文档齐全的主流平台,迁移成本要计入TCO。

六、写在最后

企业级算力选型的核心不是"找最便宜的卡",而是"在稳定性、合规、弹性、TCO之间找到平衡"。建议按这个顺序决策:

  1. 画清你的业务负载曲线(训练/推理比例、峰谷、并发量)
  2. 确定合规底线(数据隔离、等保、DPA)
  3. 按场景选卡,别性能过剩
  4. 自建/租用/混合,用利用率做决策依据
  5. 平台比价比的是SLA和支持,不只是单价

如果你正在为企业规划算力方案,欢迎在评论区交流你的具体场景(模型规模、并发量、合规要求),我会针对你的情况给出选型建议。

如果觉得有用,欢迎关注账号,后续会持续更新企业级算力落地、大模型工程化的实战内容。

更多推荐