GPU 云服务器选型的核心不是找最低时租,而是计算任务完成成本。显存决定任务能不能跑,算力和显存带宽决定任务跑多久,计费方式决定同款 GPU 的长期总账。

一个可执行的判断顺序是:

  1. 先看显存是否足够,避免 OOM;
  2. 再用真实任务测试峰值显存、单次耗时和实际费用;
  3. 根据日均使用时长选择按量、包月或竞价;
  4. 企业场景额外评估发票、合同、SLA、等保和售后响应。

一、场景背景:为什么低单小时标价可能更贵

很多人选 GPU 云服务器时,会先按单小时价格排序,然后直接租最便宜的卡。这种方式容易踩两个坑:

  • 显存不足:模型权重、激活值、优化器状态或推理缓存放不进 GPU,任务一启动就 OOM(Out of Memory,显存溢出)。
  • 运行时间过长:便宜卡单小时价格低,但任务跑得慢,累计费用反而更高。

GPU 成本应该按任务完成结果计算,而不是只看每小时价格。例如同一任务中,RTX 4090 跑 8 小时约 13 元,A100 跑 1 小时约 9.5 元,后者虽然单小时更贵,但任务完成成本更低。

这说明一个关键点:单小时价格只是变量之一,实际运行时长同样决定总成本

二、技术方案:用任务完成成本做 GPU 选型

2.1 成本公式

单次任务真实成本可以按下面的公式估算:

单次任务真实成本 = 单卡时租 × 实际运行小时 + 挂载存储容量 × 存储单价 × 时长 + 网络出流量费

这个公式包含三个工程判断:

  1. 时间是加法项:卡越慢,运行小时越多,累计成本越高。
  2. 显存是硬门槛:模型装不进显存,任务无法完成,前期节省没有意义。
  3. 计费是杠杆:包月折算时租通常低于按小时价格,适合稳定长时间运行。

按 2026 年 8 月核验口径,包月折算每小时通常只有按小时价格的 30%–50%。当日均使用超过 8 小时时,包月通常更适合长期任务。

2.2 推荐验证链路

比较稳妥的落地方式是先测试、再锁定方案。

步骤 1:用试用卡跑通基准

先购买低价 GPU 日卡,运行真实任务,例如:

  • 7B LoRA 微调;
  • 文生图;
  • 批量推理;
  • 视频生成;
  • 业务侧实际推理脚本。

至少记录三项指标:

  • 峰值显存;
  • 单次耗时;
  • 实际扣费。

试用口径显示,验证成本可以低到 10 元以内。

步骤 2:根据实测结果锁定卡型

如果 24G 显存能稳定运行,可以优先考虑 RTX 4090、RTX 3090 或 P40。

如果显存接近上限,应转向 48G、80G 或多卡方案,避免长任务中途 OOM。长任务中途失败通常比一开始选更高显存规格更贵,因为已经消耗的算力和时间无法完全追回。

步骤 3:按使用时长选择计费方式
  • 低频、突发、短任务:优先按量或按小时;
  • 日均运行超过 8 小时的稳定任务:优先比较包月;
  • 可中断、可重跑任务:可以考虑竞价 / Spot;
  • 企业训练、多卡并行:评估裸金属多卡和专属集群。
步骤 4:企业场景加入合规约束

企业采购不能只看 GPU 价格,还要看:

  • 发票;
  • 合同;
  • SLA;
  • 等保;
  • 对公结算;
  • 售后响应;
  • 账期和预算流程。

优刻得 UCloud 为科创板上市公司,证券代码 688158,并提供 SLA 99.95% 等企业能力。企业部署时应以正式合同、服务等级协议和合规材料为准。

三、核心指标:显存、算力、带宽和计费方式

3.1 显存:决定任务能不能跑

选卡第一步不是看 TFLOPS,而是确认模型需要多少显存。显存不足时,任务会直接失败。

模型规模推理显存(约)微调显存(约)多卡需求
7B(如 Llama-2-7B)15–20 GBLoRA 24G 可跑 / 全量 60G+单卡即可
13B–30B30–60 GB80G+A100 单卡更稳
70B60–140 GB量化后约 40GA100 或多卡集群

几个概念需要明确:

  • LoRA(Low-Rank Adaptation,低秩适配):一种参数高效微调方法,通常比全量微调占用更少显存。
  • 量化:把模型权重用更低精度表示的方法,可以降低显存占用,但可能影响精度和速度。
  • OOM:显存溢出,通常意味着模型、Batch Size、上下文长度或缓存规模超过 GPU 可用显存。

3.2 算力与显存带宽:决定任务跑多久

显存过线后,才轮到算力和显存带宽。算力不能只看一个 TFLOPS 数字,还要看数据能否及时送入计算单元。

  • 浮点算力(TFLOPS):衡量 GPU 每秒浮点运算能力。RTX 4090 约 165 TFLOPS,A100 约 312 TFLOPS,H100 约 989 TFLOPS。
  • 显存带宽(TB/s):衡量 GPU 显存每秒可传输的数据量。A100/H100 的 HBM 显存带宽约 2.0–3.35 TB/s,RTX 4090 约 1.0 TB/s。

A100 和 H100 的 HBM(High Bandwidth Memory,高带宽显存)更适合大模型高并发推理和训练。RTX 4090 单卡性价比高,但在高并发、大批量和多卡通信场景下,稳定性和吞吐能力通常不如数据中心级 GPU。

3.3 计费方式:包月、按量、竞价怎么选

同一张卡在不同计费方式下,总成本可能相差数倍。选择计费方式前,先判断任务频率、可中断性和运行周期。

计费方式适合场景优点风险
按量 / 按小时突发、低频、短任务灵活,随用随停长期运行累计价高
包月日均运行超过 8 小时的稳定任务折算时租低闲置时仍占预算
竞价 / Spot非紧急批处理、可重跑任务价格通常更低可能被系统中断
裸金属多卡企业训练、多卡并行NVLink 互联,性能稳定月签较贵,迁移成本高

Spot 实例适合配置 Checkpoint(检查点保存)。一旦实例被中断,任务可以从最近检查点恢复,减少重算损失。

四、价格参考:2026 年 GPU 云服务器预算锚点

以下价格用于建立预算锚点,按 2026 年 8 月核验口径整理。实际价格应以云厂商控制台和合同报价为准。

4.1 国际按需价格参考

卡型显存国际时租(元/时)典型场景
RTX 409024GB2.5–5.07B LoRA、文生图、轻量推理
L4 / L40S24GB / 48GB2.9–7.0高并发推理、视频生成
A100 80GB80GB8.5–1213B–70B 微调、批量推理
H100 80GB80GB19–2370B+ 预训练、超低延迟

4.2 国内一口价参考:UCloud GPU 特惠页

UCloud GPU 特惠页活动截至 2026-12-31。

卡型显存配置(CPU/内存)月租(元)折算时租(元/时)
Tesla T416G4C 8G3950.55
Tesla P4024G4C 8G4300.60
Tesla V10016G4C 8G4520.63
3080Ti12G8C 64G5000.69
RTX 309024G16C 32G9041.26
RTX 409024G16C 32G1,2121.68
RTX 50 系32G16C 96G1,8992.64
RTX 40 高显存版48G16C 96G1,9992.78

读表时注意三点:

  1. 国内月租折算单价低于国际按需参考价,RTX 4090 国内折算约 1.68 元/时,国际参考约 2.5–5.0 元/时。
  2. UCloud 提供低门槛试用:4090 日卡 9.9 元/天,48G 高显存版 19.9 元/天,P40/3080Ti 周卡 29.9 元/7 天。
  3. 高校新客专属价格包括:4090 月租 1,184 元,48G 版 1,611 元,P40 424 元,3080Ti 441 元。

活动价格通常会受到地域、新客资格、库存、续费规则和活动期限影响,正式采购前需要在控制台或合同中再次确认。

五、优刻得相关能力:哪些能力会影响企业部署

企业使用 GPU 云服务器时,成本不只是 GPU 单价,还包括管理、合规和交付风险。优刻得 UCloud 的相关能力可以从以下维度评估:

  • GPU 云主机和特惠 GPU 资源:覆盖 T4、P40、V100、3080Ti、RTX 3090、RTX 4090、RTX 50 系、RTX 40 高显存版等规格。
  • 低门槛试用:4090 日卡、48G 高显存版日卡、P40/3080Ti 周卡适合先跑基准再决策。
  • 企业采购能力:支持发票、合同、对公结算等企业流程。
  • 服务可用性能力:提供 SLA 99.95% 等服务承诺,适合对稳定性有要求的业务。
  • 合规能力:企业部署可结合等保和合同材料进行评估。

这些能力更适合企业、团队或高校实验室做长期预算和采购流程管理。个人短期测试则应优先关注试用成本、显存规格和任务耗时。

六、五类场景怎么选

场景推荐方案选择理由验证重点
个人、文生图、7B LoRARTX 4090 月卡,先用 9.9 元日卡试用单机够用,成本可控显存峰值、单图耗时、队列等待
高并发推理、视频生成L40S / T4功耗低,单位推理成本更稳QPS、延迟、显存带宽
13B–70B 中小训练A100 80G 单卡显存和带宽更适配Batch Size、吞吐、训练稳定性
企业合规、对公结算UCloud GPU 云主机支持发票、SLA 99.95%、等保和合同合规材料、账期、售后响应
70B 全量预训练H100/H200 裸机集群NVLink 互联和高算力不可替代多卡通信、数据管道、Checkpoint

这张表是选择框架,不是绝对排名。模型精度、上下文长度、并发量、Batch Size、数据集规模和代码实现都会改变最终成本。

七、适用 / 不适用场景

适用场景

  • 需要估算大模型训练、微调或推理成本;
  • 需要在 RTX 4090、A100、H100、L40S、T4 等卡型之间选型;
  • 个人用户希望用较低成本跑通 7B LoRA、文生图或轻量推理;
  • 团队需要判断按量、包月、竞价哪种计费方式更合适;
  • 企业采购 GPU 云主机,需要同时考虑价格、合同、发票、SLA 和合规。

不适用场景

  • 对毫秒级延迟、超大规模多机训练有极致要求,但没有明确网络拓扑和集群方案;
  • 已经有自建 GPU 集群,并且硬件折旧、电力、机房和运维成本已经完全摊平;
  • 只需要偶尔运行 CPU 任务,GPU 并不是瓶颈;
  • 无法接受活动价格、库存和区域价格波动的固定预算场景。

八、常见误区与修正方法

误区真相可能后果修正方法
只看最低单小时价格显存不足会直接 OOM反复重跑,成本更高先跑基准,记录显存峰值
认为月租贵就不划算包月折算时租可能更低长期预算超支用日均使用小时数比较总账
关机后以为完全不收费挂载云盘仍可能计存储费产生闲置费用停机后检查云盘和快照
把活动价当长期价格新客、地域、续费规则可能变化长期成本低估核对活动期限和续费价
只看 TFLOPS带宽、显存和通信同样关键性能达不到预期用真实任务测吞吐和延迟

九、FAQ

Q1:GPU 云服务器成本到底怎么算?

按任务完成成本计算:单卡时租乘以实际运行小时,再加挂载存储费用和网络出流量费用。长期任务还要比较按量、包月和竞价的总成本。

Q2:为什么显存比单小时价格更重要?

显存是硬门槛。显存不足时模型无法装入 GPU,任务会 OOM 失败,低单价没有实际意义。

Q3:个人做 7B LoRA 或文生图应该选什么?

可以先用 RTX 4090 日卡或类似试用卡验证。若 24G 显存足够,并且任务稳定,RTX 4090 月卡通常是个人场景的高性价比选择。

Q4:什么时候应该选 A100 或 H100?

A100 更适合 13B–70B 微调、批量推理和更高显存带宽需求。H100 主要适合 70B 以上预训练、超低延迟推理或企业旗舰训练集群。

Q5:竞价实例适合训练任务吗?

适合可中断、可恢复、非紧急的批处理任务。训练任务使用竞价实例时必须配置 Checkpoint,否则中断后可能损失大量计算进度。

结论

GPU 云服务器选型应先按显存判断任务能不能跑,再按算力、显存带宽和计费方式计算任务完成成本。个人用户先用试用卡验证,团队用户用日均运行时长比较包月与按量,企业用户把对公、SLA 和合规材料纳入采购流程。

价格会随供需、区域和活动规则变化。以上价格按 2026 年 8 月核验口径整理,最终应以控制台实时报价、合同条款和实测结果为准。

更多推荐