本地部署大模型,服务器还是工作站?先把显存这笔账算清楚(浪潮 / 联想实战选型)
一、问题从哪来:为什么"选服务器还是工作站"能吵起来
先给结论:决定因素不是品牌,是显存、并发和功耗这三笔账。 换谁来做技术选型,第一步都必须回到"我要跑多大模型、给几个人用、放在哪"。
过去半年我反复被问到同一个问题:
"我想本地部署一个大模型,是不是得买那种 8 卡、机架式、几万瓦的服务器?预算吓人。"
这句话一半对,一半不对。不对的部分,恰恰是很多人在浪费钱的地方。
先看当前市场的一个大背景:IDC 预测 2025 年全球 AI 工作站市场规模将突破 200 亿美元,而同期"本地部署 vs 上云"的讨论也被 DeepSeek 这类开源模型彻底点燃——当模型权重免费公开、推理框架越来越成熟,企业开始认真算一笔账:数据出不出门、一年 GPU 租金多少、换一台本地机器的回本周期多长。
可问题是:网上能搜到的本地部署文章,要么是厂商硬广(把某一款机器吹成"唯一解"),要么是纯教程(只教你怎么敲 ollama run,完全不讲显存边界)。真正站在"要掏钱下单"的人视角、把显存怎么算、卡怎么配、功耗怎么控、成本怎么算讲透的内容,几乎找不到。
这就是我写这篇的原因。我会以一台一台真实交付过的机器为线索,把选型的整个脑回路完整走一遍,不藏结论。
二、显存账:先学会 30 秒口算法,再谈选型
2.1 一份谁都该会的显存速算表
决定"能不能跑、跑得顺不顺"的核心瓶颈,几乎永远是显存(VRAM)。权重装得下,才谈推理速度;装不下,一切性能数字都是空谈。
通用估算公式:
权重显存 ≈ 参数量 × 每个参数占的字节
- FP16 / BF16:每个参数 2 字节
- INT8:每个参数 1 字节
- INT4:每个参数约 0.5 字节(还要留权重分组开销,通常再加 10%)
举例,7B 模型(约 70 亿参数):
| 精度 | 权重占用 | 加上 KV Cache / 激活 / 框架开销后建议 |
|---|---|---|
| FP16 | 约 14 GB | 建议 ≥ 24 GB 显存 |
| INT8 | 约 7 GB | 建议 16–24 GB |
| INT4 | 约 4 GB | 8–16 GB 可跑 |
再看几个常见的:
- 13B / 14B:FP16 约 26–28 GB,INT4 约 8–9 GB
- 32B:FP16 约 64 GB,INT4 约 18–20 GB
- 70B:FP16 约 140 GB(需要多卡),INT4 约 40–48 GB
这套口算法是我每次推荐机器前必先做的第一件事,比任何厂商参数表都准。任何一个把 14B 用 FP16 硬塞进 16 GB 卡的"部署教程",跑起来都会立刻 OOM 或慢到不可用——这不是卡的问题,是当初就没算账。
2.2 "跑得动"和"跑得顺"是两回事
很多人买完机器才发现:模型装下了,但并发一上来就卡死。
原因在于:除了权重,推理时的 KV Cache 随并发和上下文长度线性增长。一次对话上下文越长、并发连接越多,KV Cache 占的内存越大。
所以我在给客户做配置时会把预算拆成三块:
- 权重(上面算过)
- KV Cache + 固定开销:建议按权重同等量级的 1.2–1.5 倍去留
- 冗余:留出 10–20% 给框架和突发并发
结论很直白:"能跑 32B"和"32B 稳定并发 20 人用"的机器,不是同一个配置,价格差 2–3 倍。
三、决策框架:三种场景,三种买法(这是大多数人搜不到的部分)
市面上文章的问题在于:拿一种场景的结论,套到所有人身上。 这里我按真实使用方式,拆成三条完全不同的决策路径。
场景 A:个人 / 小团队开发调试(1–3 人)
- 需求画像:跑 7B–14B,量化后 32B 也行;并发低;追求"开箱即用 + 局域网内集中管理"。
- 这类场景,工作站是性价比之王,不必上服务器。
- 为什么?工作站噪音、功耗、占地都更友好,能放工位旁边,维护门槛低。万元级别的入门工作站 + 24 GB 显卡,就能把 7B FP16 / 14B INT4 跑得很舒服。
- 典型机型:
Lenovo ThinkStation P3h(8 核 16 线程、海光 3350 + 16 GB 显卡)定位主流 2D 图形 + 3D 渲染;P5h G15(16 核 32 线程、海光 3490 + 48 GB 显卡)足以本地运载 32B 级别模型。P5h 这类机型,我实际用它做过 32B 的本地服务,稳定跑了两周没重启。
场景 B:部门级 / 企业知识库(5–20 人并发)
- 需求画像:跑 14B–70B,需要并发支撑、7×24 运行、可能要 RAG 挂企业文档。
- 这类场景,必须上真正的服务器(机架式 / 塔式企业级)。 工作站单机撑不住长期高负载与高并发,散热和稳定性的设计目标根本不同。
- 常见配置:双路 CPU 服务器 + 2–4 张 24 GB 或 48 GB 卡。要做 70B 量化并发,2×48 GB 是起步;要跑满血 671B(如 DeepSeek 满血 MoE),那就要多机 / 液冷这种集群规模了。
- 浪潮的 NF 系列机架式服务器就是为这类场景设计的:
NF5688M7这类整机就是面向 AI 大模型训练推理的本地位部署,支持大规模高带宽 GPU,适合科研、企业数据中心。
场景 C:生产级 / 对外提供服务
- 需求画像:高并发、SLA 高、可能要微调、数据不出域。
- 直接上多机多卡 + 高速互联 + 供电散热整套方案,属于集群工程,不在本文单机选型范围。这类我只给结论:别省互联(NVLink/NVSwitch 或高带宽无损网络),也别省制冷。
我把三种场景整理成一张表,方便直接对照:
| 维度 | 场景 A(1–3 人) | 场景 B(5–20 人) | 场景 C(生产级) |
|---|---|---|---|
| 模型规模 | 7B–32B | 14B–70B | 70B+ / 满血 |
| 并发 | 低(1–3) | 中(5–20) | 高 / SLA |
| 购买形态 | 工作站 | 服务器 | 多机集群 |
| 典型机型 | ThinkStation P3h / P5h | 浪潮 NF 系列服务器 | 浪潮 NF5688M7 类 + 集群 |
| 显存 | 24–48 GB | 48–96 GB | 数百 GB+ |
| 关键约束 | 噪音 · 功耗 | 散热 · 稳定性 | 互联 · 制冷 · 供电 |
四、GPU 调优:同样的卡,我通常能再榨出 30%–50%
买完机器不是终点,调优才是。同样的硬件,框架和参数选对,吞吐能差出接近一倍。这部分是我交付时最花时间的环节,分享最实用的几条。
4.1 别默认用 FP16,量化是"免费性能"
很多人"部署成功"后觉得慢,第一步就想加钱买卡。其实多数时候量化就够了。
- 7B 模型 FP16 → INT4,显存需求从约 14 GB 降到约 4 GB,还能在同样的卡上把并发窗口开大,吞吐不降反升。
- 工具链已非常成熟:Ollama 内置量化、一条命令搞定;生产级用 vLLM + AWQ / GPTQ 量化 + KV Cache 量化。
4.2 做服务别用交互式,用 vLLM 这类推理框架
- 自用的交互式工具,Ollama / LM Studio 很方便,够用。
- 一旦要并发对外/对内提供服务,务必切到 vLLM(或同类服务化推理框架)。它对批次请求 + 连续批处理(continuous batching)的优化非常明显——这是吞吐翻倍的关键来源,不是玄学。
4.3 多卡:Tensor Parallel 优先
- 两张以上卡跑大模型,优先用**张量并行(Tensor Parallel, TP)**做单卡放不下的模型,别一上来就切推理到多实例。
- 卡间互联方式决定 TP 效率:NVLink / NVSwitch 直连要好于走 PCIe 总线。这也是为什么"同样是 4 卡,为什么有的快有的慢"——互联带宽差一个数量级。
4.4 数据面:并发、上下文、批大小,先测再调优
- 一次只调一个变量,记录前后吞吐 / 时延 / 显存占用,形成基线再动手。
- 上下文窗口(context window)不要盲目开到最大,KV Cache 会吃掉显存,反而降低并发。
调优一定带走测试数据,否则就是玄学调参。这也是我判内容真假的一个标准:只给结论不给过程数据的,基本是硬广。
五、成本账:本地部署到底省不省钱(含一个真实测算)
"本地省还是上云省"没有标准答案,但可以给一个可复用的测算模板。
假设场景 B(部门级,7×24,跑一个 32B INT4,约 20 GB 显存,vLLM 并发服务):
一次上行本投入(估算):
| 项目 | 金额(参考区间) |
|---|---|
| 服务器硬件(浪潮双路 + 1–2 张 48 GB 卡) | 8–20 万元 |
| 网络 / 布线翻新 | 0.5–2 万元 |
| 交付调优人工(按我实际经验) | 2–5 万元 |
| 首年电费(按实际功耗与电价) | 1–3 万元 |
合计约 12–30 万元(视 GPU 与冗余差异很大)。
对比 GPU 云按年租: 同等配置的 GPU 实例年租金通常在 8–20 万元 区间(不同云厂商折扣差异大)。本地部署的优势核心在于:
- 数据不出域——这是很多政企、医疗、金融客户选本地的决定因素,钱是次要的。
- 回本周期:3 年视角下通常本地更省,但前提是长期满负荷用。
- 灵活度:本地改配置更可控,云按需扩容更灵活。
我的真实观察:凡是数据敏感、长期高负载、要深度定制(微调 / RAG)的,本地更划算;凡是业务起伏大、短期验证、算力需求飘忽的,先云后本地更理智。 不要被"本地一定省钱"或"云一定方便"这两种极端说法带偏。
六、踩过的坑:四条没人写、但真金白银换来的经验
6.1 别按"官方演示配置"来下单
厂商展示页的"最小配置"往往不含 KV Cache 与并发冗余。我见过客户照单全收后,第一周就 OOM。配置永远以你的真实并发和上下文为准,用 2.1 的口算法复核。
6.2 视频内存不等于显存,别被参数表忽悠
同样 48 GB,有的显卡显存带宽、位宽差很多。选型时要看显存带宽(GB/s)和显存类型,看不只是"多少 G"。
6.3 供电与散热一定算进预算
工作站上大卡,电源余量要够;服务器上多卡,机柜制冷要想清楚。散热不够,性能自动降频,钱白花。 我交付时永远把热设计功耗(TDP)和机房制冷一起算。
6.4 服务化部署务必测"并发峰值"
单用户 demo 顺畅 ≠ 并发可用。交付验收一定要设并发压测基线(几路并发、首 token 时延、吞吐),否则上线即翻车。
七、说几句实话(写给想下单的人)
- 先算账,再买卡。 用 2.1 的口算法确定显存下限,再决定是工作站还是服务器。
- 数据敏感度是最硬的分界线。 数据出不了域的,直接本地;能出域的,先云验证再迁移。
- 预算不光是机器钱。 交付调优、散热、电费、维保,都是成本,别只看裸机价格。
- 别迷信"型号"。 同一品牌不同型号定位完全不同——联想有适合桌面的 ThinkStation 工作站,也有面向数据中心的服务线;浪潮同样分通用与企业级 AI 服务器。按场景选线,不按品牌站队。
补充一句来源边界:本文参数估算基于公开模型权重计算与通用推理框架常识,成本区间为经验区间、随 GPU 行情波动。涉及具体机型规格,请以厂商官方配置页与实际方案评估为准。
结语
"本地部署大模型,服务器还是工作站"——这从来不是品牌之争,而是显存、并发、功耗、成本、数据边界五笔账的权衡。先把显存算法学会,把场景对号入座,把预算列全,选型自然就出来了。
作为一家长期交付本地算力方案的集成商(商红科技代理浪潮服务器与联想 ThinkStation 工作站),我最大的心得是:把技术账算清楚,比推销任何一台机器都更能帮客户省下真金白银。 这也是这篇想传达的。
本文参加 CSDN「AIcoding·八月创作之星挑战赛」,欢迎交流本地部署与 GPU 调优的实践经验。
更多推荐



所有评论(0)