炸裂!仅需6万块硬件成本,实现 DeepSeek-V4 级大模型 Token 自由!
**摘要:**一台由 8 张二手 RTX 3090 组成的本地推理服务器,能不能跑起 DeepSeek-V4-Flash-0731?这次我们把模型做成 GGUF/MXFP4,通过 llama.cpp 提供 OpenAI 兼容接口。截图环境中,8 张卡合计 192GB 显存,模型文件约 155GB;一次复杂网页游戏生成任务测得首字时延 680ms、生成速度约 39 tokens/s。本文不只展示结果,也把 6.5–6.9 万元预算、供电散热、上下文限制和适用边界算清楚。

8×RTX 3090、192GB 总显存、本地 OpenAI 兼容 API。封面性能数据来自本文截图环境的单次实测。
如果只看发布会和云厂商报价,很容易形成一种印象:284B 参数的 MoE 大模型,似乎只能部署在 H100、H200 甚至更新一代的数据中心 GPU 上。
但当模型进入 GGUF/MXFP4 量化路线,并且不追求大规模在线并发时,8 张 24GB 的 RTX 3090 会给出一个非常有意思的答案:
6 万级硬件,确实可以把 DeepSeek-V4-Flash-0731 搬进自己的机房或办公室。
这不是“3090 性能等于 H100”,也不是“买完机器就能免费无限用”。它真正提供的是另一种选择:数据不出内网、容量由自己掌控、API 可以持续调用、硬件还是一项可复用资产。
先看结果:680ms 首字,39 tokens/s
本次测试让模型生成一个完整的 Canvas 贪吃蛇网页游戏,要求包含渐变鳞片、虚拟摇杆、触屏操作与完整 UI。页面记录显示:
- 首字时延(TTFT):680ms;
- 生成速度:约 39 tokens/s;
- 深度思考用时:270.3 秒;
- 页面 Token 统计:输入约 186、输出约 18,596。

复杂代码生成任务实测:页面左下角显示首字时延 680ms、39 tokens/s;上方显示深度思考 270.3 秒。
39 tokens/s 对单人交互已经相当流畅,通常快于人类逐字阅读代码的速度。更重要的是,这不是“能加载但慢到不能用”,而是已经具备内部代码助手、RAG 问答、Agent 后端和批处理生成的实用价值。
但这里必须把测试口径说在前面:
| 指标 | 本次截图能证明什么 | 不能直接推出什么 |
|---|---|---|
| 680ms TTFT | 当前请求开始流式返回很快 | 所有上下文长度、并发数下都能保持 680ms |
| 39 tokens/s | 当前单次生成达到约 39 tok/s | 8 路、32 路并发仍各自保持 39 tok/s |
| 270.3 秒思考 | 复杂任务使用了较长推理过程 | 模型在 270 秒内完成了标准化基准测试 |
| 18,596 输出 Token | 页面记录了长代码输出 | 可与其他平台的 Token 统计直接横向比较 |
**因此,本文把这组数字定义为“本次环境、当前请求的实测结果”,而不是硬件通用跑分。**如果要做采购决策,还需要补测固定提示词、固定输出长度、不同并发和不同上下文长度下的 P50/P95。
这到底是什么模型?“0731”从哪里来?
DeepSeek 官方公开资料显示,DeepSeek-V4-Flash 是一个 MoE 模型:
- 总参数量 284B;
- 单 Token 激活参数约 13B;
- 官方模型支持最长 1M Token 上下文;
- 官方发布权重采用 FP4 + FP8 Mixed:MoE 专家参数使用 FP4,其余大部分参数使用 FP8。
DeepSeek API 文档还明确说明,deepseek-v4-flash 已更新到 DeepSeek-V4-Flash-0731,API 调用名保持不变。
本地接口截图返回的则是另一层信息:这套部署把模型转换成了 GGUF/MXFP4 MoE,由 llama.cpp 提供服务。接口元数据显示:
model: DeepSeek-V4-Flash-0731
format: gguf
ftype: MXFP4 MoE
n_params: 284334567511
size: 155089895772
n_ctx: 8192
n_ctx_train: 1048576
这里最容易误读的是上下文:n_ctx_train=1048576 表示模型训练/官方能力对应约 1M 上下文;本次服务返回的 n_ctx=8192 表示当前实例配置为 8K 上下文。**模型支持 1M,不代表这台 8 卡 3090 已经在 1M 上下文下保持同样速度。**上下文越长,KV Cache、首字时延和吞吐压力都会明显上升。
硬件实锤:8 张 3090,合计 192GB 显存
RTX 3090 单卡配备 24GB GDDR6X,8 张卡理论总显存为 192GB。截图中的 nvidia-smi 可以看到 GPU 0–7 均为 GeForce RTX 3090。

上方接口返回 GGUF/MXFP4 MoE、约 155GB 模型文件和 8K 服务上下文;下方显示 8 张 RTX 3090 均已加载模型。
按截图逐卡显存占用相加,大约使用 151,034MiB(约 147.5GiB)。各卡占用并不完全一致,约在 14.7–20.9GiB 之间,说明模型权重和运行缓冲区已经在多卡之间切分。
这套方案能跑起来,关键不是“3090 有什么隐藏魔法”,而是三个条件同时成立:
- **MoE 每个 Token 只激活部分参数。**DeepSeek-V4-Flash 总参数 284B,但单 Token 激活约 13B;计算量与把全部 284B 都激活不是一回事。
- **本地权重经过 MXFP4 量化。**截图中的约 155GB 文件明显小于 BF16 全量权重所需空间,从而能够装入 192GB 总显存。
- **llama.cpp 支持 CUDA、多 GPU 切分与 OpenAI 兼容服务。**应用不需要理解底层 8 卡拓扑,只需要通过 API 调用。

完整链路:业务应用 → OpenAI 兼容 API → llama.cpp → GGUF/MXFP4 → 8×RTX 3090。
预算怎么算:不是 6 万整,而是 6.5–6.9 万
原始配置逐项加总后,更准确的说法是“6 万级”,而不是严格的 6 万元整。
| 部件 | 建议配置 | 预算区间 |
|---|---|---|
| GPU | 二手/拆机 RTX 3090 24GB × 8 | ¥40,000–44,000 |
| CPU / 双路平台 | Xeon 双路平台,重点保证 PCIe 通道 | 约 ¥8,000 |
| 机箱 / 主板 / 风道 | 8 卡位机箱、大板、强力风机 | 约 ¥5,000 |
| 内存 | 大容量 ECC/服务器内存 | 约 ¥8,000 |
| 电源 | 2000W+ 高功率电源 × 2 | 约 ¥3,000 |
| SSD | 2TB NVMe | 约 ¥1,000 |
| 合计 | 不含机柜、UPS、交换机和空调 | 约 ¥65,000–69,000 |

GPU 约占整机预算的 61%–64%;二手卡采购还应预留返修与备件预算。
价格最大的变量是二手 3090 的成色、显存稳定性、散热改造和售后。低价卡如果存在显存报错、风扇老化或长期高温历史,后续停机成本可能远高于省下的钱。
“Token 自由”到底自由在哪里?
把这台机器描述成 Token 自由没问题,但需要给“自由”一个准确含义。
1. 数据边界由自己控制
私有代码、合同、知识库和业务日志可以在局域网闭环处理。对于不能把数据发送到第三方 API 的团队,这通常比单纯比较每百万 Token 价格更重要。
2. 容量不再受外部并发和排队影响
机器归自己调度,可以为代码 Agent、离线数据清洗、合成数据、批量摘要等长任务保留固定算力窗口,也不需要临时申请云端并发额度。
3. API 接入成本低
llama.cpp 可以暴露 OpenAI 兼容接口。现有 RAG、Copilot 和 Agent 应用通常只需修改 Base URL 与模型名,不需要重写整套调用层。
curl http://127.0.0.1:8000/v1/models
一个典型的服务启动思路如下,具体参数要以你使用的 llama.cpp 版本和模型分片方式为准:
./llama-server \
--model /models/DeepSeek-V4-Flash-0731-MXFP4.gguf \
--host 0.0.0.0 \
--port 8000 \
--n-gpu-layers 999 \
--split-mode layer \
--tensor-split 1,1,1,1,1,1,1,1 \
--ctx-size 8192
不同构建版本的二进制名和参数可能变化。上线前应先通过
--help核对,并根据各卡实际可用显存调整tensor-split。
但它绝不是“买完以后零成本”
这是整篇文章最需要泼的一盆冷水。
电费不是每月几百块
RTX 3090 的参考功耗上限约为 350W,8 张卡仅 GPU 名义功耗就达到 2.8kW。再加上双路 CPU、风扇、主板和电源损耗,整机满载功率可能进入 3kW 甚至更高区间。
如果按 3kW、每天 24 小时、每月 30 天计算:
3kW × 24h × 30 = 2160kWh/月
即便不是持续满载,月度电费也很容易进入千元级;商业电价、峰谷电价和制冷成本还会继续改变结果。只有间歇使用或当地电价很低时,才可能接近“几百块”。
普通插座和办公室空调未必扛得住
3.5kW 在 220V 下已经接近 16A。实际部署应评估独立回路、线径、PDU、双电源分配、UPS 和接地,不能把两只高功率电源随意接到同一个普通插排。
整机消耗的电最终几乎都会变成热。开放式 8 卡机架还会带来持续高噪声,并不适合放在工位旁边。
二手 3090 没有数据中心级保障
消费卡缺少完整的数据中心级 ECC、带外管理和企业级服务体系。要用于生产,至少应准备:
- 长时间显存压力测试;
- 单卡故障后的替换流程;
- 备用 GPU、电源与风扇;
- 模型服务健康检查和自动拉起;
- 磁盘、温度、功耗与接口延迟监控;
- 业务侧超时、重试和降级模型。
和官方 API 比,什么时候才划算?
DeepSeek 官方 API 本身定价很低,因此低调用量团队不要只因为“省 Token 费”就买 8 卡服务器。硬件折旧、电费、制冷、场地和运维加起来,纯财务回本需要非常高且稳定的利用率。
更适合本地部署的理由通常是:
- 数据不能出域;
- 需要离线运行;
- 有长期、稳定的大批量生成任务;
- 需要自主修改模型、采样参数和服务层;
- 已经有机房、电力、运维和二手硬件采购能力;
- 云端 API 的限流、审计或网络链路不符合业务要求。
如果只是在白天偶尔问几十次问题,官方 API 往往更省钱、更省心。
哪些场景最值得上这套机器?
企业内部代码助手
源代码和报错日志不离开内网,适合接入 IDE、代码审查、单元测试生成和内部 API 文档问答。
私有知识库与 RAG
可与向量数据库、文档解析和权限系统组合,形成企业内部问答入口。模型服务层走 OpenAI 兼容 API,集成成本相对可控。
Agent 与自动化流水线
固定资产更适合高频工具调用、长时间批处理和夜间任务,不会因为调用量突然上升而收到一张不可预测的账单。
合成数据和离线生成
对于大量生成问答对、代码样本、分类标签和摘要的任务,可以把队列排满,让机器持续工作,提高硬件利用率。
哪些团队不建议冲动采购?
- 没有独立供电、散热和噪声条件;
- 团队没有 Linux、CUDA、驱动和多 GPU 运维能力;
- 调用量低,主要追求省钱;
- 需要严格 SLA,却没有双机、负载均衡和备用卡;
- 目标是 1M 超长上下文,并希望保持截图中的同等速度;
- 需要大规模在线并发,而不是单路或小并发交互。
最后的判断
这台 8×RTX 3090 服务器最有价值的地方,不是证明“消费卡吊打数据中心 GPU”,而是证明了一条现实的工程路径:
在接受量化精度、8K 服务上下文、小并发和较高运维成本的前提下,6 万级硬件已经能够把 284B MoE 模型变成可实际调用的本地服务。
本次截图给出的 680ms TTFT 和 39 tokens/s,说明它不只是“模型装进去了”,而是具备真实交互能力;但采购之前仍应补齐并发、长上下文、稳定性、功耗和持续压测数据。
所谓 Token 自由,并不是 Token 从此没有成本,而是成本结构、数据边界和调度权回到了自己手里。
如果你希望继续看完整实战,我可以再整理下一篇:
- 8 卡 3090 主板、PCIe 拓扑与供电布线;
- llama.cpp CUDA 编译与多 GPU 参数;
- GGUF/MXFP4 模型准备和分片;
- OpenAI 兼容 API、RAG 与 Agent 接入;
- TTFT、TPS、并发、显存和功耗的标准化压测脚本。
参考资料
- DeepSeek API:DeepSeek-V4-Flash-0731 调用说明
- DeepSeek-V4-Flash 官方模型卡
- llama.cpp 官方项目
- llama.cpp 中的 MXFP4 类型定义
- NVIDIA GeForce RTX 3090 官方规格
**测试与采购声明:**本文性能数字来自用户提供的单次实测截图,不是统一实验室基准。二手硬件价格、功耗、噪声、稳定性和售后差异很大,请在采购前进行独立验证。本文不构成采购或投资建议。
更多推荐



所有评论(0)