284B总参数,13B激活参数。

这就是DeepSeek V4 Flash。

很多人一看"284B"就劝退了——这玩意怎么可能本地跑?

但这恰好是MoE架构最精妙的地方——总参数大不代表跑不动。

今天这篇,从硬件选型到部署实测,把你所有踩坑可能一次讲清楚。


先搞清楚一个关键问题:284B到底要多少显卡?

这是被误解最多的地方。

很多人以为"13B激活=只需要13B的显存"——大错特错。

指标

数值

说明

总参数

284B

必须全部加载进显存/内存

激活参数

~13B

每次推理实际参与计算的部分

架构

MoE

专家路由,按需激活

最大上下文

1M Token

原生支持超长上下文

权重文件

~160GB (FP8)

磁盘存储需求

记住:284B参数必须完整加载。激活参数小只影响推理速度,不影响显存占用。

好消息是:因为每次只激活13B,推理速度接近13B稠密模型——瓶颈在显存容量,不在算力。


五条硬件路线,从4万到企业级全都有

路线1:Mac Studio M4 Max 192GB(约4.3万)

最省心的方案。

  • 统一内存192GB,Q4量化权重158GB + 30GB余量给KV缓存
  • Apple MLX 0.24+已支持MoE专家路由
  • 实测推理速度:25-35 tokens/s
  • 功耗仅120W,静音运行
  • 一行命令搞定:brew install ollama

适合: 个人开发者,不想折腾多卡互联,对CUDA没强依赖。

局限: 无法微调V4-Flash,且只有192GB版本才够装Q4量化+可用上下文。

路线2:4张RTX 4090 24GB(约6.5万)

  • 总显存96GB,靠INT4/Q4量化跑
  • CPU建议AMD Threadripper或Intel Xeon W系列
  • 内存256GB DDR4

适合: 预算有限的小团队、技术尝鲜。

局限: Q4量化有可见质量损失,复杂推理精度打折,长文本能力受限。

路线3:1张H100 80GB(企业入门)

  • FP8精度运行,质量和显存的平衡点
  • 单卡80GB刚好够用

适合: 有企业预算的研发团队,需要稳定生产环境。

路线4:2张H200 141GB(官方推荐)

  • 总显存282GB,支持FP4+FP8
  • 1M上下文完整支持
  • NVLink互联,多卡通信效率极高

适合: 金融、医疗、律所等数据敏感行业,7×24生产环境。这是真正能跑满1M上下文的配置。

路线5:3张RTX PRO 5000 72GB(企业性价比王)

  • 总显存216GB,Blackwell架构
  • 原生支持NVFP4,无需反量化
  • 多并发推理+RAG知识库轻松搞定

适合: 中型企业研发团队。

一句话总结怎么选

方案

显存/内存

量化

速度

价格

适合谁

Mac Studio

192GB

Q4

25-35 t/s

~4.3万

个人

4×4090

96GB

INT4

受限

~6.5万

尝鲜

1×H100

80GB

FP8

稳定

企业

入门

2×H200

282GB

FP4+FP8

最佳

企业

满血

3×RTX PRO

216GB

FP4+FP8

高效

~45万

团队


上手指南:从零到跑起来

环境要求

  • 系统: Ubuntu 22.04或24.04 LTS
  • CUDA: ≥ 12.4(必须!)
  • NVIDIA驱动: ≥ 550.54.15
  • Python: 3.10 ~ 3.12

⚠️ 踩坑提醒: vLLM必须 ≥ 0.9.0,CUDA必须 ≥ 12.4。版本不匹配是第一大部署失败原因。

三步搭环境

Docker一键部署(双卡H200示例)

关键参数解释:

  • --max-model-len 128000:限制上下文防OOM
  • --enable-expert-parallel:多卡MoE必备
  • --kv-cache-dtype fp8:节省显存
  • --enable-auto-tool-choice:支持Agent模式

验证是否跑通

返回正常JSON就说明成功了。


量化怎么选?一张表说清楚

量化级别

磁盘

最小显存

质量

建议

FP16

~568GB

~600GB

满分

仅微调用

Q8_0

~301GB

~315GB

几乎无损

有4×A100可用

Q5_K_M

~200GB

~210GB

略优于Q4

2×H100

Q4_K_M

~158GB

~96GB

推荐

大多数人首选

Q3_K_M

~125GB

~80GB

有损失

双卡5090可试

IQ2_XS

~90GB

~96GB

开始幻觉

只限尝鲜

结论:Q4_K_M是甜点位——质量损失大多数场景可忽略,显存需求直接砍半。


本地部署 vs 云端API:到底怎么选?

维度

本地部署

云端API

单次成本

硬件一次性投入大

2元/百万Token,近乎免费

数据隐私

完全本地,不出域

需信任API方

维护

自己搞模型更新、驱动

零维护

长上下文

需大量显存

API原生1M支持

灵活性

可微调、可改架构

受限于API边界

我的建议:

  • 个人开发者/尝鲜: 先用API。成本极低,省下折腾硬件的时间做正事。
  • 有隐私要求的团队: 本地部署,数据安全是刚需。
  • 日均Token消耗上亿: 本地部署的固定成本会逐渐摊薄,值得投资。
  • 想深入学习大模型: 本地部署是最好的学习路径,踩过的坑都是经验。

Mac用户专项优化

用MLX而非vLLM:

开启8-bit KV缓存压缩,1M上下文的50GB开销直接降到25GB:


DeepSeek V4 Flash本地部署的门槛确实不低——284B参数不是一张游戏显卡能搞定的。

但MoE架构的精妙之处在于:一旦装进内存,跑起来就像一个13B模型一样快。

如果你只是想让DeepSeek干活,API就够了,2元/百万Token几乎没有门槛。

但如果你有数据安全需求、想跑超长上下文、或者单纯想搞懂大模型部署是怎么回事——

按上面的路线选一套硬件,跟着步骤走,一个下午就能在自己电脑上跑起来。


本文硬件数据综合自UltraLAB、Compute Market、HardwarePedia等2026年8月公开资料,实际部署请以官方文档为准。


💡 收藏这篇,以后部署时翻出来照着做!你用的是什么配置跑的?评论区晒出来,一起交流! 🔥

更多推荐