DGX Spark / GB10 部署 Qwen3.6-27B
·
DGX Spark / GB10 部署 Qwen3.6-27B
部署方案基于spark-vllm-docker库进行,通过特定的启动脚本与参数配置实现模型服务化。
vllm serve --served-model-name "Qwen3.6-27B" \
--max-model-len 32000 \
--max-num-seqs 4 \
--enable-prefix-caching \
--gpu-memory-utilization 0.8 \
--port 8000 \
--host 0.0.0.0 \
--load-format fastsafetensors \
--enable-chunked-prefill \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--max-num-batched-tokens 8192 \
--trust-remote-code
在 FP8 模式下,Qwen3.6-27B需要传输 27 亿个参数,每次传输 1 字节,即 27GB。最大带宽为 270GB/s,270GB 除以 27GB,即可得到大约每秒 10 个令牌的最大吞吐量,
在相同(或相近)的总内存下,采用 4xRTX3090(约 96GB 显存)的方案,在 Qwen3.6-27B 这类模型的推理速度上,会显著优于基于 GB10 的 DGXSpark 设备。
参考链接:
https://forums.developer.nvidia.com/t/whats-the-best-speed-we-can-get-with-qwen-3-6-27b-without-quantizing/367561
https://post.smzdm.com/p/a5rm9gn8/
更多推荐


所有评论(0)