DGX Spark / GB10 部署 Qwen3.6-27B

部署方案基于spark-vllm-docker库进行,通过特定的启动脚本与参数配置实现模型服务化。

vllm serve --served-model-name "Qwen3.6-27B" \
    --max-model-len 32000 \  
    --max-num-seqs 4 \
    --enable-prefix-caching \
    --gpu-memory-utilization 0.8 \ 
    --port 8000 \
    --host 0.0.0.0 \
    --load-format fastsafetensors \
    --enable-chunked-prefill \
    --enable-auto-tool-choice \
    --tool-call-parser qwen3_coder \
    --reasoning-parser qwen3 \
    --max-num-batched-tokens 8192 \
    --trust-remote-code 

在 FP8 模式下,Qwen3.6-27B需要传输 27 亿个参数,每次传输 1 字节,即 27GB。最大带宽为 270GB/s,270GB 除以 27GB,即可得到大约每秒 10 个令牌的最大吞吐量,

在相同(或相近)的总内存下,采用 4xRTX3090(约 96GB 显存)的方案,在 Qwen3.6-27B 这类模型的推理速度上,会显著优于基于 GB10 的 DGXSpark 设备。

参考链接:

https://forums.developer.nvidia.com/t/whats-the-best-speed-we-can-get-with-qwen-3-6-27b-without-quantizing/367561

https://post.smzdm.com/p/a5rm9gn8/

更多推荐