作者​:昇腾实战派
知识地图​:https://blog.csdn.net/Lumos_Lovegood/article/details/161601003

背景概述

本文档将介绍基于vLLM-Ascend的Qwen3.5-397B模型在Atlas 800I A2上的单机混部部署实践,包括支持的特性、特性配置、环境信息以及性能测试典型case。

基本信息

软件版本设备信息组网形态总卡数数据格式
0.18.0NPU:Atlas 800I A2-280T, HBM 64G
CPU:Kunpeng 920(48核-2600MHz)
内存:24根32G3200MHZ
OS:Ubuntu 22.04 LTS
Atlas 800I A2单机8W4A8C16

服务化配置

低时延/高吞吐

export ASCEND_RT_VISIBLE_DEVICES=0,1,2,3,4,5,6,7 
export PYTORCH_NPU_ALLOC_CONF="expandable_segments:True"
export HCCL_IF_IP=xxx 
export HCCL_OP_EXPANSION_MODE="AIV"
export HCCL_BUFFSIZE=1024
export OMP_NUM_THREADS=1
export LD_PRELOAD=/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD
export TASK_QUEUE_ENABLE=1
export VLLM_ASCEND_ENABLE_FUSED_MC2=0
export VLLM_ASCEND_ENABLE_FLASHCOMM1=1

vllm serve /home/Qwen3.5-397B-A17B-w4a8-mtp \
    --served-model-name "qwen35-397b-zz" \
    --host xxx \
    --port 10888 \
    --data-parallel-size 1 \
    --tensor-parallel-size 8 \
    --max-model-len 133120 \
    --max-num-batched-tokens 16384 \
    --max-num-seqs 128 \
    --gpu-memory-utilization 0.9 \
    --enable-expert-parallel \
    --compilation-config '{"cudagraph_capture_sizes":[1,4,8,12,16,20,24,28,32,36,40,44,48,52,56,60,64,68,72,76,80,84,88,92,96,100,108,112,128,160,172,196,200,212,232,256,260,288,320,360,400], "cudagraph_mode":"FULL_DECODE_ONLY"}' \
    --speculative_config '{"method": "qwen3_5_mtp", "num_speculative_tokens": 3, "enforce_eager": true}' \
    --trust-remote-code \
    --no-enable-prefix-caching \
    --async-scheduling \
    --allowed-local-media-path / \
    --quantization ascend \
    --mm-processor-cache-gb 0 \
    --additional-config '{"enable_cpu_binding":true, "multistream_overlap_shared_expert": true}'

典型测试用例
平均输入平均输出并行策略上下文长度Prefix Cache命中率总请求数最大并发数请求频率(req/s)
20482048MLA:DP1+TP82621440288720
20482048MLA:DP1+TP8262144056140
35001500MLA:DP1+TP82621440256640
35001500MLA:DP1+TP8262144048120
163841024MLA:DP1+TP8262144080200
163841024MLA:DP1+TP826214402050
32768512MLA:DP1+TP826214403280
32768512MLA:DP1+TP826214401230
655361024MLA:DP1+TP826214402870
655361024MLA:DP1+TP82621440820
1310721024MLA:DP1+TP826214401640
1310721024MLA:DP1+TP82621440410

测试命令

参考aisbench官方测试指南。

aisbench测试命令

vllm-ascend社区官网

特别声明

  1. 以上配置均未开启Prefix Cache,若实际生产环境需要使用该特性,参考vLLM-Ascend社区参数指南开启–enable-prefix-caching

更多推荐