
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
least_conn 负载均衡会把同一会话的多轮请求分散到不同实例,而 vLLM 的前缀缓存(Prefix Cache,即 KV cache 复用)是每个实例各自独立的——第二轮请求落到另一台机器时,前几轮已算好的 KV cache 完全用不上,长历史会话的 prefill 成本每轮都全价重算。同一会话的多轮请求始终落在同一实例,直接命中该实例的 KV cache。如业务几乎不使用超长上下文,可考
64G 机型冷启动涨幅可控,热启动不受输出长度影响。5 台 4×RTX4090 + 1 台 8× 昇腾 910B4-32G + 4 台 8× 昇腾 910B4-64G。1 轮:tokens=2048, ttft=4161.12ms, tpot=87.10ms, tp=11.22。4 轮:tokens=2048, ttft=630.91ms, tpot=86.94ms, tp=11.46。5 轮:t
curl -s http://XXX.XXX.XXX.XXX:0101/v1/chat/completions-H "Content-Type: application/json"-H "Authorization: Bearer sk-XXX-XXX-XXX-XXX"-d '{"model":"Qwen3.6-27B-AWQ","messages":[{"role":"user","conten
本项目基于华为昇腾910B4 NPU服务器集群,部署GLM-5.2-W4A8语言大模型,构建具备256K超长上下文、工具调用、多模态理解能力的AI推理服务平台。集群采用"4台独立服务 + nginx负载均衡"的架构,每台机器独立运行vLLM推理服务,通过nginx实现请求分发。压力测试涵盖单机测试、集群并发测试、长上下文测试和混合负载测试,全面验证集群在高负载下的稳定性和性能表现。集群部署成功:4
本项目基于华为昇腾910B4 NPU服务器集群,部署GLM-5.2-W4A8语言大模型,构建具备256K超长上下文、工具调用、多模态理解能力的AI推理服务平台。集群采用"4台独立服务 + nginx负载均衡"的架构,每台机器独立运行vLLM推理服务,通过nginx实现请求分发。压力测试涵盖单机测试、集群并发测试、长上下文测试和混合负载测试,全面验证集群在高负载下的稳定性和性能表现。集群部署成功:4
本项目基于华为昇腾910B4 NPU服务器集群,部署GLM-5.2-W4A8语言大模型,构建具备256K超长上下文、工具调用、多模态理解能力的AI推理服务平台。集群采用"4台独立服务 + nginx负载均衡"的架构,每台机器独立运行vLLM推理服务,通过nginx实现请求分发。压力测试涵盖单机测试、集群并发测试、长上下文测试和混合负载测试,全面验证集群在高负载下的稳定性和性能表现。集群部署成功:4
- vLLM 请求处理时间长(10-30s),属于长连接场景 - 不同请求生成 token 数不同(200-300),处理时间异构 - least_conn 能动态将新请求发给当前最空闲的实例。排序后: [18s, 19s, 19s, 20s, 20s, 21s, 21s, 22s, 23s, 100s]10 个请求的延迟:[1s, 1s, 1s, 1s, 1s, 1s, 1s, 1s, 1s,
curl -s http://XXX.XXX.XXX.XXX:0101/v1/chat/completions-H "Content-Type: application/json"-H "Authorization: Bearer sk-XXX-XXX-XXX-XXX"-d '{"model":"Qwen3.6-27B-AWQ","messages":[{"role":"user","conten
基于峰值 1560 tok/s: - 每用户平均 512 tokens (输入+输出) - 理论并发用户 = 1560 / (512/21.5) ≈。测试时间: 2026-05-26 16:03 - 16:42 总请求数: 1050 (阶梯 400 + 补充 650)Qwen3.6-27B-AWQ (AWQ 4-bit 量化)2.1 阶梯测试 (固定 50 请求)并发 50→250, 请求 50。
解决方案:手动创建accelerate.py stub文件,注入is_accelerate_available=True和check_and_set_device_map函数。因此4卡每卡16层(约16GB)的配置会触发OOM,而8卡每卡8层(约8GB)则完全在安全范围内。结论:vLLM-Ascend 0.7.3官方要求CANN 8.1.RC1,与910A的CANN 9.1.0-beta.1不匹配







