logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

32卡×4090 24GB,Qwen3.8-27B-FP8 集群部署报告

least_conn 负载均衡会把同一会话的多轮请求分散到不同实例,而 vLLM 的前缀缓存(Prefix Cache,即 KV cache 复用)是每个实例各自独立的——第二轮请求落到另一台机器时,前几轮已算好的 KV cache 完全用不上,长历史会话的 prefill 成本每轮都全价重算。同一会话的多轮请求始终落在同一实例,直接命中该实例的 KV cache。如业务几乎不使用超长上下文,可考

#服务器#经验分享#docker
Agent 后台 - Token工场-集群设备配置建议

64G 机型冷启动涨幅可控,热启动不受输出长度影响。5 台 4×RTX4090 + 1 台 8× 昇腾 910B4-32G + 4 台 8× 昇腾 910B4-64G。1 轮:tokens=2048, ttft=4161.12ms, tpot=87.10ms, tp=11.22。4 轮:tokens=2048, ttft=630.91ms, tpot=86.94ms, tp=11.46。5 轮:t

#服务器#经验分享
Qwen3.6-27B-AWQ 16 路统一 Docker vLLM 集群部署报告

curl -s http://XXX.XXX.XXX.XXX:0101/v1/chat/completions-H "Content-Type: application/json"-H "Authorization: Bearer sk-XXX-XXX-XXX-XXX"-d '{"model":"Qwen3.6-27B-AWQ","messages":[{"role":"user","conten

#docker#容器
(910B4-64G)32卡-GLM-5.2-W4A8 服务集群部署测试报告

本项目基于华为昇腾910B4 NPU服务器集群,部署GLM-5.2-W4A8语言大模型,构建具备256K超长上下文、工具调用、多模态理解能力的AI推理服务平台。集群采用"4台独立服务 + nginx负载均衡"的架构,每台机器独立运行vLLM推理服务,通过nginx实现请求分发。压力测试涵盖单机测试、集群并发测试、长上下文测试和混合负载测试,全面验证集群在高负载下的稳定性和性能表现。集群部署成功:4

#经验分享#服务器#docker
(910B4-64G)32卡-GLM-5.2-W4A8 服务集群部署测试报告

本项目基于华为昇腾910B4 NPU服务器集群,部署GLM-5.2-W4A8语言大模型,构建具备256K超长上下文、工具调用、多模态理解能力的AI推理服务平台。集群采用"4台独立服务 + nginx负载均衡"的架构,每台机器独立运行vLLM推理服务,通过nginx实现请求分发。压力测试涵盖单机测试、集群并发测试、长上下文测试和混合负载测试,全面验证集群在高负载下的稳定性和性能表现。集群部署成功:4

#经验分享#服务器#docker
(910B4-64G)32卡-GLM-5.2-W4A8 服务集群部署测试报告

本项目基于华为昇腾910B4 NPU服务器集群,部署GLM-5.2-W4A8语言大模型,构建具备256K超长上下文、工具调用、多模态理解能力的AI推理服务平台。集群采用"4台独立服务 + nginx负载均衡"的架构,每台机器独立运行vLLM推理服务,通过nginx实现请求分发。压力测试涵盖单机测试、集群并发测试、长上下文测试和混合负载测试,全面验证集群在高负载下的稳定性和性能表现。集群部署成功:4

#经验分享#服务器#docker
8卡服务器(4服务x 2卡)Nginx 负载均衡配置,与百分位延迟说明

- vLLM 请求处理时间长(10-30s),属于长连接场景 - 不同请求生成 token 数不同(200-300),处理时间异构 - least_conn 能动态将新请求发给当前最空闲的实例。排序后: [18s, 19s, 19s, 20s, 20s, 21s, 21s, 22s, 23s, 100s]10 个请求的延迟:[1s, 1s, 1s, 1s, 1s, 1s, 1s, 1s, 1s,

#服务器#nginx#负载均衡
Qwen3.6-27B-AWQ 16 路统一 Docker vLLM 集群部署报告

curl -s http://XXX.XXX.XXX.XXX:0101/v1/chat/completions-H "Content-Type: application/json"-H "Authorization: Bearer sk-XXX-XXX-XXX-XXX"-d '{"model":"Qwen3.6-27B-AWQ","messages":[{"role":"user","conten

#docker#容器
4090 8卡服务器 - Qwen3.6-27B-AWQ 完整压测报告 (V2.0)

基于峰值 1560 tok/s: - 每用户平均 512 tokens (输入+输出) - 理论并发用户 = 1560 / (512/21.5) ≈。测试时间: 2026-05-26 16:03 - 16:42 总请求数: 1050 (阶梯 400 + 补充 650)Qwen3.6-27B-AWQ (AWQ 4-bit 量化)2.1 阶梯测试 (固定 50 请求)并发 50→250, 请求 50。

#服务器#经验分享
鲲鹏CPU + 8卡910A NPU服务器大语言模型推理部署测试报告

解决方案:手动创建accelerate.py stub文件,注入is_accelerate_available=True和check_and_set_device_map函数。因此4卡每卡16层(约16GB)的配置会触发OOM,而8卡每卡8层(约8GB)则完全在安全范围内。结论:vLLM-Ascend 0.7.3官方要求CANN 8.1.RC1,与910A的CANN 9.1.0-beta.1不匹配

#服务器#语言模型#运维
    共 48 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择