
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
报告时间:2026-08-29(2026-09-04 更新:新增第十六章;2026-09-09 更新:新增第十七章 TP4 架构改造、第十八章 性能实测)部署规模:4台 × 8卡 = 32卡昇腾910B4集群目录一、项目概述部署目标二、硬件环境三、软件环境四、集群部署架构五、服务详细配置5.1 vLLM 实例配置5.2 16后端实例分布六、OpenResty 反向代理配置6.1 核心功能6.2 亲
报告时间:2026-08-29(2026-09-04 更新:新增第十六章;2026-09-09 更新:新增第十七章 TP4 架构改造、第十八章 性能实测)部署规模:4台 × 8卡 = 32卡昇腾910B4集群目录一、项目概述部署目标二、硬件环境三、软件环境四、集群部署架构五、服务详细配置5.1 vLLM 实例配置5.2 16后端实例分布六、OpenResty 反向代理配置6.1 核心功能6.2 亲
报告时间:2026-08-29部署规模:4台 × 8卡 = 32卡昇腾910B4集群目录一、项目概述部署目标二、硬件环境三、软件环境四、集群部署架构五、服务详细配置5.1 vLLM 实例配置5.2 16后端实例分布六、OpenResty 反向代理配置6.1 核心功能6.2 亲和力路由设计6.3 完整 nginx.conf(16后端)七、集群验证结果7.1 16后端健康检查7.2 负载分布验证7.3
报告时间:2026-08-29部署规模:4台 × 8卡 = 32卡昇腾910B4集群目录一、项目概述部署目标二、硬件环境三、软件环境四、集群部署架构五、服务详细配置5.1 vLLM 实例配置5.2 16后端实例分布六、OpenResty 反向代理配置6.1 核心功能6.2 亲和力路由设计6.3 完整 nginx.conf(16后端)七、集群验证结果7.1 16后端健康检查7.2 负载分布验证7.3
针对在Kubernetes (K8s) + containerd环境下容器内执行nvidia-smi出现 OOM (Out-Of-Memory) 错误的问题,根源通常在于容器环境与宿主机GPU驱动运行状态之间的隔离与资源映射不一致。结合提供的【参考资料】和常见故障模式,解决方案需从容器运行时配置、驱动服务状态和K8s资源限制三个层面进行排查。
curl 返回 "content":"!├── quant_model_weights-00001-of-00009.safetensors# 权重分片1 (4.0GB)├── quant_model_weights-00002-of-00009.safetensors# 权重分片2 (4.0GB)├── quant_model_description.json# 量化描述 (124KB)# 输出
least_conn 负载均衡会把同一会话的多轮请求分散到不同实例,而 vLLM 的前缀缓存(Prefix Cache,即 KV cache 复用)是每个实例各自独立的——第二轮请求落到另一台机器时,前几轮已算好的 KV cache 完全用不上,长历史会话的 prefill 成本每轮都全价重算。同一会话的多轮请求始终落在同一实例,直接命中该实例的 KV cache。如业务几乎不使用超长上下文,可考
64G 机型冷启动涨幅可控,热启动不受输出长度影响。5 台 4×RTX4090 + 1 台 8× 昇腾 910B4-32G + 4 台 8× 昇腾 910B4-64G。1 轮:tokens=2048, ttft=4161.12ms, tpot=87.10ms, tp=11.22。4 轮:tokens=2048, ttft=630.91ms, tpot=86.94ms, tp=11.46。5 轮:t
curl -s http://XXX.XXX.XXX.XXX:0101/v1/chat/completions-H "Content-Type: application/json"-H "Authorization: Bearer sk-XXX-XXX-XXX-XXX"-d '{"model":"Qwen3.6-27B-AWQ","messages":[{"role":"user","conten
本项目基于华为昇腾910B4 NPU服务器集群,部署GLM-5.2-W4A8语言大模型,构建具备256K超长上下文、工具调用、多模态理解能力的AI推理服务平台。集群采用"4台独立服务 + nginx负载均衡"的架构,每台机器独立运行vLLM推理服务,通过nginx实现请求分发。压力测试涵盖单机测试、集群并发测试、长上下文测试和混合负载测试,全面验证集群在高负载下的稳定性和性能表现。集群部署成功:4







