logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

32卡64G-910B4-16后端集群部署报告

报告时间:2026-08-29(2026-09-04 更新:新增第十六章;2026-09-09 更新:新增第十七章 TP4 架构改造、第十八章 性能实测)部署规模:4台 × 8卡 = 32卡昇腾910B4集群目录一、项目概述部署目标二、硬件环境三、软件环境四、集群部署架构五、服务详细配置5.1 vLLM 实例配置5.2 16后端实例分布六、OpenResty 反向代理配置6.1 核心功能6.2 亲

#java#运维#大数据
32卡64G-910B4-16后端集群部署报告

报告时间:2026-08-29(2026-09-04 更新:新增第十六章;2026-09-09 更新:新增第十七章 TP4 架构改造、第十八章 性能实测)部署规模:4台 × 8卡 = 32卡昇腾910B4集群目录一、项目概述部署目标二、硬件环境三、软件环境四、集群部署架构五、服务详细配置5.1 vLLM 实例配置5.2 16后端实例分布六、OpenResty 反向代理配置6.1 核心功能6.2 亲

#java#运维#大数据
32卡-64G-910B4-16后端-(Qwen3.8-27B-W8A8)集群部署报告

报告时间:2026-08-29部署规模:4台 × 8卡 = 32卡昇腾910B4集群目录一、项目概述部署目标二、硬件环境三、软件环境四、集群部署架构五、服务详细配置5.1 vLLM 实例配置5.2 16后端实例分布六、OpenResty 反向代理配置6.1 核心功能6.2 亲和力路由设计6.3 完整 nginx.conf(16后端)七、集群验证结果7.1 16后端健康检查7.2 负载分布验证7.3

#服务器#经验分享#运维 +1
32卡-64G-910B4-16后端-(Qwen3.8-27B-W8A8)集群部署报告

报告时间:2026-08-29部署规模:4台 × 8卡 = 32卡昇腾910B4集群目录一、项目概述部署目标二、硬件环境三、软件环境四、集群部署架构五、服务详细配置5.1 vLLM 实例配置5.2 16后端实例分布六、OpenResty 反向代理配置6.1 核心功能6.2 亲和力路由设计6.3 完整 nginx.conf(16后端)七、集群验证结果7.1 16后端健康检查7.2 负载分布验证7.3

#服务器#经验分享#运维 +1
容器内nvidia-smi OOM问题解决方案

针对在Kubernetes (K8s) + containerd环境下容器内执行nvidia-smi出现 OOM (Out-Of-Memory) 错误的问题,根源通常在于容器环境与宿主机GPU驱动运行状态之间的隔离与资源映射不一致。结合提供的【参考资料】和常见故障模式,解决方案需从容器运行时配置、驱动服务状态和K8s资源限制三个层面进行排查。

#经验分享
8×910B4-32G NPU服务器 vLLM-Ascend部署Docker安装报告

curl 返回 "content":"!├── quant_model_weights-00001-of-00009.safetensors# 权重分片1 (4.0GB)├── quant_model_weights-00002-of-00009.safetensors# 权重分片2 (4.0GB)├── quant_model_description.json# 量化描述 (124KB)# 输出

#服务器#docker
32卡×4090 24GB,Qwen3.8-27B-FP8 集群部署报告

least_conn 负载均衡会把同一会话的多轮请求分散到不同实例,而 vLLM 的前缀缓存(Prefix Cache,即 KV cache 复用)是每个实例各自独立的——第二轮请求落到另一台机器时,前几轮已算好的 KV cache 完全用不上,长历史会话的 prefill 成本每轮都全价重算。同一会话的多轮请求始终落在同一实例,直接命中该实例的 KV cache。如业务几乎不使用超长上下文,可考

#服务器#经验分享#docker
Agent 后台 - Token工场-集群设备配置建议

64G 机型冷启动涨幅可控,热启动不受输出长度影响。5 台 4×RTX4090 + 1 台 8× 昇腾 910B4-32G + 4 台 8× 昇腾 910B4-64G。1 轮:tokens=2048, ttft=4161.12ms, tpot=87.10ms, tp=11.22。4 轮:tokens=2048, ttft=630.91ms, tpot=86.94ms, tp=11.46。5 轮:t

#服务器#经验分享
Qwen3.6-27B-AWQ 16 路统一 Docker vLLM 集群部署报告

curl -s http://XXX.XXX.XXX.XXX:0101/v1/chat/completions-H "Content-Type: application/json"-H "Authorization: Bearer sk-XXX-XXX-XXX-XXX"-d '{"model":"Qwen3.6-27B-AWQ","messages":[{"role":"user","conten

#docker#容器
(910B4-64G)32卡-GLM-5.2-W4A8 服务集群部署测试报告

本项目基于华为昇腾910B4 NPU服务器集群,部署GLM-5.2-W4A8语言大模型,构建具备256K超长上下文、工具调用、多模态理解能力的AI推理服务平台。集群采用"4台独立服务 + nginx负载均衡"的架构,每台机器独立运行vLLM推理服务,通过nginx实现请求分发。压力测试涵盖单机测试、集群并发测试、长上下文测试和混合负载测试,全面验证集群在高负载下的稳定性和性能表现。集群部署成功:4

#经验分享#服务器#docker
    共 54 条
  • 1
  • 2
  • 3
  • 6
  • 请选择