logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

SGLang部署DeepSeek V3.2模型在Atlas 800I A2双机环境下图捕获卡死问题排查

本文针对使用SGLang框架在Atlas 800I A2双机环境下部署DeepSeek-V3.2-W8A8(W8A8量化)模型时,出现服务拉起过程中“Capturing batches”阶段卡死的问题,结合实际排查过程,系统性地梳理了问题根因与解决方案,为类似场景提供可复用的优化路径。模型权重未启用MTP量化,但启动命令中启用了MTP相关参数,导致运行时异常。​设置过小,无法满足长序列场景下的集体

#sglang#人工智能
Atlas 800I A2平台GLM5服务拉起失败问题排查与解决方案

本文聚焦于在Atlas 800I A2、HDK 25.5.0版本环境下,使用vLLM Ascend拉起GLM5模型时,主节点报错的典型问题,结合实际排查过程,提供清晰的根因分析与修复方案。在分布式推理服务部署中,合理配置参数是保障服务稳定拉起的关键。本案例表明,即使仅缺失一个参数,也可能导致整个服务链路中断。建议在部署脚本中统一规范参数使用,避免因配置遗漏引发线上故障。

Atlas 300I Duo部署 Qwen3-30B 模型 OOM 问题排查与优化实践

随着大语言模型在各类业务场景中的广泛应用,高效、稳定地完成模型推理成为关键挑战。在模型部署过程中,配置参数对资源消耗的影响尤为显著,尤其是在资源受限的边缘设备上。本文记录了在 Atlas 300I Duo 设备上部署 Qwen3-30B-A3B-Instruct-2507 模型时遇到的进程被系统终止问题,结合实际调试过程,深入分析根因并提出可复用的优化方案,为后续类似场景提供参考。

#人工智能
基于 vLLM-Ascend 的Qwen3.5-27B 推理服务异常崩溃问题分析与解决方案

在基于 vLLM-Ascend 框架部署 Qwen3.5-27B 进行推理服务的过程中,部分场景下服务在启动后出现异常崩溃,表现为错误。本文基于实际排查过程,系统分析问题根因,并提出可复用的优化方案。本问题通过配置合理推理参数、严格校验输入数据,可有效避免因资源超限或数据异常导致的服务崩溃。始终以实际硬件资源为基准,避免盲目追求高并发与长序列;在服务入口增加数据校验,拦截非法请求;关注plog日志

#人工智能
Atlas 800I A2双机部署DeepSeek-V3.1时HCCL通信异常问题排查与解决

采用Atlas 800I A2(8*64G)服务器进行双机部署时,若ranktable配置不当,可能导致通信组创建失败,进而引发推理服务无法启动的问题。本文结合一次典型故障案例,系统梳理问题现象、根因分析及解决方案,为开发者提供可复用的部署实践参考。配置规范:在多机部署中,ranktable文件的device\_ip必须为NPU网卡的物理IP地址,严禁使用网关或管理IP。部署前检查:建议在部署前执

#人工智能
昇腾平台vLLM-Omni 服务中 Pydantic 校验异常问题的定位与解决

在基于 vLLM-Omni 框架部署模型(如 Qwen-Image、Qwen-Image-Edit)的推理服务过程中,服务虽能正常启动并完成推理流程,但在返回结果阶段频繁抛出错误,导致客户端收到 500 Bad Request 响应,且图像等多模态输出无法正常返回。本文将从问题现象出发,深入分析根因,并提供多种可选的解决方案,帮助开发者快速定位并修复该类兼容性问题。本问题源于平台补丁对 vLLM

#人工智能
昇腾平台vLLM-Omni 服务中 Pydantic 校验异常问题的定位与解决

在基于 vLLM-Omni 框架部署模型(如 Qwen-Image、Qwen-Image-Edit)的推理服务过程中,服务虽能正常启动并完成推理流程,但在返回结果阶段频繁抛出错误,导致客户端收到 500 Bad Request 响应,且图像等多模态输出无法正常返回。本文将从问题现象出发,深入分析根因,并提供多种可选的解决方案,帮助开发者快速定位并修复该类兼容性问题。本问题源于平台补丁对 vLLM

#人工智能
昇腾设备PD分离部署中因TLS配置不一致导致推理答非所问的定位与修复

在Atlas 800I A3设备上部署DeepSeek-V3.1模型时,发现模型推理生成内容语义连贯但与用户请求完全无关,即出现“答非所问”现象。本文基于实际排查过程,系统分析问题根因,并提出可用的优化方案。在 vLLM PD 分离部署场景下,若出现回答内容与请求无关或精度异常问题,需检查日志中是否存在 mooncake transfer failed 报错。若存在上述报错,通常对应 HCCL 建

#人工智能#深度学习
昇腾设备PD分离部署中因TLS配置不一致导致推理答非所问的定位与修复

在Atlas 800I A3设备上部署DeepSeek-V3.1模型时,发现模型推理生成内容语义连贯但与用户请求完全无关,即出现“答非所问”现象。本文基于实际排查过程,系统分析问题根因,并提出可用的优化方案。在 vLLM PD 分离部署场景下,若出现回答内容与请求无关或精度异常问题,需检查日志中是否存在 mooncake transfer failed 报错。若存在上述报错,通常对应 HCCL 建

#人工智能#深度学习
基于 vLLM-Ascend 的Qwen3.5-27B 推理服务异常崩溃问题分析与解决方案

在基于 vLLM-Ascend 框架部署 Qwen3.5-27B 进行推理服务的过程中,部分场景下服务在启动后出现异常崩溃,表现为错误。本文基于实际排查过程,系统分析问题根因,并提出可复用的优化方案。本问题通过配置合理推理参数、严格校验输入数据,可有效避免因资源超限或数据异常导致的服务崩溃。始终以实际硬件资源为基准,避免盲目追求高并发与长序列;在服务入口增加数据校验,拦截非法请求;关注plog日志

#人工智能
    共 15 条
  • 1
  • 2
  • 请选择