logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Minimax M3 在 Atlas 800I A2 上入图后精度问题分析与修复

在基于 vLLM 0.19.0 版本部署 Minimax M3 模型时,我们发现 Atlas 800I A2 机器在启用图模式后出现精度异常,而单算子模式及 Atlas 800I A3 机器均表现正常。经排查,该问题与 MoE 通信路径选择、TP/EP 多卡部署及 torch compile 图模式相关,最终定位为 ALLGATHER 通信方式下缺少 TP all-reduce 导致聚合结果不完整

#人工智能
vLLM-Ascend 异步调度下 Repetition Penalty 失效问题排查与修复

在将 MuSe-0.6B 模型从 GPU 迁移至 Atlas 800I A2 平台时,发现模型在推理过程中出现重复输出问题。该模型基于 Qwen3-0.6B 微调,采用 decoder-only causal LM 架构,自回归生成离散音频 token。经过逐层排查,最终定位问题根因在于在异步调度场景下未能作用于已生成 token。

vLLM-Ascend框架MTP投机推理在Full Graph模式下的精度问题分析与修复

在多Token预测(MTP)投机推理场景中,模型通过同时预测多个后续token来加速推理过程。然而,部分场景下在vLLM-Ascend框架中接入MTP后,Full Graph图模式下可能会出现精度异常问题,表现为draft token接受率低于Piecewise图模式。本文详细记录了该问题的定位过程、根因分析及修复方案,为类似场景下的精度问题排查提供参考。

#人工智能
PaddleOCR模型之昇腾部署

在使用飞桨OCR模型推理功能时候,主要涉及PaddlePaddle,PaddleCustomDevice,PaddleOCR,PaddleX,Paddle Inference组件。当然并不是所有的组件需要同时部署同时使用,因为飞桨提供了多套部署方案。接下来我们就这些组件进行描述和功能分类。飞桨主框架,将框架的基础接口和基础功能定义清楚,提供训练和推理的基础能力,以及业务中的动态和静态图的模式,参考

PaddleOCR模型之昇腾部署

在使用飞桨OCR模型推理功能时候,主要涉及PaddlePaddle,PaddleCustomDevice,PaddleOCR,PaddleX,Paddle Inference组件。当然并不是所有的组件需要同时部署同时使用,因为飞桨提供了多套部署方案。接下来我们就这些组件进行描述和功能分类。飞桨主框架,将框架的基础接口和基础功能定义清楚,提供训练和推理的基础能力,以及业务中的动态和静态图的模式,参考

PaddleOCR模型之昇腾部署

作者:昇腾实战派 一、PaddlePaddle(飞桨)技术入门 参考开源文档 部署&&快速开始: https://www.paddleocr.ai/latest/quick_start.html 飞桨官方昇腾推理参考链接: https://github.com/PaddlePaddle/PaddleX/blob/release/3.2/docs/practical_tutorial

#中文OCR体验#paddlepaddle#昇腾AI解决方案 +1
到底了