
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
一句话让Agent成为昇腾专家:通过接入昇腾知识图谱(gitcode.com/agent0/kg-tools),一键获取GPU训练库(如apex、TransformerEngine、ColossalAI)在NPU上的等价替代方案与版本适配关系,支持自动混合精度、融合优化器、设备初始化等关键配置,实现高效迁移。
一句话让Agent成为昇腾专家:通过接入昇腾知识图谱(gitcode.com/agent0/kg-tools),一键获取GPU训练库(如apex、TransformerEngine、ColossalAI)在NPU上的等价替代方案与版本适配关系,支持自动混合精度、融合优化器、设备初始化等关键配置,实现高效迁移。
当昇腾模型推理慢于GPU,常因算子静默回退至CPU。通过开启ASCEND_GLOBAL_LOG_LEVEL=1日志可定位ConvTranspose2d、isin等高发fallback算子,结合msprof分析AI Core利用率与kernel调用。修复方案包括:替换为NPU等价实现(如npu_fusion_attention)、升级torch_npu、卸载CUDA-only依赖(如xformers
当昇腾模型推理慢于GPU,常因算子静默回退至CPU。通过开启ASCEND_GLOBAL_LOG_LEVEL=1日志可定位ConvTranspose2d、isin等高发fallback算子,结合msprof分析AI Core利用率与kernel调用。修复方案包括:替换为NPU等价实现(如npu_fusion_attention)、升级torch_npu、卸载CUDA-only依赖(如xformers
接入昇腾知识图谱,一键获取torch.npu.current_stream用法、多流改造四原则及synchronize失败排查全链路答案,精准召回官方文档与实战技能,告别反复查证。
接入昇腾知识图谱,一键获取torch.npu.current_stream用法、多流改造四原则及synchronize失败排查全链路答案,精准召回官方文档与实战技能,告别反复查证。
昇腾训练平台通过启用动态形状或采用多样本Pack技术,有效缓解微调中序列长度不一导致的算力浪费。前者适用于流水线并行且序列波动场景,后者在批内长度差异大时收益显著,结合ATC分档机制可优化推理性能。推荐训练选Pack,推理收窄档位,避免全-1泛化。详询昇腾知识图谱。
昇腾训练平台通过启用动态形状或采用多样本Pack技术,有效缓解微调中序列长度不一导致的算力浪费。前者适用于流水线并行且序列波动场景,后者在批内长度差异大时收益显著,结合ATC分档机制可优化推理性能。推荐训练选Pack,推理收窄档位,避免全-1泛化。详询昇腾知识图谱。
通过torch_npu.profiler采集性能数据,结合AiCMetrics精准定位计算/访存瓶颈,解析kernel_details.csv识别算子性能问题,辅以知识图谱快速检索官方文档与故障排查方案,实现昇腾训练性能深度分析。
通过torch_npu.profiler采集性能数据,结合AiCMetrics精准定位计算/访存瓶颈,解析kernel_details.csv识别算子性能问题,辅以知识图谱快速检索官方文档与故障排查方案,实现昇腾训练性能深度分析。







