logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

GLM-5.2 在 MindSpore TransFormer 动态图迁移与 GPU/NPU 精度对齐工作报告

随着大模型训练场景的多样化发展,模型需要在不同硬件平台上保持一致的训练精度。本工作旨在将 GLM-5.2 模型结构接入 MindFormers PyNative 框架,并以 GPU 上的 Megatron-LM 为参考基准,验证 Ascend NPU 与 NVIDIA GPU 在单卡训练场景下的精度一致性。通过系统化的对齐流程,确保模型在不同硬件平台上的训练行为可复现、可预期,为后续多卡扩展和实际

#人工智能#python#机器学习 +4
Ascend for PyTorch Inductor C++ Builder 设备编译注册机制适配 NPU

修改前() -> None:Args:"""Args:目的:提供模块级注册表与公开 API。重复注册时发出警告并覆盖,与 PyTorch 其他注册机制一致。

#人工智能
昇腾950PR执行通信算子用例超时报错问题分析与解决方案

在基于950PR环境的多卡并行训练场景中,使用PyTorch框架调用NPU通信算子进行模型参数同步是常见需求。为验证通信算子在高并发下的稳定性与性能表现,需在8张NPU卡上并行执行指定时长的通信任务。然而,在实际测试过程中,部分卡在规定时间结束后未能及时退出,导致整体任务因同步超时而失败,影响了测试用例的可靠性与可重复性。本文针对该问题展开分析,并提出有效的解决方案。import os# ---

#python#人工智能
昇腾950PR执行通信算子用例超时报错问题分析与解决方案

在基于950PR环境的多卡并行训练场景中,使用PyTorch框架调用NPU通信算子进行模型参数同步是常见需求。为验证通信算子在高并发下的稳定性与性能表现,需在8张NPU卡上并行执行指定时长的通信任务。然而,在实际测试过程中,部分卡在规定时间结束后未能及时退出,导致整体任务因同步超时而失败,影响了测试用例的可靠性与可重复性。本文针对该问题展开分析,并提出有效的解决方案。import os# ---

#python#人工智能
昇腾950PR执行通信算子用例超时报错问题分析与解决方案

在基于950PR环境的多卡并行训练场景中,使用PyTorch框架调用NPU通信算子进行模型参数同步是常见需求。为验证通信算子在高并发下的稳定性与性能表现,需在8张NPU卡上并行执行指定时长的通信任务。然而,在实际测试过程中,部分卡在规定时间结束后未能及时退出,导致整体任务因同步超时而失败,影响了测试用例的可靠性与可重复性。本文针对该问题展开分析,并提出有效的解决方案。import os# ---

#python#人工智能
到底了