
简介
该用户还未填写简介
擅长的技术栈
未填写擅长的技术栈
可提供的服务
暂无可提供的服务
Ascend for Pytorch基于graphImplInterface的图捕获实现方案(非cuda迁移变体)
在 PyTorch 的优化路径中,图捕获(Graph Capture)是实现性能提升的关键环节。当前 PyTorch 社区对图捕获的实现主要围绕 CUDA 设备展开,但随着 NPU 等其他加速器的接入需求日益增长,我们需要设计一套可扩展的图捕获架构,使得不同硬件后端能够以统一的方式接入这一优化路径。本文介绍的是“使用契约、但不迁移 CUDA”的实现变体。该方案的核心思路是:NPU 及其他已注册后端
DeepSeek-V3 单卡 PyNative 从 MindSpore 迁移到 PyTorch —— 改造思路与实践
在大型语言模型(LLM)的训练与推理实践中,框架生态的兼容性是一个关键挑战。在无 MindSpore 环境的情况下,实现单卡 PyNative(动态图)模式的预训练闭环。目标平台为 Ascend NPU(通过torch_npu),同时需向下兼容 CUDA 和 CPU。本次单卡改造必须为后续平滑放大到多卡并行训练铺平道路,避免未来大规模重构。因此,所有设计决策都以“单卡即多卡 world_size=
DeepSeek-V3 单卡 PyNative 从 MindSpore 迁移到 PyTorch —— 改造思路与实践
在大型语言模型(LLM)的训练与推理实践中,框架生态的兼容性是一个关键挑战。在无 MindSpore 环境的情况下,实现单卡 PyNative(动态图)模式的预训练闭环。目标平台为 Ascend NPU(通过torch_npu),同时需向下兼容 CUDA 和 CPU。本次单卡改造必须为后续平滑放大到多卡并行训练铺平道路,避免未来大规模重构。因此,所有设计决策都以“单卡即多卡 world_size=
到底了







