
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要:昇腾CANN中的GE(Graph Executor)是负责图编译、优化和执行的核心组件,位于框架适配层与编译器之间。它将PyTorch等框架的计算图转换为NPU可执行格式,主要工作流程包括图准备(解析与检查)、图编译(算子融合、内存优化等)和图执行(运行时管理)。GE与graph-autofusion(在线融合)和TorchAir(动态图转静态图)共同构成昇腾的图处理体系,适用于静态shap

摘要:昇腾CANN中的GE(Graph Executor)是负责图编译、优化和执行的核心组件,位于框架适配层与编译器之间。它将PyTorch等框架的计算图转换为NPU可执行格式,主要工作流程包括图准备(解析与检查)、图编译(算子融合、内存优化等)和图执行(运行时管理)。GE与graph-autofusion(在线融合)和TorchAir(动态图转静态图)共同构成昇腾的图处理体系,适用于静态shap

摘要:昇腾CANN中的GE(Graph Executor)是负责图编译、优化和执行的核心组件,位于框架适配层与编译器之间。它将PyTorch等框架的计算图转换为NPU可执行格式,主要工作流程包括图准备(解析与检查)、图编译(算子融合、内存优化等)和图执行(运行时管理)。GE与graph-autofusion(在线融合)和TorchAir(动态图转静态图)共同构成昇腾的图处理体系,适用于静态shap

摘要:hccl是昇腾NPU的集合通信库,功能类似NVIDIA的NCCL,支持AllReduce等通信原语,用于多卡训练梯度同步。与hcomm(上层封装)、hixl(单边通信)共同构成昇腾通信体系。使用时需注意:1)PyTorch后端设为"hccl";2)batch_size需按卡数放大;3)AllReduce是同步操作。hccl针对昇腾硬件特性优化,与NCCL底层实现不同,迁移时需重新适配。

摘要:hccl是昇腾NPU的集合通信库,功能类似NVIDIA的NCCL,支持AllReduce等通信原语,用于多卡训练梯度同步。与hcomm(上层封装)、hixl(单边通信)共同构成昇腾通信体系。使用时需注意:1)PyTorch后端设为"hccl";2)batch_size需按卡数放大;3)AllReduce是同步操作。hccl针对昇腾硬件特性优化,与NCCL底层实现不同,迁移时需重新适配。

有个同事之前跟我说,他写了一套数据预处理的 pipeline,全是 NumPy 写的,后来要迁移到昇腾 NPU 上跑,“感觉天都要塌了”——几千行 NumPy 代码,难道要全部重写?后来他发现了 asnumpy,这个东西基本上解决了这个问题。不需要改你的 NumPy 代码,直接换一下 import,数据搬上 NPU 跑,原来的语法一个不动。

有个同事之前跟我说,他写了一套数据预处理的 pipeline,全是 NumPy 写的,后来要迁移到昇腾 NPU 上跑,“感觉天都要塌了”——几千行 NumPy 代码,难道要全部重写?后来他发现了 asnumpy,这个东西基本上解决了这个问题。不需要改你的 NumPy 代码,直接换一下 import,数据搬上 NPU 跑,原来的语法一个不动。

FlashAttention 在昇腾 NPU 上是怎么省显存的?我花了两天把它搞明白了

FlashAttention 在昇腾 NPU 上是怎么省显存的?我花了两天把它搞明白了








