logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

ge(Graph Executor):昇腾 CANN 的“大脑“,图编译和执行到底是怎么工作的

摘要:昇腾CANN中的GE(Graph Executor)是负责图编译、优化和执行的核心组件,位于框架适配层与编译器之间。它将PyTorch等框架的计算图转换为NPU可执行格式,主要工作流程包括图准备(解析与检查)、图编译(算子融合、内存优化等)和图执行(运行时管理)。GE与graph-autofusion(在线融合)和TorchAir(动态图转静态图)共同构成昇腾的图处理体系,适用于静态shap

文章图片
#人工智能#android
ge(Graph Executor):昇腾 CANN 的“大脑“,图编译和执行到底是怎么工作的

摘要:昇腾CANN中的GE(Graph Executor)是负责图编译、优化和执行的核心组件,位于框架适配层与编译器之间。它将PyTorch等框架的计算图转换为NPU可执行格式,主要工作流程包括图准备(解析与检查)、图编译(算子融合、内存优化等)和图执行(运行时管理)。GE与graph-autofusion(在线融合)和TorchAir(动态图转静态图)共同构成昇腾的图处理体系,适用于静态shap

文章图片
#人工智能#android
ge(Graph Executor):昇腾 CANN 的“大脑“,图编译和执行到底是怎么工作的

摘要:昇腾CANN中的GE(Graph Executor)是负责图编译、优化和执行的核心组件,位于框架适配层与编译器之间。它将PyTorch等框架的计算图转换为NPU可执行格式,主要工作流程包括图准备(解析与检查)、图编译(算子融合、内存优化等)和图执行(运行时管理)。GE与graph-autofusion(在线融合)和TorchAir(动态图转静态图)共同构成昇腾的图处理体系,适用于静态shap

文章图片
#人工智能#android
hccl:昇腾多卡训练的“胶水“,和 NCCL 到底像不像

摘要:hccl是昇腾NPU的集合通信库,功能类似NVIDIA的NCCL,支持AllReduce等通信原语,用于多卡训练梯度同步。与hcomm(上层封装)、hixl(单边通信)共同构成昇腾通信体系。使用时需注意:1)PyTorch后端设为"hccl";2)batch_size需按卡数放大;3)AllReduce是同步操作。hccl针对昇腾硬件特性优化,与NCCL底层实现不同,迁移时需重新适配。

文章图片
#人工智能#android#语言模型
hccl:昇腾多卡训练的“胶水“,和 NCCL 到底像不像

摘要:hccl是昇腾NPU的集合通信库,功能类似NVIDIA的NCCL,支持AllReduce等通信原语,用于多卡训练梯度同步。与hcomm(上层封装)、hixl(单边通信)共同构成昇腾通信体系。使用时需注意:1)PyTorch后端设为"hccl";2)batch_size需按卡数放大;3)AllReduce是同步操作。hccl针对昇腾硬件特性优化,与NCCL底层实现不同,迁移时需重新适配。

文章图片
#人工智能#android#语言模型
asnumpy:让你的 NumPy 代码零改动跑在昇腾 NPU 上

有个同事之前跟我说,他写了一套数据预处理的 pipeline,全是 NumPy 写的,后来要迁移到昇腾 NPU 上跑,“感觉天都要塌了”——几千行 NumPy 代码,难道要全部重写?后来他发现了 asnumpy,这个东西基本上解决了这个问题。不需要改你的 NumPy 代码,直接换一下 import,数据搬上 NPU 跑,原来的语法一个不动。

文章图片
#numpy#人工智能
asnumpy:让你的 NumPy 代码零改动跑在昇腾 NPU 上

有个同事之前跟我说,他写了一套数据预处理的 pipeline,全是 NumPy 写的,后来要迁移到昇腾 NPU 上跑,“感觉天都要塌了”——几千行 NumPy 代码,难道要全部重写?后来他发现了 asnumpy,这个东西基本上解决了这个问题。不需要改你的 NumPy 代码,直接换一下 import,数据搬上 NPU 跑,原来的语法一个不动。

文章图片
#numpy#人工智能
FlashAttention 在昇腾 NPU 上是怎么省显存的?我花了两天把它搞明白了

FlashAttention 在昇腾 NPU 上是怎么省显存的?我花了两天把它搞明白了

文章图片
#android#人工智能
FlashAttention 在昇腾 NPU 上是怎么省显存的?我花了两天把它搞明白了

FlashAttention 在昇腾 NPU 上是怎么省显存的?我花了两天把它搞明白了

文章图片
#android#人工智能
到底了