logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

CANN ops-transformer 的 FlashAttention:把大模型的记忆从 32GB 压到 8GB,怎么做到的

刚接触昇腾CANN那会,我以为 ops-transformer 就是个普通的算子仓库,和 ops-math、ops-nn 没什么区别。后来跑一个 70B 模型的推理任务,显存直接爆了,才发现大模型的注意力计算才是真正的吞显存怪兽——而 ops-transformer 里那个 FlashAttention,是昇腾NPU上唯一能把这头怪兽关进笼子的东西。ops-transformer 是昇腾CANN

#transformer#深度学习#人工智能
PyTorch 为什么换到昇腾 NPU 就要改代码?torchtitan-npu 如何做到零改造

摘要: torchtitan-npu是昇腾NPU与PyTorch生态的桥梁,通过五层优化机制实现“零改造”适配:1)NPU融合算子减少CPU-NPU交互;2)图优化提升执行效率;3)图下沉降低CPU参与频率;4)算子自动融合动态优化新算子组合;5)显存池化管理降低分配开销。该插件无需修改PyTorch源码或学习AscendCL,仅需替换设备名即可复用GPU代码,在Llama-2等模型上实现最高2.

文章图片
#pytorch#人工智能#python
PyTorch 为什么换到昇腾 NPU 就要改代码?torchtitan-npu 如何做到零改造

摘要: torchtitan-npu是昇腾NPU与PyTorch生态的桥梁,通过五层优化机制实现“零改造”适配:1)NPU融合算子减少CPU-NPU交互;2)图优化提升执行效率;3)图下沉降低CPU参与频率;4)算子自动融合动态优化新算子组合;5)显存池化管理降低分配开销。该插件无需修改PyTorch源码或学习AscendCL,仅需替换设备名即可复用GPU代码,在Llama-2等模型上实现最高2.

文章图片
#pytorch#人工智能#python
PyTorch 为什么换到昇腾 NPU 就要改代码?torchtitan-npu 如何做到零改造

摘要: torchtitan-npu是昇腾NPU与PyTorch生态的桥梁,通过五层优化机制实现“零改造”适配:1)NPU融合算子减少CPU-NPU交互;2)图优化提升执行效率;3)图下沉降低CPU参与频率;4)算子自动融合动态优化新算子组合;5)显存池化管理降低分配开销。该插件无需修改PyTorch源码或学习AscendCL,仅需替换设备名即可复用GPU代码,在Llama-2等模型上实现最高2.

文章图片
#pytorch#人工智能#python
PyTorch 为什么换到昇腾 NPU 就要改代码?torchtitan-npu 如何做到零改造

摘要: torchtitan-npu是昇腾NPU与PyTorch生态的桥梁,通过五层优化机制实现“零改造”适配:1)NPU融合算子减少CPU-NPU交互;2)图优化提升执行效率;3)图下沉降低CPU参与频率;4)算子自动融合动态优化新算子组合;5)显存池化管理降低分配开销。该插件无需修改PyTorch源码或学习AscendCL,仅需替换设备名即可复用GPU代码,在Llama-2等模型上实现最高2.

文章图片
#pytorch#人工智能#python
PyTorch 为什么换到昇腾 NPU 就要改代码?torchtitan-npu 如何做到零改造

摘要: torchtitan-npu是昇腾NPU与PyTorch生态的桥梁,通过五层优化机制实现“零改造”适配:1)NPU融合算子减少CPU-NPU交互;2)图优化提升执行效率;3)图下沉降低CPU参与频率;4)算子自动融合动态优化新算子组合;5)显存池化管理降低分配开销。该插件无需修改PyTorch源码或学习AscendCL,仅需替换设备名即可复用GPU代码,在Llama-2等模型上实现最高2.

文章图片
#pytorch#人工智能#python
从零跑通昇腾 NPU 算子:cann-samples 快速上手实战

昇腾NPU算子开发入门指南:通过cann-samples快速上手 摘要:本文介绍了如何利用昇腾官方提供的cann-samples资源库快速掌握NPU算子开发。cann-samples包含从基础算子到优化实现的完整示例,是连接理论知识与实践的重要工具。文章详细说明了环境准备、示例编译和运行验证的关键步骤,特别强调了版本匹配和常见错误的解决方法。通过对比基础实现与优化版本(如融合算子)的性能差异,开发

文章图片
#正则表达式#transformer#深度学习 +1
从零跑通昇腾 NPU 算子:cann-samples 快速上手实战

昇腾NPU算子开发入门指南:通过cann-samples快速上手 摘要:本文介绍了如何利用昇腾官方提供的cann-samples资源库快速掌握NPU算子开发。cann-samples包含从基础算子到优化实现的完整示例,是连接理论知识与实践的重要工具。文章详细说明了环境准备、示例编译和运行验证的关键步骤,特别强调了版本匹配和常见错误的解决方法。通过对比基础实现与优化版本(如融合算子)的性能差异,开发

文章图片
#正则表达式#transformer#深度学习 +1
为什么写矩阵乘还要“模板“?catlass 矩阵乘模板深度解读

摘要:矩阵乘法在昇腾NPU上需要精细优化才能发挥Cube单元性能,传统手写方式需200-300行AscendC代码。catlass模板库通过三层抽象设计(TLA逻辑层、MLA映射层、PLA物理层)实现高性能矩阵乘的快速开发,代码量减少80%且性能接近手写。与CUTLASS不同,catlass专为昇腾达芬奇架构定制,利用硬件流水特性实现计算与搬运重叠。该模板库适用于99%的矩阵乘场景,显著提升开发效

文章图片
#矩阵#服务器#线性代数
为什么写矩阵乘还要“模板“?catlass 矩阵乘模板深度解读

摘要:矩阵乘法在昇腾NPU上需要精细优化才能发挥Cube单元性能,传统手写方式需200-300行AscendC代码。catlass模板库通过三层抽象设计(TLA逻辑层、MLA映射层、PLA物理层)实现高性能矩阵乘的快速开发,代码量减少80%且性能接近手写。与CUTLASS不同,catlass专为昇腾达芬奇架构定制,利用硬件流水特性实现计算与搬运重叠。该模板库适用于99%的矩阵乘场景,显著提升开发效

文章图片
#矩阵#服务器#线性代数
    共 19 条
  • 1
  • 2
  • 请选择