
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
在深度学习推理场景中,模型量化与激活函数的组合操作频繁出现,通常需要依次执行反量化(Dequant)、激活函数(如 SwiGLU)和量化(Quant)三个步骤。传统分步执行方式会产生大量中间张量的显存读写,导致推理延迟增加。为解决这一问题,本文设计并实现了一个融合算子,将上述三个操作合并为一次 kernel 调用,显著减少显存访问开销,提升推理性能。该算子基于 Triton-Ascend DSL
在深度学习推理场景中,模型量化与激活函数的组合操作频繁出现,通常需要依次执行反量化(Dequant)、激活函数(如 SwiGLU)和量化(Quant)三个步骤。传统分步执行方式会产生大量中间张量的显存读写,导致推理延迟增加。为解决这一问题,本文设计并实现了一个融合算子,将上述三个操作合并为一次 kernel 调用,显著减少显存访问开销,提升推理性能。该算子基于 Triton-Ascend DSL
在深度学习模型训练中,MSELoss 作为常用的损失函数,其计算性能直接影响整体训练效率。本文针对大规模向量(如 33.5M 元素)下的 MSELoss 计算,从基线实现中存在的性能瓶颈出发,逐步优化,最终在昇腾硬件上实现接近甚至超越 PyTorch 原生实现的吞吐性能。文章记录了优化思路、关键改进及性能数据,旨在为类似场景下的算子优化提供参考。
在深度学习模型训练中,MSELoss 作为常用的损失函数,其计算性能直接影响整体训练效率。本文针对大规模向量(如 33.5M 元素)下的 MSELoss 计算,从基线实现中存在的性能瓶颈出发,逐步优化,最终在昇腾硬件上实现接近甚至超越 PyTorch 原生实现的吞吐性能。文章记录了优化思路、关键改进及性能数据,旨在为类似场景下的算子优化提供参考。
在深度学习模型训练中,均方误差损失(MSELoss,又称 L2 Loss)是回归任务中最常用的损失函数之一。随着模型规模的不断扩大,对算子的计算效率和精度要求也越来越高。Triton 作为一种高效的 GPU 编程语言,能够帮助开发者编写高性能的自定义算子。本文基于 Triton-Ascend 框架,设计并实现了一个支持多种归约模式、具备动态优化策略的 MSELoss 算子,旨在解决现有实现中精度不
在深度学习模型训练中,均方误差损失(MSELoss,又称 L2 Loss)是回归任务中最常用的损失函数之一。随着模型规模的不断扩大,对算子的计算效率和精度要求也越来越高。Triton 作为一种高效的 GPU 编程语言,能够帮助开发者编写高性能的自定义算子。本文基于 Triton-Ascend 框架,设计并实现了一个支持多种归约模式、具备动态优化策略的 MSELoss 算子,旨在解决现有实现中精度不







