logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Ascend C 实战:开发高性能自定义 SwiGLU 算子,加速大模型 FFN 层(附完整代码与图解)

深入解析Ascend C:华为昇腾AI芯片的高效编程指南 - CSDN App】https://blog.csdn.net/2501_93573441/article/details/155790458?:developer@example.com | 昇腾社区ID: Ascend-AI-Dev。,将 3 步计算压缩为 1 次 Kernel 调用,显著提升推理性能。的结果已由前序 GEMM 算子计

文章图片
#c语言#开发语言
CANN Rotary Embedding 融合算子:解锁千问大模型推理性能的 3 倍密钥

RoPE 融合算子是大模型推理优化中“积少成多”的典范。它通过消除 12% 的纯搬运开销,换取了近 40% 的吞吐提升。在昇腾 NPU 上部署千问、LLaMA 等主流模型时,启用中的融合算子,是提升推理效率、降低算力成本的必选项。下一步建议跑示例:访问下载代码,运行目录下的千问-7B 推理示例。测性能:使用profiling工具对比融合前后的 RoPE 阶段耗时。看源码:深入ops/rope/目录

文章图片
用昇腾 NPU 跑大模型,CANN 的 FlashAttention 算子到底帮了多少忙

因果掩码的传入方式的 mask 参数格式和 PyTorch 原生不一样,记得看仓库文档里的示例。KV Cache 的 Prefill/Decode 切换:Prefill 阶段处理完整 prompt,pre_toks要设大;Decode 阶段逐 token 生成,next_toks设为 1。参数搞混了结果不对。数据类型:昇腾 NPU 对 BF16 的支持比 FP16 更好(尤其在 Softmax 精

文章图片
#transformer#深度学习#人工智能 +1
FlashAttention 算子深度解析:让大模型在昇腾NPU上跑得更快

FlashAttention 是个好东西,尤其是在昇腾 NPU 上,它能让你的显存占用掉 75%,推理速度翻一倍。要在昇腾上用,记得去 AtomGit 上把 ops-transformer 仓库 clone 下来,里面有现成的 Ascend C 实现,直接编译就能用。踩坑的时候注意 seq_len 的对齐问题,还有不同 NPU 型号(训练卡 vs 推理卡)的 SRAM 大小不一样,分块参数得动态调

文章图片
#transformer#python
FlashAttention算子深度解读:让大模型在昇腾NPU上跑得更快

昇腾CANN平台上的ops-transformer算子库把FlashAttention的精髓搬到了昇腾NPU上,让大模型的Attention计算不再被显存带宽卡脖子。这个算子的核心思路特别简单:不把所有Attention矩阵摊开算,而是分小块算、边算边扔。标准Attention算10个token要来回搬运100次数据,FlashAttention只要10次。在昇腾NPU的达芬奇架构上,这个差异被放

文章图片
#人工智能
FlashAttention V2深度解析:反向传播显存优化让大模型训练不再OOM

FlashAttention V2通过IO感知的梯度计算、并行化优化、数值稳定性增强,让大模型训练显存降低90%,速度提升2.5倍。在昇腾NPU上,还有Cube/Vector流水线、指令优化、动态batch等独有优化。如果你在训练大模型时遇到显存不够或者速度太慢的问题,试试FlashAttention V2。一行代码切换,不用改模型架构。仓库地址:https://atomgit.com/cann/

文章图片
#机器学习
FlashAttention与知识蒸馏:Tiny-FlashAttention怎么蒸馏大模型的能力

某团队训练了一个强大的大模型(70B参数),在长上下文任务上表现优异。现在需要把这个能力迁移到一个小模型(1.3B参数)上,在昇腾NPU上高效部署。直接Fine-tuning小模型效果不好,因为小模型的容量不足以学习长距离依赖。问题出在知识蒸馏策略不对。标准的知识蒸馏只蒸馏输出logits,但FlashAttention学到的能力是结构化的——大模型的attention pattern、长距离依赖

文章图片
#深度学习#人工智能#机器学习
用昇腾 NPU 跑大模型,CANN 的 FlashAttention 算子到底帮了多少忙

因果掩码的传入方式的 mask 参数格式和 PyTorch 原生不一样,记得看仓库文档里的示例。KV Cache 的 Prefill/Decode 切换:Prefill 阶段处理完整 prompt,pre_toks要设大;Decode 阶段逐 token 生成,next_toks设为 1。参数搞混了结果不对。数据类型:昇腾 NPU 对 BF16 的支持比 FP16 更好(尤其在 Softmax 精

文章图片
#transformer#深度学习#人工智能 +1
FlashAttention 算子深度解析:让大模型在昇腾NPU上跑得更快

FlashAttention 是个好东西,尤其是在昇腾 NPU 上,它能让你的显存占用掉 75%,推理速度翻一倍。要在昇腾上用,记得去 AtomGit 上把 ops-transformer 仓库 clone 下来,里面有现成的 Ascend C 实现,直接编译就能用。踩坑的时候注意 seq_len 的对齐问题,还有不同 NPU 型号(训练卡 vs 推理卡)的 SRAM 大小不一样,分块参数得动态调

文章图片
#transformer#python
FlashAttention V2深度解析:反向传播显存优化让大模型训练不再OOM

FlashAttention V2通过IO感知的梯度计算、并行化优化、数值稳定性增强,让大模型训练显存降低90%,速度提升2.5倍。在昇腾NPU上,还有Cube/Vector流水线、指令优化、动态batch等独有优化。如果你在训练大模型时遇到显存不够或者速度太慢的问题,试试FlashAttention V2。一行代码切换,不用改模型架构。仓库地址:https://atomgit.com/cann/

文章图片
#机器学习
    共 142 条
  • 1
  • 2
  • 3
  • 15
  • 请选择