logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

CANN-FlashAttention-为什么你的大模型推理慢到抓狂

摘要: 昇腾CANN生态中的FlashAttention通过算子融合、架构适配和编译优化,显著提升大模型推理性能。相比标准Attention,它采用分块计算避免中间矩阵存储,显存占用从O(N²)降至O(N),吞吐量提升3倍,延迟降低50%以上。在昇腾NPU上,通过PyTorch适配层或ATB框架可无缝调用,但对输入维度有16字节对齐要求。该技术已集成到ops-transformer仓库,支持最新M

文章图片
CANN-MoE融合算子-大模型稀疏激活的昇腾NPU加速方案

摘要:昇腾NPU团队开发的CANN MoE融合算子针对大模型稀疏激活场景优化,通过三层融合策略显著提升性能。核心创新是将通信与计算流水线化,其中MC2通算融合使通信延迟被计算掩盖,通信占比从47%降至18%。在Atlas 800I A2上测试Mixtral 8x7B模型,吞吐量提升至1420 tokens/s/p。该方案要求expert权重连续排列且K≤2,需HCCL 2.0以上支持。开发者可通过

文章图片
CANN-ops-transformer-昇腾NPU大模型算子五分钟跑起来

摘要:本文介绍了如何在昇腾NPU上快速部署和使用ops-transformer大模型算子,无需编写Ascend C代码。主要内容包括:1) 环境要求检查(CANN版本和PyTorch适配);2) 一键编译流程及常见错误处理;3) FlashAttention和MoE融合算子的调用示例;4) 性能对比验证方法。整个过程可在5分钟内完成,为后续模型推理优化提供基础。文章还提供了进一步学习路径和贡献指南

文章图片
#transformer#深度学习#人工智能
CANN-ops-transformer仓库全景-昇腾NPU大模型算子该去哪找

摘要:CANN ops-transformer是昇腾NPU专门针对Transformer架构大模型的进阶算子仓库,包含FlashAttention、MoE融合等核心复合算子。该仓库位于CANN五层架构的算子库顶层,与ATB和cann-recipes形成完整调用链。文章详细解析了仓库定位、核心算子清单、与其他仓库的关系,并提供了仓库结构和快速入门指南。开发者可通过该仓库高效实现大模型在昇腾NPU上的

文章图片
#transformer#深度学习#人工智能
CANN-昇腾NPU-Speculative-Decoding-昇腾NPU上怎么用小模型加速大模型推理

摘要:Speculative Decoding利用小模型生成候选token,大模型并行验证,在昇腾NPU上实现高效加速。该方法将单token解码转为多token预填充,使NPU的batch GEMM利用率提升3.5倍。关键因素是小模型的接受率需高于60%,同架构小模型可提升10-15%接受率。在8卡Atlas 800I A2上,虽然显存减少29%,但吞吐可提升2-3倍。动态调整K值和提高小模型温度

文章图片
#kotlin#android#开发语言
CANN生成式AI与大模型优化

生成式AI是指能够生成新内容的AI技术,包括文本、图像、音频、视频等。CANN为生成式AI和大模型优化提供了完整的解决方案,从量化到LoRA微调,都可以高效实现。通过合理的优化策略,可以在保证质量的前提下大幅提升推理效率。模型量化压缩LoRA高效微调Flash Attention加速KV Cache优化。

#人工智能
CANN音频处理与语音识别应用

音频信号处理是AI应用的重要领域,涵盖语音识别、音频分类、音乐分析等多个方向。CANN为音频处理和语音识别应用提供了强大的计算支持,从特征提取到端到端识别,都可以获得显著加速。通过合理的模型设计和优化,可以构建高效的语音应用系统。高效的音频特征提取实时语音处理能力多通道并行处理端侧部署优化。

#音视频#语音识别#人工智能
CANN-FlashAttentionV2-昇腾NPU反向传播融合到底快在哪

摘要:CANN 8.5的FlashAttention V2通过反向传播融合显著提升训练性能。相比V1拆分dQ/dK/dV计算,V2在反向kernel内重新计算Softmax归一化因子,用5%额外计算换取40%显存读写优化。实测显示,Llama2-7B训练吞吐提升30%,显存占用减少21%,最大序列长度从8K扩展到16K。该特性在CANN 8.5+torch_npu 2.3中自动启用,推理场景无需升

文章图片
CANN-RotaryEmbedding-昇腾NPU上位置编码为什么该融进Attention

摘要:RoPE(Rotary Position Embedding)在昇腾NPU上的标准实现存在性能瓶颈,主要由于Q/K数据在显存和计算单元间的频繁搬运。CANN的RotaryEmbedding融合算子将旋转操作直接嵌入Attention计算流程,避免了两次显存读写。实测显示,在Llama2-7B推理中,融合算子使首token延迟降低16%,吞吐提升12%,长序列场景收益更显著。使用方式包括自动路

文章图片
CANN-ops-math推理优化-昇腾NPU数学算子调优实战

《昇腾NPU数学算子调优实战:优化大模型推理性能》 本文针对大模型推理中的数学算子性能瓶颈进行深入分析,以Llama2-7B为例展示了优化实践。通过CANN Profiler工具发现,ReduceMean、Softmax、Cast等数学算子可能占用10-15%的推理时间。文章详细介绍了三种关键优化方法:1)确保Softmax走优化路径,将三次HBM读取压缩为一次;2)使用fused_add_rms

文章图片
#深度学习#pytorch#人工智能
    共 208 条
  • 1
  • 2
  • 3
  • 21
  • 请选择