
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
摘要:模型量化主要有W4A16(权重4bit,激活fp16)和W8A8(权重和激活8bit)两种方案。W4A16显存占用最小(Llama2-7B从14GB降至4GB),精度损失小(0.3-0.8%),适合显存受限场景;W8A8速度最快(吞吐提升1.8-2.0倍),但显存占用较大(7GB),精度损失更高(1.0-2.0%)。选择方案需根据需求:显存受限选W4A16,速度优先选W8A8。W4A16的g

容器化技术为CANN应用部署提供了标准化和可移植的解决方案。
生成式AI是指能够生成新内容的AI技术,包括文本、图像、音频、视频等。CANN为生成式AI和大模型优化提供了完整的解决方案,从量化到LoRA微调,都可以高效实现。通过合理的优化策略,可以在保证质量的前提下大幅提升推理效率。模型量化压缩LoRA高效微调Flash Attention加速KV Cache优化。
摘要: 昇腾CANN生态中的FlashAttention通过算子融合、架构适配和编译优化,显著提升大模型推理性能。相比标准Attention,它采用分块计算避免中间矩阵存储,显存占用从O(N²)降至O(N),吞吐量提升3倍,延迟降低50%以上。在昇腾NPU上,通过PyTorch适配层或ATB框架可无缝调用,但对输入维度有16字节对齐要求。该技术已集成到ops-transformer仓库,支持最新M

摘要:昇腾NPU团队开发的CANN MoE融合算子针对大模型稀疏激活场景优化,通过三层融合策略显著提升性能。核心创新是将通信与计算流水线化,其中MC2通算融合使通信延迟被计算掩盖,通信占比从47%降至18%。在Atlas 800I A2上测试Mixtral 8x7B模型,吞吐量提升至1420 tokens/s/p。该方案要求expert权重连续排列且K≤2,需HCCL 2.0以上支持。开发者可通过

摘要:本文介绍了如何在昇腾NPU上快速部署和使用ops-transformer大模型算子,无需编写Ascend C代码。主要内容包括:1) 环境要求检查(CANN版本和PyTorch适配);2) 一键编译流程及常见错误处理;3) FlashAttention和MoE融合算子的调用示例;4) 性能对比验证方法。整个过程可在5分钟内完成,为后续模型推理优化提供基础。文章还提供了进一步学习路径和贡献指南

摘要:CANN ops-transformer是昇腾NPU专门针对Transformer架构大模型的进阶算子仓库,包含FlashAttention、MoE融合等核心复合算子。该仓库位于CANN五层架构的算子库顶层,与ATB和cann-recipes形成完整调用链。文章详细解析了仓库定位、核心算子清单、与其他仓库的关系,并提供了仓库结构和快速入门指南。开发者可通过该仓库高效实现大模型在昇腾NPU上的

摘要:Speculative Decoding利用小模型生成候选token,大模型并行验证,在昇腾NPU上实现高效加速。该方法将单token解码转为多token预填充,使NPU的batch GEMM利用率提升3.5倍。关键因素是小模型的接受率需高于60%,同架构小模型可提升10-15%接受率。在8卡Atlas 800I A2上,虽然显存减少29%,但吞吐可提升2-3倍。动态调整K值和提高小模型温度

这篇技术文章详细介绍了如何在昇腾NPU上优化大模型推理的显存使用。文章从显存分布分析入手,逐步讲解了五种优化方法:KV Cache分页分配、fp8压缩、权重W8A16量化、权重分片加载和共享权重。通过这些优化组合,作者展示了如何将Llama2-7B模型的显存使用效率提升近一倍,从96K token并发提升到197K。文章还针对不同规模的模型(7B/13B/70B)给出了具体的部署建议,强调优化顺序

摘要: 昇腾CANN生态中的FlashAttention通过算子融合、架构适配和编译优化,显著提升大模型推理性能。相比标准Attention,它采用分块计算避免中间矩阵存储,显存占用从O(N²)降至O(N),吞吐量提升3倍,延迟降低50%以上。在昇腾NPU上,通过PyTorch适配层或ATB框架可无缝调用,但对输入维度有16字节对齐要求。该技术已集成到ops-transformer仓库,支持最新M








