登录社区云,与社区用户共同成长
邀请您加入社区
CANN 全面开源开放,致力于为开发者构建统一、高效的算力使能平台,助力 AI 应用创新与加速落地。为进一步促进区域开发者交流、共建 CANN 生态,CANN 开源社区联合 AtomGit 正式发起「CANN 开发者 Meetup」南京站。
进入社区互动讨论,获取往期材料,赢取社区好礼~
高性能推理引擎架构之道:解密XLLM演进之路、代码设计与核心能力
👉 立即挑战,赢定制周边:https://gitcode.com/cann/cann-learning-hub/issues/531。📅 活动时间: 8月6日至8月13日。
B站预约链接:点击预约
稀疏注意力(Sparse Attention)是大语言模型处理长上下文的核心技术,其原理在于通过结构化稀疏计算降低显存带宽压力,而非简单跳过token。相比FlashAttention-2等通用优化方案,DeepSeek-V3.2提出的DSA(DeepSeek Sparse Attention)结合硬件感知编译器CANN,实现了从算法设计到GPU kernel级的端到端协同优化,显著提升128K长
本文档详细介绍了在鲲鹏920服务器(aarch64)上安装昇腾310P NPU驱动的完整流程。环境配置包括UOS V2500操作系统和CANN 8.3.RC2版本。主要内容包括:1)创建专用运行用户HwHiAiUser;2)通过yum更新源并安装Python依赖;3)校验并安装NPU驱动和固件包;4)系统重启后使用npu-smi验证驱动加载。文档还提供了三个常见错误的解决方案:内核开发包缺失、DK
GLM-5.2 KV Offload 系统优化实践Agent 赋能模型部署优化:Hy3 昇腾推理实践PyPTO 编程框架与 Agent 算子生成能力面向昇腾 950DT 的 DSpark 推理实现与性能优化Longcat 2.0:推理低时延优化SanaVideo 模型 NPU 单卡部署与性能优化实践。
SIG 主要沉淀面向 6G AI RAN 的典型任务样例,覆盖时变信道表征与建模、信道估计、端到端无反馈MIMO预编码与多流传输、跨场景智能定位与多基站协作传输等方向,并可进一步拓展至基站智慧节能、移动性管理等 AI for RAN 应用。面向高校学生同时启动5大赛区:京津冀东北赛区、上合赛区、西北赛区、西南赛区、杭厦赛区,荣誉证书 +秋招机考面试绿卡+丰厚奖金 欢迎广大学生报名参加!CANN社区
QAT 算子的开发实践验证了 PyPTO 的简单易用:用高层张量 API 表达算法逻辑,用tile_shape和等参数完成性能调优。在此基础上,Agent 可以先围绕公式和张量关系快速完成功能实现,再根据 profiling 结果调整少量参数完成优化,2周便完成 QAT 算子的开发、调优和模型接入,实现了模型吞吐性能的显著提升。
当大模型落地进入性能攻坚阶段,昇腾 NPU 推理、KV 缓存调度、MoE 异构部署、视频生成模型适配、自定义算子优化成为所有 AI 开发者绕不开的核心难题。为打通模型从论文到昇腾硬件落地全链路,落地杭州线下专场 Meetup,聚焦主流大模型、视频生成模型、Agent 智能体、DSA 架构的 CANN 深度优化实战,集结一线昇腾技术专家面对面拆解调优踩坑经验,专为杭州及周边 AI 算法、算子、部署工
全员可参与,体验昇腾950系列产品算力。9大任务上线,16W+奖金池开放!扫码参与活动报名,抢先了解任务详情。
B站预约链接:点击跳转预约
本文详细介绍了在Ubuntu 22.04系统上配置昇腾 CANN 7.0环境的5大关键步骤,包括系统环境预检、CANN组件化安装、环境变量配置、硬件状态监控及PyTorch模型迁移实战。通过华为昇腾AI处理器的入门学习指南,帮助开发者快速搭建高效开发环境,提升AI模型训练效率。
神经网络计算架构(CANN)作为AI加速器的核心软件栈,通过算子融合、内存优化等技术显著提升计算效率。在生成式AI(AIGC)领域,这种优化尤为关键,例如Stable Diffusion等大模型需要处理动态shape和高分辨率图像。华为昇腾处理器结合CANN 6.0的动态shape支持和分布式图优化,实现了40%的吞吐量提升。技术原理上,CANN通过FusedAttention等融合算子减少内存访
在深度学习中,张量填充(Padding)是卷积神经网络预处理的关键技术,直接影响模型精度和计算效率。其核心原理是通过扩展输入数据维度,确保卷积核能完整覆盖特征图边缘区域。常见的填充模式包括CONSTANT、EDGE、REFLECT等,分别适用于图像处理、语音信号等不同场景。华为CANN架构针对昇腾芯片特性,通过计算图融合和内存访问优化,显著提升Pad算子性能。在Stable Diffusion等生
Transformer架构作为现代大语言模型的核心,其注意力机制的计算复杂度O(n²·d)和内存占用问题一直是工程优化的重点。通过分块计算和内存访问优化技术,Flash Attention将显存占用从O(n²)降至O(n),同时提升计算效率2-4倍。类似操作系统的分页管理,PagedAttention技术将KV Cache动态划分为固定大小的block,使内存利用率提升2-4倍。这些优化在华为CA
在深度学习中,张量维度对齐是确保模型计算正确性的基础操作。Pad算子作为核心预处理算子,通过在数据边缘添加特定数值,解决卷积等操作导致的尺寸缩减问题。其数学本质是维度扩展运算,支持CONSTANT、REFLECT等多种填充模式,直接影响模型输出质量和计算效率。华为CANN架构针对昇腾芯片对Pad算子进行了硬件级优化,包括向量化处理、内存零拷贝等关键技术,在Stable Diffusion等图像生成
深度学习推理中的硬件利用率问题一直是性能优化的关键挑战。异构计算架构通过任务并行化和流水线技术,能够显著提升计算设备的吞吐效率。CANN作为专为神经网络设计的计算架构,其多流(Multi-Stream)与异步执行机制实现了计算与数据传输的重叠执行、多任务间的无等待调度。这种并发编程模型在ResNet50、BERT等典型模型中可实现2-3倍的性能提升,特别适用于视频分析、自然语言处理等需要高吞吐的场
激活函数作为深度学习的核心组件,通过引入非线性变换使神经网络具备强大的表达能力。从数学原理上看,Sigmoid、ReLU等函数各有特性,而工业级实现需兼顾计算精度与硬件效率。在异构计算架构如CANN中,ops-nn模块通过分层设计、向量化指令和内存优化等技术,显著提升激活函数的执行性能。通过分析AtomGit开源代码可见,针对NPU等专用硬件的指令级优化可带来5-10倍加速。这类优化技术广泛应用于
非线性激活函数是神经网络的核心组件,其数学特性直接影响模型的表现力与训练效率。从ReLU到GELU等现代激活函数,通过引入分段线性、概率门控等机制,解决了梯度消失与神经元死亡等问题。在工程实现层面,华为CANN框架的ops-nn算子库针对Ascend芯片特性,采用向量化加载、掩码计算等技术,显著提升计算效率。特别是在AIGC等场景中,通过AtomGit协作开发的定制化激活函数,既能满足生成式模型对
模型集成多个融合算子,包括Recurrent KDA 与 Conv1D fn / update,Stable LatentMoE 采用 Combine 与 MXFP8 Dispatch 大EP算子,以及Gated MLA的KV Cache更新融合算子 与 FIA 算子,助力进一步性能优化。针对2.8T超大参数规模,支持Kimi K3原生MXFP4量化模式,路由专家直接使用模型原生的MXFP4权重与
在AI推理领域,算子库作为连接算法与硬件的桥梁,其优化水平直接影响模型推理效率。通过硬件指令级映射技术,算子库能够将神经网络操作高效转化为NPU可执行的指令序列,显著提升计算单元利用率。以CANN ops-nn为例,其核心价值在于实现了计算密集型操作(如矩阵乘法)与内存访问模式的深度优化,支持多精度计算和动态形状处理。这些技术在LLM推理等场景中尤为重要,通过算子融合、内存布局优化等方法,可减少高
昇腾算子编程专场
CANN
——CANN
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net