登录社区云,与社区用户共同成长
邀请您加入社区
B站预约链接:点击预约
全新昇腾950系列课程上线,免费算力、多重好礼等你拿!📅 活动时间:即日起至2027年1月11日。
本周摘要CANN代码仓上新:cannbotCANN技术活动:CANN NEXT系列开播CANN 社区进展直达开源社区:https://gitcode.com/cannCANN 上新。
HiF8不只是节省带宽,而是通过QKPV全量化、紧凑数据表示、Scale复用以及访存/计算流水重构,进一步缓解了原有SparseMLA中明显的Scalar Bound。,HiF8 在权重、激活和KV Cache上均表现出较好的数值保真度,主要Benchmark与高精度基线基本持平;,通过RmsNorm+Quant、Rotary+Quant等融合,将中间结果尽可能留在片上,减少完整Tensor写回和
低比特量化是降低大语言模型推理成本和资源需求的重要手段。随着部署场景对显存占用、带宽压力和计算效率提出更高要求,量化研究正逐渐从 8-bit 进一步推进到 4-bit。HiFloat4(HiF4)是昇腾自研的一种 4-bit 数值格式,通过三级缩放机制显著扩展了低精度数值的动态范围,使其更适配大模型权重和激活中常见的动态范围分布。将高精度权重直接转化为 4 比特格式通常会带来量化误差。因此,量化校
下面这张图可以支撑:HiF8和MXFP8在KV cache上均能保持较高量化保真度,KV cache不是HiF8相比MXFP8的主要精度风险来源,在KV cache SQNR上,未观察到HiF8相比 MXFP8的系统性退化,两种格式整体稳定在相近水平。该结果表明,HiF8在KV cache量化中未引入额外的小值置零风险,并可能相比MXFP8更好地保留低幅值cache信息,HiF8在KV cache
大模型量化是推理优化的关键能力之一。通过降低权重和激活的数值精度,量化可以减少模型存储、显存占用和计算开销,是大模型在实际业务中高效部署的重要手段。AMCT 是 CANN 社区提供的模型压缩与量化工具,面向昇腾 AI 处理器支持 LLM 模型高效量化,覆盖 BF16 基线评估、PTQ 离线数据提取、PTQ 参数训练、fake quant 精度评估等典型流程。本文与配套使用,提供一份可参考、可跑通的
CANN技术活动:CANN挑战赛、HCCL通信库创新大赛火热报名中CANN社区进展直达开源社区:https://gitcode.com/cann竞 赛 进 行 时【2026 华为算法挑战赛_CANN挑战赛】开启预报名!面向高校学生同时启动5大赛区:京津冀东北赛区、上合赛区、西北赛区、西南赛区、杭厦赛区,荣誉证书 +秋招机考面试绿卡+丰厚奖金 欢迎广大学生报名参加!【2026 CANN-HCCL通信
是面向生命科学领域、负责建设昇腾原生算子库的开源兴趣小组,算子仓为bio-ops-molecule。SIG聚焦多组学数据处理、生物分子模拟和生物基础模型训练等场景,通过高性能行业算子解决计算效率、显存占用和数据访存等底层性能瓶颈。面向高校学生同时启动5大赛区:京津冀东北赛区、上合赛区、西北赛区、西南赛区、杭厦赛区,荣誉证书 +秋招机考面试绿卡+丰厚奖金 欢迎广大学生报名参加!CANN社区新开发者首
需要注意的是,FLOPs会独立于数值精度统计multiply-accumulate operations:它反映的是token剪枝带来的FLOPs降低,但并不能体现HiF8带来的收益,例如低比特宽度带来的memory和bandwidth节省,以及低比特矩阵计算单元上的更高吞吐。因此,它能够在不依赖细粒度per-token / per-block scale的情况下,同时兼顾宽动态范围和高精度表示,
但 FP16/BF16 一共只有 65536 种位模式,HiFloat8 只有 256 种——干脆在 host(CPU)上预先把所有结果算出来打成一张表,device 上只剩"查表 + 写回",又快又简单。精度侧覆盖了 FP16/BF16 全 65536 个位模式的 roundtrip、HiFloat8 全 256 个值的 decode,以及 ±0、±Inf、NaN、subnormal 的边界场景
点击参与CANN开源开发者满意度有奖调研
PyPTO Professional 的赌注是:算子开发者应该把时间花在「切多大的块、开几级流水、Buffer 怎么摆」上,而不是花在「这个 offset 算对了吗、这个 event id 配对了吗」上。前者是创造性的、决定性能上限的工作;后者是机械的、只决定你今晚能不能下班的工作。PyPTO Professional 把后者全部接管,同时一寸不让地把前者留给你——因为想摸到理论峰值 0.9x 以
在 AI 大模型时代,模型部署时会遇到容量压力、带宽与吞吐压力和工程适配压力。同时,本可以收敛成一条工具链的工作被分散在各个流程中,进而导致在适配不同模型时做重复工作。如何低成本的部署模型,如何把模型量化收敛成一条统一的工作流,是这个时代需要解决的问题。AMCT-LLM 是一款面向大语言模型低比特量化的模型压缩工具,将模型适配、精度评估、量化优化与部署导出收敛为统一工作流。
CANN 全面开源开放,致力于为开发者构建统一、高效的算力使能平台,助力 AI 应用创新与加速落地。为进一步促进区域开发者交流、共建 CANN 生态,CANN 开源社区联合 AtomGit 正式发起「CANN 开发者 Meetup」南京站。
CANNBot-DSL正是基于此考虑:把那些复杂、易错、却又不左右性能的动作逐一建模,沉淀为一层架设在昇腾稳定Ascend C之上的软件抽象,让 CANNBot 彻底从繁冗细节中解放出来,回到算法与数据流的主场,心无旁骛,尽展所长。为突破Agent开发复杂高性能算子的各类难题,CANNBot-DSL方案通过昇腾硬件友好的协程范式、框架自动管理同步、Agent友好的API封装、尾块自动处理、性能优化
用 CANNBot去写高性能复杂算子时,拦住它的从来不是算法,而是一堆"天生对Agent不友好"的实现细节:为榨干多级流水而生的NBuffer、核内核间稍有不慎就出错的同步原语、各种Layout堆出来的复杂地址计算、还有因为极致性能而引入的私有格式。它们与算法无关,但也是Agent生成复杂算子最容易出错的主要原因。面对这些复杂的细节,当前的大模型能力、提示词和skills还无法
为什么写这篇文章? 随着大模型训练需求的爆发式增长,分布式训练已成为AI开发者的必备技能。作为CANN生态中的核心通信组件,HCCL承担着多机多卡训练中数据同步的关键任务。本文基于gitcode平台上的两台NPU Notebook,对HCCL进行了完整的体验、测试与评测,旨在帮助开发者: 了解HCCL的核心能力:它能为分布式训练带来什么价值?验证实际性能表现:在真实环境中的通信效率如
5月16日-17日,第九届信息技术新工科产学研联盟年会暨信息技术领域产学合作论坛在天津隆重召开。大会由信息技术新工科产学研联盟、中国软件行业协会主办,华为技术有限公司协办,南开大学承办。联盟理事单位、工委成员单位等全国各地专家学者、教育界和企业界代表共400余人参会。华为CANN领域总经理邵立欣发表主题演讲,分享《CANN开源开放,助力高校培养AI开发者》。 本届年会开幕式由联盟副理事
CANN开源
——CANN开源
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net