
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文介绍了在昇腾NPU上使用INT8量化技术优化大模型推理的方法。通过将FP16模型参数压缩为INT8格式,模型大小减少50%,同时利用NPU的INT8计算单元加速运算。关键优化包括:1) 直接使用INT8权重进行矩阵乘法,避免反量化开销;2) 将量化参数存储在片上内存;3) 对KV Cache进行INT8量化。实验显示,LLaMA-2 7B模型在Atlas 300I Duo上实现吞吐提升56%、

本文介绍了在昇腾NPU上使用INT8量化技术优化大模型推理的方法。通过将FP16模型参数压缩为INT8格式,模型大小减少50%,同时利用NPU的INT8计算单元加速运算。关键优化包括:1) 直接使用INT8权重进行矩阵乘法,避免反量化开销;2) 将量化参数存储在片上内存;3) 对KV Cache进行INT8量化。实验显示,LLaMA-2 7B模型在Atlas 300I Duo上实现吞吐提升56%、

摘要: 在昇腾NPU上运行LLaMA时发现RMSNorm(替代LayerNorm)占8%推理时间,因其标准实现未优化。RMSNorm相比LayerNorm计算量少30%(省去均值计算和β参数),但标准实现存在两次HBM读写和FP16数值不稳定问题。ops-transformer通过融合Kernel(单次HBM访问)、FP32累加和多核并行,将延迟降低67%(从1.8ms至0.6ms),占比从8.2

本文介绍了PyTorch在昇腾NPU上的优化策略,重点解决非连续张量操作带来的性能问题。通过ops-tensor仓实现了三类张量操作的优化:切片/索引、形状变换和广播/拼接。针对gather算子提出索引预排序和批量读取方案,利用UB内存减少HBM访问。同时分析了reshape与view的区别,建议避免不必要的contiguous操作。还介绍了Blaze后端的JIT编译优化,通过预编译和缓存机制处理

本文介绍了PyTorch在昇腾NPU上的优化策略,重点解决非连续张量操作带来的性能问题。通过ops-tensor仓实现了三类张量操作的优化:切片/索引、形状变换和广播/拼接。针对gather算子提出索引预排序和批量读取方案,利用UB内存减少HBM访问。同时分析了reshape与view的区别,建议避免不必要的contiguous操作。还介绍了Blaze后端的JIT编译优化,通过预编译和缓存机制处理

MoE专家并行中的MC2通信优化技术通过Merge-Communicate-Split三阶段设计,有效解决了All-to-All通信瓶颈问题。该方法将通信与计算流水线化,在Ascend C平台上实现异步调度,使8卡MoE推理的通信时间占比从30%降至18ms,提升效率28%。其核心创新在于利用状态机轮询专家处理状态,通过HCCL异步通信实现计算与通信重叠,特别适合专家计算量小的场景。随着EP规模扩

MoE专家并行中的MC2通信优化技术通过Merge-Communicate-Split三阶段设计,有效解决了All-to-All通信瓶颈问题。该方法将通信与计算流水线化,在Ascend C平台上实现异步调度,使8卡MoE推理的通信时间占比从30%降至18ms,提升效率28%。其核心创新在于利用状态机轮询专家处理状态,通过HCCL异步通信实现计算与通信重叠,特别适合专家计算量小的场景。随着EP规模扩

MoE模型推理的瓶颈在于路由机制而非计算,主要面临负载不均衡和通信开销两大挑战。负载不均衡源于softmax输出的偏态分布,导致多数token集中于少数专家,现有解决方案包括辅助损失函数和token丢弃策略。在昇腾NPU上,Top-K路由通过Cube/Vector双核架构实现两阶段并行化处理,显著提升效率。Expert Parallel模式下的All-to-All通信则通过MC2融合技术优化,将通

MoE模型推理的瓶颈在于路由机制而非计算,主要面临负载不均衡和通信开销两大挑战。负载不均衡源于softmax输出的偏态分布,导致多数token集中于少数专家,现有解决方案包括辅助损失函数和token丢弃策略。在昇腾NPU上,Top-K路由通过Cube/Vector双核架构实现两阶段并行化处理,显著提升效率。Expert Parallel模式下的All-to-All通信则通过MC2融合技术优化,将通

MoE模型推理的瓶颈在于路由机制而非计算,主要面临负载不均衡和通信开销两大挑战。负载不均衡源于softmax输出的偏态分布,导致多数token集中于少数专家,现有解决方案包括辅助损失函数和token丢弃策略。在昇腾NPU上,Top-K路由通过Cube/Vector双核架构实现两阶段并行化处理,显著提升效率。Expert Parallel模式下的All-to-All通信则通过MC2融合技术优化,将通








