logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

INT8 量化算子:让大模型在昇腾NPU上“减肥“不“掉肉“

本文介绍了在昇腾NPU上使用INT8量化技术优化大模型推理的方法。通过将FP16模型参数压缩为INT8格式,模型大小减少50%,同时利用NPU的INT8计算单元加速运算。关键优化包括:1) 直接使用INT8权重进行矩阵乘法,避免反量化开销;2) 将量化参数存储在片上内存;3) 对KV Cache进行INT8量化。实验显示,LLaMA-2 7B模型在Atlas 300I Duo上实现吞吐提升56%、

文章图片
#人工智能#c++#scikit-learn +3
INT8 量化算子:让大模型在昇腾NPU上“减肥“不“掉肉“

本文介绍了在昇腾NPU上使用INT8量化技术优化大模型推理的方法。通过将FP16模型参数压缩为INT8格式,模型大小减少50%,同时利用NPU的INT8计算单元加速运算。关键优化包括:1) 直接使用INT8权重进行矩阵乘法,避免反量化开销;2) 将量化参数存储在片上内存;3) 对KV Cache进行INT8量化。实验显示,LLaMA-2 7B模型在Atlas 300I Duo上实现吞吐提升56%、

文章图片
#人工智能#c++#scikit-learn +3
RMSNorm 算子:让 LayerNorm 不再拖后腿

摘要: 在昇腾NPU上运行LLaMA时发现RMSNorm(替代LayerNorm)占8%推理时间,因其标准实现未优化。RMSNorm相比LayerNorm计算量少30%(省去均值计算和β参数),但标准实现存在两次HBM读写和FP16数值不稳定问题。ops-transformer通过融合Kernel(单次HBM访问)、FP32累加和多核并行,将延迟降低67%(从1.8ms至0.6ms),占比从8.2

文章图片
#harmonyos#华为#人工智能 +3
CANN ops-tensor:张量操作算子库的切片与索引优化

本文介绍了PyTorch在昇腾NPU上的优化策略,重点解决非连续张量操作带来的性能问题。通过ops-tensor仓实现了三类张量操作的优化:切片/索引、形状变换和广播/拼接。针对gather算子提出索引预排序和批量读取方案,利用UB内存减少HBM访问。同时分析了reshape与view的区别,建议避免不必要的contiguous操作。还介绍了Blaze后端的JIT编译优化,通过预编译和缓存机制处理

文章图片
#AIGC#人工智能#harmonyos +2
CANN ops-tensor:张量操作算子库的切片与索引优化

本文介绍了PyTorch在昇腾NPU上的优化策略,重点解决非连续张量操作带来的性能问题。通过ops-tensor仓实现了三类张量操作的优化:切片/索引、形状变换和广播/拼接。针对gather算子提出索引预排序和批量读取方案,利用UB内存减少HBM访问。同时分析了reshape与view的区别,建议避免不必要的contiguous操作。还介绍了Blaze后端的JIT编译优化,通过预编译和缓存机制处理

文章图片
#AIGC#人工智能#harmonyos +2
CANN ops-transformer:MC2 通信融合算子怎么加速 MoE 的 All-to-All

MoE专家并行中的MC2通信优化技术通过Merge-Communicate-Split三阶段设计,有效解决了All-to-All通信瓶颈问题。该方法将通信与计算流水线化,在Ascend C平台上实现异步调度,使8卡MoE推理的通信时间占比从30%降至18ms,提升效率28%。其核心创新在于利用状态机轮询专家处理状态,通过HCCL异步通信实现计算与通信重叠,特别适合专家计算量小的场景。随着EP规模扩

文章图片
#transformer#深度学习#人工智能
CANN ops-transformer:MC2 通信融合算子怎么加速 MoE 的 All-to-All

MoE专家并行中的MC2通信优化技术通过Merge-Communicate-Split三阶段设计,有效解决了All-to-All通信瓶颈问题。该方法将通信与计算流水线化,在Ascend C平台上实现异步调度,使8卡MoE推理的通信时间占比从30%降至18ms,提升效率28%。其核心创新在于利用状态机轮询专家处理状态,通过HCCL异步通信实现计算与通信重叠,特别适合专家计算量小的场景。随着EP规模扩

文章图片
#transformer#深度学习#人工智能
CANN ops-transformer:MoE 路由算子的负载均衡策略

MoE模型推理的瓶颈在于路由机制而非计算,主要面临负载不均衡和通信开销两大挑战。负载不均衡源于softmax输出的偏态分布,导致多数token集中于少数专家,现有解决方案包括辅助损失函数和token丢弃策略。在昇腾NPU上,Top-K路由通过Cube/Vector双核架构实现两阶段并行化处理,显著提升效率。Expert Parallel模式下的All-to-All通信则通过MC2融合技术优化,将通

文章图片
#transformer#负载均衡#深度学习
CANN ops-transformer:MoE 路由算子的负载均衡策略

MoE模型推理的瓶颈在于路由机制而非计算,主要面临负载不均衡和通信开销两大挑战。负载不均衡源于softmax输出的偏态分布,导致多数token集中于少数专家,现有解决方案包括辅助损失函数和token丢弃策略。在昇腾NPU上,Top-K路由通过Cube/Vector双核架构实现两阶段并行化处理,显著提升效率。Expert Parallel模式下的All-to-All通信则通过MC2融合技术优化,将通

文章图片
#transformer#负载均衡#深度学习
CANN ops-transformer:MoE 路由算子的负载均衡策略

MoE模型推理的瓶颈在于路由机制而非计算,主要面临负载不均衡和通信开销两大挑战。负载不均衡源于softmax输出的偏态分布,导致多数token集中于少数专家,现有解决方案包括辅助损失函数和token丢弃策略。在昇腾NPU上,Top-K路由通过Cube/Vector双核架构实现两阶段并行化处理,显著提升效率。Expert Parallel模式下的All-to-All通信则通过MC2融合技术优化,将通

文章图片
#transformer#负载均衡#深度学习
    共 48 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择