logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

FlashAttention:让大模型在昇腾NPU上快起来的秘密

FlashAttention在ops-transformer里的实现,核心思想是分块计算 + online softmax + L1 Buffer复用。三个关键收益显存从O(N²)降到O(N)——不存中间矩阵能跑更长序列——从2048扩展到32768延迟下降70%+——减少HBM读写一句话说清楚:FlashAttention就像请客吃饭,不用把所有菜同时摆桌上——炒一个吃一个,桌子(显存)只要够放

文章图片
#c语言#开发语言#算法
ascend-transformer-boost实战:大模型推理的“流水线魔法“

把"点菜式"调用变成"套餐式"融合,减少HBM读写。LLaMA推理:整层融合,吞吐翻3倍动态shape:一次编译,多种shape复用多精度推理:自动选择最优精度,平衡性能和精度一句话说清楚:ops-transformer是"原材料",ATB是"预制菜"。预制菜不是原料更好,而是加工流程优化了——中间步骤不写回HBM,直接在片上传递。昇腾NPU上跑大模型推理,ATB是生产环境首选。ops-trans

文章图片
#transformer#深度学习#人工智能
FlashAttention:让大模型在昇腾NPU上快起来的秘密

FlashAttention在ops-transformer里的实现,核心思想是分块计算 + online softmax + L1 Buffer复用。三个关键收益显存从O(N²)降到O(N)——不存中间矩阵能跑更长序列——从2048扩展到32768延迟下降70%+——减少HBM读写一句话说清楚:FlashAttention就像请客吃饭,不用把所有菜同时摆桌上——炒一个吃一个,桌子(显存)只要够放

文章图片
#c语言#开发语言#算法
深入理解 Ascend C:华为昇腾 AI 芯片的高效算子开发语言

Ascend C 是华为为昇腾 AI 处理器(如 Ascend 910B、310P 等)量身打造的高性能 C++ 扩展语言。它并非一门全新的编程语言,而是基于标准 C++17/20,通过引入一系列内置函数(Intrinsics)内存管理原语和并行编程模型,使开发者能够直接操作昇腾芯片的计算单元(如 AI Core 中的 Cube 单元、Vector 单元)和片上内存(如 Unified Buffe

文章图片
#人工智能#开发语言#c语言
ascend-transformer-boost实战:大模型推理的“流水线魔法“

把"点菜式"调用变成"套餐式"融合,减少HBM读写。LLaMA推理:整层融合,吞吐翻3倍动态shape:一次编译,多种shape复用多精度推理:自动选择最优精度,平衡性能和精度一句话说清楚:ops-transformer是"原材料",ATB是"预制菜"。预制菜不是原料更好,而是加工流程优化了——中间步骤不写回HBM,直接在片上传递。昇腾NPU上跑大模型推理,ATB是生产环境首选。ops-trans

文章图片
#transformer#深度学习#人工智能
hccl:让分布式训练快起来的秘密

hccl是昇腾CANN社区的集合通信库,核心价值是把分布式训练的allreduce延迟降低3.2倍——从38ms降到12ms,带宽利用率从60%提升到92%,还支持通信和计算重叠、梯度压缩。核心优化技术Ring-AllReduce算法优化:带宽利用率从60%提升到92%,allreduce延迟降低35%通信和计算重叠:allreduce和反向传播并行,allreduce延迟隐藏在计算里,训练吞吐提

文章图片
#分布式#python#深度学习
hccl:让分布式训练快起来的秘密

hccl是昇腾CANN社区的集合通信库,核心价值是把分布式训练的allreduce延迟降低3.2倍——从38ms降到12ms,带宽利用率从60%提升到92%,还支持通信和计算重叠、梯度压缩。核心优化技术Ring-AllReduce算法优化:带宽利用率从60%提升到92%,allreduce延迟降低35%通信和计算重叠:allreduce和反向传播并行,allreduce延迟隐藏在计算里,训练吞吐提

文章图片
#分布式#python#深度学习
ops-math:让昇腾NPU上的随机数又快又准

ops-math是昇腾CANN社区的数学类基础算子库,核心价值是把随机数生成在昇腾NPU上的性能提升3倍——生成速度从12.5ms降到4.2ms,支持固定seed保证可复现,还支持多种分布和融合优化。核心优化技术PRNG状态在NPU侧维护:省掉host↔NPU拷贝,快3倍查表法代替Box-Muller:快10倍随机数生成和后续算子融合:省掉HBM读写,快3.4倍性能收益随机数生成耗时:12.5ms

文章图片
#算法#开发语言#深度学习 +1
ops-math:让昇腾NPU上的随机数又快又准

ops-math是昇腾CANN社区的数学类基础算子库,核心价值是把随机数生成在昇腾NPU上的性能提升3倍——生成速度从12.5ms降到4.2ms,支持固定seed保证可复现,还支持多种分布和融合优化。核心优化技术PRNG状态在NPU侧维护:省掉host↔NPU拷贝,快3倍查表法代替Box-Muller:快10倍随机数生成和后续算子融合:省掉HBM读写,快3.4倍性能收益随机数生成耗时:12.5ms

文章图片
#算法#开发语言#深度学习 +1
GEMM:LLM推理慢,不一定是attention的锅

GEMM是LLM推理的核心瓶颈,60-70%的算子时间花在矩阵乘法上。优化GEMM比优化attention更能提升整体吞吐。GEMM慢的根本原因:HBM带宽远低于计算吞吐,数据喂不进去。ops-blas的解法:三层分块(Panel分块→K方向分块→Tensor Core微操),把数据放进L1,减少HBM访问。性能收益ops-blas GEMM比朴素实现快150倍量化版比FP16再快3-4倍达到昇腾

文章图片
#人工智能#深度学习#算法
    共 43 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择