logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

CANN Transformer加速库ascend-transformer-boost深度实践:昇腾NPU上大模型推理优化的KV Cache管理、算子融合与吞吐调优全记录

大语言模型推理部署是当前AI工程领域的核心挑战之一。Transformer架构的自回归生成机制带来了两个关键性能瓶颈:其一是KV Cache的显存占用随序列长度线性增长,对于70B量级的模型,单个请求的KV Cache可能占用数百GB显存;其二是attention计算中的访存密集型操作成为推理吞吐量的主要限制因素。

文章图片
CANN AMCT模型压缩工具链全貌解析:从训练后量化到稀疏剪枝的昇腾NPU部署管线——INT8/INT4混合精度量化策略与精度损耗诊断实录详解报告

在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的

文章图片
CANN Transformer算子库ops-transformer深度实践:昇腾NPU上Attention计算、位置编码与LayerNorm融合优化的工程实现

• Pympler(http://pythonhosted.org/Pympler/):该库声明支持 Python 2.5,2.6,2.7,3.1,3.2,3.3。objgraph(参考 http://mg.pov.lt/objgraph/)是一个简单的工具,用于创建对象引用的。不幸的是,在使用 Python/C API 的 C 扩展中,引用计数的管理必须使用 Py_INCREF()尽管相当吓人,

文章图片
CANN AMCT模型压缩工具链全貌解析:从训练后量化到稀疏剪枝的昇腾NPU部署管线——INT8/INT4混合精度量化策略与精度损耗诊断实录详解报告

在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的

文章图片
CANN AMCT模型压缩工具链全貌解析:从训练后量化到稀疏剪枝的昇腾NPU部署管线——INT8/INT4混合精度量化策略与精度损耗诊断实录详解报告

在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的

文章图片
CANN AMCT模型压缩工具链全貌解析:从训练后量化到稀疏剪枝的昇腾NPU部署管线——INT8/INT4混合精度量化策略与精度损耗诊断实录详解报告

在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的

文章图片
CANN AMCT模型压缩工具链全貌解析:从训练后量化到稀疏剪枝的昇腾NPU部署管线——INT8/INT4混合精度量化策略与精度损耗诊断实录详解报告

在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的

文章图片
CANN HCCL集合通信库深度实践:昇腾NPU多卡AllReduce通信拓扑优化与HCCS/RoCE带宽调优工程实录

在大规模分布式训练场景中,通信开销往往占据总训练时间的30%至50%,成为制约模型收敛速度的核心瓶颈。当训练规模从单机扩展到数百台昇腾NPU服务器时,梯度同步、参数广播等集合通信操作的效率直接决定了集群的线性加速比能否逼近理论值。CANN(Compute Architecture for Neural Networks)作为昇腾AI处理器的全栈软件平台,其集合通信库HCCL(Huawei Coll

文章图片
CANN HCCL集合通信库深度实践:昇腾NPU多卡AllReduce通信拓扑优化与HCCS/RoCE带宽调优工程实录

在大规模分布式训练场景中,通信开销往往占据总训练时间的30%至50%,成为制约模型收敛速度的核心瓶颈。当训练规模从单机扩展到数百台昇腾NPU服务器时,梯度同步、参数广播等集合通信操作的效率直接决定了集群的线性加速比能否逼近理论值。CANN(Compute Architecture for Neural Networks)作为昇腾AI处理器的全栈软件平台,其集合通信库HCCL(Huawei Coll

文章图片
CANN HCCL集合通信库深度实践:昇腾NPU多卡AllReduce通信拓扑优化与HCCS/RoCE带宽调优工程实录

在大规模分布式训练场景中,通信开销往往占据总训练时间的30%至50%,成为制约模型收敛速度的核心瓶颈。当训练规模从单机扩展到数百台昇腾NPU服务器时,梯度同步、参数广播等集合通信操作的效率直接决定了集群的线性加速比能否逼近理论值。CANN(Compute Architecture for Neural Networks)作为昇腾AI处理器的全栈软件平台,其集合通信库HCCL(Huawei Coll

文章图片
    共 101 条
  • 1
  • 2
  • 3
  • 11
  • 请选择