
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
大语言模型推理部署是当前AI工程领域的核心挑战之一。Transformer架构的自回归生成机制带来了两个关键性能瓶颈:其一是KV Cache的显存占用随序列长度线性增长,对于70B量级的模型,单个请求的KV Cache可能占用数百GB显存;其二是attention计算中的访存密集型操作成为推理吞吐量的主要限制因素。

在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的

• Pympler(http://pythonhosted.org/Pympler/):该库声明支持 Python 2.5,2.6,2.7,3.1,3.2,3.3。objgraph(参考 http://mg.pov.lt/objgraph/)是一个简单的工具,用于创建对象引用的。不幸的是,在使用 Python/C API 的 C 扩展中,引用计数的管理必须使用 Py_INCREF()尽管相当吓人,

在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的

在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的

在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的

在昇腾NPU上进行大模型部署时,模型体积与推理吞吐始终是工程落地的核心矛盾。CANN生态中的AMCT(Ascend Model Compression Toolkit)提供了一套完整的模型压缩工具链,覆盖训练后量化(PTQ)、量化感知训练(QAT)、稀疏剪枝(Sparsity)与知识蒸馏(KD)四大能力。本文基于AMCT开源仓库的实际代码与文档,梳理从Calibration数据采集到量化模型导出的

在大规模分布式训练场景中,通信开销往往占据总训练时间的30%至50%,成为制约模型收敛速度的核心瓶颈。当训练规模从单机扩展到数百台昇腾NPU服务器时,梯度同步、参数广播等集合通信操作的效率直接决定了集群的线性加速比能否逼近理论值。CANN(Compute Architecture for Neural Networks)作为昇腾AI处理器的全栈软件平台,其集合通信库HCCL(Huawei Coll

在大规模分布式训练场景中,通信开销往往占据总训练时间的30%至50%,成为制约模型收敛速度的核心瓶颈。当训练规模从单机扩展到数百台昇腾NPU服务器时,梯度同步、参数广播等集合通信操作的效率直接决定了集群的线性加速比能否逼近理论值。CANN(Compute Architecture for Neural Networks)作为昇腾AI处理器的全栈软件平台,其集合通信库HCCL(Huawei Coll

在大规模分布式训练场景中,通信开销往往占据总训练时间的30%至50%,成为制约模型收敛速度的核心瓶颈。当训练规模从单机扩展到数百台昇腾NPU服务器时,梯度同步、参数广播等集合通信操作的效率直接决定了集群的线性加速比能否逼近理论值。CANN(Compute Architecture for Neural Networks)作为昇腾AI处理器的全栈软件平台,其集合通信库HCCL(Huawei Coll









