
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
刚接触昇腾CANN那会,我被大模型推理时的显存占用吓了一跳。跑个 70B 参数模型,光是注意力机制的临时显存就能吃掉几十GB,像是给NPU喂了一头大象。后来在 ops-transformer 仓库里翻到 FlashAttention 算子,才发现这玩意儿本质上是给显存做了一次"断舍离"。
刚接触昇腾CANN那会,我被大模型推理时的显存占用吓了一跳。跑个 70B 参数模型,光是注意力机制的临时显存就能吃掉几十GB,像是给NPU喂了一头大象。后来在 ops-transformer 仓库里翻到 FlashAttention 算子,才发现这玩意儿本质上是给显存做了一次"断舍离"。
刚接触昇腾CANN那会,我被大模型推理时的显存占用吓了一跳。跑个 70B 参数模型,光是注意力机制的临时显存就能吃掉几十GB,像是给NPU喂了一头大象。后来在 ops-transformer 仓库里翻到 FlashAttention 算子,才发现这玩意儿本质上是给显存做了一次"断舍离"。
Ascend C算子开发进阶教程:从优化到实战

MindSpore Transformers与vLLM精度对比及问题定位深度指南

昇腾AI处理器与CANN异构计算架构:深度技术解析与高阶实战

C算子开发入门:从基础到实战

昇腾AI处理器与CANN异构计算架构:深度技术解析与高阶实战

昇腾AI处理器与CANN软件的组合,构建了国产化AI基础设施的核心竞争力:硬件层面提供自主可控的全场景算力,软件层面通过多层次优化实现算力高效释放,二者协同解决了传统AI部署中"算力浪费、开发复杂、落地困难"的三大痛点。未来,随着昇腾生态的不断完善,这一技术底座将为AI产业的自主创新提供更加强劲的动力。作为国产化AI算力的核心载体,昇腾AI处理器的设计理念是"算力按需分配"——边缘端芯片侧重低功耗

MindSpore Transformers与vLLM精度对比及问题定位深度指南








