logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

FlashAttention与Gradient Checkpointing:显存不够时怎么训练超大模型?

"""细粒度Gradient Checkpointing策略:不是整个Attention作为一个检查点而是按block分层,每B个block保存一个检查点好处:反向时只需重计算B个block,不是整个序列"""self.checkpoint_every = checkpoint_every # 每N个block保存一个检查点"""细粒度检查点前向把序列分成多个block,每checkpoint_e

文章图片
#python#深度学习#机器学习
FlashAttention多模态应用:图像token太多时Attention怎么算?

某团队在昇腾NPU上跑多模态大模型(LLaVA、Qwen-VL等),发现FlashAttention的效果没有纯文本场景那么明显。他们分析了一下原因:多模态模型的文本部分不长(几百个token),但图像部分被tokenize之后有几百到几千个token,这些token之间的关系很复杂——局部token之间关系紧密(如同一图像patch内的token),远距离token之间关系稀疏(如不同图像pat

文章图片
#计算机视觉#人工智能#深度学习
FlashAttention与AWQ量化:模型权重怎么压缩又不掉精度?

某团队在昇腾NPU上部署量化后的模型(INT8),发现模型质量下降明显——生成文本的流畅度不如FP16,数学计算的正确率也下降了。他们试过GPTQ量化,效果稍好但仍然有明显损失。问题出在量化的策略上。GPTQ和标准INT8量化都只看权重的分布,没有考虑激活值(activation)的分布。权重分布均匀,但激活值的分布差异很大——某些权重虽然数值小,但对应的激活值很大,这些权重如果被粗量化,会严重影

文章图片
#人工智能#python
FlashAttention与AWQ量化:模型权重怎么压缩又不掉精度?

某团队在昇腾NPU上部署量化后的模型(INT8),发现模型质量下降明显——生成文本的流畅度不如FP16,数学计算的正确率也下降了。他们试过GPTQ量化,效果稍好但仍然有明显损失。问题出在量化的策略上。GPTQ和标准INT8量化都只看权重的分布,没有考虑激活值(activation)的分布。权重分布均匀,但激活值的分布差异很大——某些权重虽然数值小,但对应的激活值很大,这些权重如果被粗量化,会严重影

文章图片
#人工智能#python
FlashAttention与AWQ量化:模型权重怎么压缩又不掉精度?

某团队在昇腾NPU上部署量化后的模型(INT8),发现模型质量下降明显——生成文本的流畅度不如FP16,数学计算的正确率也下降了。他们试过GPTQ量化,效果稍好但仍然有明显损失。问题出在量化的策略上。GPTQ和标准INT8量化都只看权重的分布,没有考虑激活值(activation)的分布。权重分布均匀,但激活值的分布差异很大——某些权重虽然数值小,但对应的激活值很大,这些权重如果被粗量化,会严重影

文章图片
#人工智能#python
FlashAttention与AWQ量化:模型权重怎么压缩又不掉精度?

某团队在昇腾NPU上部署量化后的模型(INT8),发现模型质量下降明显——生成文本的流畅度不如FP16,数学计算的正确率也下降了。他们试过GPTQ量化,效果稍好但仍然有明显损失。问题出在量化的策略上。GPTQ和标准INT8量化都只看权重的分布,没有考虑激活值(activation)的分布。权重分布均匀,但激活值的分布差异很大——某些权重虽然数值小,但对应的激活值很大,这些权重如果被粗量化,会严重影

文章图片
#人工智能#python
FlashAttention与多模态:图文联合理解实战

FlashAttention通过跨模态Attention、模态融合、图文Embedding映射,让多模态理解的显存降低65%,推理速度提升4.2倍,图文检索准确率提升11.8%。在昇腾NPU上,还有Cube/Vector并行、达芬奇架构感知模态融合、零拷贝跨模态数据传输等独有优化。如果你在做多模态理解(比如图文问答、图文检索、视觉常识推理),需要同时处理文本和图片,试试多模态FlashAttent

文章图片
#人工智能#spring#后端
FlashAttention与多模态:图文联合理解实战

FlashAttention通过跨模态Attention、模态融合、图文Embedding映射,让多模态理解的显存降低65%,推理速度提升4.2倍,图文检索准确率提升11.8%。在昇腾NPU上,还有Cube/Vector并行、达芬奇架构感知模态融合、零拷贝跨模态数据传输等独有优化。如果你在做多模态理解(比如图文问答、图文检索、视觉常识推理),需要同时处理文本和图片,试试多模态FlashAttent

文章图片
#人工智能#spring#后端
FlashAttention与多模态:图文联合理解实战

FlashAttention通过跨模态Attention、模态融合、图文Embedding映射,让多模态理解的显存降低65%,推理速度提升4.2倍,图文检索准确率提升11.8%。在昇腾NPU上,还有Cube/Vector并行、达芬奇架构感知模态融合、零拷贝跨模态数据传输等独有优化。如果你在做多模态理解(比如图文问答、图文检索、视觉常识推理),需要同时处理文本和图片,试试多模态FlashAttent

文章图片
#人工智能#spring#后端
FlashAttention在端侧设备的部署:手机/IoT优化

FlashAttention通过模型量化、知识蒸馏、算子融合,让端侧设备的显存降低93.7%,推理速度提升3.5倍,精度损失只有0.5%。在昇腾NPU(Ascend 310B)上,还有达芬奇架构感知算子融合、动态电压频率调整、零拷贝端侧数据传输等独有优化。如果你在端侧设备(手机、IoT、智能手表)上部署大模型,显存受限(≤8GB),试试端侧FlashAttention。一行代码切换,不用改模型架构

文章图片
#物联网
    共 47 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择