
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
"""细粒度Gradient Checkpointing策略:不是整个Attention作为一个检查点而是按block分层,每B个block保存一个检查点好处:反向时只需重计算B个block,不是整个序列"""self.checkpoint_every = checkpoint_every # 每N个block保存一个检查点"""细粒度检查点前向把序列分成多个block,每checkpoint_e

某团队在昇腾NPU上跑多模态大模型(LLaVA、Qwen-VL等),发现FlashAttention的效果没有纯文本场景那么明显。他们分析了一下原因:多模态模型的文本部分不长(几百个token),但图像部分被tokenize之后有几百到几千个token,这些token之间的关系很复杂——局部token之间关系紧密(如同一图像patch内的token),远距离token之间关系稀疏(如不同图像pat

某团队在昇腾NPU上部署量化后的模型(INT8),发现模型质量下降明显——生成文本的流畅度不如FP16,数学计算的正确率也下降了。他们试过GPTQ量化,效果稍好但仍然有明显损失。问题出在量化的策略上。GPTQ和标准INT8量化都只看权重的分布,没有考虑激活值(activation)的分布。权重分布均匀,但激活值的分布差异很大——某些权重虽然数值小,但对应的激活值很大,这些权重如果被粗量化,会严重影

某团队在昇腾NPU上部署量化后的模型(INT8),发现模型质量下降明显——生成文本的流畅度不如FP16,数学计算的正确率也下降了。他们试过GPTQ量化,效果稍好但仍然有明显损失。问题出在量化的策略上。GPTQ和标准INT8量化都只看权重的分布,没有考虑激活值(activation)的分布。权重分布均匀,但激活值的分布差异很大——某些权重虽然数值小,但对应的激活值很大,这些权重如果被粗量化,会严重影

某团队在昇腾NPU上部署量化后的模型(INT8),发现模型质量下降明显——生成文本的流畅度不如FP16,数学计算的正确率也下降了。他们试过GPTQ量化,效果稍好但仍然有明显损失。问题出在量化的策略上。GPTQ和标准INT8量化都只看权重的分布,没有考虑激活值(activation)的分布。权重分布均匀,但激活值的分布差异很大——某些权重虽然数值小,但对应的激活值很大,这些权重如果被粗量化,会严重影

某团队在昇腾NPU上部署量化后的模型(INT8),发现模型质量下降明显——生成文本的流畅度不如FP16,数学计算的正确率也下降了。他们试过GPTQ量化,效果稍好但仍然有明显损失。问题出在量化的策略上。GPTQ和标准INT8量化都只看权重的分布,没有考虑激活值(activation)的分布。权重分布均匀,但激活值的分布差异很大——某些权重虽然数值小,但对应的激活值很大,这些权重如果被粗量化,会严重影

FlashAttention通过跨模态Attention、模态融合、图文Embedding映射,让多模态理解的显存降低65%,推理速度提升4.2倍,图文检索准确率提升11.8%。在昇腾NPU上,还有Cube/Vector并行、达芬奇架构感知模态融合、零拷贝跨模态数据传输等独有优化。如果你在做多模态理解(比如图文问答、图文检索、视觉常识推理),需要同时处理文本和图片,试试多模态FlashAttent

FlashAttention通过跨模态Attention、模态融合、图文Embedding映射,让多模态理解的显存降低65%,推理速度提升4.2倍,图文检索准确率提升11.8%。在昇腾NPU上,还有Cube/Vector并行、达芬奇架构感知模态融合、零拷贝跨模态数据传输等独有优化。如果你在做多模态理解(比如图文问答、图文检索、视觉常识推理),需要同时处理文本和图片,试试多模态FlashAttent

FlashAttention通过跨模态Attention、模态融合、图文Embedding映射,让多模态理解的显存降低65%,推理速度提升4.2倍,图文检索准确率提升11.8%。在昇腾NPU上,还有Cube/Vector并行、达芬奇架构感知模态融合、零拷贝跨模态数据传输等独有优化。如果你在做多模态理解(比如图文问答、图文检索、视觉常识推理),需要同时处理文本和图片,试试多模态FlashAttent

FlashAttention通过模型量化、知识蒸馏、算子融合,让端侧设备的显存降低93.7%,推理速度提升3.5倍,精度损失只有0.5%。在昇腾NPU(Ascend 310B)上,还有达芬奇架构感知算子融合、动态电压频率调整、零拷贝端侧数据传输等独有优化。如果你在端侧设备(手机、IoT、智能手表)上部署大模型,显存受限(≤8GB),试试端侧FlashAttention。一行代码切换,不用改模型架构








