CBAM（Convolutional Block Attention Module）

图解：将输入的feature map经过两个并行的MaxPool层和AvgPool层，将特征图从C*H*W变为C*1*1的大小，然后经过Share MLP模块，在该模块中，它先将通道数压缩为原来的1/r（Reduction，减少率）倍，再扩张到原通道数，经过ReLU激活函数得到两个激活后的结果。该模块由通道注意力模块和空间注意力模块两部分组成，能够分别关注输入特征图的通道信息和空间信息，进而提升模

mvnmvn

1534人浏览 · 2024-05-13 19:16:08

mvnmvn · 2024-05-13 19:16:08 发布

CBAM（Convolutional Block Attention Module）是轻量级的卷积注意力模块，它结合了通道和空间的注意力机制模块，用于增强卷积神经网络（CNN）的特征表达能力。该模块由通道注意力模块和空间注意力模块两部分组成，能够分别关注输入特征图的通道信息和空间信息，进而提升模型对于重要特征的关注度。

在通道注意力模块中，CBAM通过全局平均池化和最大池化操作捕获通道间的依赖关系，生成两个通道描述子。这两个描述子随后通过共享的全连接层和ReLU激活函数进行变换，再经过Sigmoid函数得到通道注意力权重。这些权重与原始特征图相乘，实现通道维度的特征重标定。

空间注意力模块则关注特征图的空间位置信息。它首先对特征图进行通道维度的平均池化和最大池化操作，生成两个空间描述子。这两个描述子经过一个卷积层进行融合，再通过Sigmoid函数得到空间注意力权重。这些权重与原始特征图相乘，实现对空间位置的特征重标定。

CBAM模块可以轻松地嵌入到现有的卷积神经网络架构中，如ResNet、VGG等，通过增强模型的注意力能力，提升其在图像分类、目标检测等任务上的性能。同时，CBAM还具有良好的可解释性，有助于理解模型在决策过程中的关注点，为深度学习模型的可视化和解释提供了有力的工具

上图可以看到，CBAM包含CAM（Channel Attention Module）和SAM（Spartial Attention Module）两个子模块，分别进行通道和空间上的Attention。这样不只能够节约参数和计算力，并且保证了其能够做为即插即用的模块集成到现有的网络架构中去

一、通道注意力Channel attention module（CAM）

相同视角下，取不同的池化值，然后就是通道的压缩及扩展，最后通过sigmoid得到最终权重。其实这里模式很像SE，但也不能照搬SE，所以用了个多分支。

图解：将输入的feature map经过两个并行的MaxPool层和AvgPool层，将特征图从C*H*W变为C*1*1的大小，然后经过Share MLP模块，在该模块中，它先将通道数压缩为原来的1/r（Reduction，减少率）倍，再扩张到原通道数，经过ReLU激活函数得到两个激活后的结果。将这两个输出结果进行逐元素相加，再通过一个sigmoid激活函数得到Channel Attention的输出结果，再将这个输出结果乘原图，变回C*H*W的大小。

通道注意力公式：

二、空间注意力Spatial attention module（SAM）

刚才那个是通道上的压缩及放缩，那这里就是空间特征图上，依然采用两种池化方式。

图解：将Channel Attention的输出结果通过最大池化和平均池化得到两个1*H*W的特征图，然后经过Concat操作对两个特征图进行拼接，通过7*7卷积变为1通道的特征图（实验证明7*7效果比3*3好），再经过一个sigmoid得到Spatial Attention的特征图，最后将输出结果乘原图变回C*H*W大小。

空间注意力公式：

北京朝阳AI社区

更多推荐

【AI 智能体】Coze 实战详解：AI 数字人视频智能体的异步回调机制配置

状态字段通常包括"pending"、"processing"、"completed"和"failed"等值。任务队列将每个请求封装为独立任务，分配唯一标识符便于跟踪。自动化测试保障功能正确性，单元测试覆盖核心逻辑，集成测试验证组件协作。指数退避算法适合处理暂时性故障，首次重试间隔设置为5秒，后续每次间隔加倍直至上限。安全机制可采用HMAC签名验证，请求头携带时间戳和签名。任务队列负责管理视频生成请

北京朝阳AI社区

【AI 智能体】Coze 工作流实战：AI 数字人视频生成的模板化与个性化平衡

通过 Coze 工作流，可以实现模板化与个性化之间的平衡，提升创作效率的同时保持内容的独特性。后期渲染模块整合光影效果和场景合成，提升视频的整体质感。视觉风格参数包括色彩饱和度、对比度和锐度等，可微调视频的画面质感。企业宣传场景中，可快速生成统一风格的介绍视频，同时针对不同地区调整语言和文化元素。教育培训领域，同一课程内容可适配不同年龄段学员的接受特点，改变讲解方式和辅助视觉元素。信息密度参数决定