阅读:基于深度学习的红外与可见光图像融合综述: 发展与展望
·
基于深度学习的红外与可见光图像融合综述:发展与展望-期刊-万方数据知识服务平台
期刊名称:控制与决策
期刊级别:EI
目录
一、引言
1.1. 研究目的和作用
可见光具有丰富纹理和高分辨率但易受环境因素影响。
红外光对环境因素不敏感但是细节表达不足。
IVIF旨在融合图像源之间的互补信息,更好地理解和分析图像信息。
1.2. 传统IVIF方法
- 基于多尺度变换
- 基于子空间
- 基于稀疏表示
- 基于显著性
- 其他
困境
特征提取不充分,且融合规则过于复杂。
二、基于深度学习的IVIF方法
2.1. 基于卷积神经网络(CNN)的IVIF方法

原理
采用卷积进行特征提取,构建特征金字塔进行多模态特征交互融合。通过上采样进行特征重构计算损失。
特点
大多数基于现有体系如Yolo,Fast-R-CNN,主要是在融合和检测上做创新。
无需手动设置规则,直接从源图像学习特征,且泛化能力强。
相关成果
| 引用 | 适用任务 | 有监督 | 端到端 | 目标与成果 |
|---|---|---|---|---|
| [9] | IVIF | √ | – | 首次用 CNN 做 IVIF,构建金字塔,多尺度融合显著/纹理区域。 |
| [10] | 通用 | √ | √ | 迁移 ResNet 浅层特征,利用预训练提升特征抽取能力。 |
| [11] | 通用 | – | √ | 引入密集特征流,增强局部与全局结构表达。 |
| [12] | 通用 | – | √ | 可持续学习框架,不同融合任务共享模型避免遗忘。 |
| [13] | IVIF | – | √ | 采用残差密集模块,改善细节提取和结构保持。 |
| [14] | IVIF | √ | √ | 显著性引导的特征掩码,聚焦关键区域,强化显著目标。 |
| [15] | 通用 | – | √ | 将融合简化为梯度+强度建模,自适应决策提升可解释性。 |
| [16] | IVIF | √ | √ | 结合语义分割指导融合,提升高级视觉任务表现。 |
| [17] | IVIF | – | √ | 图像分解为公有/私有特征,减少模态冲突增强互补性。 |
| [18] | IVIF | – | √ | 基于光照估计调节可见光退化区域,提升弱光融合质量。 |
| [19] | IVIF | – | √ | 利用渐进式特征传输,增强多层次融合信息流。 |
| [20] | 通用 | √ | √ | 显著性与特征引导联合优化,同时强化目标与细节。 |
| [21] | 通用 | – | √ | 利用记忆单元整合中间特征,增强跨任务稳定性。 |
| [22] | IVIF | – | √ | 引入梯度自适应调节,保持结构与细节平衡。 |
| [23] | IVIF | – | √ | 稀疏残差结构提升显著区域对比度,减少无效纹理。 |
| [24] | IVIF | – | √ | 自适应权重图动态调控融合强度,增强局部信息保持。 |
| [25] | IVIF | – | √ | 利用语义感知分支补充高层语义,强化目标表达。 |
| [26] | IVIF | √ | √ | 引入跨尺度双流结构,强化细节与显著区域协同。 |
| [27] | IVIF | – | √ | 耦合检测/分割任务,双任务约束提升目标可见性。 |
| [28] | 多模态 | – | √ | 引入跨模态特征传播机制,保持结构一致性。 |
| [29] | IVIF | – | √ | 自适应空间融合,抑制噪声并提升纹理清晰度。 |
| [30] | IVIF | √ | √ | 融合-分割联合训练,提升语义一致性与边缘精度。 |
| [31] | IVIF | – | √ | 边缘引导 + 多粒度交互,增强细节与几何结构。 |
| [32] | IVIF | – | √ | 使用伪融合图作为先验,缓和模态差异影响。 |
1.2. 基于自编码器(AE)的IVIF方法

原理
通过对图片的编码阶段对特征进行提取,解码还原图像并计算损失进行更新。
特点
需要先使用大型数据集进行预训练,再进行融合。在无监督训练具有优势。
相关成果
| 引用 | 适用任务 | 有监督 | 端到端 | 目标与成果 |
|---|---|---|---|---|
| [34] | IVIF | – | – | 最早使用AE骨干网络,编码-解码结构重构融合图像。 |
| [35] | IVIF | – | ✓ | 分解源图像低/高频特征,拼接输入解码器生成融合图像。 |
| [36] | IVIF | – | – | 设计多尺度特征提取模块,强化信息传递。 |
| [37] | IVIF | – | – | 对称编码-残差结构,平衡细节与结构信息。 |
| [38] | IVIF | – | – | 多尺度嵌套连接,提升深层特征传递效率。 |
| [39] | IVIF | ✓ | ✓ | 引入自监督与特征自适应思想,双解码器生成融合图像。 |
| [40] | IVIF | – | – | 跨尺度特征融合框架,增强特征层次表达。 |
| [41] | IVIF | – | – | 改进U-Net结构,强化特征对齐与细节保持。 |
| [42] | 通用 | ✓ | – | 引入任务无关特征分离,提升通用性。 |
| [43] | IVIF | – | ✓ | 残差块与分层融合模块结合,提升细节保真度。 |
| [44] | IVIF | ✓ | – | 知识蒸馏框架,利用教师网络引导学生网络融合。 |
| [45] | IVIF | – | – | 多尺度注意力融合结构,改善特征选择与重构。 |
| [46] | IVIF | – | ✓ | 特征级协同学习框架,提升跨模态信息整合。 |
| [47] | 通用 | ✓ | – | 加入持续学习与解耦损失,支持多任务融合。 |
| [48] | IVIF | ✓ | – | 引入显著目标掩膜分离前景/背景,减少冗余信息干扰。 |
| [49] | IVIF | – | ✓ | 通道注意力 + 残差结构增强特征重构。 |
| [50] | IVIF | – | ✓ | 轻量化特征提取 + 多阶段解码,提升效率与质量。 |
| [51] | IVIF | – | ✓ | 深度可解释双编码器 + 循环协同训练,增强语义信息。 |
1.3. 基于GAN的IVIF方法

原理
通过生成器生成近似数据样本,训练判别器进行区分,通过对抗训练迫使前者生成更好的图像。
特点
无标签对抗效果好,训练不稳定,容易不收敛。
相关成果
| 引用 | 适用任务 | 有监督 | 端到端 | 目标与成果 |
|---|---|---|---|---|
| [53] | IVIF | – | ✓ | 首个将 GAN 引入 IVIF,生成器重建融合图像、判别器提升质量,开辟 GAN-IVIF 研究方向。 |
| [54] | IVIF | – | ✓ | 提升对抗生成框架中可见光/红外信息的保持能力,使融合图像纹理更清晰。 |
| [55] | 多模态 | – | ✓ | 引入双判别器分别关注内容与结构差异,改善单判别器无法平衡两模态的问题。 |
| [56] | IVIF | – | ✓ | 在 Wasserstein GAN 框架下提升生成稳定性,并增强可见光纹理的保持。 |
| [57] | IVIF | – | ✓ | 使用注意力机制聚焦显著区域,使融合图像具备更强目标突出性。 |
| [58] | IVIF | – | ✓ | 通过跨模态一致性约束,使生成器更好地对齐红外与可见光结构信息。 |
| [63] | IVIF | – | ✓ | 设计深度生成融合网络,提高纹理保持与红外亮度继承能力。 |
| [64] | 通用 | ✓ | ✓ | 双判别器 + 目标检测协同训练,分别关注红外前景和可见光纹理,使融合与检测互相促进。 |
| [65] | 通用 | – | ✓ | 引入跨域判别器,提高多模态融合的域适应能力,融合结果更稳定。 |
| [66] | IVIF | – | ✓ | 使用对比约束引导生成器保持结构差异,提高细节表现力。 |
| [59] | IVIF | – | ✓ | 从粗到细的多尺度架构 + 边缘引导注意力,减少对严格配准数据的依赖。 |
| [67] | IVIF | – | – | 引入密集特征交互模块,增强细节表达,但未完全端到端。 |
| [68] | IVIF | – | ✓ | 使用多层级融合生成器和纹理强化模块,提升可见光细节保持能力。 |
| [69] | IVIF | – | ✓ | 双流结构结合跨模态特征交互,实现更强互补信息融合能力。 |
| [70] | IVIF | – | ✓ | 采用双注意力模块,增强显著目标与结构纹理。 |
| [62] | IVIF | ✓ | ✓ | 引入显著性监督,使生成器专注红外前景区域,显著提升目标可见性。 |
| [71] | IVIF | – | ✓ | 轻量化对抗生成架构,降低计算量同时保持较好融合质量。 |
| [72] | IVIF | – | ✓ | 对比学习 + 最大特征约束,避免出现两模态“折中图像”,突出互补信息并抑制冗余。 |
1.4. 基于Transformer的IVIF方法

原理
Transformer 采用 自注意力机制(Self-Attention),能够捕获远距离依赖关系。
特点
擅长建模全局依赖,支持多分支结构,对高级视觉任务友好,计算量较高。
相关成果
| 引用 | 适用任务 | 有监督 | 端到端 | 目标与成果(精简概括) |
|---|---|---|---|---|
| [76] | IVIF | – | – | 首个将 Transformer 引入 IVIF,采用双分支 Transformer 提取两模态全局特征。 |
| [77] | IVIF | – | ✓ | 通过 Transformer 改善模态间关系建模,提升融合质量。 |
| [78] | 通用 | – | ✓ | 引入移位窗口机制(Swin Transformer),实现域内全局信息整合与跨域交互。 |
| [79] | IVIF | – | – | 采用轻量化 Transformer 提取多尺度特征,提升边缘保持能力。 |
| [80] | IVIF | – | ✓ | 引入深度 Token 表征结构,加强重要区域的关注。 |
| [81] | IVIF | – | ✓ | 提出多级 Transformer 交互模块,强化全局纹理融合。 |
| [82] | IVIF | – | ✓ | 设计双阶段 Transformer,使模态特征逐步交互与对齐。 |
| [83] | IVIF | – | ✓ | 采用跨模态注意力模块强化特征关联,改善结构保持。 |
| [84] | IVIF | – | – | 使用多头注意力增强远程依赖建模,提升亮度与结构一致性。 |
| [85] | 多模态 | – | ✓ | 采用 Laplacian Pyramid + Transformer,加强多模态细节融合。 |
| [86] | IVIF | – | ✓ | 引入跨模态 Transformer 编码器,提高全局一致性与保真度。 |
| [87] | IVIF | – | ✓ | 通过递归式 Transformer 捕获多尺度远程依赖。 |
| [88] | IVIF | – | ✓ | 加入跨尺度自注意力模块,提高显著区域建模效果。 |
| [89] | IVIF | – | ✓ | 三阶段训练 + 交叉特征 Transformer,融合网络与分割任务相互增强。 |
更多推荐
所有评论(0)