目录

一、问题来源

二、基本原理理解

2.1. 本质理解

2.2. 结构剖析

2.3. 结构功能

2.3.0.输入

2.3.1.数据预处理

2.3.2.特征提取

2.3.3.特征交互与融合

2.3.4.特征重构

2.3.5.监督策略

2.3.6.损失设计

2.3.7.优化更新

2.4. 框架设计目标

三、各类方法对比

3.1. 分类思路 

3.2. 框架家族

3.2.1. CNN(Convolutional neural network,卷积神经网络)

3.2.2. AE(Autoencoder,自编码器)

3.2.3. GAN(Generative Adversarial Network,生成对抗网络)

3.3. 框架家族横向对比

3.4. 组件家族

3.4.1. ACF(Attention-based Component Family,基于注意力的组件家族)

3.4.2. SSCF(State-Space Component Family,基于状态空间的组件家族)

3.4.3. GCF(Graph-based Component Family,基于图结构的组件家族)

3.4.4. FACF(Function-Approximation Component Family,基于函数逼近的组件家族)

3.5. 组件家族横向对比

3.6. 框架+组件联合实例


 

一、问题来源

        在对IVIF融合为基础的任务学习中,我们经常基于深度学习方法(传统方法需要手动规则,效率低下),而在最近的综述阅读中,文章中经常将DeepLearning的相关方法分类成基于AE、CNN、GAN甚至是Transformer等。这些方法有时候看起来大同小异,因此需要做一个区分和理解。

二、基本原理理解

2.1. 本质理解

        在对于各种方法的理解之前,我们最好有一点基础,至少应该熟悉IVIF的流程。

        笔者认为,对于IVIF任务,过程和操作应该是固定的,在基于深度学习、神经网络的不同的方法本质上都是在完成这个任务,只不过在一些步骤如:数据预处理,损失更新上采用的方法不同。

        总体上还是神经网络那点事。

2.2. 结构剖析

        IVIF任务就是:把红外图和可见光图变成一张“既有红外显著目标、又有可见光纹理细节”的融合图。

        我们可以把几乎所有方法抽象成这7方面:

        而这7方面又可以分为2条主线:

        网络结构体系(内部机制):

        1.输入与预处理

        2.特征提取

        3.特征交互与融合

        4.特征重构

        训练体系(外部机制):

        5.监督策略

        6.损失构建

        7.优化与更新策略

2.3. 结构功能

        图中是对上文提到7大部分的可视化,实现了一个IVIF深度学习的统一框架,主要包含前向推理和训练优化两大部分。

2.3.0.输入

系统接收一对来自不同模态的原始图像:

  • 红外图像(IR):包含显著目标、热辐射信息

  • 可见光图像(VIS):包含纹理、细节、结构信息

这些图像作为整个融合过程的起点。

2.3.1.数据预处理

在进入网络前,原始图像会经过必要的处理,包括:

  • 尺度统一

  • 配准(若需要)

  • 降噪、增强

  • 颜色或强度归一化

该步骤完全位于模型外部,用于获得更稳定可靠的输入。

2.3.2.特征提取

预处理后的图像进入模型内部,由特征提取模块进行编码,包括:

  • 卷积提取局部信息

  • 多尺度卷积或 Res2Net 捕获尺度变化

  • Transformer/Mamba 结构捕获长距离依赖

输出结果为:
多层、多尺度、多通道的深度特征

“网络参数区”通过虚线指向该模块,表示其内部权重在训练中不断更新,从而决定特征提取能力。

2.3.3.特征交互与融合

这一部分是 IVIF 的核心。

融合方法可能包括:

  • 模态内融合:在同一模态内部进行多层特征整合

  • 模态间融合:红外与可见光特征交互,强调互补性

  • 注意力机制:引导网络关注显著目标和重要纹理

  • 掩码/显著性权重图:用于强化关键区域对融合的贡献

最终输出融合后的深度特征表示

2.3.4.特征重构

融合后的特征进入解码器,生成最终的融合图像。
典型方式包括:

  • 卷积解码

  • 反卷积 / 上采样

  • 多层重建结构

输出即为:
融合图像(Fused Image)

2.3.5.监督策略

监督策略不在模型内部,而是定义训练的“学习方式”,例如:

  • 无监督:梯度、强度、结构一致性损失

  • 弱监督:显著性引导、伪 GT

  • 对抗学习:使用 GAN 判别器

  • 多任务监督(语义分割、检测)

监督策略通过虚线影响“损失设计”,决定指导模型学习的信号来源。

2.3.6.损失设计

融合图像会根据监督策略,计算不同的损失,如:

  • 像素强度差损失

  • 梯度/边缘损失

  • 结构(SSIM)损失

  • 私有/共享特征分解损失

  • 对抗损失

  • 任务驱动损失(检测/分割)

损失函数输出“损失结果”,是训练中唯一的反馈信号。

2.3.7.优化更新

损失结果输入优化器(SGD、Adam、AdamW、EMA 机制等),更新模型参数区。
参数区所有权重更新后,会在下一次 forward 中影响:

  • 特征提取

  • 特征交互

  • 特征重构

从而形成完整的“反向传播 → 参数更新 → 前向提升”的训练闭环。

为什么监督策略影响的是损失设计而不是模型本身?

因为:

  • 模型结构是 forward computation graph(前向图)。
  • 而监督策略不管数据流向,只管“训练时你要让模型学什么”。
  • 所以监督策略不会影响模型内部结构。

另外:

  • 监督策略不是“有没有标签”那么简单。
  • 监督策略指的是:训练信号的来源类型以及它如何约束网络学习
  • 常见监督策略的本质含义:
监督策略本质是什么损失如何设计
有监督(supervised)有 ground truthL1/L2/SSIM,直接比较输出和GT
无监督(unsupervised)无GT,需要构造训练信号梯度损失、熵损失、互信息、结构保持
弱监督(weak)部分标签或额外监督信号显著性 mask 损失、伪标签损失
自监督(self-supervised)从输入构造目标对比损失、重构损失、伪融合图损失
对抗监督(GAN)判别器提供学习信号对抗损失(adversarial loss)

所有监督策略最终都变成了“不同的损失形式”。


因此:

监督策略不属于模型结构,而属于训练范式。
它的全部影响都通过“损失函数”传递到模型参数更新中。
因此监督策略影响的是损失设计,而不是前向结构。

为什么损失和优化在模型外,神经网络不应该是模型自优化吗?

对于一个神经网络:

原理上: 一个可微的函数。

功能是:接受输入+做运算(线性/卷积等)+输出结果。

好不好:是损失函数来判断的(必须在模型外)。

怎么改:是优化器来做的(也必须在模型外)。

如果损失优化放在内部:

模型就随时在改变自己,forward 会变得不可预测,会破坏可微性,也无法训练。

2.4. 框架设计目标

        从根源上解决几个常见混乱:

1. Transformer到底算不算IVIF模型?

很多论文把“Transformer IVIF”作为一种“新架构”,但实际上:

  • 它们仍然需要 CNN 编码器

  • 它们仍然需要解码器

  • Transformer 只是插入在 特征交互(节点 3) 而不是全流程

2. Mamba、KAN、GNN都被营销成“大模型框架”,但它们不能独立用在IVIF中。

它们缺乏:

  • 图像重建机制

  • 映射到像素空间的能力

  • 模态配准

  • 解码器

  • 监督信号的设计模板

它们其实只能当作:

        “特征变换器 + 关系建模器”

3.框架可以解释“为什么GAN和AE看似不同但却有共通性”

因为两者都属于 完整模型家族

  • 都有 encoder → latent → decoder

  • 都是像素级重生成任务家族

  • 都决定 IVIF 的主流程结构

三、各类方法对比

3.1. 分类思路 

      在采用统一框架对IVIF方法进行描述后,我们在对各类方法进行对比就不应拘泥于方法的外壳,而是在这些方面细致的做区分,因为很多方法思想其实是相同的。

        我们把这些家族分为两类:框架家族组件家族

        本文的介绍和归纳将基于三个框架家族(卷积神经网络,自编码器,生成对抗网络),四个组件家族(注意力、状态空间、图结构、函数逼近)来验证统一框架的实用性,并且找出他们共同的思想而非受限于表面知识。

        另外它们的特点是,框架家族可以构成一个完整的pipeline,组件家族并不是一种完整的 IVIF 模型,它本质只是用于“特征交互”的组件,一般来说是“模型内部的可插拔算子”。

3.2. 框架家族

        由CNN,AE,GAN组成。

        它们的共同点是:
        可以独立完成从输入→特征编码→特征交互→融合生成→输出的端到端 IVIF 流程。
        这是它们能成为“完整框架”的关键

3.2.1. CNN(Convolutional neural network,卷积神经网络)

本质作用

基于局部卷积、金字塔结构做特征提取与融合,擅长捕获纹理、边缘、局部结构。

为什么属于完整框架?

CNN 自带 encoder → decoder 结构或 encoder-only + 逐像素重构层,
能直接生成融合图像。

典型特征

  • 局部感受野 + 多尺度金字塔

  • 权重共享,计算高效

  • 强纹理保留能力

适用场景

早期 IVIF、大部分轻量化融合方法、实时应用。

3.2.2. AE(Autoencoder,自编码器)

本质作用

通过编码器–解码器结构完成潜空间重构;融合发生在 latent 空间,强调结构一致性与全局约束。

为什么属于完整框架?

AE 天生就是“输入→编码→解码→重建”的体系,非常契合 IVIF pipeline。

典型特征

  • 显式潜空间(latent),可实现低/高频分解

  • 强全局结构约束

  • 适合做内容/亮度一致性

适用场景

医学融合、分解-重构式融合、灰度/亮度一致性要求高的场景。

3.2.3. GAN(Generative Adversarial Network,生成对抗网络)

本质作用

基于生成器–判别器对抗机制,通过判别器隐式学习“什么是更真实的融合图像”。

为什么属于完整框架?

GAN 的 Generator 能直接从多模态输入生成融合图像,
判别器提供训练信号,构成完整的训练机制。

典型特征

  • 可生成更自然、更真实的纹理

  • 对抗损失强化对比度/细节

  • 适合复杂分布建模

适用场景

可见-红外增强、夜视增强、对比度极高的任务。

3.3. 框架家族横向对比

1)数据预处理

家族处理方式特点
CNN 家族基本预处理(归一化、尺度统一、拼接/双分支输入)对输入敏感性低,工程简单
AE 家族通常进行更严格的亮度/结构一致化预处理(如低高频分解、归一化)为编码器提供更稳定的重构条件
GAN 家族经常加入风格、噪声、亮度增强,以提升判别器稳定性处理更灵活,但对训练稳定性影响大

2)特征提取

家族主体结构特性与优势
CNN 家族卷积层 + 多尺度金字塔擅长纹理、边缘、局部结构;速度快
AE 家族Encoder(多层卷积 + 下采样)显式 latent 表达,全局结构一致性强
GAN 家族Generator 的编码部分 / 或条件编码器在对抗信号引导下,特征更“任务导向”

3)特征交互与融合

家族融合方式本质特性
CNN 家族加权、Concat、注意力、多尺度融合可控性强、适用于显式融合策略
AE 家族latent 空间拼接 / 低高频分解再组合强调结构一致性,融合自然但偏平滑
GAN 家族隐式融合(Generator 自动学习联合分布)最“自然”、最逼真,但不可解释性最强

4)特征重构

家族重构机制重构效果特点
CNN 家族上采样、反卷积、卷积恢复像素空间清晰、稳定,但可能缺少全局一致性
AE 家族Decoder 重建 latent → 图像亮度与结构保持最佳,但细节偏弱
GAN 家族Generator 直接生成融合图视觉效果丰富、纹理生动,但易出现伪影

5)监督策略

家族典型监督思路优劣
CNN 家族梯度/结构/熵/亮度等手工监督稳定可靠,但难以学习“自然性”
AE 家族重构误差、结构保持、信息保真稳定、标准化,但不鼓励细节生成
GAN 家族对抗损失 + 内容损失(结构/梯度/亮度)生成细节最强,但训练最不稳定

6)损失设计

家族主要损失组成特点
CNN 家族L1/L2、结构相似度、梯度/边缘损失等注重清晰度、边缘与纹理
AE 家族重构损失 + 低/高频双分支损失注重内容一致性与全局结构
GAN 家族对抗损失 + 感知损失 + 内容损失注重细节表现与自然性,灵活但难训

7)优化更新

家族训练特征稳定性
CNN 家族SGD/Adam + 单路优化最稳定、工程成本最低
AE 家族Encoder–Decoder 联合优化中等难度,收敛性好
GAN 家族G–D 博弈训练 + 学习率细控最不稳定,需要技巧防模式崩塌

3.4. 组件家族

        包括:Attention,State-Space,Graph,Function-Approximation。

        它们不是完整 IVIF 模型,只是“特征交互 / 表达增强”功能模块,如果单从运行上讲是流程中可有可无的。

3.4.1. ACF(Attention-based Component Family,基于注意力的组件家族)

代表性实例

Self-Attention、Cross-Attention、Multi-Head Attention、Swin Transformer Block 等。这些组件在图像处理中被广泛用于跨像素、跨通道或跨模态的全局依赖构建。

机制(原理)

ACF 的核心机制是“注意力加权”,通过 Query–Key–Value 机制计算特征间的匹配度,再以权重形式重分配特征,从而建立全局、跨模态的显式关联。注意力不受空间位置限制,能够根据任务需要动态聚焦关键区域,实现跨域和跨空间的特征选择。

作用(在 IVIF 中的角色)

主要用于实现显式跨模态交互。红外图像的热源特征与可见光的纹理区域可以通过自注意力或交叉注意力的加权机制进行互补,使模型更好地捕获显著性与细节在视觉上的协同关系。

插入框架的位置

主要插入于3.特征交互与融合环节,用于增强跨模态层的特征交互能力。有时也可用于2.深层特征提取阶段作为高级编码模块。

3.4.2. SSCF(State-Space Component Family,基于状态空间的组件家族)

代表性实例

Mamba Block(S6)、线性 RNN(Linear-RNN)、Gated SSM(GSSM)等模块均属于该家族。这些组件依赖状态空间模型结构进行信息递推,比注意力更轻量、更连续。

机制(原理)

SSCF 基于“隐状态递推”机制。通过状态空间模型(State-Space Model),组件以线性或选择性的方式更新内部状态,使特征在序列中自然传播,不依赖注意力的全局匹配计算。在图像任务中,特征被视为二维序列,状态递推能够自然捕获长程依赖。

作用(在 IVIF 中的角色)

承担 连续结构信息的传播器 角色。它能够平滑且一致地在空间和通道维度上传递信息,使红外与可见光的特征在局部到全局之间产生连续均衡的融合效果,是 Transformer 的轻量替代方案。

插入框架的位置

主要插入于3.特征交互与融合,用于在不增加计算量的情况下增强跨模态特征的长程依赖建模。部分任务中也可进入4.特征重构,用作连续特征生成器。

3.4.3. GCF(Graph-based Component Family,基于图结构的组件家族)

代表性实例

典型实例包括 GCN(图卷积层)、GAT(图注意力层)、Patch-Graph 模块、Dual-Graph Fusion 模块等。它们都将图像区域视为节点,建模区域之间的拓扑关系。

机制(原理)

GCF 的机制基于“节点—边”结构的图信号传播。通过在图结构上执行卷积或注意力,组件可以根据邻域拓扑和图结构信息传播特征,使模型在捕获局部与整体结构时更具方向性和结构一致性。

作用(在 IVIF 中的角色)

作为 空间拓扑关系建模器,适合处理轮廓、结构和语义区域的一致性问题。在 IR/VIS 融合中,它能保持物体边缘、全局轮廓、行人结构等关键形态,在复杂结构场景(行人、车辆、建筑边缘)中特别有效。

插入框架的位置

常用于3.特征交互与融合,作为增强结构域关联的方法。在保持几何结构时,也可放于4.特征重构,用于增强边缘与轮廓一致性。

3.4.4. FACF(Function-Approximation Component Family,基于函数逼近的组件家族)

代表性实例

包括 KAN(Kolmogorov–Arnold Network Layer)、Neural ODE Block、Implicit Layer、SIREN 等组件,它们均通过连续可学习函数实现非线性表达。

机制(原理)

FACF 通过一维可学习函数叠加、隐式连续函数建模或微分方程求解,实现对特征间非线性关系的逼近。相比传统 MLP,它能更清晰地描述“融合权重如何变化”这一函数形式,使融合过程更具解释性。

作用(在 IVIF 中的角色)

作为 非线性融合映射器,主要用于学习可解释的融合权重,例如“显著性来自 IR,纹理来自 VIS”的非线性组合规则。适合对融合细节、亮度、纹理等进行数值映射与调控。

插入框架的位置

主要位于4.特征重构,用于显式学习融合值/融合函数。也可在3.特征交互与融合中提供小型可解释映射函数补充注意力机制。

3.5. 组件家族横向对比

组件家族核心机制在 IVIF 中的作用插入框架位置
ACF利用 Q–K–V 显式建模全局依赖与跨模态匹配。提供红外与可见光特征的显式对齐与显著性增强。2/3
SSCF通过隐状态递推实现连续长程依赖传播。以轻量方式保持跨模态特征的连续结构关联。3/4
GCF基于节点—边拓扑关系进行空间结构传播。保持轮廓、边缘等结构一致性,实现区域级跨模态关联。3/4
FACF用可学习连续函数实现非线性融合映射。学习可解释的融合权重与显著性–纹理组合规则。3/4

3.6. 框架+组件联合实例

步骤AE 框架 + Attention 组件(示例 1)CNN 框架 + Graph 组件(示例 2)
0. 输入可见光、红外 可见光 、红外
1. 数据预处理归一化、对齐、直方图均衡(可选)得到 同左,得到
2. 特征提取(框架)AE Encoder:CNN Backbone:
3. 特征交互(组件)Cross-Attention(ACF 组件):Graph 模块(GCF 组件):构建图 (G=(V,E))
4. 特征重构(框架)AE Decoder:CNN Decoder(如 UNet 上采样):
5. 监督策略导向损失(保留红外目标)、纹理保持、梯度损失目标区域加权损失(红外显著性)、梯度损失、纹理保持损失
6. 损失设计
7. 优化更新SGD/Adam,基于损失反向更新 Encoder/Decoder + Attention同左,更新 CNN Backbone + GraphConv + Decoder
框架家族归属AE(框架) + ACF(组件)CNN(框架) + GCF(组件)
落位总结AE 提供 encode–decode,Attention 专注跨模态特征交互CNN 提供 backbone–decoder,Graph 提供区域结构关系建模

 

更多推荐