基于深度学习的遥感领域自适应方法:一项综合综述
摘要
—领域自适应是遥感中一项至关重要且日益重要的任务,旨在将知识从一个源域迁移到一个分布不同的目标域。它在各种现实世界应用中具有广泛的应用,包括遥感要素解译、生态环境监测以及城乡规划。然而,由于数据的差异,如地面采样距离的变化、来自不同传感器的成像模式、地理景观和环境条件,遥感中的领域自适应带来了重大挑战。近年来,深度学习已成为特征表示和跨领域知识迁移的强大工具,因此在遥感任务中得到了广泛应用。在本文中,我们对遥感中基于深度学习的领域自适应的重要进展进行了全面综述。我们首先介绍了预备知识,以阐明关键概念、数学符号和方法的分类法。然后,我们从多个角度(包括任务分类、输入模式、监督范式和算法粒度)对现有算法进行了组织,为读者提供了对该领域的结构化理解。接下来,我们回顾了常用的数据集,并总结了最先进方法的性能,以提供当前进展的概览。我们还指出了开放性挑战和潜在方向,以指导遥感领域自适应的未来研究。与之前的综述相比,本工作涵盖了遥感中更广泛的领域自适应任务,而不仅仅集中在少数子领域。它还提出了一个系统的分类法,提供了对该领域更全面和有组织的理解。总体而言,本综述可以激励研究社区,促进理解,并指导该领域的未来工作。
索引词—领域自适应,遥感,深度学习,综合综述。
I. 引言
遥感(RS)技术已在各种现实世界应用中得到广泛应用,包括遥感要素解译[1]-[3]、生态环境监测[4]、[5]、城乡规划[6]–[8]等。在过去的十年中,深度学习的发展,如深度卷积神经网络[9]-[11]、Transformer[12]、[13]和Mamba[14]-[16],显著加速了遥感应用的发展。然而,它们的有效性通常依赖于成本高昂且劳动密集的带有注释的训练样本,这些样本需要充分覆盖复杂的场景。在实际场景中,此类样本的稀缺性常常无法充分解决训练(源)和测试(目标)图像之间的差异,从而导致性能显著下降。这种领域偏移现象以及源域和目标域之间的后续差距带来了重大挑战。为了缓解这一问题并有效弥合领域差距,遥感领域的自适应方法已成为一个关键的研究课题。这些方法致力于增强遥感模型的泛化能力,使其能够在多样且未见过的领域中稳健地执行,从而克服由不足和有偏的训练数据带来的局限性。
基于深度学习的领域自适应方法旨在使用源数据集训练模型,然后将其能力迁移到目标数据集上以生成准确的预测。在遥感场景领域,以下几个方面的挑战依然存在。(1)由不同地面采样距离引起的严重变化。如图1(a)所示,以不同地面采样距离捕获的图像中的“汽车”等物体表现出明显的特征差异。(2)由于使用不同成像模式导致源图像和目标图像之间某些类别的差异。如图1(b)所示,“树木”的颜色在R-G-B和IR-R-G图像之间有所不同。(3)不同地理景观下相同类别的差异。如图1©所示,农村和城市的“建筑物”展现出不同的建筑模式。(4)由于不同环境因素(天气条件、光照、阴影等)导致的大领域偏移。图1(d)显示了有雾和无雾的“火车站”场景的对比。总的来说,这些挑战导致了不同程度的数据分布差异,从而在源域和目标域图像之间产生了领域偏移问题。

为了减轻遥感场景中源图像和目标图像之间的领域偏移并弥合领域差距,已经提出了许多领域自适应方法。在深度学习时代之前,领域自适应方法主要集中在传统方法上[17],例如不变特征选择[18]-[21]、数据分布自适应[22]-[25]等,目的是调整源域和目标域之间的分布差异。在过去的十年中,深度学习[26]、[27],特别是深度神经网络的快速发展,促进了遥感领域领域自适应方法的发展。最初,对抗学习成为主要技术[28]-[35],主要用于特征级或图像级对齐。作为另一种显著的技术,自训练在遥感领域自适应任务中引起了相当大的关注[36]-[41]。这种非对抗范式通过为目标域图像生成可靠、一致和类别平衡的伪标签来增强自适应能力。由于对抗学习和自训练从不同角度增强了领域自适应方法的效率,这两种技术的结合已成为一个新的研究焦点[42]-[46]。大型视觉模型(LVMs)的引入,如Segment Anything Model (SAM) [47]、[48],标志着计算机视觉领域的一个革命性时代。利用其在各种场景中卓越的泛化能力,遥感领域有望从领域自适应方法[49]-[51]中获益匪浅。尽管基于LVM的遥感领域自适应方法仍相对未被充分探索,但它仍然揭示了一个重要且有前景的未来研究趋势。
随着最近遥感领域自适应方法的大量涌现,一些综述论文已被提出。值得注意的是,[52]、[53]深入探讨了专门为遥感分类任务量身定制的领域自适应方法。[54]阐明并回顾了遥感领域中无监督领域自适应的概念。由于最近的相关综述仅涵盖到2022年的方法,因此有必要在这个快速发展的领域提供一个更更新的综述。与之前的综述论文相比,我们提供了对最新方法的更新概述。对于各种特定的遥感任务,我们在不同的基准数据集上进行了详细和全面的实验比较。考虑到大型视觉模型(LVMs)预计将成为未来几年的研究焦点,我们将专门探讨基于LVM的领域自适应方法,并概述遥感领域的新兴趋势。
总而言之,本综述的主要贡献可以列举如下。
- 我们对遥感领域自适应方法的最新研究提供了系统性概述。与之前的综述工作相比,我们的研究提供了更广泛的范围和更更新的内容。
- 我们从四个角度(任务分类、输入模式、监督范式和算法粒度)提出了当前遥感领域自适应方法的几种系统分类法。
- 我们强调了在几个关键基准上具有最先进性能的有影响力的工作,为正在进行和未来的研究工作提供了富有洞察力的指导。
- 我们总结了该领域的现有方法,并提出了我们对未来趋势和值得进一步探索的主题的看法。
如图2所示,本文的组织结构如下。在第二节中,我们回顾了遥感领域自适应方法的预备知识,包括“预备知识”和“方法分类法与数学符号”。在第三节中,我们以逐篇论文的方式对现有文献进行了彻底回顾,并从四个角度进行分类。在第四节中,我们首先介绍了基准数据集。然后,我们在各种遥感任务的不同基准数据集上展示了详细的性能比较。在第五节中,我们讨论了未来的研究趋势和主题以及我们的观点。最后,我们在第六节中总结了本综述。

II. 预备知识
如图2所示,我们将首先介绍一些基本符号的预备知识。随后,我们将从四个角度(任务分类、输入模式、监督范式和算法粒度)组织并呈现方法分类法以及不同方法的数学定义。
A. 数学符号
如图2所示,我们对现有方法进行了详细的分类,根据四个角度:任务分类、输入模式、监督范式和算法粒度。具体的方法分类法如图3所示。

表I显示了预备数学符号。对于本综述中关注的四个任务(图3),现有方法总是构建一个模型,使用训练集 (Dtrain)(\mathcal{D}_{train})(Dtrain) 进行优化,并在测试集 (Dtest)(\mathcal{D}_{test})(Dtest) 上评估其性能。这些训练和测试数据集是从一个综合数据集 (D=Dtrain∪Dtest)(\mathcal{D}=\mathcal{D}_{train}\cup\mathcal{D}_{test})(D=Dtrain∪Dtest) 中划分出来的。因此,尽管训练和测试数据集之间可能存在数据分布差异,我们仍然将它们视为来自同一领域的样本。当领域自适应被整合到上述四个任务中时,问题定义将发生显著变化。

对于遥感领域自适应(DA-RS)任务,它总是遇到源数据集 (DS)(\mathcal{D}_{S})(DS) 和目标数据集 (DT)(\mathcal{D}_{T})(DT)。如果源数据集和目标数据集的类别集分别表示为 CS,CT\mathcal{C}_{S},\mathcal{C}_{T}CS,CT,通常情况下,两个集合具有相同数量的类别 (NCS=NCT)(N_{\mathcal{C}_{S}}=N_{\mathcal{C}_{T}})(NCS=NCT)。
DS={DSi}i=1NS,DT={DTi}i=1NT\mathcal{D}_{S}=\{\mathcal{D}_{S}^{i}\}_{i=1}^{N_{S}},\quad\mathcal{D}_{T}=\{\mathcal{D}_{T}^{i}\}_{i=1}^{N_{T}}DS={DSi}i=1NS,DT={DTi}i=1NT
源数据集和目标数据集的第 ithi^{th}ith 个子集分别包含 KSiK_{S}^{i}KSi 和 KTiK_{T}^{i}KTi 个样本,其中 KSi≥0K_{S}^{i}\geq0KSi≥0 和 KTi≥0K_{T}^{i}\geq0KTi≥0。这个过程可以用公式2表示。
DSi={(xSi,j,ySi,j)}j=1KSi,DTi={(xTi,j,yTi,j)}j=1KTi\mathcal{D}_{S}^{i}=\{(\boldsymbol{x}_{S}^{i,j},y_{S}^{i,j})\}_{j=1}^{K_{S}^{i}},\quad\mathcal{D}_{T}^{i}=\{(\boldsymbol{x}_{T}^{i,j},y_{T}^{i,j})\}_{j=1}^{K_{T}^{i}}DSi={(xSi,j,ySi,j)}j=1KSi,DTi={(xTi,j,yTi,j)}j=1KTi
为了优化DA-RS任务的模型,DT\mathcal{D}_{T}DT 被划分为训练和测试子集 (DT−train,DT−test)(\mathcal{D}_{T-train},\mathcal{D}_{T-test})(DT−train,DT−test),其中 DT=DT−train∪DT−test\mathcal{D}_{T}=\mathcal{D}_{T-train}\cup\mathcal{D}_{T-test}DT=DT−train∪DT−test。因此,对于给定的DA-RS任务,训练数据集包括源数据集 DS\mathcal{D}_{S}DS 和目标数据集的训练子集 (DT−train)(\mathcal{D}_{T-train})(DT−train),而测试数据集 Dtest\mathcal{D}_{test}Dtest 仅由 DT−test\mathcal{D}_{T-test}DT−test 组成。这意味着在训练阶段会同时利用 DS\mathcal{D}_{S}DS 和一部分 DT\mathcal{D}_{T}DT。值得注意的是,在训练阶段 DT\mathcal{D}_{T}DT 的比例可能为0,这意味着在某些情况下目标数据集不会用于训练目的。
如公式1和公式2所示,源数据集包含 NSN_{S}NS 个子集,而目标数据集包含 NTN_{T}NT 个子集,并且满足约束条件 NS≥1N_{S}\geq1NS≥1 和 NT≥1N_{T}\geq1NT≥1。这表明两个数据集都至少包含一个子集。
B. 方法分类法
- DA-RS任务的问题定义:如图3所示,本综述主要回顾了四个DA-RS任务,即DA-RSCls、DA-RSSeg、DA-RSDet、DA-RSCD。具体的说明如图4所示。

DA-RSCls。如图4(a)所示,分类器包含一个单一的编码器。在前向传递过程中,源图像和目标图像 (xS,xT ∈ RB×C×H×W)(\boldsymbol{x}_{\boldsymbol{S}},\boldsymbol{x}_{\boldsymbol{T}}\;\in\;\mathbb{R}^{B\times\boldsymbol{C}\times H\times W})(xS,xT∈RB×C×H×W) 被输入到编码器 (fcls(⋅))(f_{cls}(\cdot))(fcls(⋅)) 中以生成预测,如公式3所示。在分类任务中,预测 (PS−cls,PT−cls∈RB×NC)(\boldsymbol{P}_{S-cls},\boldsymbol{P}_{T-cls}\in\mathbb{R}^{B\times N_{C}})(PS−cls,PT−cls∈RB×NC) 表示为各个类别的后验概率。这里,NCN_{C}NC 表示类别的数量。
PS−cls=fcls(xS),PT−cls=fcls(xT)\begin{array}{r}{\boldsymbol{P}_{\boldsymbol{S}-\boldsymbol{cls}}=f_{cls}(\boldsymbol{x}_{\boldsymbol{S}}),\quad\boldsymbol{P}_{\boldsymbol{T}-\boldsymbol{cls}}=f_{cls}(\boldsymbol{x}_{\boldsymbol{T}})}\end{array}PS−cls=fcls(xS),PT−cls=fcls(xT)
为了优化编码器,基本损失 (LDA−cls)(\mathcal{L}_{DA-cls})(LDA−cls) 如公式4所示,其中 Lce\mathcal{L}_{ce}Lce 表示交叉熵损失。基于这种优化范式,现有方法集成了各种损失组件来构建组合损失,包括对抗损失、自训练损失等。
LDA−cls=−1B∑i=1BLce(PS−clsi,PT−clsi,ySi,yTi)\mathcal{L}_{DA-cls}=-\frac{1}{B}\sum_{i=1}^{B}\mathcal{L}_{ce}(\boldsymbol{P}_{S-cls}^{i},\boldsymbol{P}_{T-cls}^{i},y_{S}^{i},y_{T}^{i})LDA−cls=−B1i=1∑BLce(PS−clsi,PT−clsi,ySi,yTi)
DA-RSSeg。如图4(b)所示,分割器采用“编码器-解码器”架构 (fseg(⋅))(f_{seg}(\cdot))(fseg(⋅))。xS,xT\boldsymbol{x}_{S},\boldsymbol{x}_{T}xS,xT 分别通过分割器生成像素级预测 (PS−seg,PT−seg∈RB×NC×H×W)(\boldsymbol{P}_{S-seg},\boldsymbol{P}_{T-seg}\in\mathbb{R}^{B\times N_{C}\times H\times W})(PS−seg,PT−seg∈RB×NC×H×W),如公式5所示。这些预测中的每个像素都代表一个后验概率,从而使语义分割被视为一个像素级分类任务。
PS−seg=fseg(xS),PT−seg=fseg(xT)\begin{array}{r}{\boldsymbol{P}_{\boldsymbol{S}-\boldsymbol{seg}}=f_{seg}(\boldsymbol{x}_{\boldsymbol{S}}),\quad\boldsymbol{P}_{\boldsymbol{T}-\boldsymbol{seg}}=f_{seg}(\boldsymbol{x}_{\boldsymbol{T}})}\end{array}PS−seg=fseg(xS),PT−seg=fseg(xT)
类似于DA-RSCls任务中采用的基本损失函数(公式5),交叉熵损失也被用作优化分割器的基线损失 (LDA−seg)(\mathcal{L}_{DA-seg})(LDA−seg)。该公式如公式6和公式7所示。
LDA−segi=1HW∑h,w=1H,WLce(PS−segi,h,w,PT−segi,h,w,ySi,h,w,yTi,h,w)\mathcal{L}_{DA-seg}^{i}=\frac{1}{H W}\sum_{h,w=1}^{H,W}\mathcal{L}_{ce}(\boldsymbol{P}_{S-seg}^{i,h,w},\boldsymbol{P}_{T-seg}^{i,h,w},y_{S}^{i,h,w},y_{T}^{i,h,w})LDA−segi=HW1h,w=1∑H,WLce(PS−segi,h,w,PT−segi,h,w,ySi,h,w,yTi,h,w)
LDA−seg=−1B∑i=1BLDA−segi\mathcal{L}_{DA-seg}=-\frac{1}{B}\sum_{i=1}^{B}\mathcal{L}_{DA-seg}^{i}LDA−seg=−B1i=1∑BLDA−segi
DA-RSDet。目标检测是一个重大挑战,因为它力求同时定位和分类图像中的目标。通过利用领域自适应,检测器即使面对来自不同数据分布的样本也能实现准确检测。如图4©所示,基本检测器结合了编码器和检测头,这提供了一个“单阶段检测器”和“两阶段检测器”架构的总体概述。
与DA-Cls和DA-Seg任务类似,源图像和目标图像都将被送入检测器 (fdet(⋅))(f_{det}(\cdot))(fdet(⋅)) 并生成最终预测 (PS−det,PT−det)(\boldsymbol{P}_{S-det},\boldsymbol{P}_{T-det})(PS−det,PT−det)。具体来说,在“单阶段检测器”中,这些预测被构造成一个单一的张量,该张量集成了定位和分类结果。相反,在“两阶段检测器”中,预测是从专门用于定位和分类的不同分支生成的。无论检测器类型如何变化,都需要用于边界框的回归损失 (Lreg)(\mathcal{L}_{reg})(Lreg) 和用于实例后验概率的分类损失 (Lcls)(\mathcal{L}_{cls})(Lcls)。总的来说,DA-Det优化的基本损失函数 (LDA−det)(\mathcal{L}_{DA-det})(LDA−det) 可以从公式8到公式10表示。
PS−det=fdet(xS),PT−det=fdet(xT)\begin{array}{r}{\boldsymbol{P}_{S-det}=f_{det}(\boldsymbol{x}_{S}),\quad\boldsymbol{P}_{T-det}=f_{det}(\boldsymbol{x}_{T})}\end{array}PS−det=fdet(xS),PT−det=fdet(xT)
LDA−deti=Lreg(PS−deti,PT−deti,yS−boxi,yT−boxi)+Lcls(PS−deti,PT−deti,yS−clsi,yT−clsi)\begin{aligned}\mathcal{L}_{DA-det}^{i}&=\mathcal{L}_{reg}(\boldsymbol{P}_{S-det}^{i},\boldsymbol{P}_{T-det}^{i},y_{S-box}^{i},y_{T-box}^{i})\\&+\mathcal{L}_{cls}(\boldsymbol{P}_{S-det}^{i},\boldsymbol{P}_{T-det}^{i},y_{S-cls}^{i},y_{T-cls}^{i})\end{aligned}LDA−deti=Lreg(PS−deti,PT−deti,yS−boxi,yT−boxi)+Lcls(PS−deti,PT−deti,yS−clsi,yT−clsi)
LDA−det=−1B∑i=1BLDA−deti\mathcal{L}_{DA-det}=-\frac{1}{B}\sum_{i=1}^{B}\mathcal{L}_{DA-det}^{i}LDA−det=−B1i=1∑BLDA−deti
DA-RSCD。变化检测是遥感中的一项基本任务,旨在检测和分析同一地理区域随时间发生的变化。如图4(d)所示,变化检测模型通过接受图像对作为输入来操作。xA\boldsymbol{x}_{A}xA 和 xB\boldsymbol{x}_{B}xB 分别表示变化前(事件前)和变化后(事件后)的图像。在RSCD任务中,xA\boldsymbol{x}_{A}xA 和 xB\boldsymbol{x}_{B}xB 显示出最小的差异,表明领域偏移程度较低。在DA-RSCD任务中,xA\boldsymbol{x}_{A}xA 和 xB\boldsymbol{x}_{B}xB 表现出显著的领域偏移问题,这通常是由使用不同传感器或不同成像条件引起的。
变化检测器 (fcd(⋅))(f_{cd}(\cdot))(fcd(⋅)) 的架构类似于分割器。xA\boldsymbol{x}_{A}xA 和 xB\boldsymbol{x}_{B}xB 被输入到一个“编码器-解码器”结构中,以生成二进制预测 (Pcd∈RB×NC×H×W)(\boldsymbol{P_{cd}}\in\mathbb{R}^{B\times N_{C}\times H\times W})(Pcd∈RB×NC×H×W),其中 NC=2N_{C}=2NC=2。这个过程在公式11中表示。
Pcd=fcd(xA,xB)\boldsymbol{P_{cd}}=f_{cd}(\boldsymbol{x_{A}},\boldsymbol{x_{B}})Pcd=fcd(xA,xB)
DA-RSCD的优化可以被视为一个二进制分割优化问题。基本损失函数 (LDA−cd)(\mathcal{L}_{DA-cd})(LDA−cd) 的具体公式在公式12中详细说明,其中 Lbce\mathcal{L}_{bce}Lbce 表示二进制交叉熵损失。
LDA−cd=−1BHW∑i=1B∑h,w=1H,WLbce(Pcdi,h,w,yi,h,w)\mathcal{L}_{DA-cd}=-\frac{1}{B H W}\sum_{i=1}^{B}\sum_{h,w=1}^{H,W}\mathcal{L}_{bce}(\boldsymbol{P}_{cd}^{i,h,w},y^{i,h,w})LDA−cd=−BHW1i=1∑Bh,w=1∑H,WLbce(Pcdi,h,w,yi,h,w)
DA-RSCD任务与上述三个DA-RS任务的区别在于,领域偏移问题出现在图像对内部。相反,DA-RSCls、DS-RSSeg和DA-RSDet面临的领域偏移挑战则体现在源数据集和目标数据集之间。

- 不同输入模式的数学定义:在输入模式的分类法中,主要有五种不同类型的DA-RS方法,根据源子集和目标子集的数量进行分类(图3)。具体定义如表II所示。
单源单目标(“一对一”)。当 NSN_{S}NS 和 NTN_{T}NT 都设置为1时,这对应于不同任务上的标准领域自适应配置。在这种模式下,模型被训练以从源域自适应到目标域。
单源多目标(“一对多”)。当 NSN_{S}NS 设置为1而 NTN_{T}NT 设置为大于1的值时,主要目标是开发能够在不同目标域上表现良好的模型。这种模式下的一种典型领域自适应任务被称为领域泛化(DG)。
多源单目标(“多对一”)。当 NSN_{S}NS 设置为大于1的值而 NTN_{T}NT 设置为1时,目标是开发一个模型,该模型可以利用来自多个源域的集体知识来增强模型在未见过的目标域上的泛化能力。在这种情况下,另一个关键挑战是减轻各种源子集之间的领域偏移的不利影响。
多源多目标(“多对多”)。当 NSN_{S}NS 和 NTN_{T}NT 都设置为大于1的值时,任务将变得更加复杂。模型需要有效地优化,以便从多个源域泛化到多个目标域。
无源单目标/多目标(“无对一/多”)。在这种模式下,NTN_{T}NT 设置为大于1的值,而由于数据隐私或传输困难,NSN_{S}NS 在自适应阶段不可用。在上述四种模式中,带注释的源数据都是可访问的。在无源领域自适应中,只有在源数据上预训练的模型是可用的。
- 不同监督范式的数学定义:如图3所示,DA-RS方法主要有三种监督范式。
遥感中的无监督领域自适应(“UDA-RS”)。UDA是遥感领域中一个显著且广泛应用的范式。一般来说,UDA表示目标图像的标签不可用,但这些目标图像仍然可以被纳入训练阶段。在数学上,在公式2中,每个目标样本 (yTi,j)(y_{T}^{i,j})(yTi,j) 被表示为 ‘‘None′′``None''‘‘None′′,如公式13所示。在此设置下,yTy_TyT 在每个任务的损失函数中被表示为空集,如公式4、公式6和公式9所示。
yT=∅,∀i∈[1,NT],j∈[1,KTi],yTi,j→None\boldsymbol{y}_{\boldsymbol{T}}=\boldsymbol{\emptyset},\quad\forall i\in[1,N_{T}],j\in[1,K_{T}^{i}],y_{T}^{i,j}\rightarrow\mathit{None}yT=∅,∀i∈[1,NT],j∈[1,KTi],yTi,j→None
狭义上讲,UDA-RS表示一个典型的单源单目标RS任务,其中 NS=1,NT=1N_{S}=1,N_{T}=1NS=1,NT=1。显然,该范式中使用的方法旨在解决标记目标域样本不足所带来的限制,以及解决高标注成本的问题。
遥感中的半监督领域自适应(“SSDA-RS”)。SSDA是遥感领域的另一个热门话题,旨在通过标记少量目标域样本来提高泛化性能。如公式2所示,目标数据集的每个子集 (DTi)(\mathcal{D}_{T}^{i})(DTi) 包含标记和未标记的样本,其中未标记样本的数量 (KT−ui)(K_{T-u}^{i})(KT−ui) 远大于标记样本的数量 (KT−li)(K_{T-l}^{i})(KT−li)。该范式可以用公式14表示。
DTi={(xTi,l,yTi,l)}l=1KT−li∪{(xTi,u)}u=1KT−ui\mathcal{D}_{T}^{i}=\{(\boldsymbol{x}_{T}^{i,l},y_{T}^{i,l})\}_{l=1}^{K_{T-l}^{i}}\cup\{(\boldsymbol{x}_{T}^{i,u})\}_{u=1}^{K_{T-u}^{i}}DTi={(xTi,l,yTi,l)}l=1KT−li∪{(xTi,u)}u=1KT−ui
其中 KT−li+KT−ui=KTiK_{T-l}^{i}+K_{T-u}^{i}=K_{T}^{i}KT−li+KT−ui=KTi 且 KT−li≪KT−uiK_{T-l}^{i}\ll K_{T-u}^{i}KT−li≪KT−ui。与UDA-RS类似,现有的SSDA-RS方法也主要利用单源单目标输入模式。与UDA-RS相比,SSDA-RS强调从有限的标记样本中探索信息,同时最大化未标记样本的利用。
遥感中的监督领域自适应(“SDA/Finetuning-RS”)。SDA假设两个域的标记样本都是可用的。SDA方法侧重于具有挑战性的情况,即目标域的标记样本数量少于源域中可用的样本数量[52]。在这种情况下,正确使用源域信息和在目标域上进行微调技术对于解决目标问题非常重要。在数学上,该范式可以表示为 [∑i=1NTKTi≪∑i=1NSKSi]\begin{array}{r}{\left[\sum_{i=1}^{N_{T}}K_{T}^{i}\ll\sum_{i=1}^{N_{S}}K_{S}^{i}\right]}\end{array}[∑i=1NTKTi≪∑i=1NSKSi]。
在遥感场景中,从各种传感器(如卫星和无人机)获取数据相对简单,从而导致来自不同领域的数据供应充足。然而,由于广阔的地理土地覆盖,高标注成本的挑战变得更加突出。因此,UDA-RS和SSDA-RS范式更符合实际需求。
- 典型算法的数学定义:如图3所示,DA-RS方法主要由五种典型类型的算法组成。

基于分布度量的方法。基于分布度量的方法主要旨在匹配来自不同域的隐藏特征的分布。如图5和公式15所示,常见的操作是将自适应度量(例如,最大均值差异,MMD)嵌入到神经网络中。
MMD(DS,DT)=∣∣1NS∑i=1NSE(xSi)−1NT∑j=1NTE(xTj)∣∣22\mathcal{MMD}(\mathcal{D}_{S},\mathcal{D}_{T})=||\frac{1}{N_{S}}\sum_{i=1}^{N_{S}}E(\boldsymbol{x}_{S}^{i})-\frac{1}{N_{T}}\sum_{j=1}^{N_{T}}E(\boldsymbol{x}_{T}^{j})||_{2}^{2}MMD(DS,DT)=∣∣NS1i=1∑NSE(xSi)−NT1j=1∑NTE(xTj)∣∣22
DAN[55]是利用深度卷积神经网络在UDA任务中学习跨域可迁移隐藏特征的先驱。它嵌入了MMD度量进行度量。在DAN之后,许多DA-RS任务采用MMD来度量属于不同域的图像的中间特征图之间的分布。
基于对抗学习的方法。对抗学习在DA-RS方法中经常使用,主要包括两种类型:图像级和特征级对抗学习方法。这两种典型的对抗学习范式的说明如图6所示。

图像级对抗学习方法利用图像生成技术,如图像翻译[55]、[57],来同步源图像和目标图像之间的数据分布。这些方法首先应用图像级自适应,然后使用跨域合成数据训练模型。如图1(a)所示,GS→TG_{S\rightarrow T}GS→T 和 GT→SG_{T\rightarrow S}GT→S 负责将源域图像自适应到目标域,反之亦然。同时,DSD_{S}DS 和 DTD_{T}DT 的作用是区分真实源数据和生成器产生的假数据。对于优化,采用对抗损失,如公式16所示。
{Ladv(GS→T,DT)=ExT∼XT[log(DT(xT))]+ExS∼XS[log(1−DT(GS→T(xS)))]Ladv(GT→S,DS)=ExS∼XS[log(DS(xS))]+ExT∼XT[log(1−DS(GT→S(xT)))]\left\{\begin{aligned}{\mathcal{L}_{adv}(G_{S\to T},D_{T})}&{{}=\mathbb{E}_{x_{T}\sim X_{T}}[\log(D_{T}(\mathbf{x_{T}}))]}\\ {}&{{}+\mathbb{E}_{x_{S}\sim X_{S}}[\log(1-D_{T}(G_{S\to T}(\mathbf{x_{S}})))]}\\ {}&{{}}\\ {\mathcal{L}_{adv}(G_{T\to S},D_{S})}&{{}=\mathbb{E}_{x_{S}\sim X_{S}}[\log(D_{S}(\mathbf{x_{S}}))]}\\ {}&{{}+\mathbb{E}_{x_{T}\sim X_{T}}[\log(1-D_{S}(G_{T\to S}(\mathbf{x_{T}})))]}\\ \end{aligned}\right.⎩⎨⎧Ladv(GS→T,DT)Ladv(GT→S,DS)=ExT∼XT[log(DT(xT))]+ExS∼XS[log(1−DT(GS→T(xS)))]=ExS∼XS[log(DS(xS))]+ExT∼XT[log(1−DS(GT→S(xT)))]
为了优化 GS→TG_{S\rightarrow T}GS→T 和 GT→SG_{T\rightarrow S}GT→S,“Min-max”准则被采用,如公式17所示。
{minGS→TmaxDTLadv(GS→T,DT)minGT→SmaxDSLadv(GT→S,DS) \begin{cases}{{\min}_{G_{S\rightarrow T}}{\max}_{D_{T}}\mathcal{L}_{adv}(G_{S\rightarrow T},D_{T})}\\ {}\\ {{\min}_{G_{T\rightarrow S}}{\max}_{D_{S}}\mathcal{L}_{adv}(G_{T\rightarrow S},D_{S})}\\ \end{cases}⎩⎨⎧minGS→TmaxDTLadv(GS→T,DT)minGT→SmaxDSLadv(GT→S,DS)
在这个范式中,重建损失 (Lrec)(\mathcal{L}_{rec})(Lrec) 或循环一致性损失始终与对抗损失一起使用。其公式如公式18所示。
Lrec(GS→T,GT→S)=ExT∼XT[∣∣GS→TGT→S(xT)−xT∣∣a]+ExS∼XS[∣∣GT→SGS→T(xS)−xS∣∣a](18)\small\begin{aligned}{\mathcal{L}_{rec}(G_{S\to T},G_{T\to S})}&{{}=\mathbb{E}_{x_{T}\sim X_{T}}[||G_{S\to T}G_{T\to S}(\mathbf{x_{T}})-\mathbf{x_{T}}||_{a}]}\\ {}&{{}+\mathbb{E}_{x_{S}\sim X_{S}}[||G_{T\to S}G_{S\to T}(\mathbf{x_{S}})-\mathbf{x_{S}}||_{a}]}\\ \end{aligned}(18)Lrec(GS→T,GT→S)=ExT∼XT[∣∣GS→TGT→S(xT)−xT∣∣a]+ExS∼XS[∣∣GT→SGS→T(xS)−xS∣∣a](18)
其中 ∣∣⋅∣∣a||\cdot||_{a}∣∣⋅∣∣a 表示 LaL_{a}La 范数,用作损失函数。在常用范数中,L1L_{1}L1 范数和 L2L_{2}L2 范数尤为普遍。该损失函数旨在鼓励在风格迁移过程中保留结构特性。
特征级对抗学习方法深入研究源风格和目标风格特征之间共享的领域不变特征。这些方法利用特征级对齐策略来解决领域偏移问题。通常,判别器被集成到网络中,以确保中间特征图或输出后验概率的一致性对齐。
如图6(b)所示,E用于特征提取,在大多数场景中它们共享权重。fSf_{S}fS 和 fTf_{T}fT 用于将提取的特征转换为预测。这些模块的设计以及它们是否共享权重可能因具体的DA-RS任务而异。为了优化框架,特征级对抗损失可以在公式19和公式20中描述。
Ladv(E,DF)=ExS∼XS[log(DF(E(xS)))]+ExT∼XT[log(1−DF(E(xT)))]\begin{aligned}{\mathcal{L}_{adv}(E,D_{F})}&{{}=\mathbb{E}_{x_{S}\sim X_{S}}[\log(D_{F}(E(\mathbf{\mathbf{\mathbf{\mathit{x}}}}_{S})))]}\\ {}&{{}+\mathbb{E}_{x_{T}\sim X_{T}}[\log(1-D_{F}(E(\mathbf{\mathbf{\mathbf{\mathit{x}}}}_{T})))]}\\ \end{aligned}Ladv(E,DF)=ExS∼XS[log(DF(E(xS)))]+ExT∼XT[log(1−DF(E(xT)))]
Ladv(E,fS,fT,DP)=ExS∼XS[log(DP(fS(E(xS))))]+ExT∼XT[log(1−DP(fT(E(xT))))](20)\begin{aligned}{\mathcal{L}_{adv}(E,f_{S},f_{T},D_{P})}&{{}=\mathbb{E}_{x_{S}\sim X_{S}}[\log(D_{P}(f_{S}(E(\mathbf{x_{S}}))))]}\\ {}&{{}+\mathbb{E}_{x_{T}\sim X_{T}}[\log(1-D_{P}(f_{T}(E(\mathbf{x_{T}}))))]}\\ \end{aligned}(20)Ladv(E,fS,fT,DP)=ExS∼XS[log(DP(fS(E(xS))))]+ExT∼XT[log(1−DP(fT(E(xT))))](20)
类似于图像级对抗学习中的优化过程(公式17),“min-max”准则也用于优化损失函数,如公式21所示。
{minEmaxDFLadv(E,DF)min{E,fS,fT}maxDPLadv(E,fS,fT,DP) \begin{cases}{\min_{E}\max_{D_{F}}\mathcal{L}_{adv}(E,D_{F})}\\ {}\\ {\min_{\{E,f_{S},f_{T}\}}\max_{D_{P}}\mathcal{L}_{adv}(E,f_{S},f_{T},D_{P})}\\ \end{cases}⎩⎨⎧minEmaxDFLadv(E,DF)min{E,fS,fT}maxDPLadv(E,fS,fT,DP)
基于自训练的方法。作为一种非对抗性的UDA范式,自训练在DA-RS任务中引起了广泛关注。该算法通过生成可靠、一致和类别平衡的伪标签来提升自适应能力。通过使用从目标域派生的高质量伪标签来监督模型,模型可以快速适应目标图像。
自训练机制主要包括两个过程。第一个过程是更新阶段,其中指数移动平均(EMA)技术通常应用于原始网络,称为学生网络。一旦完成EMA更新过程,生成的网络就作为EMA教师。具体来说,在每个训练步骤 ttt,EMA教师的权重通过学生权重的EMA操作进行更新,如公式22所示。
ϕt=αϕt−1+(1−α)θt\phi_{t}=\alpha\phi_{t-1}+(1-\alpha)\theta_{t}ϕt=αϕt−1+(1−α)θt
其中 α\alphaα 表示EMA衰减因子,控制更新速率。ϕt\phi_{t}ϕt 表示第 ttht^{th}tth 步骤时EMA教师的权重。θt\theta_{t}θt 表示同一 ttht^{th}tth 步骤时学生网络的权重。
在更新教师网络的权重后,第二个过程涉及为目标图像生成伪标签并利用这些伪标签进行监督。对于特定的DA-RS任务,输入图像被送入教师网络进行伪标签生成过程,可参考公式3、5、8、11。随后,这些伪标签被视为目标样本的真值,以优化和增强学生网络的性能。
基于集成训练的方法。为了在解决领域偏移问题时提高模型性能,许多领域自适应方法采用了一种集成训练策略,也称为混合训练策略。除了用于优化的基本任务特定损失函数(参考公式4、7、10、12)外,对抗学习在实现一致性对齐方面起着至关重要的作用,而自训练机制主要旨在减轻源训练网络的表示偏差。因此,这两种训练策略是兼容的,将它们与组合损失函数集成可以从不同角度增强模型。
基于大型视觉模型的方法。在DA-RS领域,由于各种因素(图1),领域偏移问题尤为严重。本质上,单个模型由于其有限的泛化能力,往往无法在不同领域中表现良好。大型视觉模型[58]可以有效缓解这一问题。它们的通用表示能力源于在大量样本上的广泛预训练,涵盖了广泛的领域。
最近,DA-RS任务中基于LVM的方法仍然相对未被充分探索。挑战在于如何有效地将LVM的通用能力迁移到特定的下游DA-RS任务,以及如何设计针对基于LVM方法的优化范式。
III. 方法论:一项综述
在本节中,我们将根据监督范式的分类法和算法粒度的分类法对方法论进行全面回顾。首先,我们将根据监督范式的分类法,包含与不同任务类别相关的不同方法。接下来,我们将根据算法粒度的分类法,对这些方法进行详细介绍。鉴于大多数现有的DA-RS方法使用“单源单目标”作为输入模式,我们还将深入探讨采用其他独特输入模式的方法。需要承认的是,这三种分类法中的方法可能存在不可避免的重叠。具体来说,一些方法可能属于多个分类法的范畴。
A. 基于监督范式的分类法
- UDA-RS方法:在遥感领域,高标注成本给遥感(RS)任务带来了重大挑战。因此,研究减少对大量标注样本依赖的方法已成为一个热门话题。如前所述,UDA-RS力求使用源图像训练模型,同时可以访问目标图像但没有其对应的标注。代表性的UDA-RS方法包含在表III中。

在深度学习时代之前,开创性的传统方法定义了UDA-RS任务并引入了各种机器学习模型[168]-[174],这极大地推动了该领域的发展。进入深度学习时代后,深度学习技术在性能上显示出优于传统方法的优势。
UDA-RSCls。无监督领域自适应高光谱图像(HSI)分类是UDA-RSCls任务中的一个关键话题。如表III所示,许多方法[30]、[61]、[62]、[64]、[67]–[69]、[72]、[74]、[79]、[81]、[83]、[88]、[90]、[92]、[94]提出了各种算法来解决UDA HSI分类的挑战。航空图像分类的无监督领域自适应是UDA-RSCls任务中的另一个有趣研究话题。许多著名的方法[29]、[42]、[59]、[60]、[65]、[66]、[70]、[71]、[76]–[78]、[84]、[87]、[89]、[91]–[99]被提出,以利用高分辨率航空和卫星图像中包含的丰富信息。鉴于SAR数据的独特成像特性和固有的领域偏移,SAR图像分类的无监督领域自适应成为UDA-RSCls更广泛范围内的另一个引人注目的方向。最近的一些研究[75]、[80]、[82]、[85]、[86]探索了减轻不同SAR数据中显著领域差距的策略,旨在增强跨域泛化能力。
UDA-RSSeg。遥感语义分割的无监督领域自适应主要集中在跨高分辨率(HR)航空和卫星光学图像[33]、[44]-[46]、[100]–[120]的模型自适应,解决由地理或采集差异引起的领域偏移。一些方法[121]-[124]还旨在弥合多光谱或SAR图像分割的模态差距,解决纹理、分辨率和光谱特性变化等挑战。
UDA-RSDet。遥感目标检测的无监督领域自适应主要集中在将知识从标记的光学航空和卫星图像迁移到来自不同领域的未标记图像[41]、[132]-[143],其中由于根本不同的成像机制、目标纹理和背景杂波而产生了显著的领域差距。与光学到光学的自适应不同,SAR数据在特征表示和对齐方面引入了重大挑战,促使开发了专门的技术,如领域不变特征学习、跨模态对齐和伪标签细化[125]-[129]。
-
SSDA-RS方法:遥感中的半监督领域自适应旨在将知识从标记的源域迁移到部分标记的目标域,减少标注成本,同时适应新的地理区域或传感器类型。一些方法专注于分类任务[20]、[28]、[146]-[156],而其他方法则针对语义分割[157]-[160]或目标检测[161]-[167],在SSDA范式下解决不同的遥感任务。
-
SDA/Finetuning-RS方法:SDA假设可以访问两个域的标记数据。因此,SDA通常被视为一种实用的工程解决方案,而不是一个基本的研究挑战。在许多实际应用中,一旦有适量的标记目标数据可用,工程师通常会选择直接在目标域上微调或重新训练特定模型,这可以在不需要复杂领域自适应技术的情况下产生强大的性能。尽管如此,一些方法[51]、[175]-[178]仍然值得注意,因为它们为利用目标域标签进行自适应和泛化提供了宝贵的见解。
B. 基于算法粒度的分类法
- 基于分布度量的方法:如表III所示,许多著名的方法利用分布度量技术来对齐不同领域的分布。DAN[59]引入了一个辅助网络,该网络由堆叠在预训练卷积神经网络(CNN)之上的多个隐藏层组成。该设计除了标准的交叉熵误差外,还结合了图拉普拉斯和最大均值差异(MMD)正则化项。通过对隐藏层进行自适应,DAN能够应对领域偏移问题。DDME[29]学习一个流形嵌入,并通过为源图像和目标图像训练分类器来对齐判别分布。DACNN[60]框架将子空间对齐(SA)与CNN集成,以应对RS场景图像分类中的领域自适应挑战。该方法使CNN模型能够无缝适应对齐的特征子空间,从而有效减轻领域分布的差异。TCANet[61]由几个基于卷积滤波器的阶段组成,这些滤波器在高光谱图像的补丁上操作。利用迁移成分分析(TCA),通过最小化分布距离度量来学习跨不同领域的变换矩阵。DDA-Net[62]首先设计了一个领域对齐模块,通过相似性度量在无关任务的指导下最小化领域差异。此外,它采用了一个任务分配模块,在对齐的约束下对源域进行分类。此外,它集成了一个领域自适应模块,将对齐能力和分类能力迁移到目标域。JCGNN[30]通过将领域级和类别级CORAL嵌入GNN框架来增强联合分布的度量和对齐。通过这种设计,它能够实现更精确的特征匹配和跨领域的改进判别性。ADA-DDA[70]通过注意力机制引导边际分布对齐,并动态平衡边际分布和条件分布的重要性来增强领域自适应。TSTnet[81]引入了一个集成的基于CNN的语义特征和基于GCN的拓扑结构建模。通过设计图最优传输和CNN与GCN输出之间的一致性约束,该方法有效地对齐了领域之间的分布和拓扑关系。SSM[92]通过提出一种光谱偏移缓解策略来解决跨场景HSI分类中的光谱偏移,该策略结合了幅度归一化和邻近效应校正。DAN_MFAC[94]涉及多级特征对齐,显式约束全局和类别级分布,从而增强领域不变特征学习并提高跨场景的泛化能力。DATSNET[95]引入了任务特定分类器,并采用分类器差异的对抗最小最大化来实现更好的源和目标特征分布对齐,同时细化任务特定的决策边界。MRDAN[96]采用特征融合自适应模块来构建更广泛的领域不变空间,并采用动态对齐机制自动平衡局部和全局自适应损失,从而增强跨域性能。AMRAN[97]联合对齐边际和条件分布,同时利用注意力和多尺度策略来增强特征鲁棒性和信息完整性。SRKT[98]通过对抗和对比对齐学习传感器不变表示。它显式建模并对齐类别级关系分布。DDCI[99]引入了自适应扩散蒸馏模块和一致因果干预模块,以实现有效的跨域知识迁移并消除虚假相关性,从而提高模型的泛化能力和鲁棒性。DCA[103]显式对齐类别特征以学习领域不变表示,这在不平衡和不一致分布下增强了类内紧凑性和类间可分性。为了解决SAR船舶检测中标记SAR数据的缺乏问题,HSANet[126]引入了一个分层领域自适应框架,利用标记的光学图像。它在全局(通过基于傅里叶的对齐进行结构级)和局部(通过原型对齐进行实例级)尺度上对齐SAR和光学领域,以增强跨模态检测性能。CORAL-ADA[137]将相关对齐和对抗领域自适应集成到基于区域的检测器中,并通过重建损失进一步增强,在目标域中实现了明显的性能提升。
一些半监督领域自适应方法围绕分布对齐或距离度量展开,因为少量标记目标数据的可用性允许更可靠地估计领域差异,并更好地指导源域和目标域特征空间之间的对齐。TDDA[146]提出了一种用于高光谱图像分类的两阶段深度领域自适应方法,该方法结合了基于MMD的领域对齐和具有成对损失的空间-光谱孪生网络,利用少量标记目标样本学习判别性嵌入空间。DJ-CORAL[150]将异构特征投影到共享子空间,并联合对齐边际和条件分布。该方法有效利用未标记目标数据减少领域偏移并提高分类性能。BSCA[152]通过结合无监督最大均值差异对齐和监督类别感知对齐,有效减少领域偏移并利用源域和目标域的标记和未标记数据。SSCA[155]集成了旋转鲁棒卷积特征提取器(RCFE)以处理旋转变化,并集成了基于邻居的子类别质心对齐(NSCA)模块以减轻跨领域的类内差异。CDMPC[158]引入了矛盾结构学习机制和自监督学习策略,以增强领域对齐并提高有限标记目标样本的利用。SAR-CDSS[163]提出了一种用于SAR图像的半监督跨域目标检测框架,利用光学数据和少量标记的SAR样本。它通过图像混合和实例交换进行数据增强,并通过自适应优化策略进行选择性特征对齐,逐步减少图像、实例和特征级别的领域偏移。CDTL-YOLOV5[167]提出了一种基于YOLOv5的半监督SAR目标检测方法。通过引入特征领域自适应约束,该模型将丰富的知识从标记的光学数据迁移到SAR特征学习中,以在有限标注下提高性能。
- 基于对抗学习的方法:如前所述,对抗学习技术旨在从特征级、像素级或两者中提取信息,以减少不同领域之间存在的差异。在表III所示的方法中,对抗学习在不同任务和不同监督范式中扮演着重要角色。
基于特征级对抗学习的方法。特征级对抗学习旨在将源域和目标域的特征图对齐到一个统一的潜在空间中,从而减轻在将目标特征映射到预测过程中的偏差。
在全局级别,特征对抗对齐鼓励模型学习领域不变的类别级语义,从而提高跨领域的预测一致性。SSMT-RS[63]利用元学习来区分多个目标域,并利用对抗学习来混淆源域和混合多目标域之间的区别。这两个过程,元学习和对抗学习,迭代且动态地运行。ADA-Net[64]基于变分自编码器开发生成器,旨在从两个领域获取光谱和空间特征。通过结合两个用于对抗学习的目标函数,将考虑全局和局部对齐。为了解决多个源域数据集和单个目标域数据集之间的领域偏移问题,MSCN[65]首先设计了一个预训练CNN,以提取跨不同领域的图像特征。随后,通过一个跨领域对齐模块对每个源域和目标域的特征进行对齐,该模块由不同的源特定判别器组成。ECB-FAM[66]将错误校正边界机制集成到特征级对抗学习框架中。这种集成能够同时构建领域不变特征和语义上有意义的特征。CDA[67]集成了类别级对抗对齐和PMMD(概率MMD)策略,通过按类别对齐领域不变特征来实现无监督领域自适应。为了解决HSI分类中的跨领域特征分布差异,JDA[68]首先通过耦合VAE(变分自编码器)模块将数据映射到共享潜在空间,然后通过细粒度联合分布对齐模块细化类别级对齐。DFENet[71]结合了上下文感知特征细化(CAFR)模块,用于自适应提取全局和局部判别特征,以及多级对抗丢弃(MAD)模块。该设计通过在特征和决策级别选择性地抑制低质量信息来增强特征泛化能力。UDACA[72]提出了一种新颖的UDA-HSI方法,该方法通过对抗框架联合减少类别级和风格感知级差异来执行内容级特征对齐。TAADA[74]通过基于注意力的双分支特征提取和对抗学习提取光谱-空间联合信息,从而实现更有效的跨域分类性能。SSWADA[79]解决了使用高光谱图像进行跨场景湿地映射的挑战。它引入了一个空间-光谱加权对抗领域自适应框架,利用联合2D-3D卷积、实例加权判别和多分类器学习来增强领域对齐和目标分类。FDDAN[83]设计了一个基于特征解耦的领域自适应网络,用于跨场景沿海湿地分类,旨在通过显式分离领域特定和类别不变组件来提取类别特定的领域不变特征。通过变压器-卷积融合编码器和对抗解耦策略,该方法增强了可迁移性和类别判别性。AdaIN[85]结合了双级特征对抗学习和基于自适应实例归一化的跨领域特征模拟,该方法在SAR和光学领域之间实现了物理上合理的自适应。ADDA[28]将对抗判别领域自适应方法扩展到遥感目标识别的半监督设置,能够利用标记和未标记数据有效适应新的地理区域。CDADA[147]通过将双土地覆盖分类器作为判别器,鼓励生成器产生跨领域对齐但仍远离类别边界的可迁移特征。DACNN-MME[148]将标记数据上的交叉熵损失与未标记目标数据上的对抗最小最大熵损失融合,以联合促进领域不变和类别判别特征学习。SSDAN[149]联合优化标准交叉熵损失和对抗最小最大熵损失,该方法有效利用标记和未标记目标数据学习领域不变但具有判别性的特征。SASS[156]提出了一种用于高光谱和LiDAR数据分类的半监督学习方法,通过引入共享-私有特征解耦机制和多级特征对齐。该方法有效利用标记和未标记数据,在有限注释下增强分类性能。
在像素级别,特征级对抗学习主要旨在增强密集预测的一致性。MBATA-GAN[105]提出了一种基于变压器的框架,利用相互增强的注意力模块有效捕捉跨领域语义依赖。通过结合全局注意力和增强的特征级对抗学习,它显著提高了特征可迁移性。JDAF[107]联合对齐边际和条件分布,并结合不确定性自适应学习策略以提高伪标签的可靠性并减少领域差距。CSLG[108]基于补丁级自适应难度,逐步从局部语义到全局结构级别对齐特征。通过这种设计,它有效解决了由多样土地覆盖和传感器变化引起的局部分布偏移和全局领域差距。MemoryAdaptNet[109]结合输出空间对抗学习和类别感知不变特征记忆模块,弥合领域差距并增强特征一致性,在多个跨域任务中实现了卓越性能。De-GLGAN[110]通过利用多尺度高频/低频分解和全局-局部生成对抗学习来增强遥感中的语义分割,提高领域不变表示学习和跨域泛化能力。RCA-DD[111]提出了一种区域和类别自适应领域判别器,其中包含基于熵的区域注意力模块和类别清晰模块。该方法专注于难以对齐的区域,并在训练期间选择性地更新类别分布。MIDANet[112]采用多任务学习和基于熵的对抗训练,利用语义分割和高程估计来提取领域不变特征,并在不需要目标域标签的情况下增强泛化能力。MMDANet[119]通过多路径编码器和多任务解码器集成DSM数据,并进一步使用特征级对抗学习对齐源域和目标域,通过高度感知融合细化实现更丰富的表示和改进的分割。HighDAN[122]通过结合多分辨率融合和对抗学习在多模态遥感数据(高光谱、多光谱、SAR)上增强可迁移性,用于跨城市分割。
在实例级别,特征级对抗学习主要促进特征对齐,以实现跨领域的更准确目标定位和识别。IDA[128]通过设计一个新的损失函数来强制预测一致性,从而解决领域偏移问题。通过在图像和实例级别对齐语义信息,它增强了特征判别性并减少了负迁移的风险,理论分析支持其收敛特性。DFD-CAC[129]利用动态特征判别和中心感知校准来减轻由SAR传感器散射差异引起的边界框回归错误和特征错位。通过利用双向特征聚合和中心性引导对齐,该方法在跨领域条件下增强了检测鲁棒性。FACL[130]将对抗学习与专门的注意力和补偿模块结合。对抗学习注意力(ALA)使用基于熵的加权进行精确的实例级和像素级对齐,而补偿损失模块(CLM)强制跨领域的原型特征一致性以提高检测准确性。为了解决跨领域的特征不兼容性,PDSCR[131]通过补丁级通道重校准捕获领域特定特征,并利用动态加权原型对齐(DWPA)来减轻早期训练中噪声伪标签的影响。RIRA[132]框架通过关系感知图引入图像级和原型级特征对齐,以及旋转不变正则化,有效提高了跨领域检测的鲁棒性。FADA[133]通过基于对抗的前景对齐集成对抗训练(AT),并通过基于原型的混淆特征对齐进一步细化领域泛化。RFA-Net[134]引入了一个统一框架,结合数据级增强、稀疏特征重建和伪标签生成。该设计增强了实例级对齐,同时减少了无监督领域自适应场景中背景噪声的影响。APA[135]提出了一种对抗预测空间对齐方法,联合自适应位置和类别置信度输出,用于卫星图像中的车辆检测,展示了增强的跨领域检测性能。FIE-Net[143]在一个前景增强对齐框架中解决了前景-背景不平衡问题。它通过集成前景聚焦多粒度对齐模块和渐进标签过滤策略来强调显著实例特征。DA-FRCNN[161]提出了一种用于SAR目标检测的领域自适应Faster R-CNN[179]框架,利用有限的标记数据通过从标记的光学图像迁移知识。它在提案生成后使用基于GAN的约束,从而在小型SAR数据集上实现了卓越的检测性能。
基于图像级对抗学习的方法。图像级对抗学习旨在通过将源图像翻译成目标域风格(或反之亦然)来减少领域差异,同时保留语义内容。通过在像素级别对齐视觉外观,模型可以更一致地感知源图像和目标图像,从而在领域偏移条件下促进下游任务。
VSFA[80]集成了视觉特征和散射拓扑特征,以改善合成和实测SAR图像之间的目标识别。通过利用图神经网络和类别级对齐策略,该方法实现了卓越的性能。UDA-GAN[100]是第一个将基于GAN的分割网络应用于解决UDA-RSSeg任务的方法。它引入了一种图像级对抗学习方案,其中生成器将源图像翻译成目标域风格,而判别器鼓励翻译后的图像在视觉上与真实目标图像无法区分,从而在像素级别减少领域差距。ResiDualGAN[33]引入了一个网络内调整器来处理尺度差异,并通过残差连接来稳定真实到真实的翻译,在无监督领域自适应设置下显著提高了语义分割准确性。BiFDANet[104]同时优化源到目标和目标到源的翻译,以利用互补的领域信息。通过集成双向语义一致性损失并在推理时结合双分类器,它在多个数据集上优于传统的单向方法。MHDA[117]为遥感分割引入了一个统一的多级无监督领域自适应框架,特别强调通过循环一致性进行图像级对抗学习。通过结合实例级对齐、特征级对比学习和决策级任务一致性,它在不依赖目标域监督的情况下有效解决了复杂的领域偏移。FDDA[162]集成了基于重建的解码模块和领域自适应模块,以利用未标记的SAR数据和标记的光学遥感(ORS)图像。通过联合优化检测、重建和领域对齐损失,该模型有效地将知识从ORS迁移到SAR,并在有限标记的SAR数据上实现了改进的检测性能。
基于特征级和图像级集成的对抗学习方法。集成对抗学习方法结合了图像级和特征级对齐,以全面减少领域差异。图像级自适应对齐源图像和目标图像的视觉外观,以减轻低级分布差距,而特征级自适应确保高级语义表示被映射到一个共享的潜在空间中。这种联合优化能够实现更有效的表示。
PFDA[75]提出了一种像素级和特征级领域自适应方法,结合了图像翻译和特征对齐,以解决异构SAR目标识别中的分布差异挑战。SDEnet[93]采用对抗领域扩展与空间-光谱随机化和监督对比学习来增强领域不变表示。DNT[102]提出了一种双重空间对齐框架,使用数字数变换器减少输入级差异,并通过多尺度特征聚合和细粒度判别增强特征级对齐。IterDANet[118]结合了一个渐进框架,首先增强域间对齐,然后通过子域聚类和伪标签优化迭代地细化域内一致性。DCLDA[138]利用精选的支持集进行多级领域对齐,并采用一种新颖的对比损失来减轻假阴性偏差并增强跨域鲁棒性,用于UDA-RSDet任务。ML-UDA[139]为遥感图像中的单阶段目标检测提出了一个多级无监督领域自适应框架,以渐进的方式集成像素级和特征级自适应。为了解决局部变形和尺度变化,该方法结合了语义区域感知翻译和注意力引导的多尺度特征对齐。
- 基于自训练的方法:基于自训练的领域自适应方法通过迭代地为未标记数据生成伪标签并重新训练模型来提高目标域性能。这些方法利用模型自身的预测来逐步细化决策边界,从而在领域偏移下实现更好的类别判别。
UDA-SAR[82]利用基于伪标签的对比学习来增强光学源域和SAR目标域之间的类别级对齐。通过集成一致性约束和跨域伪标签监督,该方法有效减轻了源域偏差并逐步细化了目标域表示,以实现准确的SAR船舶分类。DST[86]提出了一种用于异构SAR图像分类的新颖无监督领域自适应方法。它引入了一个嵌入领域特定弱对齐模块的动态自训练框架,该模块自适应地区分已知和未知类别。MLUDA[88]被开发用于利用伪标签和监督对比学习进行自训练,以增强类间可分性。CPCA[113]解耦因果和偏差特征,并利用基于因果原型和反事实干预的对比学习。除了这种设计外,它还涉及一种自训练策略,利用从因果特征生成的可靠伪标签来指导目标域学习。MEBS[114]提出了一种用于遥感图像分割的自监督师生UDA框架,通过两种关键技术解决类别混淆和不平衡问题:用于改进上下文学习的掩码增强类别混合(MECM)和用于更好地表示小尺度类别的基于尺度的稀有类别采样(SRCS)。MS-CADA[115]构建了专家特定分支,采用跨域混合、自适应伪标签和多视图知识集成,以在类别不对称的多源设置中有效地跨不匹配的类别空间迁移知识。EUDA-PLR[124]设计了一种多因子引导的伪标签细化策略,以有效地将知识从历史SAR数据集迁移到具有有限注释的新油污事件中。该方法可以提高跨各种传感器和海洋条件的分割准确性。DualDA-Net[136]设计了一个双头校正框架,结合多级特征对齐与从粗到细的一致性和协作伪标签细化。它通过师生协同训练方案逐步增强目标监督并减轻标签偏差。RST[141]引入了第一个基于DETR的框架,通过自适应伪标签分配器增强跨域对齐,有效改善了稀疏目标和噪声背景场景中的检测。SFOD[142]仅使用预训练的源模型执行无监督领域自适应,而无需访问源域数据。它嵌入了多级扰动和师生一致性策略,以对齐目标域和扰动域。EasySeg[160]集成了交互式和主动学习。通过引入点级标签策略(SFAL)和交互式分割网络(ISS-Net),该方法有效地标注了信息像素并细化了伪标签,以提高领域自适应性能。SRA-YOLO[164]使用师生策略与知识蒸馏和自适应缩放技术来减轻空间分辨率差异。该方法有效利用标记和未标记数据,通过在不同航空图像中对齐地面采样距离(GSD)来解决领域差异。DT[165]将学习过程分为跨域和半监督子任务,每个子任务由一个单独的师生模型指导。这些模型通过从未标记的SAR数据生成和利用伪标签来协同优化检测器。WeedTeacher[166]设计了一个基于YOLOv8的半监督目标检测框架,用于杂草检测,集成了基于EMA的自训练以有效利用未标记数据。
- 基于集成训练的方法:集成训练方法统一了对抗学习和自训练,以联合促进领域对齐和类别级判别。对抗学习减少了领域差距,而自训练逐步细化目标预测,从而提高了自适应性能。
AST[42]提出了一种对抗自训练框架,集成了自训练和对抗学习,以同时细化决策边界并增强高分辨率航空场景分类的跨域特征对齐。PPLM-Net[84]通过三个关键组件解决领域偏移和复杂背景问题:用于提取领域不变特征的领域对抗训练、用于增强全局上下文学习的部分路径局部掩蔽,以及用于生成伪标签以提升目标域性能的师生网络自训练策略。TriADA[101]引入了一种基于三元组的对抗框架,通过领域相似性判别器联合利用源域和目标域信息,以及类别感知的自训练策略以实现可靠的伪标签。FGUDA[106]提出了一种细粒度自适应框架,集成了全局-局部对齐和类别级自训练机制。通过关注难以对齐的区域并压缩分散的类别特征,它有效减轻了负迁移并增强了目标域中的语义一致性。RoadDA[44]为遥感道路分割引入了一种分阶段领域自适应框架,结合了图像级对抗对齐和对抗自训练。通过逐步自适应域间和域内特征,它有效减轻了领域偏移并增强了目标域中的分割性能。STADA[45]集成了对抗特征对齐和在去噪伪标签上的自训练。它提高了模型对分布外目标域的适应能力。ST-DASegNet[46]解决了由传感器、分辨率和地理差异引起的领域偏移。它结合了特征级对抗学习和基于EMA的自训练策略,以增强跨域泛化能力。CDANet[116]结合了对抗学习、像素级对比损失和自训练策略,可以有效对齐跨域特征并增强小而密集分布建筑物的提取。DDF[120]引入了一种混合训练策略,利用图像级风格迁移和基于空间上下文的伪标签细化。TDAIF[121]通过耦合图像级伪目标生成、特征级领域判别器和自集成策略来解决跨域云检测问题,有效减轻了由辐射度和尺度差异引起的分布差距。FRCNN-SAR[125]是第一个用于SAR目标检测的无监督领域自适应框架,在没有昂贵注释的情况下提高了未标记目标域中的性能。它结合了像素级自适应、多级特征对齐和迭代伪标签,以解决由不同雷达参数和场景引起的领域偏移。PT-SAR[127]分三个阶段将知识从光学图像迁移到SAR数据:使用基于GAN的翻译进行像素级外观自适应、通过对抗学习进行特征级领域对齐,以及通过鲁棒自训练进行预测级增强以减轻噪声伪标签。CDST[41]采用基于GAN的领域迁移来减少领域偏移,随后采用硬样本选择策略,通过置信度和关系评分机制提高伪标签质量。该框架增强了跨域遥感场景中目标检测的鲁棒性和准确性。MGDAT[140]通过将像素级、图像级和实例级特征对齐纳入师生架构,增强了领域偏移下的遥感目标检测,实现了更鲁棒和细粒度的跨域表示学习。CFAN[154]在类别级别对齐源域和目标域特征,同时通过结合双向原型对齐模块和对抗训练来增强伪标签质量以减轻噪声。
- 基于LVM的方法:大型视觉模型(视觉基础模型)已经彻底改变了AI和深度学习,为遥感提供了跨多样场景的更强泛化能力。Lu等人[58]强调了由LVM驱动的遥感领域的新兴趋势和关键进展。尽管在DA-RS任务中使用大型视觉模型(LVM)仍然未被充分探索,但一些值得注意的方法[51]、[178]、[180]已经显示出有前途的潜力,值得进一步关注。PFM-JONet[51]通过集成Segment Anything Model (SAM) [47]作为基础模型来解决超高分辨率(VHR)遥感图像语义分割的UDA问题,以减轻特征不一致和领域差距问题。通过结合对抗学习和自训练的混合训练策略在特征和预测级别,该框架在多样城市场景中实现了鲁棒的自适应。SLR[178]探索了大型预训练基础变压器模型在遥感中的高效自适应策略。它旨在克服预训练和下游任务之间的分布差距,而无需高昂的完整训练成本。CrossEarth[180]是第一个为遥感领域泛化语义分割提出的基础模型。
总的来说,遥感中的领域自适应已经从传统的浅层方法演变为基于深度学习的框架,现在正朝着基础模型驱动的方向发展。沿着这一轨迹,出现了几个代表性范式。基于分布度量的方法通过对其统计分布来减少领域差距,为早期DA研究奠定了基础。基于对抗学习的方法利用领域判别器进行全局对齐,特别是在具有粗略领域偏移的分类任务中非常有效。基于自训练的方法利用伪标签进行渐进式自适应,在分割和检测等密集预测任务中尤其强大。集成训练方法结合了对齐、自训练和辅助技术(如对比学习或风格迁移),以实现更鲁棒的语义一致性。最近,基于大型视觉模型的方法正在获得动力,将预训练的基础模型自适应到遥感任务中,开辟了一个具有可迁移和开放词汇能力的新范式。
C. 基于输入模式的分类法
如图3所示,现有的DA-RS方法也可以根据不同的输入模式进行分类。上述方法主要集中在广泛研究的“一对一”配置上。在以下部分中,我们将回顾表IV中列出的其他输入模式的方法。

-
一对多:为了解决遥感中单目标领域自适应的局限性,SSMT-RS[63]开创了遥感中单源多目标领域自适应的研究,通过构建一个具有挑战性的混合多目标数据集并提出一个元对抗学习框架。GNN-MTDA[73]提出了一种多目标自适应框架,通过利用基于图的协同教学和顺序自适应策略,在多个未标记的目标域上学习一个统一的分类器,有效地聚合了来自源域和多样目标域的特征。在改进MTDA的目标基础上,EHACA[76]提出了一种从易到难的自适应框架,在每个目标域内保留语义完整性,并通过分层域内和协作域间特征对齐有效建模源-目标和目标-目标关系。HFPAN[87]集成了细粒度的全局-局部特征提取与分层特征嵌入和渐进对齐。通过这种设计,该方法有效解决了跨多个目标域的领域偏移。S²AMSnet[91]通过光谱-空间生成网络扩展源域分布,并通过对抗学习强制语义一致性,从而实现对未见过的单个或多个域的泛化。TSAN[181]集成了对抗学习进行全局领域对齐和自监督学习进行伪域标签生成,无需手动注释即可迭代细化多个目标域表示。DAL[182]包含三个关键模块,分别是多域风格迁移(MST)、多域特征近似(MFA)和多域级联实例提取(MCIE)。这三个模块协同弥合领域差异并提高跨多个目标域的提取准确性。CCDR[183]在没有复杂管道或外部数据的情况下弥合领域偏移并实现卓越性能。它有效地增强了从单个源到多个未见过目标域的泛化能力。
-
多对多:SSCA[155]是一种典型的解决“多对多”半监督领域自适应任务的方法。它在涉及异构多数据源的遥感场景中特别有效,增强了模型在不同目标域中的鲁棒性和泛化能力。DAugNet[184]增强了在不断演变和异构领域中的泛化能力,在适应新地理位置方面优于现有方法。MultiDAN[185]为遥感图像分割提出了一种新颖的无监督多阶段、多源和多目标领域自适应框架。通过集成多对抗学习、基于熵的子域聚类和动态伪标签策略,它有效解决了跨多个目标域的域间和域内偏移。M3SPADA[186]用于跨时间土地覆盖分类,使用多传感器、多时间和多尺度遥感数据。它能够在同一地理区域内的不同时期之间有效迁移模型,解决由环境和传感器变化引起的分布偏移。MDGTnet[187]捕捉了领域特定和共享特征,实现了在未见过目标域上的鲁棒分类。FDINet[188]结合了用于公共特征提取的权重共享基线、基于模态的相似性估计和锐度感知特征区分(SAFD)策略。通过这种设计,FDINet在不牺牲特征判别性的情况下增强了泛化能力。GeIraA-Net[189]通过联合建模全局-局部特征和类间关系,增强了多源遥感数据的跨场景分类。一种量身定制的伪标签引导对齐策略进一步细化了领域校准。
-
多对一:MSCN[65]是第一篇解决遥感中具有非共享类别的多源域数据集UDA任务的文章。与大多数假设类别对称的UDA方法不同,MS-CADA[115]解决了遥感图像使用多源的更现实但未被充分探索的类别不对称自适应问题。SSDAN[149]提出了一种用于遥感场景分类的多源半监督领域自适应方法,利用预训练的EfficientNet-B3[205]提取判别特征,并采用基于余弦距离的原型分类模块。AMDA[190]有效地从多个领域自适应训练数据,并在局部气候区(LCZ)分类任务中实现了显著的性能提升。IMIS[191]解决了具有不完整多源域的跨域场景分类问题,其中目标类别可能对每个源部分未知。为了解决这个问题,它提出了一种分离机制,在执行对齐之前区分目标域中的已知和未知类别。Swin-DA[192]在不重复访问源数据的情况下对齐源域和目标域,在多个高分辨率遥感数据集上实现了卓越的性能和稳定性。ALKA[193]提出了一种新颖的多源无监督领域自适应架构。为了减少领域差异,采用了最小最大熵优化策略,对抗性地将目标特征与源分类器对齐以提高泛化能力。MECKA[194]为遥感中的多源单目标领域自适应设计了一个统一框架。它顺利地将信息转移到具有不完整类别重叠的目标域,增强了分类鲁棒性。MSSDANet[195]是一种新颖的无监督多源领域自适应框架。它结合了两阶段特征提取策略和新设计的判别语义迁移(DST)和类别相关(CC)损失,无需目标域标签即可增强跨领域的语义对齐。
-
无源:无源领域自适应是指在无法访问源数据的情况下,将预训练的源模型自适应到未标记的目标域,仅依赖目标数据和迁移的模型参数。HSI-SFDA[196]生成源光谱特征并通过对比学习将其与目标特征对齐,结合对数加权原型分类器进行迭代伪标签,该方法在无法访问标记源数据的情况下实现了有效的目标域自适应。MSF-UDA[197]结合了加权信息最大化和伪标签损失,以在多个源域上对齐源和目标特征分布。它在减少自适应过程中对源数据依赖的同时,提高了目标域分类准确性。MLDP-SFOD[198]由领域扰动、多级对齐和基于原型的蒸馏组成,在均值教师框架内。通过这种设计,它有效地提取了领域不变特征,将源预训练模型自适应到目标域,而无需访问源数据。SFUDA[199]提出了一种用于跨区域和跨时间作物类型映射的无源无监督领域自适应(UDA)方法,有效解决了传统UDA方法在自适应过程中需要源数据的局限性。该方法在不同国家、传感器和时间段上展示了强大的泛化能力。SFOD[142]也解决了传统UDA方法在自适应过程中依赖访问源数据的局限性。它在不需要源图像的情况下有效提取了领域不变特征。APD-SFDA[200]开创了遥感图像的无源领域自适应分割,消除了自适应过程中对源数据的需求。通过将视觉基础模型与注意力引导的提示调优和基于相似性的特征对齐策略集成,该方法有效地将预训练模型自适应到多样目标图像。LPLDA[201]蒸馏低置信度提案并引入实例一致性损失。这种方法增强了小目标表示在领域偏移下的鲁棒性,使其在航空场景中的细粒度目标上特别有效。SD-SFDA[202]提出了一种用于SAR图像中船舶检测的无源跨传感器自适应方法,解决了在异构领域(如光学到SAR迁移)中固定阈值伪标签的局限性。S3AHI[203]在测试时训练期间仅使用未标记数据将源训练模型自适应到目标域。它在均值教师框架下集成了切片辅助超推理(SAHI)和实例级对比学习,以克服数据稀缺和领域偏移挑战。SMNA[204]结合了模型统计引导的对齐策略和噪声自适应模块,使目标域特征能够与源分布对齐,同时减轻标签噪声的影响。
D. 其他
- 跨变化标签空间的领域自适应:虽然我们的重点仍然是共享标签空间下的领域自适应,但现实世界的遥感场景通常涉及源域和目标域之间不匹配的类别配置。部分、开放集和通用领域自适应等跨标签设置带来了超出分布对齐的额外挑战。由于这些方法主要解决标签空间差异问题,我们在此简要提及它们,而不进行详细讨论。

如图7所示,部分领域自适应(PDA)假设目标标签集被认为是源标签集的子集。相反,开放集领域自适应(OS-DA)假设目标标签集包含源标签集中不存在的未知类别,这意味着源标签集被认为是目标标签集的子集。通用领域自适应(UniDA)对源域和目标域的标签集没有先验知识。相反,它假设每个域都包含共享和私有(领域特定)标签集的混合。在此基础上,无源通用领域自适应(SF-UniDA)进一步假设在自适应期间无法访问源数据,并且只有训练好的源模型和未标记的目标数据可用。
在遥感领域,许多最近的进展已经解决了PDA[78]、[206]、OSDA[86]、[207]-[215]、UniDA[89]、[216]-[219]和SF-UniDA[77]、[220]、[221]的挑战。
PDA遥感方法。PDA[78]首次尝试解决遥感场景分类中的部分领域自适应问题,其中源标签空间包含目标标签空间。引入了渐进辅助领域模块、多权重对抗学习和注意力熵正则化,以减轻负迁移并提高自适应性能。PDANN[206]设计了一种部分领域对抗神经网络,以解决作物产量预测中的领域偏移和标签空间不匹配问题,通过在领域对齐期间降低异常源样本的权重来提高可迁移性。
OS-DA遥感方法。OSDANet[207]通过利用特征生成器和分类器之间的对抗学习来区分共享类别并拒绝未知目标样本,解决了遥感图像场景分类的开放集领域自适应问题。ODA-SAR[208]为开放集条件下的SAR图像分类提出了一种球形空间领域自适应网络,将特征映射到超球面以增强类别可分性。OSDAETD[209]联合探索可迁移性以减少域间和类内差异,同时通过判别性增强类间可分性,从而有效解决遥感图像中未见类别和强类间相似性的挑战。SSOUDA[210]通过集成对比自监督学习和一致性自训练,解决了光学遥感中的开放集无监督领域自适应问题,能够提取判别性目标特征和可靠的未知类别样本。DST[86]是一种旨在解决异构SAR图像分类中开放集UDA挑战的新方法。所提出的框架自适应地区分未知目标类别和已知类别,实现更鲁棒的跨域识别。IAFAN[211]采用基于实例亲和力的机制来分离未知样本,并采用样本判别性损失来增强类别分离,同时一种新颖的Mask-MMD度量确保已知类别的精确对齐,而不会负迁移未知类别。MAOSDAN[212]通过集成注意力感知反向传播、辅助对抗学习和自适应熵抑制,在具有部分重叠标签空间的复杂现实场景中增强模型鲁棒性。它有效分离已知和未知目标类别,同时减轻负迁移。OSDA-ST[213]引入最大logit分数阈值和动态源选择来估计未知类别。PUMCL[214]通过对其特征和细化伪标签,有效处理未知类别并提高跨域泛化能力。DFEN[215]联合捕捉局部判别模式和全局语义相关性,通过利用与已知类别的样本相似性来增强对未见类别的检测。
UniDA遥感方法。C3DA[89]提出了一种用于遥感场景识别的通用领域自适应方法,引入了一种新颖的“C3”准则,该准则集成了置信度、一致性和确定性,以有效识别未知类别。通过优化损失函数设计,它提高了训练效率并改善了在多样DA场景中的适应性。HyUniDA[216]、[218]消除了对先验标签空间知识的依赖。它有效识别共享类别并估计目标域结构,实现了在多样HSI域间的鲁棒知识迁移。SPOT[217]利用不平衡最优传输和样本补充机制有效区分共享和私有类别。通过增强类间可分性和类内紧凑性,它在复杂领域偏移下实现了更高的准确性和鲁棒性。DCMix[219]集成了闭集和开集分类器与特征混合策略,增强了目标域泛化并实现了更鲁棒的跨域迁移。
SF-UniDA遥感方法。SDG-UniDA[220]首先从预训练模型生成合成源数据,然后使用可迁移权重机制进行自适应,以区分共享和未知类别。SDG-MA[77]提出了一种无需先验标签集知识的遥感图像场景分类UniDA框架。通过从预训练模型合成源数据并引入可迁移权重,该方法有效识别共享类别,同时检测目标域中的未知类别。OKRA[221]利用邻域相似性进行知识蒸馏,并利用基于能量的不确定性建模有效区分已知和未知目标样本,无需源数据或手动阈值。
- DA-RSCD:如前所述,DA-RSCD任务与DA-RSCls、DS-RSSeg和DA-RSDet不同,领域偏移发生在成对图像内部,而不是跨单独的域(源域和目标域)。
DA-RSCD任务,也称为跨域变化检测(CDCD),专注于检测从不同传感器或在不同成像条件下获取的遥感图像对中的变化。Chen等人[222]提供了DA-RSCD的首次系统综述。该综述检查了这一研究方向的关键组成部分,包括图像预处理、特征表示和变化检测策略,同时指出了当前挑战和未来研究途径。Cheng等人[223]也研究了变化检测任务领域的领域自适应问题。
IV. 基准性能
在本节中,我们首先介绍DA-RS领域中常用的主要数据集。然后,我们展示了在这些主要数据集上评估的最先进方法。值得注意的是,我们的重点是广泛用于比较分析的代表性算法。
A. DA-RS的基准数据集
如表V、表VI、表VII所示,我们将总结DA-RS研究中广泛使用的主导基准数据集。这些数据集旨在支持各种领域自适应任务,包括DA-RSCls、DA-RSSeg和DA-RSDet。对于每个数据集,我们强调其成像模式、特征和评估适用性。

- DA-RSCls的基准数据集:对于DA-RSCls,基准数据集(表V)涵盖高光谱(HSI)、光学和SAR图像,反映了任务的全局分类特征。这种多样性捕捉了不同的光谱、空间和模态特征,为评估领域自适应方法提供了全面的基础。
休斯顿数据集(Houston2013[224],Houston2018[225])由2013年和2018年使用不同传感器在休斯顿大学区域收集的高光谱图像组成。经过光谱和空间对齐后,从Houston2013场景中提取了一个大小为209×955、包含48个光谱波段和7个一致土地覆盖类别的共享区域,以对应Houston2018场景。
帕维亚大学和中心数据集(PU和PC)由ROSIS传感器在意大利北部帕维亚的一次飞行活动中获取。PC的光谱波段数为102,PU为103。两个数据集都包含9个类别,尽管它们的类别定义并不完全相同。对于领域自适应实验,仅选择两个数据集共享的7个类别以确保标签一致性。
博茨瓦纳数据集(5月、6月和7月)由NASA EO-1 Hyperion传感器在2001年5月、6月和7月在博茨瓦纳奥卡万戈三角洲捕获的三个多时相高光谱图像组成。每张图像包含9个标注类别,具有242个光谱波段,覆盖357-2576nm范围,光谱分辨率为10 nm,空间分辨率为30 m。去除未校准和噪声波段后,保留145个波段用于实验。
HyRANK数据集[226]包含由Hyperion传感器(EO-1,USGS)获取的卫星高光谱图像,具有176个光谱波段。该数据集包括两个标注场景,Dioni和Loukia。两个场景共享12个一致的土地覆盖类别。
KSC(肯尼迪航天中心)数据集由AVIRIS传感器以224个光谱波段和18 m空间分辨率捕获。去除噪声和水吸收波段后,保留176个波段供使用。它包含两个空间不相交的子集,共享10个共同类别。这两个子集通常在领域自适应实验中用作源域和目标域。
印第安纳松树数据集[228]由NASA的AVIRIS传感器收集。原始数据集包含224个波段。经过预处理后,数据包含200个光谱波段,覆盖3公里区域,空间分辨率为20米。为了模拟领域自适应任务,每张高光谱图像通过对其光谱波段进行分组分成两部分。一个子集被指定为源域,另一个子集被指定为目标域,模拟由不同传感器以不同光谱覆盖范围获取的数据。
Salines数据集由AVIRIS传感器获取。去除20个水吸收波段后,该数据集包含204个光谱波段,分辨率为3.7 m,包含16个用于分类任务的标注土地覆盖类别。
杭州-上海数据集[227]由2002年EO-1 Hyperion传感器获取,预处理后各保留198个光谱波段。两个数据集都覆盖了城市和农村地区,包含3个标注的土地覆盖类别。由于杭州-上海数据集具有相似的地理场景组成,因此常用于领域自适应。
航空图像数据集(AID)[1]包含30个场景类别和总共10,000张大尺度RGB图像,每张图像大小为600 × 600像素。每个类别的图像数量从220到420不等。空间分辨率在0.5到8米之间。
NWPU-RESISC45数据集[2]包含31,500张RGB图像,涵盖45个场景类别,图像大小为256 × 256像素。每个类别包含700个样本。空间分辨率范围从0.2到30米。
UC-Merced数据集[229]包含2,100张RGB图像,均匀分布在21个场景类别中,每个类别包含100张图像。所有图像的空间分辨率为0.3米,固定大小为256 × 256像素。
WHU-RS19数据集[230]、[231]包含1,005张高分辨率场景图像,分为19个语义类别。每个类别由大约50到70个样本表示,所有图像的大小统一为600 × 600像素。
RSSCN7数据集[232]包含2,800张图像,涵盖7个类别。图像大小为400×400400\times400400×400像素,来自不同季节和光照条件下的谷歌地球。
PatternNet数据集[233]是一个用于图像检索的大规模遥感数据集,包含30,400张图像,涵盖38个类别。每个类别有800个样本(256 × 256像素),来自谷歌地球的美国城市。
在领域自适应实验中,航空和卫星光学图像数据集,如AID[1]、NWPU-RESISC45[2]、UC-Merced[229]、WHU-RS19[230]、[231]、RSSCN7[232]、PatternNet[233],通过选择共享类别并将它们相互视为源域和目标域来使用。
SAMPLE数据集[234]包含1,345对合成和实测SAR图像,涵盖10种车辆类型,由MSTAR数据集在匹配的成像参数下生成。合成和实测图像分别使用CAD模型和真实SAR捕获生成。
FUSAR-Ship数据集[235]包含从126张GF-3场景中裁剪的5,000多张高分辨率船舶芯片。它引入了一个可扩展的SAR船舶分类法,包含15个类别和98个子类别,支持船舶识别算法的全面开发、评估和基准测试。
OpenSARShip数据集[236]是一个基于Sentinel-1图像构建的大规模SAR船舶检测基准。它包含来自41张SAR场景的11,346张船舶芯片,覆盖17个AIS定义的船舶类型,并带有详细的子类型注释。该数据集对于检测、细粒度分类以及领域自适应研究非常有价值。
OpenSARShip 2.0数据集[237]通过提供从87张Sentinel-1图像中提取的34,528张SAR船舶芯片,对其前身进行了扩展。它提供多种数据格式,包括原始、灰度、伪彩色和校准版本,支持对SAR图像中船舶目标的更深入分析。

- DA-RSSeg的基准数据集:对于DA-RSSeg,基准数据集(表VI)主要由高分辨率航空和卫星光学图像组成,提供适合语义分割的细粒度空间细节。这些数据集具有多样的地理区域和采集条件,能够全面评估领域自适应方法。
ISPRS数据集[8]提供6个土地覆盖类别的像素级注释,并包括波茨坦和瓦亨根数据集。波茨坦包含38张超高分辨率正射影像(6000×6000像素),模式为IR-R-G、R-G-B和R-G-B-IR,而瓦亨根有33张正射影像(约2000×2000像素),模式为IR-R-G。领域自适应分割实验在波茨坦和瓦亨根数据集之间进行。
LoveDA数据集[6]提供了来自南京、常州和武汉的5,987张超高分辨率遥感图像(1024×1024),涵盖城市和农村环境。它跨越城市和农村领域,以评估模型在不同地理特征上的泛化能力。
CITY-OSM数据集[7]是一个以城市为重点的数据集,为柏林、芝加哥、苏黎世、巴黎和东京等城市提供像素级注释。它通过3个类别突出关键城市元素:“背景”、“道路”和“建筑”。
WHU数据集[238]为建筑提取提供了广泛的像素级注释,包括航空和卫星图像。航空子集包含来自新西兰的8,189张RGB图像,分辨率为0.3米。卫星II子集包含来自东亚的17,388张RGB补丁,分辨率为2.7米。两个子集都提供多样化的建筑类型,并可用于领域自适应实验。
BLU数据集[239]由北京-2卫星以0.8米的地面采样距离(GSD)收集。它为北京多样化的城市和农村场景中的6个土地利用类别提供了细粒度的像素级注释。该数据集包含4张大型高分辨率瓦片(每张15680×15680像素),裁剪成256张非重叠子图像用于训练、验证和测试。
OpenEarthMap数据集[240]是一个为高分辨率土地覆盖制图设计的综合性全球数据集,包含来自六大洲44个国家97个地区的多样化航空和卫星图像。它在0.25~0.5米分辨率下提供8类注释,支持开发具有强大跨区域泛化能力的模型。
DeepGlobe数据集[241]旨在支持准确的道路提取。它包含来自泰国、印度尼西亚和印度的8,570张高分辨率RGB图像(0.5米/像素),涵盖城市和农村地区。
道路检测数据集[242]包含224张超高分辨率谷歌地球图像(1.2米/像素),带有手动标注的道路分割。每张图像的大小至少为600×600像素,道路宽度约为12-15像素。复杂背景和频繁遮挡的存在使检测极具挑战性。
C2Seg数据集[122]是一个开创性的大规模基准,专为跨城市多模态遥感语义分割设计,结合了高光谱、多光谱和SAR数据。它包含两个场景:C2Seg-AB源自EnMAP、Sentinel-2和Sentinel-1,C2Seg-BW源自高分五号、高分六号和高分三号。C2Seg集成了三种遥感模态,同时保持10米的GSD,并覆盖13个类别。
OpenEarthMap-SAR数据集[243]是一个用于全球高分辨率土地覆盖制图的大型SAR图像基准数据集,解决了缺乏特定SAR基准的问题。它包含来自日本、法国和美国35个地区的5033张图像中的150万个片段,标记为8个类别。作为官方的“IEEE GRSS数据融合竞赛Track I”数据集,它支持在具有挑战性的现实世界设置下的语义分割研究。

- DA-RSDet的基准数据集:对于DA-RSDet,基准数据集(表VII)主要由高分辨率航空和卫星图像组成。也包括基于SAR的检测数据集。这些数据集强调在复杂地理空间场景中准确的目标定位和识别,为评估DA-RSDet任务提供了基础。
DOTA数据集[244]是一个用于航空图像中目标检测的大规模基准,包含来自多个传感器和平台的图像。它包含具有不同尺度、方向和形状的多样化目标,由专家使用任意四边形进行标注。该数据集包括15个类别、2,806张图像和超过188,000个实例。该数据集已在多个版本中扩展[257]、[258]。
xView数据集[245]是一个基于WorldView-3图像构建的大规模 overhead 目标检测数据集,分辨率为0.3米,覆盖超过1,400平方公里。它包含来自60个类别的超过100万个目标,通过严格的多阶段质量控制过程进行标注。
DIOR数据集[246]是一个用于遥感目标检测的大规模基准,包含23,463张图像和192,472个手动标注的实例,涵盖20个类别。它以其广泛的物体尺寸变化而著称,跨越不同的分辨率和多样化的类内和类间尺度。
UCAS-AOD数据集[247]由谷歌地球图像构建,专注于具有多样化方向的车辆和飞机。车辆数据集包含310张图像,有2,819个标注的车辆实例,而飞机数据集包括600张图像,包含3,210个飞机实例。其平衡的方向分布和目标检测的细粒度注释使其在遥感中具有重要意义。
CARPK数据集[248]是第一个用于车辆计数的大型无人机停车场数据集。它包含1,448张图像和89,774个标注的车辆。每张图像的分辨率为1280×720像素。
NWPU_VHR-10数据集[249]为多类地理空间目标检测提供了一个多样化且具有挑战性的基准。它涵盖10个类别,有3,651个手动标注的实例,并提供正负样本以进行全面评估。
UAVDT数据集[250]为无人机目标检测提供了一个大规模基准。它包含179个视频,超过80,000帧。一个包含10,000张图像的实验子集也可用,包含三个标注的目标类别。
Visdrone数据集[251]是一个包含超过10,000帧的大型无人机基准,从超过6小时的视频中收集。它专注于三个常见目标类别,图像分辨率在540p和1080p之间。该数据集分为6,883张训练图像和546张测试图像。
HRRSD数据集[252]确保了训练、验证和测试子集之间的平衡分布。它包括13个目标类别,有26,722张图像,从谷歌地球和百度地图收集,空间分辨率在0.15米和1.2米之间。
LEVIR数据集[253]包含超过22,000张高分辨率谷歌地球图像,大小为800×600像素,空间分辨率为每像素0.2~1.0米。该数据集包括三个目标类别——飞机、船舶和油罐,总共有11,000个标注的边界框。通过仅关注船舶并排除无关类别,它被广泛用于领域自适应研究。
SAR船舶检测数据集(SSDD)[254]包含1160张SAR图像,有2456个船舶实例,涵盖了多样的海况、分辨率和传感器。它通常与HRRSD数据集[252]配对,以评估从光学到SAR图像的跨模态领域自适应。
SAR-Ship-Dataset[255]由中国科学院发布,主要由GF-3 SAR图像构建,提供了43,819个具有多样化背景的船舶芯片。它作为一个大规模基准用于基于SAR的船舶检测。
miniSAR和FARAD数据集由桑迪亚国家实验室分别于2005年和2015年获取。miniSAR数据集包括9张图像,其中7张用于训练,2张用于测试。FARAD包含106张图像,分为78张训练图像和28张测试图像。两个数据集都表现出显著的领域差异,使其成为评估跨域SAR图像分析方法的合适基准。
AIR-SARship-1.0[256]包含31张大型场景SAR图像,共有879艘船舶,分辨率为1米和3米。它通常用于基于SAR的船舶检测实验的领域自适应。
B. 实验结果的比较与分析
在本节中,我们回顾了DA-RS任务的最先进方法,特别关注表V、表VI和表VII中总结的主流基准数据集。我们强调了广泛用于比较评估的代表性算法。由于不同论文重新实现了其他方法进行比较,表中的结果根据原始论文报告。
在本综述中,我们关注广泛研究的UDA设置,主要指单源单目标场景。我们还包括了已进行相对系统研究的其他设置。
- DA-RSCls的基准性能:在DA-RSCls任务中,常用的评估指标是总体准确率(OA)、平均准确率(AA)和kappa系数(κ)。OA衡量整个数据集中正确分类样本的比例,反映了全局分类性能。AA计算各类别准确率的平均值,在类别分布不平衡时提供更公平的评估。κ考虑了预测和真实值之间超出偶然性的 agreement,提供了对分类一致性的更严格评估。为了在不同方法之间保持实验一致性,本综述主要采用OA作为主要评估指标。

HSI数据集上的基准性能。表VIII总结了代表性UDA-RSCls方法在表V所列HSI基准数据集上的性能。
在休斯顿数据集中,Houston2013和Houston2018分别作为源集和目标集。从Houston2013场景中提取了7个一致的土地覆盖类别,以对应Houston2018场景。列出了以下2个领域自适应任务:
- 将Houston2013自适应到Houston2018(KaTeX parse error: Expected 'EOF', got '}' at position 55: …{\mathrm{HS}}18}̲)。
- 将Houston2018自适应到Houston2013(HS18 → HS13)。
在HyRANK数据集中,Dioni和Loukia分别作为源集和目标集。从Dioni和Loukia中提取了12个一致的土地覆盖类别。列出了以下2个领域自适应任务:
- 将Dioni自适应到Loukia(Dioni → Loukia)。
- 将Loukia自适应到Dioni(Loukia→Dioni\mathrm{Loukia}\rightarrow\mathrm{Dioni}Loukia→Dioni)。
在杭州-上海数据集中,杭州和上海分别作为源集和目标集。从杭州和上海中提取了3个一致的土地覆盖类别。列出了以下2个领域自适应任务:
- 将杭州自适应到上海(HZ→SH\mathrm{HZ\rightarrow SH}HZ→SH)。
- 将上海自适应到杭州(SH→HZ\mathrm{SH}\rightarrow\mathrm{HZ}SH→HZ)。
在帕维亚大学和中心数据集中,帕维亚大学和帕维亚中心分别作为源集和目标集。从帕维亚大学和帕维亚中心中提取了7个一致的土地覆盖类别。列出了以下2个领域自适应任务:
- 将帕维亚大学自适应到帕维亚中心(PU→PC\mathrm{PU}\rightarrow\mathrm{PC}PU→PC)。
- 将帕维亚中心自适应到帕维亚大学(PC→PU\mathrm{PC}\rightarrow\mathrm{PU}PC→PU)。
在博茨瓦纳数据集中,三个子集(5月、6月、7月)用作源域和目标域,有9个一致的土地覆盖类别。每个子集可以作为源域,而其他两个作为目标域,从而产生6个领域自适应任务。
- 将5月自适应到6月(May→June\mathrm{May}\to\mathrm{June}May→June)。
- 将6月自适应到5月(June → May)。
- 将5月自适应到7月(May → July)。
- 将7月自适应到5月(July → May)。
- 将6月自适应到7月(June → July)。
- 将7月自适应到6月(July → June)。
从表VIII的性能比较中,我们从以下几个角度进行了深入分析。(1) TSTnet[81]、S4DL[90]和DAN_MFAC[94]研究了仅使用5%源样本进行训练的挑战性场景,并在“休斯顿”、“HyRANK”、“杭州-上海”和“帕维亚大学和中心”数据集上展示了有竞争力的性能。相比之下,其他方法不遵循这种受限设置,从而可以在全监督下进行更直接的比较。TAADA[74]在HyRANK数据集的自适应任务上取得了最高性能。在“HZ→SH”和“SH→HZ\mathrm{SH}{\rightarrow}\mathrm{HZ}SH→HZ”任务上,TAADA[74]和MLUDA[88]分别取得了最佳结果。UDACA[72]代表了帕维亚大学和中心数据集上的最先进水平。对于博茨瓦纳数据集,JCGNN[30]展示了明显的优势,在6个任务中的5个上取得了最佳结果。(2) 在HSI数据集上的DA-RSCls任务中,不同方法的实验配置差异很大。因此,我们建议在遵循这些方法时仔细检查每篇论文的实现细节。(3) 高光谱数据的预处理阶段起着至关重要的作用。因此,方法的比较不仅仅是关于深度学习技术,而是包含了预处理、超参数设置和其他相关因素的综合评估。(4) 一些数据集仅在孤立的方法中被探索,系统或连续的探索相对有限。因此,表VIII中并未呈现所有HSI数据集的结果。

航空和卫星光学图像数据集上的基准性能。表IX总结了代表性UDA-RSCls方法在表V所列航空和卫星光学基准数据集上的性能。
如表IX所示,我们选择了5个广泛应用的数据集,即AID (A) [1]、UC-Merced (U) [229]、WHU-RS19 (W) [230]、NWPU-RESISC45 (N) [2]和RSSCN7 ® [232]来构建以下UDA-RSCls任务。由于不同方法在实验中使用不同的数据集组合,共享类别的数量各不相同。因此,我们在表IX中进行了全面总结。
- UC-Merced和AID之间的自适应(A→U&U→A\mathrm{A}\to\mathrm{U}\&\mathrm{U}\to\mathrm{A}A→U&U→A)。
- UC-Merced和WHU-RS19之间的自适应(U→W&W→U\mathrm{U}\to\mathrm{W}\&\mathrm{W}\to\mathrm{U}U→W&W→U)。
- UC-Merced和NWPU-RESISC45之间的自适应(U→N&N→U\mathrm{U}\to\mathrm{N}\&\mathrm{N}\to\mathrm{U}U→N&N→U)。
- AID和WHU-RS19之间的自适应(A→W&W→A\mathrm{A}\to\mathrm{W}\&\mathrm{W}\to\mathrm{A}A→W&W→A)。
- AID和NWPU-RESISC45之间的自适应(A→N&N→A\mathrm{A}\to\mathrm{N}\&\mathrm{N}\to\mathrm{A}A→N&N→A)。
- UC-Merced和RSSCN7之间的自适应(U → R & R → U)。
- AID和RSSCN7之间的自适应(A → R & R → A)。
- NWPU-RESISC45和RSSCN7之间的自适应(N→R&R→N\mathrm{N}\to\mathrm{R}\&\mathrm{R}\to\mathrm{N}N→R&R→N)。
- WHU-RS19和RSSCN7之间的自适应(W→R&R→W\mathrm{W}\to\mathrm{R}\&\mathrm{R}\to\mathrm{W}W→R&R→W)。
从表IX的性能比较中,我们将从以下几点进行分析。(1) DATSNET[95]、MRDAN[96]、AMRAN[97]、SRKT[98]、DDCI[99]采用了相似的任务配置和实现细节。其中,DDCI[99]取得了最佳的整体性能。(2)在UDA-RSCls任务中,对抗学习机制常用于特征对齐,但在此设置下可能不够经济。由于分类依赖于全局语义特征而非细粒度的局部细节,对抗训练可能会引入不必要的复杂性和不稳定性。相比之下,更直接的分布度量算法可以提供一种更简单、更稳定的方式来减少领域差距,同时保持效率。

SAR数据集上的基准性能。尽管对SAR数据集的UDA-RSCls研究相对有限,我们仍然在表X中总结了SAR基准数据集上的代表性UDA-RSCls方法。
在SAMPLE[234]数据集中,UDA-RSCls任务在合成子集和实测子集之间进行,合成子集作为源域,实测子集作为目标域。
- 将合成自适应到实测(S→M\mathsf{S}\to\mathbf{M}S→M)。
反向设置(M→S\mathbf{M}\rightarrow\mathbf{S}M→S)未被考虑,因为它缺乏实际相关性。
在UDA SAR船舶分类任务中,使用了FUSAR-Ship[235]和OpenSARShip[236]。为确保一致性,选择了五个共享类别。任务通过在两个数据集之间自适应来制定。
- 将FUSAR-Ship自适应到OpenSARShip(F→O\mathrm{F}\to\mathrm{O}F→O)。
- 将OpenSARShip自适应到FUSAR-Ship(O→F\mathbf{O}\rightarrow\mathbf{F}O→F)。
如表X所示,PFDA[75]、VSFA[80]、TSIC[208]和DST[86]为SAR图像分类的领域自适应提供了见解。其中,VSFA[80]和DST[86]在各自的实验设置上取得了最佳性能。
- DA-RSSeg的基准性能:在DA-RSSeg任务中,模型性能使用IoU/mIoUIoU/mIoUIoU/mIoU和F1/mF−scoreF1/mF{\mathrm{-score}}F1/mF−score进行评估。对于类别iii,IoUi=tpi/(tpi+fpi+fni)IoU_{i}=tp_{i}/(tp_{i}+fp_{i}+fn_{i})IoUi=tpi/(tpi+fpi+fni),其中tpi, fpitp_{i},\;fp_{i}tpi,fpi和fnifn_{i}fni分别表示真阳性、假阳性和假阴性。mIoU是所有类别的平均值。F1-score定义为2×Precision×Recall/(Precision+Recall)2\times Precision\times Recall/(Precision+Recall)2×Precision×Recall/(Precision+Recall),mF-score是其在所有类别上的平均值。为了确保方法之间公平和一致的比较,本综述主要报告使用mIoU作为主要评估指标的结果。

如前所述,大多数最近的DA-RSSeg方法都集中在高分辨率航空和卫星光学图像上。在本综述中,我们在两个著名的基准数据集ISPRS[8]和LoveDA[6]上系统地比较了它们的性能。结果总结在表XI中。
ISPRS[8]是UDA-RSSeg任务中最广泛使用的基准数据集。它为DA任务提供了全面的覆盖,波茨坦提供了大规模多模态超高分辨率图像(IR-R-G和R-G-B),而瓦亨根贡献了IR-R-G图像。现有方法通常在该数据集上遵循两种评估设置:一些方法考虑包括“杂波”的所有6个类别(w/“Clutter”),而其他方法采用排除它的5类设置(w/o“Clutter”)。该数据集上的DA任务如下所示。
- 将波茨坦IR-R-G自适应到瓦亨根IR-R-G(P→V1◯\mathrm{P}\to\mathrm{V}\textcircled{1}P→V1◯)。
- 将瓦亨根IR-R-G自适应到波茨坦IR-R-G(V→P1◯\mathrm{V}\to\mathrm{P}\textcircled{1}V→P1◯)。
- 将波茨坦R-G-B自适应到瓦亨根IR-R-G(P→V2◯\mathrm{P}\to\mathrm{V}\textcircled{2}P→V2◯)。
- 将瓦亨根IR-R-G自适应到波茨坦R-G-B(V→P2◯\mathrm{V}\to\mathrm{P}\textcircled{2}V→P2◯)。
LoveDA[6]是DA-RSSeg任务的另一个著名基准数据集。它支持两个跨域任务(如下所列),其测试集通过在线服务器进行评估。
- 将城市自适应到农村(U→R\mathrm{U}\to\mathbb{R}U→R)。
- 将农村自适应到城市(R→U\mathbb{R}\to\mathbb{U}R→U)。
如表XI所示,可以得出以下观察结果:(1) 在ISPRS数据集上,MEBS[114]在“w/ Clutter”设置下取得了最佳性能,而DeGLGAN[110]在“w/o Clutter”配置下优于所有其他方法。此外,DeGLGAN在LoveDA数据集的“R → U\mathrm{R}~\rightarrow~\mathrm{U}R → U”任务上表现出色,而ST-DASegNet[46]在“U→R\mathrm{U}\rightarrow\mathrm{R}U→R”任务上取得了最佳性能。(2) PFM-JONet[51]并未达到最先进性能,这突显了基于基础模型的方法并不总是在特定下游任务上超越专用模型。(3) UDA-RSSeg任务中的类别级IoU结果提供了模型在不同类别上性能的更详细视图,可参考原始论文进行进一步分析。(4) 应注意的是,LoveDA排行榜包含许多方法,但并非所有方法都与已发表的论文相关联。
- DA-RSDet的基准性能:在DA-RSDet任务中,模型性能通常使用AP/mAPAP/mAPAP/mAP、AR/mARAR/mARAR/mAR和F1/mFF1/mFF1/mF-score进行评估。对于每个类别iii,平均精度(APi)定义为精度-召回率曲线下的面积,而平均平均精度(mAP)是所有类别APi的平均值。平均召回率(ARi)反映了正确检测到的目标比例,mAR是其在所有类别上的平均值。F1-score定义为2× Precision× Recall /(Precision+Recall),mF-score表示其在所有类别上的平均值。在本综述中,采用mAP@50(mAP50)(mAP_{50})(mAP50)作为主要评估指标,因为大多数现有方法都使用它。

我们选择表VII中的数据集来系统地报告UDA-RSDet方法的性能,详细任务如下所示。
- xView和DOTA之间的自适应(xView → DOTA-3)。
- DIOR和DOTA之间的自适应(DIOR→DOTA−10\mathrm{DIOR}\rightarrow\mathrm{DOTA-}10DIOR→DOTA−10)。
- NWPU VHR-10和DIOR之间的自适应(NWPU VHR-10 → DIOR)。
- UCAS-AOD和CARPK之间的自适应(UCAS−AOD → CARPK & CARPK → UCAS−AOD\mathrm{UCAS-AOD~{\rightarrow}~CARPK~\&~CARPK~{\rightarrow}~UCAS-AOD}UCAS−AOD → CARPK & CARPK → UCAS−AOD)。
- UCAS-AOD和ISPRS波茨坦之间的自适应(UCAS-AOD → ISPRS Potsdam)。
- HRRSD和SSDD之间的自适应(HRRSD → SSDD)。
- LEVIR和SSDD之间的自适应(LEVIR → SSDD)。
在UDA-RSDet任务中,“HRRSD → SSDD”任务代表了光学到SAR的场景,而“LEVIR → SSDD”任务对应于典型的SAR到SAR设置。所有剩余任务都属于光学到光学类别。
结果总结在表XII中。在这里,我们首先澄清,一些方法在相同数据集上使用不同的实验设置,例如不同的数据集划分和模型选择。因此,比较可能并不完全公平。本综述仅报告表VII中原始论文列出的结果。有关更多详细信息,请参阅原始论文。从结果和原始论文中提供的详细信息可以看出,最近的方法如FIE-Net[143]和CDST[41]在多个跨域任务上 consistently 取得了领先性能。
基于实验结果和之前的回顾,我们的分析如下。当前的UDA-RSDet方法大多使用混合策略,以自训练为核心,使用高质量的伪标签逐步自适应到目标域。对抗对齐作为一种辅助工具,通常与类别级约束或对比学习相结合,以提高特征一致性。
V. 未来工作
近年来,基于深度学习的DA-RS方法在分类、分割、检测和变化检测方面取得了显著进展。尽管取得了巨大进展,但在实际部署和进一步突破方面仍存在一些挑战。
有限计算资源的研究。大多数DA-RS方法依赖于计算量大的深度模型,这限制了它们在卫星、无人机和边缘设备等现实平台上的使用。未来的工作应专注于轻量级架构、高效优化和模型压缩技术,以在性能和实际部署之间取得平衡。
扩展到多源/多目标设置。大多数DA-RS方法专注于单源到单目标设置,只有少数考虑多源或多目标的问题。在实践中,应用总是面临具有不同条件的多样领域。将DA-RS扩展到多源和多目标设置可以提高可扩展性和鲁棒性,这需要新的领域融合和自适应泛化策略。
对Transformer结构的进一步探索。Transformer在视觉和多模态学习中取得了成功,但其在DA-RS中的潜力仍未被充分探索。未来的方法应研究注意力机制和分层表示如何捕捉跨领域不变性、提高语义一致性并增强跨任务的适应性。
对基础模型范式的探索。大多数基础模型都是基于Transformer架构构建的,它们的出现为DA-RS带来了新的机遇。利用视觉或视觉-语言基础模型并将其自适应到遥感任务中可以带来新的优势。它们可能提供更强的跨领域泛化能力,支持开放词汇识别,并实现任务可迁移性。总的来说,这些进展指向了领域自适应研究的一个新范式。
VI. 结论
本综述对遥感中基于深度学习的领域自适应方法的最新进展进行了全面综述,这些方法近年来迅速发展。我们通过一个统一的视角回顾了现有的相关方法,该视角考虑了任务分类、输入模式、监督范式和算法粒度,从而为该领域提供了系统的理解。此外,我们总结了基准工作,包括广泛使用的数据集和最先进方法的性能评估。最后,对未来研究方向的讨论概述了有前景的探索途径。我们希望本综述有助于增进对遥感领域自适应的理解,并作为参考支持和指导未来的研究。
更多推荐
所有评论(0)