1. 项目概述:当深度学习遇见标签模糊性

在遥感图像分类,特别是像局部气候区(LCZ)分类这样复杂的任务中,我们常常会遇到一个棘手的问题:标签本身就不确定。想象一下,你拿着一张城市区域的卫星图像,交给十位遥感专家,让他们判断这片区域属于“紧凑低层建筑”还是“稀疏建筑”,结果可能得到好几种不同的答案。这种分歧不是错误,而是反映了现实世界的复杂性和人类认知的模糊性。传统的深度学习模型,比如我们熟悉的ResNet或VGG,在处理这类任务时,通常采用“独热编码”的硬标签进行训练。模型的目标是学会将一张图像唯一地、确定地归入某个类别。然而,这种“非黑即白”的训练方式,强行忽略了数据中固有的、有价值的模糊性信息,导致模型可能对边界模糊的样本产生过度自信的预测,其输出的“置信度”往往并不可靠。

不确定性量化(UQ)正是为了解决这个问题而生的关键技术。它的核心思想是,一个成熟的模型不仅要告诉我们“它预测了什么”,还要诚实地告诉我们“它对这个预测有多不确定”。这种不确定性主要分为两类: 认知不确定性 随机不确定性 。认知不确定性源于模型自身知识的不足,比如训练数据不够、模型结构不合适,这种不确定性可以通过获取更多数据或改进模型来减少。随机不确定性则源于数据本身固有的噪声和模糊性,比如传感器噪声、云层遮挡,或者——就像我们遇到的——专家标注之间的分歧,这种不确定性是固有的、无法消除的。一个优秀的UQ框架,应该能同时捕捉并量化这两种不确定性。

本文要探讨的,正是一种将标签不确定性“喂”给模型的高级玩法: 标签嵌入 。我们不再把一张图像的标签看作一个固定的点(比如“类别3”),而是看作一个在潜在空间中的分布。这个分布由多个专家的投票信息生成,它编码了“这张图更像A类,但也有点像B类”的模糊认知。然后,我们设计深度学习模型,不是去拟合一个硬标签,而是去学习这个复杂的、包含不确定性的标签分布。这就像教学生时,不仅告诉他标准答案,还告诉他其他可能的答案以及各自的合理性,从而培养出更稳健、更“谦虚”的思考能力。我们将构建一个三层次的不确定性量化框架,从基础的伪概率,到灵活的狄利克雷分布,再到融合了先验知识的贝叶斯标签嵌入,逐层深入,并系统评估这些方法在模型校准和分布外检测这两个核心下游任务上的表现。

2. 核心原理:三层次不确定性量化框架拆解

要理解标签嵌入的价值,我们首先需要建立一个清晰的不确定性量化层级观念。这个框架如同一个显微镜,让我们能逐级审视模型预测的“确信度”。

2.1 第一层:伪概率不确定性(Level-1)

这是最常见、最基础的一层。对于一个标准的K类分类神经网络,输入图像x经过网络前向传播,会得到一组未归一化的分数,即logits向量 h_θ(x) = [h1, h2, ..., hK] 。我们通常通过softmax函数将其转换为伪概率分布: ˆπ(y|x) = softmax(h_θ(x)) = exp(hk) / Σ exp(hj) 其中, ˆπk 可以被解释为模型认为输入属于第k类的“概率”。模型的最终预测是取概率最大的类别: ˆy = argmax(ˆπ) 。这一层的不确定性通常简单地用 1 - max(ˆπ) 来表示,即模型对最高概率类别的“不确信度”。

注意 :这里称之为“伪概率”是因为它们并非来自严格的概率模型,而是softmax归一化的结果。在模型过度自信时,即使预测错误, max(ˆπ) 也可能接近1,导致不确定性被严重低估。这是传统深度学习模型校准不佳的根源之一。

2.2 第二层:狄利克雷分布不确定性(Level-2)

为了获得更丰富、更灵活的不确定性表示,我们跳出softmax的范畴,将模型的输出空间松弛为一个 狄利克雷分布 。狄利克雷分布是定义在K维概率单纯形上的一个分布,其概率密度函数由一组正参数α = (α1, α2, ..., αK) 决定,记为 Dir(α)

这里的精妙之处在于:一个狄利克雷分布的期望 E[π] = α / Σα 正好对应一个分类分布(即softmax输出的那种概率向量)。但是,不同的α参数组合可以产生相同的期望值,却对应着完全不同的 浓度 。浓度参数 α0 = Σαk 是关键: α0 值越大,分布越集中在其期望值附近(不确定性低); α0 值越小,分布越分散在整个单纯形上(不确定性高)。

在第二层框架中,我们让神经网络直接输出这组α参数(通常通过对logits取指数得到: α = exp(h_θ(x)) )。这样,模型不仅预测了类别的期望概率,还通过α参数隐含地预测了该概率的 置信度 。从这个狄利克雷分布中,我们可以推导出多种不确定性度量,例如:

  • 总不确定性 :用预测分布的熵来表示。
  • 随机不确定性 :用狄利克雷分布下条件熵的期望来表示。
  • 认知不确定性 :用总不确定性减去随机不确定性(即互信息)来表示。

这种方法(如先验网络)的优势在于,它在一个统一的框架内同时建模了认知和随机不确定性。

2.3 第三层:贝叶斯标签嵌入不确定性(Level-3)

这是本文引入的创新层,旨在将 数据中固有的标签不确定性 直接整合到模型的学习目标中。其核心思想是:既然我们有多个专家对同一图像的投票数据 Y_i = (yi1, yi2, ..., yiK) (其中yik是投给类别k的票数),我们何不利用这些数据来为每个图像估计一个“真实的”、包含不确定性的标签分布呢?

我们采用一个 经验贝叶斯 框架:

  1. 建模 :假设每个图像的专家投票向量 Y_i 服从一个以潜在概率向量 π_i 为参数的多项分布: Y_i | π_i ~ Mult(π_i, J) ,其中J是专家总数。
  2. 层级先验 :进一步假设潜在概率向量 π_i 本身服从一个狄利克雷先验: π_i | α_i ~ Dir(α_i)
  3. 估计嵌入 :我们的目标是估计超参数 α_i 。通过贝叶斯定理,我们可以得到给定投票数据后 α_i 的后验分布。为了便于优化,我们通常对 α_i 取对数,得到无约束的嵌入向量 Z_i = log(α_i) ,并为其假设一个高斯先验。然后,利用马尔可夫链蒙特卡洛(MCMC)等随机估计算法,从所有训练数据的标签信息中,迭代地估计出每个图像对应的最优嵌入 Ẑ_i
  4. 转换为目标 :最终,我们将估计出的 Ẑ_i 转换回狄利克雷参数 ˆα_i = exp(Ẑ_i) 。这个 ˆα_i 就是我们的“软标签”或“标签嵌入”,它不是一个单一的类别,而是一个完整的分布,完美编码了该图像上专家共识与分歧的所有信息。

至此,我们得到了一个强大的学习目标:不再是用一个硬标签(如[0,0,1,0])去训练网络,而是用一个狄利克雷分布 Dir(ˆα_i) 作为目标。网络的任务就是学习预测一个与之匹配的狄利克雷分布 Dir(α_model) 。如何衡量两个分布之间的差距?自然就引出了下一节的核心:损失函数的设计。

3. 实操要点:损失函数设计与模型训练策略

有了标签嵌入作为目标,如何指导神经网络去学习它,是工程实现的关键。我们主要探讨三种不同的损失函数设计思路,它们各有侧重,适用于不同的场景。

3.1 KL散度损失:分布匹配的黄金标准

最直接的想法是,既然我们的预测和目标都是狄利克雷分布,那么最小化它们之间的KL散度就是最自然的选择。两个狄利克雷分布 Dir(α) Dir(β) 之间的KL散度有闭合形式的解:

KL(Dir(α) || Dir(β)) = log Γ(α0) - Σ log Γ(αk) - log Γ(β0) + Σ log Γ(βk) + Σ (αk - βk) * [ψ(αk) - ψ(α0)]

其中, α0 = Σαk , β0 = Σβk Γ 是伽马函数, ψ 是双伽马函数。

实操步骤

  1. 在训练前,离线为训练集中每个样本i计算其贝叶斯标签嵌入 ˆα_embedding,i
  2. 前向传播时,网络输出logits f_θ(x_i) ,通过 α_model,i = exp(f_θ(x_i)) 转换为预测的狄利克雷参数。
  3. 计算损失: L(θ) = KL(Dir(α_model,i) || Dir(ˆα_embedding,i))
  4. 反向传播,更新网络参数θ。

心得 :KL散度损失在理论上是完美的,因为它直接最小化预测分布与真实(嵌入)分布之间的差异。然而,在实际训练中需要特别注意数值稳定性。 α 参数经过指数运算后可能非常大,导致伽马函数计算溢出。一个常见的技巧是引入一个“温度”参数 t ,将logits缩放为 f_θ(x_i)/t 后再取指数,训练完成后在推理时再缩放回来。我们在实验中发现 t=3 是一个有效的值。

3.2 均方误差损失:嵌入空间的直接回归

第二种思路更直接:既然我们估计出的贝叶斯嵌入 Ẑ_i 本身是一个连续的、无约束的向量,为什么不把神经网络的学习目标设定为直接回归这个向量呢?这就将分类问题转化为了一个多输出的回归问题。此时,损失函数采用最常用的均方误差:

L_MSE(θ) = Σ_k (Ẑ_i,k - f_θ(x_i)_k)^2

这里, f_θ(x_i)_k 是网络第k个节点的原始输出(logits),我们让它直接去拟合 Ẑ_i,k

优势与挑战

  • 优势 :实现简单,计算高效,无需处理复杂的狄利克雷函数。
  • 挑战 :MSE损失假设各维度误差独立同分布,忽略了标签嵌入向量 Ẑ_i 各个维度之间可能存在的相关性。例如,如果“紧凑低层”和“开放中层”这两个类别的嵌入在潜在空间中本就接近,那么预测其中一个时产生的误差,对另一个类别的影响应该被考虑进去。MSE损失无法捕捉这种类间结构信息。

3.3 马氏距离损失:引入协方差结构的回归

为了克服MSE的局限性,我们引入马氏距离作为损失函数。马氏距离考虑了数据各维度之间的相关性,其定义为:

L_MD(θ) = sqrt( (f_θ(x_i) - Ẑ_i)^T * Σ^{-1} * (f_θ(x_i) - Ẑ_i) )

其中, Σ 是标签嵌入向量 在整个训练集上的经验协方差矩阵。这个协方差矩阵可以在估计嵌入的步骤中一并得到。

实操解析

  1. 在估计贝叶斯嵌入 Ẑ_i 的同时,利用MCMC采样过程中的样本,计算所有嵌入向量的协方差矩阵 ˆΣ_embedding
  2. 训练时,计算网络预测 f_θ(x_i) 与目标嵌入 Ẑ_i 之间的马氏距离作为损失。
  3. 马氏距离等价于先将数据投影到一个经过 Σ^{-1/2} 变换的空间,使得各维度去相关且方差归一化,然后再计算欧氏距离。这相当于让网络在学习时,更关注那些在嵌入空间中方差大的方向(类间差异大的方向),而忽略方差小的方向(类间差异小的方向)。

注意事项 :马氏距离损失的性能高度依赖于估计的协方差矩阵 Σ 的准确性。如果训练数据有限,或者嵌入估计算法不稳定, Σ 可能估计不准,甚至接近奇异矩阵,求逆时会导致数值问题。在实际应用中,往往需要加入一个小的正则化项 λI 来保证 Σ + λI 的可逆性。

3.4 一个重要的基线:无信息先验的简单狄利克雷模型

除了上述三种基于复杂嵌入的方法,论文中还设置了一个强有力的基线模型——简单狄利克雷模型。它不依赖于复杂的贝叶斯嵌入估计,而是采用一个非常直观的构造: 对于每个样本,给定专家投票向量 Y_i ,我们直接设定一个无信息先验常数 c (例如 c=1 ),然后根据共轭先验的性质,得到后验狄利克雷参数为: α_post,k = c + y_ik 然后,我们同样使用KL散度损失,让网络去学习预测这个 α_post 分布。

这个方法看似简单,但其哲学很深刻:它承认标签的不确定性(通过票数 y_ik 来体现),但又不对这种不确定性做任何复杂的先验假设。在后续的实验中我们会看到,这种“简单粗暴”的方法在分布外检测任务上表现异常出色。

4. 实验部署与评估:校准与OoD检测实战

理论再优美,也需要实验的验证。我们基于So2Sat LCZ42数据集的一个子集——包含10个欧洲城市、每张图像由10位专家独立标注的评估数据集——来展开实验。我们将17个LCZ类别合并为16类(因第7类数据极少且算法不稳定),并设计了两种数据划分策略来评估模型。

4.1 实验设置与模型对比

我们对比了七种不同的训练范式:

  1. 独热编码 :使用专家多数票作为硬标签,交叉熵损失。
  2. 分布标签 :使用专家投票的经验分布( Y_i / J )作为软标签,KL散度损失。
  3. 采样独热 :每个epoch从专家投票分布中采样一个标签作为硬标签,交叉熵损失。
  4. 简单狄利克雷 :使用 α = 1 + Y_i 作为目标,KL散度损失。
  5. KL嵌入 :使用贝叶斯标签嵌入 ˆα_i 作为目标,KL散度损失。
  6. MSE嵌入 :使用贝叶斯嵌入 Ẑ_i 作为目标,均方误差损失。
  7. MD嵌入 :使用贝叶斯嵌入 Ẑ_i 作为目标,马氏距离损失。

所有模型均基于Sen2LCZ网络架构,保持超参数一致(初始学习率2e-4,批次大小128,最大30轮,早停策略等)。

4.2 模型校准性能深度分析

模型校准衡量的是模型预测的“置信度”是否与其“准确率”相匹配。一个校准良好的模型,当它说“我有90%的把握”时,它的预测应该有90%是正确的。我们使用以下指标进行评估:

  • 期望校准误差 :将预测置信度区间[0,1]划分为M个分箱,计算每个分箱内平均置信度与准确率之差的加权平均。
  • 最大校准误差 :所有分箱中,置信度与准确率之差的最大绝对值。
  • 静态校准误差 :在类别级别计算校准误差,对每个类别单独分箱评估。

实验结果与解读 : 下表汇总了关键结果(基于论文数据整理):

模型 整体准确率 ECE (↓) MCE (↓) SCE (↓) 预测与嵌入的KL散度 (↓)
独热编码 0.723 0.142 0.411 0.168 1.892
分布标签 0.718 0.138 0.398 0.162 1.745
采样独热 0.701 0.149 0.423 0.171 1.934
简单狄利克雷 0.695 0.105 0.235 0.121 1.654
KL嵌入 0.711 0.055 0.289 0.128 1.203
MSE嵌入 0.706 0.061 0.301 0.130 1.315
MD嵌入 0.698 0.132 0.385 0.159 1.801

核心发现

  1. 嵌入方法的校准优势 :基于贝叶斯标签嵌入的模型(KL嵌入和MSE嵌入)在ECE和SCE上显著优于传统方法。 KL嵌入模型将ECE降低了超过60% 。这说明,让模型学习一个包含不确定性的软目标,能有效抑制其过度自信的倾向,输出更可靠的置信度。
  2. 简单狄利克雷的竞争力 :简单狄利克雷模型在校准方面也表现优异,尤其在MCE和SCE上甚至略胜嵌入模型。这表明,即使没有复杂的先验估计,仅仅将投票信息以狄利克雷参数的形式引入,也能极大改善校准。
  3. MD嵌入的困境 :马氏距离嵌入模型表现不佳。我们分析认为,嵌入空间的协方差结构可能过于复杂,使得回归任务变得困难,反而损害了校准性能。
  4. 准确率的轻微牺牲 :可以看到,校准性能最好的模型,其分类准确率相比独热编码基线有轻微下降(约1-2个百分点)。这是一个典型的 准确性-校准性权衡 。追求完美的校准有时需要以微小的准确率损失为代价,但在许多安全关键应用中,一个“知道自己不知道”的可靠模型,远比一个盲目自信的模型更有价值。

4.3 分布外检测性能剖析

分布外检测任务是评估模型不确定性的“试金石”。其核心思想是:模型在训练时只见过一部分类别(分布内,ID),在测试时,我们会混入它从未见过的其他类别(分布外,OoD)的数据。一个良好的不确定性量化模型,应该对ID数据给出低不确定性,对OoD数据给出高不确定性。

我们设计了两个实验场景:

  • 场景A(建筑类ID, 植被类OoD) :使用建筑类(1-10)训练,用非建筑类(A-G)测试。
  • 场景B(植被类ID, 建筑类OoD) :使用非建筑类训练,用建筑类测试。

我们使用接收者操作特征曲线下面积(AUROC)和精确率-召回率曲线下面积(AUPR)作为评估指标,数值越高说明模型区分ID/OoD的能力越强。我们测试了多种不确定性度量指标,包括最大softmax概率(MSP)、预测熵、证据深度学习中的Dempster-Shafer度量(DSM)、期望熵(随机不确定性)和分布不确定性(认知不确定性)。

关键结果与洞见

  1. 简单狄利克雷的统治力 :在OoD检测任务上, 简单狄利克雷模型展现了压倒性的优势 。在场景B中,其AUROC高达96.7%,远超其他模型。这是因为其无信息先验( c=1 )没有对ID数据给予过强的关注,使得模型在面对未知的OoD样本时,能更“敏感”地产生较高的不确定性。
  2. 嵌入模型的局限性 :与校准实验相反,基于贝叶斯嵌入的模型在OoD检测上表现平平,甚至不如传统模型。 原因在于,贝叶斯嵌入将数据特定的标签不确定性也编码了进去 。模型在学习过程中“吸收”了这种不确定性,导致其对ID数据预测的不确定性本身就较高,从而与OoD数据的不确定性区分度变小。这揭示了校准和OoD检测这两个任务之间可能存在的内在冲突:一个完美拟合了数据固有不确定性的模型,其不确定性估计可能不再适合用于检测“未知的未知”。
  3. 不确定性指标的选择 :并非所有不确定性指标都适用于OoD检测。例如,“证据”和“期望熵”在这些模型上的AUROC甚至低于50%(不如随机猜测)。 MSP和预测熵仍然是实践中最鲁棒、最通用的OoD检测指标 。DSM在狄利克雷模型上表现也很好。
  4. 场景不对称性 :场景A(建筑ID vs 植被OoD)的检测难度远高于场景B。所有模型在场景A中的AUROC最高仅约83%。这可能是因为建筑类内部差异大、结构复杂,其嵌入本身不确定性就高,而植被类相对均匀,模型对其预测非常自信,因此当建筑类作为OoD时,微小的不确定性提升就能被有效检测到。

5. 经验总结、避坑指南与未来展望

经过一系列实验的洗礼,我们对标签嵌入和不确定性量化有了更深刻的理解。以下是一些从实战中提炼出的核心经验和未来可探索的方向。

5.1 核心经验与避坑指南

  1. 明确你的首要目标:校准还是OoD检测?

    • 如果追求极致的模型校准 (例如在医疗诊断、自动驾驶中,需要置信度绝对可靠),那么 基于KL散度的贝叶斯标签嵌入方法是首选 。它能将专家分歧的不确定性有效传递给模型,产出概率解释性极强的预测。
    • 如果首要任务是分布外检测或异常发现 (例如在监控系统中发现未知物体),那么 简单狄利克雷模型往往是更好的选择 。它的无信息先验使其对未知样本保持“警惕”,能产生更具区分度的不确定性信号。
    • 鱼与熊掌难以兼得 :我们的实验表明,在这两个任务上取得同时最优是困难的。需要在设计系统时进行权衡。
  2. 实现中的数值稳定性是头等大事

    • 温度缩放必不可少 :直接对logits取指数得到α参数极易导致数值溢出(特别是使用FP16混合精度训练时)。务必引入温度参数 t ,在训练阶段对logits进行缩放( α = exp(logits / t) ),在推理阶段再缩放回来。 t=2 t=5 是常见的搜索范围。
    • 防止零参数 :狄利克雷参数必须为正数。在计算KL散度或采样时,如果 α 参数过小或为零,会导致伽马或贝塔函数计算错误。一个简单的技巧是为所有 α 加上一个极小的正数 ϵ (如1e-8)。
    • 协方差矩阵的逆 :如果使用马氏距离损失,计算经验协方差矩阵 Σ 的逆矩阵前,必须检查其条件数。通常需要添加一个小的正则化项 λI λ 可取1e-6到1e-4),即计算 (Σ + λI)^{-1} ,以确保数值稳定。
  3. 标签嵌入估计的质量是瓶颈

    • 贝叶斯标签嵌入的性能完全依赖于离线估计步骤的准确性。如果专家投票数据质量差(例如专家水平参差不齐、标注指南模糊),或者MCMC采样没有充分收敛,估计出的嵌入将是不可靠的,甚至会误导模型。
    • 建议 :在投入训练前,务必可视化检查嵌入结果。例如,可以在潜在空间(如通过PCA或t-SNE降维)中绘制不同类别的嵌入点,观察同类样本是否聚集,不同类是否分离,以及嵌入的分布是否合理。
  4. 不要迷信复杂的损失函数

    • 马氏距离损失在理论上考虑了类间相关性,但实际效果可能不如简单的MSE或KL散度。这往往是因为估计的协方差矩阵不能很好地代表真实的类间结构,或者这种结构对于分类任务本身并非最关键的因素。
    • 实践建议 :始终将KL散度损失作为一个强基线。它理论坚实,实现相对稳定,在大多数情况下都能提供优秀或可接受的结果。

5.2 未来扩展与研究方向

  1. 超越投票:融合语义信息的嵌入 当前的标签嵌入完全依赖于人工投票数据。一个有趣的方向是引入图像的 语义信息 来辅助或生成嵌入。例如,可以利用无监督或自监督学习(如CLIP、SimCLR)为图像提取特征,然后与投票信息共同学习一个联合嵌入空间。这样,即使某些样本缺乏专家投票,也能根据其视觉语义获得合理的嵌入。

  2. 动态与个性化的嵌入 目前的嵌入是静态的、每个样本固定的。可以考虑开发 动态嵌入网络 ,该网络能够根据输入图像的内容,自适应地调整或生成其标签嵌入。这类似于“条件先验”,让模型对不同的输入采用不同置信度的学习目标。

  3. 面向更广泛噪声标签的泛化 本文框架基于多专家投票这种特殊的“噪声”形式。未来研究可以测试其在其他类型噪声标签(如众包标注、自动生成的弱标签、部分标注)上的泛化能力。核心在于如何为不同类型的标签噪声设计合适的生成模型(似然函数)和先验。

  4. 与主动学习、持续学习的结合 高质量的不确定性估计是主动学习的核心驱动力。将本文的标签嵌入框架与主动学习结合,可以在标注成本有限的情况下,优先选择那些标签不确定性高(即专家分歧大) 模型认知不确定性高的样本进行标注,从而实现标注效益的最大化。同样,在持续学习场景中,模型对旧任务预测的不确定性可以用来防止灾难性遗忘。

最终,这项工作的价值在于它提供了一种范式转变:从要求模型“猜对答案”,到训练模型“理解问题的模糊性并表达自己的确信程度”。在遥感乃至更广泛的AI应用领域,当数据本身充满歧义时,这种能够量化并表达不确定性的智能,或许才是通向真正可靠决策系统的关键一步。

更多推荐