1. 项目概述与核心挑战

在机器学习安全领域,对抗性样本(Adversarial Examples)是一个绕不开的难题。简单来说,攻击者只需对一张“熊猫”图片添加人眼难以察觉的细微扰动,就能让一个训练有素的图像分类模型以99%的置信度将其识别为“长臂猿”。这并非科幻,而是当前深度学习模型在现实部署中面临的真实安全威胁。其根源在于高维特征空间中,模型的决策边界往往并非平滑且鲁棒,攻击者可以沿着损失函数的梯度方向,高效地找到那些能让模型“失明”的扰动。随着AI在自动驾驶、医疗影像分析、金融风控等关键领域的深入应用,构建能够抵御此类攻击的鲁棒模型,已从学术研究课题演变为一项紧迫的工程与安全需求。

然而,过去几年的研究陷入了一种“猫鼠游戏”的循环:一种新的防御方法(如对抗训练、随机化、模型集成)被提出,宣称具有高鲁棒性;不久后,针对该防御弱点量身定制的新型攻击便被设计出来,轻易将其攻破。这种动态表明,依赖单一的、“最佳”的防御策略是脆弱的。一个更根本的问题是: 不同防御机制之间,是否存在某种“互补性”? 能否利用这种特性,构建一个动态、自适应的防御体系,而非静态的“马奇诺防线”?

这正是“博弈论混合专家”(Game-theoretic Mixed Experts, GaME)框架试图回答的问题。它不再寻求一个“银弹”防御,而是将攻击与防御的对抗建模为一个博弈过程。防御方(玩家D)拥有一个由多种异构防御模型(专家)组成的武器库,攻击方(玩家A)则掌握着多种攻击算法。双方的目标是最大化自己的收益(对防御方是鲁棒精度,对攻击方是攻击成功率)。通过求解这个博弈的混合纳什均衡,防御方可以获得一个最优的随机化策略——即,对于每一个输入样本,以特定的概率分布从武器库中选择一个或多个防御专家进行决策。这种思路的核心洞见在于: 针对单一防御精心设计的攻击,往往难以有效迁移到其他架构或原理不同的防御上 。GaME框架正是要系统性地利用这种低迁移性,让攻击者无法预测下一次会遇到哪种防御,从而大幅提高其攻击成本与不确定性。

2. 核心防御机制解析与攻击迁移性实验

要理解GaME框架的威力,首先需要剖析其武器库中的核心“专家”成员,并验证它们之间攻击迁移性低的假设。我们选取了几类具有代表性的前沿防御方法进行组合。

2.1 核心防御机制深度剖析

2.1.1 随机变换弹幕(Barrage of Random Transforms, BaRT) 这是一种基于输入随机化的防御策略。其核心思想是在模型推理时,对输入图像施加一系列随机顺序、随机参数的图像变换(如旋转、缩放、噪声添加、色彩抖动等)。由于变换的随机性,攻击者难以计算一个稳定的梯度方向来生成有效的对抗样本。我们实验中使用了BaRT-1, BaRT-5, BaRT-10等变体,数字代表每次预测时应用的随机变换数量。数量越多,随机性越强,但也会轻微降低正常样本的分类精度(Clean Accuracy)。

注意 :许多防御在提出后很快被攻破,但BaRT是少数即使面对针对性白盒攻击仍能保持相当鲁棒性的方法。其关键在于集成了不可微的变换(如JPEG压缩),这直接阻碍了基于梯度优化的攻击算法。

2.1.2 友好对抗训练(Friendly Adversarial Training, FAT) 对抗训练通过在训练过程中注入对抗样本来增强模型鲁棒性。FAT是PGD对抗训练的一种改进,它引入了一个早停机制τ:在生成对抗样本的迭代过程中,如果当前样本已被模型误分类,则提前停止扰动生成。这避免了“过度训练”在过强的对抗样本上,从而在保持高鲁棒性的同时,也维持了较高的正常样本分类精度。我们将其应用于两种不同架构:传统的ResNet-164和视觉Transformer(ViT-L-16),以探索架构差异的影响。

2.1.3 变废为宝(Trash is Treasure, TiT) 这是一种巧妙的双模型防御架构。它训练两个模型:一个“诱饵”模型Cb和一个“主力”模型Ca。攻击者针对Cb生成对抗样本,而Ca则被专门训练来正确分类这些针对Cb的对抗样本。在推理时,输入x先经过Cb并对其生成对抗扰动ψ(x, Cb),然后将这个被扰动的样本送给Ca做最终分类。其核心思想是利用两个模型决策空间的差异性,让针对一个模型的攻击对另一个模型失效。我们测试了两种变体:基于CNN的原始版本(VGG/ResNet)和混合架构版本(BiT/ViT)。

2.1.4 新颖模型架构:ViT与SNN 除了专门的防御算法,模型本身的架构特性也影响其鲁棒性。视觉Transformer(ViT)和脉冲神经网络(SNN)与标准CNN的决策机制存在本质不同。研究表明,针对CNN生成的对抗样本,对ViT和SNN的迁移成功率较低。我们将这些新颖架构也纳入防御池,旨在利用这种天然的“架构多样性”来增加攻击者的难度。

2.2 攻击迁移性实验与关键发现

我们设计了一个关键实验来验证核心假设: 针对特定防御生成的对抗样本,能否成功攻击其他防御?

我们在CIFAR-10数据集上,使用当前最强的定制化攻击(APGD攻击非随机防御,MIME攻击随机防御)分别去攻击上述每一种单一防御。然后,将这些生成的对抗样本,喂给其他所有防御模型,观察其被误分类的比例(即攻击迁移成功率)。

实验结果(如图1和表2所示)清晰地揭示了几个重要模式:

  1. 普遍的低迁移性 :平均而言,针对某一种防御生成的对抗样本,在其他防御上的平均攻击成功率仅为21.62%。例如,针对BaRT-1生成的对抗样本,对FAT ViT的攻击成功率只有0.8%。
  2. 架构同质性导致高迁移 :相同或相似架构的防御之间,攻击迁移性相对较高。例如,针对FAT ViT生成的攻击,对同样使用ViT的BVT(TiT BiT/ViT)防御有21.7%的成功率,这远高于对CNN架构防御的迁移率。
  3. 不存在“万能攻击” :没有任何一种单一攻击(APGD, MIM, MIME)能在所有防御上都取得高成功率(>50%)。

这个实验的结论是革命性的:它意味着 防御的多样性本身就是一种强大的武器 。攻击者无法找到一个“一击必杀”的策略来对付所有防御。这为构建基于博弈论的动态防御体系提供了坚实的经验基础——防御方可以通过随机地、策略性地选择不同的防御专家,迫使攻击者陷入“猜谜”游戏,从而系统性地提升整体鲁棒性。

3. 新型组合攻击算法设计

面对由多种异构防御组成的混合体系,传统的单一模型攻击显然力不从心。攻击者必须进化,发展出能够同时威胁多个目标的“组合拳”。为此,我们提出了三种新型的白盒攻击算法。

3.1 针对随机防御的动量迭代期望攻击(MIME)

随机化防御(如BaRT, TiT)通过引入随机性来破坏基于梯度的攻击。经典的期望过变换(EOT)攻击通过多次采样来估算随机变换下的期望梯度,但其效率和对强随机防御的效果有限。MIME攻击融合了动量迭代法(MIM)的稳定性和EOT的期望思想。

其更新公式的核心如下: g(i) = γ * g(i-1) + E_{t~T} [ ∂L / ∂t(x_adv(i)) ] 其中, g(i) 是第i次迭代的动量梯度, γ 是动量衰减因子, t 是从防御的变换分布 T 中采样的随机变换函数, L 是损失函数。

实操解析 :在每次迭代中,MIME并非计算单一变换下的梯度,而是对防御可能应用的多种随机变换进行采样(例如,对BaRT采样N次不同的变换组合),计算损失相对于扰动后输入的梯度,并取平均作为当前梯度的期望估计。这个期望梯度再与历史梯度(动量)结合,用于更新对抗扰动。这种方法使攻击能够更准确地“模拟”防御方的随机行为,从而找到在多种随机状态下都有效的扰动方向。

在我们的测试中,MIME在攻击TiT和BaRT时,攻击成功率显著高于APGD和MIM(如表1所示)。例如,对于BaRT-10,MIME-50(迭代50步)将攻击成功率从MIM的59.5%和APGD的70.8%,降低到了23.2%,这意味着防御的鲁棒性大幅提升。但更重要的是,MIME证明了即使面对强随机化,精心设计的攻击依然有效,这迫使防御不能仅仅依赖随机化。

3.2 针对多模型防御的多智能体梯度期望攻击(MAGE)

当防御方采用模型集成时,攻击者需要生成能同时欺骗多个模型的对抗样本。MAGE攻击正是为此而生。它是对现有Auto SAGA攻击的扩展,旨在攻击包含随机防御和非随机防御的混合体系。

MAGE的核心是计算一个混合梯度 G_blend G_blend(x_adv(i)) = γ * G_blend(x_adv(i-1)) + Σ_{k∈D\R} α_k(i) φ_k(i) ⊙ (∂L_k / ∂x_adv(i)) + Σ_{r∈R} α_r(i) φ_r(i) ⊙ (E_{t~T} [ ∂L_r / ∂t(x_adv(i)) ]) 这里, D\R 代表非随机防御集合, R 代表随机防御集合。 α 是各模型梯度的自适应权重, φ 是自注意力图(对于ViT模型)或全1矩阵(对于其他模型), 表示逐元素相乘。

算法逻辑拆解

  1. 梯度聚合 :对于非随机防御,直接计算其损失梯度;对于随机防御,使用MIME中的期望梯度估计方法。
  2. 权重自适应 :权重 α 并非固定,而是在攻击迭代过程中动态更新。其更新方向是使生成的对抗样本对当前所有目标模型的损失总和最大化。这通过一个内嵌的优化循环实现,确保攻击能平衡地对所有防御模型生效。
  3. 迭代扰动 :使用符号函数处理混合梯度 G_blend ,按照步长 ε_step 更新对抗样本,并投影到扰动约束球(l∞范数)内。

MAGE的本质是一个 多目标优化 过程。它不再追求欺骗某一个模型,而是寻找高维扰动空间中的一个“共识方向”,使得沿着这个方向移动,能同时增大所有目标模型的损失。这大大增加了攻击集成防御的效率。

3.3 针对检测器防御的MAGE-D攻击

更高级的防御会引入“检测器”机制,即当集成模型中的多个子模型对同一个输入的分类结果无法达成多数共识时,系统将其判定为对抗样本并拒绝分类(输出特殊标签⊥)。这要求攻击者不仅要让所有模型都错,还要让它们错成 同一个 错误类别,以形成虚假的“共识”。

MAGE-D攻击正是为了破解这种检测机制而设计。它在MAGE的基础上增加了一个 针对性攻击阶段

  1. 第一阶段 :运行标准的MAGE攻击(非定向),生成初始对抗样本 x_adv
  2. 检测判断 :如果 x_adv 成功欺骗了所有模型但被检测器以“无共识”为由拒绝(输出⊥),则进入第二阶段。
  3. 第二阶段 :对于集成中的每一个模型 m ,获取其对于 x_adv 的预测类别 y'_m (这很可能是五花八门的错误类别)。然后,针对每一个 y'_m ,发起一次 定向的 MAGE攻击,目标是让所有模型都将样本错误地分类为这个特定的 y'_m
  4. 选择最优 :在所有这些定向攻击生成的样本中,选择那个能使得检测器对于目标错误类别的置信度(softmax概率)最高的样本作为最终攻击样本。

实验表明,MAGE-D能显著提升对检测器防御的攻击成功率。在Tiny ImageNet数据集上,面对一个使用两个普通模型的检测器,MAGE的攻击有85.3%的样本被正确分类或检测出来,而MAGE-D将这个数字降到了0%,实现了完全攻破。

心得 :MAGE-D揭示了集成防御中“投票机制”的潜在弱点。单纯的多数投票或概率投票,在攻击者有能力协调所有模型的错误方向时,可能变得脆弱。这提示我们,未来的检测机制可能需要更复杂的共识形成逻辑,例如引入不确定性度量或基于特征的异常检测。

4. 博弈论混合专家(GaME)框架构建

基于“低迁移性”的观察和新型攻击的挑战,我们正式构建GaME框架。其目标是将攻击与防御的交互形式化为一个博弈,并求解近似最优的混合策略。

4.1 问题形式化:从连续空间到离散博弈

最广义的对抗样本博弈可以表述为一个极小极大优化问题: inf_{θ∈Θ} sup_{a∈A_ϵ*} E[L(x + a(θ, x, y), y; θ)] 其中,防御方 p_D 选择模型参数 θ ,攻击方 p_A 选择攻击函数 a ,目标是最大化/最小化期望损失 L 。然而,搜索整个连续的参数空间 Θ 和攻击函数空间 A_ϵ* 是计算上不可行的。

GaME的核心简化在于 离散化 :我们不再考虑所有可能的模型和攻击,而是从一个精心挑选的、有限的“专家”集合中选材。

  • 防御方策略集 D :一个包含 N_d 种现有防御模型(如BaRT-1, FAT ResNet, ViT等)的集合。
  • 攻击方策略集 A :一个包含 N_a 种攻击算法(如APGD, MIME, MAGE等)的集合。

这样,博弈被简化为一个 有限策略、零和、矩阵博弈 。我们可以通过实验,构建一个收益矩阵 R ,其中每个元素 R_{d,a} 表示当防御方采用策略 d (某个防御模型)、攻击方采用策略 a (某种攻击)时,防御方的收益(即模型在对应对抗样本上的鲁棒精度)。

4.2 求解混合纳什均衡

在纯策略博弈中,攻击者总能找到防御方最薄弱的环节进行攻击。因此,双方都需要采用 混合策略 ——即以一定的概率分布随机选择自己的策略。

设防御方的混合策略为一个概率向量 λ_D (长度为 N_d ),攻击方的混合策略为 λ_A (长度为 N_a )。那么防御方的期望收益为: U_D(λ_D, λ_A) = λ_D * R * λ_A^T 这是一个双线性形式。防御方希望最大化自己最坏情况下的期望收益(最大最小值),攻击方则相反。这个混合策略的纳什均衡可以通过求解一个线性规划问题来获得:

防御方线性规划

最大化 r*
约束条件: λ_D * R >= (r*, r*, ..., r*)  // 保证无论攻击方选何策略,收益至少为r*
          Σ λ_D_i = 1, λ_D_i >= 0

求解这个线性规划,我们就能得到防御方的最优混合策略 λ_D* 和其能保证的最小收益 r* (即博弈值)。同理,求解其对偶问题即可得到攻击方的最优混合策略 λ_A*

4.3 框架扩展:GaME_n 与 GaME-D_n

基础的GaME_1框架只允许防御方每次随机选择一个模型进行预测。我们将其扩展为更通用的GaME_n框架,允许防御方每次选择 最多n个模型 组成一个集成,并采用投票机制(如多数投票 f_h 或平均软概率投票 f_s )做出最终决策。此时,防御方的策略集 D 扩展为所有大小不超过n的模型子集与投票函数的笛卡尔积。这极大地增加了策略空间,但也提升了防御能力,因为攻击者需要同时欺骗多个模型。

进一步,我们引入 对抗检测机制 ,形成GaME-D_n框架。在此框架下,防御方的集成模型可以输出一个特殊的“对抗样本”标签 。其投票规则改为:仅当存在一个类别获得绝对多数的投票时,才输出该类;否则,输出 ,表示检测到对抗样本。这迫使攻击者必须协调所有模型的错误方向,如前文MAGE-D攻击所应对的那样。

5. 实验验证与结果分析

我们在CIFAR-10和Tiny ImageNet两个标准数据集上对GaME框架进行了全面评估。防御池包括BaRT-1/5, FAT ResNet/ViT, SNN以及TiT等7种模型。攻击池则包含了APGD, MIM, MIME以及针对所有可能防御对(pair)的MAGE和MAGE-D攻击,总计数十种攻击方式。

5.1 性能对比:单一防御 vs. GaME集成

实验结果(图2)令人印象深刻:

  • 在CIFAR-10上 ,最强的单一防御(FAT ResNet)的鲁棒精度为45%。而通过GaME框架找到的混合策略(GaME-1),在不使用检测器的情况下,将鲁棒精度提升至 63% ,相对提升达40%。当使用带检测器的GaME-D-7(最多7个模型集成)时,鲁棒精度进一步跃升至 82.31%
  • 在Tiny ImageNet上 ,最强的单一防御(BaRT-5)鲁棒精度仅为11%。GaME-1将其提升至 24.5% ,GaME-D-2更是达到了 57.40%
  • 清洁精度保持 :这些提升并非以牺牲正常样本分类能力为代价。GaME集成在CIFAR-10上保持了96.2%的清洁精度,在Tiny ImageNet上保持了72.6%,与顶级单一防御模型相当。

5.2 最优策略解读与洞察

分析求解得到的混合纳什均衡策略,能给我们带来更深层次的启发:

防御方策略(表9) :在CIFAR-10的GaME_1中,最优策略以36.5%的概率选择FAT ResNet,以27%的概率选择SNN Transfer,以23.6%的概率选择BaRT-5。而BaRT-1和BVT的概率为0。这告诉我们, 并非所有防御在混合策略中都是平等的 。FAT ResNet因其均衡的鲁棒性和清洁精度成为中流砥柱,而SNN和BaRT-5则提供了宝贵的多样性。BaRT-1虽然清洁精度高,但其对某些攻击的极端脆弱性(最低鲁棒精度仅2.5%)使其在混合策略中被“淘汰”。

攻击方策略(表10) :攻击方的最优策略高度倾向于使用多模型攻击(MAGE和MAGE-D)。例如,在CIFAR-10上,攻击FAT ResNet和FAT ViT的MAGE-D攻击占据了62.4%的概率质量。这印证了我们的核心观点:在面对混合防御时,攻击者必须采用组合攻击才能获得最佳效果。同时,攻击者倾向于选择目标为 不同架构 的防御对(如ResNet和ViT),因为针对同构防御的攻击迁移性高,收益有限。

5.3 计算成本与实用性考量

构建GaME框架需要为每一对(攻击, 防御)生成对抗样本并评估鲁棒精度,以填充收益矩阵 R 。这涉及到大量的前向传播和(对于攻击)反向传播计算。我们的实验表明,在CIFAR-10上构建包含7个防御、28种攻击的收益矩阵,总模型评估时间约为2.9小时(使用RTX 3080 GPU和i9 CPU)。其中,求解线性规划得到混合策略的时间仅占约3%(5分钟)。

实操建议 :对于实际部署,可以采用“离线计算,在线采样”的模式。离线阶段,在代表性数据集上计算好最优混合策略 λ_D* 。在线推理时,对于每个输入,只需根据 λ_D* 的概率分布随机选择一个(或一组)防御模型进行预测。这个随机选择过程开销极低,主要的计算成本就是所选模型的单次或数次前向传播,与使用单一复杂模型相当。

6. 常见问题、挑战与未来方向

在实际考虑应用GaME框架时,会遇到一些典型问题和挑战。

6.1 框架局限性与应对

  1. 防御与攻击池的完备性 :GaME的收益矩阵依赖于预设的防御和攻击集合。如果出现全新的、不在池中的“未知攻击”,其效果可能会下降。
    • 应对 :将GaME视为一个动态框架。可以定期将新出现的SOTA攻击和防御纳入池中,重新计算收益矩阵和混合策略,实现防御体系的迭代升级。
  2. 计算与存储开销 :维护一个包含多种大型模型(如ViT, BiT)的防御池,需要可观的存储和内存资源。
    • 应对 :模型蒸馏、剪枝和量化技术可以用于压缩各个“专家”模型的大小。此外,可以考虑使用共享底层特征提取器的多任务学习模型,或更轻量级的模型变体作为专家。
  3. 延迟敏感场景 :在需要极低延迟的应用中(如自动驾驶的实时感知),随机选择多个模型并集成可能会引入不可接受的延迟。
    • 应对 :优先选择推理速度快的模型组合,或采用级联架构:先用一个快速模型进行初筛,只有高不确定性的样本才触发更复杂、更多样的GaME决策流程。

6.2 策略部署中的实际问题

  1. 概率分布的采样 :在线服务中,如何实现按概率分布随机选择模型?一种简单高效的方法是生成一个[0,1)的均匀随机数,然后根据 λ_D* 定义的累积分布函数选择对应的防御策略。这可以在API网关或负载均衡器层面实现。
  2. 模型版本管理与更新 :当某个防御模型需要更新(如重新训练)时,需要重新评估其与所有攻击的交互,更新收益矩阵和混合策略。这需要一个自动化的模型评估和策略更新流水线。
  3. 输入一致性 :不同的防御模型可能对输入预处理(如归一化、尺寸)有不同要求。需要在策略调度层进行统一的输入适配,确保同一个样本经过不同预处理后,再送给对应的模型。

6.3 未来扩展方向

  1. 元学习与在线适应 :当前的混合策略是静态的。未来可以探索元学习框架,让防御系统能够根据实时观察到的攻击模式分布,动态调整混合策略 λ_D ,实现在线自适应博弈。
  2. 异构任务与模态 :将GaME框架推广到图像分类之外的任务,如目标检测、语义分割、自然语言处理等。不同任务下的防御机制(如针对目标检测的对抗补丁防御)和攻击方式可以纳入统一的博弈分析。
  3. 可解释性与策略分析 :开发工具来分析混合策略,理解为什么某些防御被赋予高权重,某些攻击被频繁使用。这不仅能增加系统的透明度,还能帮助研究者发现防御模型之间新的互补特性。

从个人实践角度看,GaME框架最大的魅力在于它提供了一种 系统性的、而非临时补丁式的安全设计哲学 。它承认了在对抗环境下不存在绝对安全的“银弹”,转而寻求在动态博弈中建立稳健的优势。这种思路不仅适用于机器学习安全,对于构建任何复杂的、处于对抗环境中的系统,都具有深刻的启发意义。它告诉我们,安全有时不在于筑起最高的墙,而在于让对手永远猜不透下一扇门在哪里。

更多推荐