TPAMI 2026 | 显著与伪装检测的通用解!VSCode-v2 凭动态提示实现全域性能提升
点击上方“小白学视觉”,选择加"星标"或“置顶”
重磅干货,第一时间送达
在计算机视觉领域,显著目标检测(SOD)和伪装目标检测(COD)是两大核心任务,涵盖RGB、RGB-D、RGB-T、视频等多模态场景。但现有模型要么针对性过强、泛化性差,要么多任务联合训练时易出现优化冲突,难以兼顾不同任务的共性与特性。近期,一篇题为VSCode-v2: Dynamic Prompt Learning for General Visual Salient and Camouflaged Object Detection With Two-Stage Optimization的论文,提出了一套全新的通用检测框架,通过动态提示学习和两阶段优化策略,不仅在6项SOD/COD核心任务上实现性能均衡提升,还具备零样本处理新模态任务的能力!
论文信息
题目: VSCode-v2: Dynamic Prompt Learning for General Visual Salient and Camouflaged Object Detection With Two-Stage Optimization
VSCode-v2:基于两阶段优化的动态提示学习通用视觉显著与伪装目标检测
作者:Ziyang Luo, Nian Liu, Xuguang Yang, Dingwen Zhang, Deng-Ping Fan, Fahad Shahbaz Khan, Junwei Han
一、研究背景:SOD与COD的痛点待解
SOD和COD虽同属二分图像分割任务,但核心目标截然不同:SOD找的是图像中最显眼、与背景差异大的物体,而COD要揪出那些“伪装”在背景里、纹理/结构与环境高度相似的目标。随着研究深入,这两个任务衍生出RGB、RGB-D、RGB-T、视频等多模态子任务(如图1),每个子任务都有专属的数据集和模型设计。
图1:SOD、COD及其多模态变体的双维度分类关系,清晰展现不同输入模态(领域)和检测目标(任务)的关联
现有方法的核心问题集中在两点:一是模型“定制化”严重,针对单一任务设计的架构,换个模态或任务就性能骤降;二是多任务联合训练时,“学共性”和“学特性”的目标相互冲突,优化难度大,且固定的提示策略和特征融合方式,让模型无法适配不同图像的分布差异,也难以灵活处理多模态输入。
二、VSCode-v2核心架构:从静态到动态的全面升级
为解决上述问题,研究团队提出VSCode-v2框架,整体架构如图2所示。该框架以VST(纯Transformer分割模型)为基础,核心改进集中在“动态提示生成”“灵活模态融合”“两阶段训练”三大方向,既保留了基础模型对跨任务共性的学习能力,又强化了对领域/任务特性的捕获。
图2:VSCode-v2整体架构设计,清晰展示两阶段训练流程、MoPE层融入方式及多模态融合逻辑
1. 提示专家混合层(MoPE):让提示“适配每一张图”
传统方法中,同一任务的所有图像共享一组固定提示,完全忽略了图像间的数据分布差异。VSCode-v2借鉴“专家混合(MoE)”思想,设计了MoPE层(如图4),让模型能根据输入图像的特征,动态选择并聚合最相关的提示“专家”。
图4:MoPE层工作机制,实现领域/任务提示的动态选择与聚合
具体来说,研究团队预先构建了领域提示池(覆盖RGB、深度、热成像、光流模态)和任务提示池(覆盖SOD、COD任务),通过两个可学习的门控机制,对输入图像特征进行处理后,为每个“专家”打分,筛选出Top-2最相关的领域和任务专家。最终的提示由这些高相关专家的输出加权求和得到,实现了“一张图一套专属提示”,大幅提升模型的自适应能力。
消融实验证实,领域和任务提示各设置5个专家、选择Top-2的配置,能在模型容量和计算效率间达到最佳平衡,比固定提示策略的性能更优。
2. 灵活的多模态融合:告别“固定MLP”,适配任意模态
此前的多模态融合依赖“通道拼接+MLP降维”,这种固定结构只能处理预设数量的模态,新增模态就需要重新训练。VSCode-v2将其替换为“均值聚合”——对不同模态单独处理后的特征,计算逐元素平均值,无需修改参数或重新训练,就能适配任意数量的输入模态,为零样本泛化打下基础。
3. 任务特定提示:编码器+解码器双维度强化
SOD和COD虽有共性,但特征关注点差异显著:SOD需聚焦前景,COD则要重视背景;且伪装目标的边界更复杂,需要更精细的解码过程。因此,VSCode-v2在编码器中加入任务特定提示,引导模型学习任务相关的语义特征;在解码器中单独设计SOD/COD专属提示(如图3),为伪装目标的边界重建分配更多注意力,解决了解码阶段任务特性捕捉不足的问题。
图3:任务特定提示在模型中的作用效果,有效区分SOD和COD的特征学习重点
三、两阶段训练+对比学习:优化效率与特征关联双提升
1. 两阶段训练:解耦“共性”与“特性”学习
传统单阶段训练同时优化“跨任务共性”和“领域/任务特性”,容易导致目标冲突。VSCode-v2将训练拆分为两个阶段:
-
第一阶段:移除所有提示模块,仅用基础模型联合训练所有任务,专注学习跨任务的通用特征表示,为后续学习打下基础;
-
第二阶段:引入MoPE层和任务特定提示,专门捕获领域/任务特性,同时加入知识蒸馏损失,借鉴初代VSCode模型的权重,避免MoPE层引入的信息损失。
实验表明,两阶段训练比单阶段训练在多数任务上性能更优,证明“先学共性、再学特性”的策略能有效降低优化难度。
2. 对比损失+数据增强:强化提示与特征的关联
为解决“提示与底层特征对应关系弱”的问题,研究团队设计了带数据增强的对比学习机制:
-
数据增强:将同一任务的两张图像垂直/水平拼接,丰富特征表示的多样性;
-
对比损失:以解码器输出的分割预测为依据,分离前景和背景特征,将前景特征与对应提示作为正样本,背景特征作为负样本,强制模型学习提示与图像语义的对应关系。
此外,还引入“提示判别损失”,确保不同领域/任务的提示具有区分性,避免提示信息纠缠,进一步提升特征学习的有效性。
四、实验验证:6大任务性能均衡提升,零样本泛化能力突出
1. 实验设置
研究团队在SOD/COD的全模态基准数据集上开展实验,包括RGB SOD(DUTS、ECSSD等6个)、RGB-D SOD(NJUD、NLPR等6个)、RGB-T SOD(VT821等3个)、VSOD(DAVIS等6个)、RGB COD(COD10K等3个)、VCOD(CAD等2个),采用结构度量(S_m)、最大增强对齐度量(E_m)、最大F-measure(F_m)作为核心评估指标。
训练过程中,图像统一调整为384×384后随机裁剪至352×352,使用Adam优化器,分阶段调整学习率,确保多任务训练的平衡性。
2. 核心结果
-
消融实验验证了各组件的有效性:MoPE层引入后,多数任务性能显著提升;加入知识蒸馏和对比损失后,性能进一步优化;两阶段训练相比单阶段,能更好地兼顾共性与特性;
-
与固定提示策略相比,MoPE动态提示的设计在所有任务上均表现更优;
-
零样本泛化测试:VSCode-v2无需修改参数,就能处理RGB-D视频SOD这一三模态新任务,证明了框架的通用适配能力。
五、总结与展望
VSCode-v2的核心贡献在于,从“动态提示生成”和“优化策略重构”两个维度,突破了通用视觉显著与伪装目标检测的瓶颈:
-
MoPE层实现了图像级的自适应提示生成,解决了固定提示的适配性问题;
-
两阶段训练+知识蒸馏,解耦了多任务优化的冲突,保留了模型的通用特征学习能力;
-
均值聚合的模态融合方式,让模型具备任意模态的适配能力;
-
对比学习机制强化了提示与特征的关联,提升了特征学习的有效性。
该研究为多模态、多任务的通用视觉检测提供了全新思路,不仅在SOD/COD任务上实现了性能突破,也为其他计算机视觉多任务学习场景提供了参考。未来,该框架有望进一步扩展到更多视觉任务中,推动通用视觉模型的落地应用。
下载1:OpenCV-Contrib扩展模块中文版教程
在「小白学视觉」公众号后台回复:扩展模块中文教程,即可下载全网第一份OpenCV扩展模块教程中文版,涵盖扩展模块安装、SFM算法、立体视觉、目标跟踪、生物视觉、超分辨率处理等二十多章内容。
下载2:Python视觉实战项目52讲
在「小白学视觉」公众号后台回复:Python视觉实战项目,即可下载包括图像分割、口罩检测、车道线检测、车辆计数、添加眼线、车牌识别、字符识别、情绪检测、文本内容提取、面部识别等31个视觉实战项目,助力快速学校计算机视觉。
下载3:人工智能0基础学习攻略手册
在「小白学视觉」公众号后台回复:攻略手册,即可获取《从 0 入门人工智能学习攻略手册》文档,包含视频课件、习题、电子书、代码、数据等人工智能学习相关资源,可以下载离线学习。
交流群
欢迎加入公众号读者群一起和同行交流,目前有SLAM、三维视觉、传感器、自动驾驶、计算摄影、检测、分割、识别、医学影像、GAN、算法竞赛等微信群(以后会逐渐细分),请扫描下面微信号加群,备注:”昵称+学校/公司+研究方向“,例如:”张三 + 上海交大 + 视觉SLAM“。请按照格式备注,否则不予通过。添加成功后会根据研究方向邀请进入相关微信群。请勿在群内发送广告,否则会请出群,谢谢理解~


更多推荐



所有评论(0)