CVPR 2026|别再一换线就重训:DGS让视觉大模型“学新不忘旧”
来源 Boosting Vision-Language Models Towards Cross-Domain Incremental Object Detection
作者 Xu Wang, Zihan Lin, Yixin Zhang, Zilei Wang
产线最怕的不是模型不会,而是新缺陷刚学会,旧缺陷先掉点。
新品导入、换线换型、相机更换、光照漂移、料号切换、缺陷库持续扩容,都是工业视觉的日常。
连续 fine-tuning 容易灾难性遗忘;每个场景单独训一套,又会带来模型版本爆炸、回归周期拉长、显存和部署资源越吃越多。
CVPR 2026 这篇工作换了个思路:不是继续堆模型,而是让视觉语言模型在新类别 + 新域不断到来的情况下持续学习,同时尽量守住老能力。作者提出跨域增量目标检测 CDIOD,并给出 Dynamic Group Subspace,简称 DGS。
对工业视觉而言,它的重要意义很直接:把一次性交付的检测模型,往长期可维护的模型资产推进。
全套《跨域增量工业视觉检测资料包》已整理完毕,内含 CDIOD任务设定、DGS核心框架拆解、DTG/LoRA/Adapter合并要点和后续创新选题方向,以及近年相关顶会顶刊论文合集。
免费发给你。获得方式在这👇:
一套模型连续吃新任务,真正难的是“别互相打架”
传统增量检测往往默认前后任务来自近似分布,但产线不是实验室。钢板、PCB、焊缝、铸件之间是大域差;同一产品换机台、镜头、曝光和表面批次,也会产生 domain shift。
CDIOD 把“加新类别”和“切新域”放进同一个连续任务流。模型不仅要学新东西,还得在跨域后保住历史能力。论文指出,大分布偏移下,全量微调容易严重遗忘,而一些 PEFT 方法虽然更稳,却又可能在新域上适应不足。
论文 Figure 1(a)|跨域增量任务流:从同域加类走向跨场景持续学习

映射到现场,就是今天加划痕,明天切新 SKU,后天换相机,下个月再补一个压伤类。难点已经从单次精度,转向模型寿命周期。
先看分布,再决定“共享还是隔离”
DGS 第一刀是 Dynamic Task Grouping,DTG。
新任务进来后,冻结视觉 backbone 提取特征,用均值 μt 和方差 Σt 估计任务分布,再与已有任务组比较 KL divergence。相似就并组,差异太大则新开一组。
工业现场可以把它理解成“工艺分仓”:近域共享经验,远域及时隔离。
这比机械地“一任务一 Adapter”更有工程味。因为任务 ID 一旦路由错了,后面的 Adapter 再强也白搭。论文实验也显示,group-wise routing 能明显缓解任务级路由混淆。
Adapter不能只会加,还得会“收口”
DGS 的第二个关键,是 IGA 和 IGC。
论文以 Grounding DINO 为底座,用 LoRA 做轻量更新,并把 Adapter 插入视觉和文本分支的 FFN。新任务进入已有组后,会从该组 base adapter 初始化一个 new adapter,训练后再合并回组内共享子空间。
λ 用来平衡旧知识保留和新知识吸收。合并完成后,new adapter 可以丢掉,避免任务越积越多、参数一路线性膨胀。
论文 Figure 4|DGS整体框架:任务分组、Adapter扩展、组内合并与推理路由

对于多 SKU、多机台团队,这一点很实在:模型不是越训越肥,而是边学边归档。
新工艺要敢学,老工艺要守住
全量 fine-tuning 的典型问题是新任务学得快,旧任务掉得也快;PEFT 更稳,但遇到大 domain shift 又可能学不透。
DGS 根据任务是否进入已有 group 动态切换训练 recipe:新组更强调适应能力;已有组则引入知识蒸馏,重点保护共享知识。
放到工业侧很好理解:新工艺冷启动和老工艺追加缺陷,本来就不该用同一套训练策略。
连续跑10个阶段,差距被拉到11.4 AP
论文使用 DIOR、Pascal VOC、RUOD 构建跨域连续任务流。
在 10 阶段的 0-5 设置下,DGS 最终平均 AP 达到 60.2,MR-GDINO 为 48.8,领先 11.4 AP;5 阶段设置下达到 64.7,比此前最佳结果高 8.5 AP。
论文 Table 1|CDIOD主结果:任务链越长,稳定性差距越明显

另一个值得工业团队关注的数据是参数量。完整 DGS 只增加约 1.2%额外参数,同时在连续任务增加时控制参数增长。
论文 Figure 7|10阶段增量下的参数增长与平均性能

下一阶段,工业视觉拼的可能是“模型维护成本”
DGS 更值得迁移的地方,不是某个公开数据集上的 AP,而是一套多产品、多域、持续迭代的模型维护范式。
把论文中的自然场景、水下、遥感换成钢板、PCB、焊缝、铸件,或者换成不同机台、不同相机、不同光学 recipe,逻辑依然成立:先判断域是不是一路,再决定共享还是隔离;近域复用知识,远域单开子空间;最后通过 Adapter 合并压住模型体量。
这套方案也有现实门槛。论文明确指出,DGS 比较依赖任务分布估计,数据量不足时可能产生错误分组。对工业场景而言,小样本、长尾缺陷、设备漂移、开放词汇识别,恰好都是后续可以继续往下挖的方向。
工业视觉下一阶段比拼的,可能不只是首版 mAP,而是谁能让一套模型在线上活得更久。
全套《跨域增量工业视觉检测资料包》已整理完毕,内含 CDIOD任务设定、DGS核心框架拆解、DTG/LoRA/Adapter合并要点和后续创新选题方向,以及近年相关顶会顶刊论文合集。
免费发给你。获得方式在这👇:
更多推荐
所有评论(0)