logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

红外与可见光融合目标检测基础知识

目标检测(Object Detection)是计算机视觉的核心任务之一,目标是让计算机模拟人类视觉能力,从图像或视频中识别出感兴趣的目标物体,并确定它们的具体位置。简单来说,就是同时回答两个核心问题:图像里「有什么」(目标类别),以及「在哪里」(空间位置)。输入:同一场景、同一时刻严格配对的可见光图像 + 红外图像过程:通过算法对双模态信息进行融合增强,再完成目标的识别与定位输出:与普通目标检测一

#目标检测#目标跟踪#人工智能
CVPR 2026 | 当Transformer邂逅Mamba:一种面向视频目标检测的Transformer-Mamba混合网络

本文提出的TMambaDet整体框架如图2所示。具体而言,每帧输入图像首先经过共享的骨干网络提取特征图,随后对特征图进行投影与展平处理,得到令牌(token)特征。接着,将令牌特征与对应的位置编码(由Deformable DETR[67]生成)相加,输入至空间自适应可变形Transformer编码器中,有效建模帧内长距离依赖关系并完成帧内特征聚合,输出空间编码特征。之后,将来自多帧的空间编码特征进

#transformer#音视频#目标检测
CVPR 2026 | DyFCLT:面向多模态微小目标检测的动态频率解耦跨模态学习 Transformer

阶段输入关键操作输出模态特征提取RGB、IR 图像双流 ResNet-50三层多尺度特征频率解耦QKVQ/K/VQKV特征FFT、动态径向掩码低/中/高频子带跨模态交互对应频带特征带内相关性与空间调制互补频率表征背景平滑DFCA 输出前景掩码、通道压缩噪声抑制特征引导上采样低层精细特征、高层语义特征动态核、pixel shuffle前景增强的多尺度特征检测输出双分支融合特征可变形 Transfor

#目标检测#学习#transformer +3
AAAI 2025 | MambaYOLO:一种基于状态空间模型的简单目标检测基线

在深度学习技术飞速发展的推动下,YOLO系列为实时目标检测器树立了新标杆。此外,基于Transformer的架构已成为该领域最强大的解决方案,通过大幅扩展模型的感受野实现了显著性能提升。然而这种改进也带来了代价——自注意力机制的二次复杂度增加了模型的计算负担。为解决这一问题,论文提出了一种简单却有效的基线方法Mamba YOLO。结构化状态空间序列模型S4和 Mamba,其根植于 SSM ,两者均

#论文阅读#目标检测#人工智能
PR 2024 | ICAFusion:迭代交叉注意力引导的多光谱目标检测特征融合

多光谱图像的有效特征融合在多光谱目标检测中具有关键作用。现有研究虽已证明卷积神经网络在特征融合中的有效性,但这些方法因局部特征交互的固有缺陷,容易因图像错位导致性能下降。为解决这一问题,我们提出了一种新型双交叉注意力变换器框架,通过建模全局特征交互并同步捕获跨模态互补信息,显著提升了目标特征的区分度。该框架通过查询引导的交叉注意力机制增强特征增强效果,但堆叠多个变换器模块会导致参数量激增和空间复杂

#论文阅读#目标检测#人工智能
AAAI 2025 | MambaYOLO:一种基于状态空间模型的简单目标检测基线

在深度学习技术飞速发展的推动下,YOLO系列为实时目标检测器树立了新标杆。此外,基于Transformer的架构已成为该领域最强大的解决方案,通过大幅扩展模型的感受野实现了显著性能提升。然而这种改进也带来了代价——自注意力机制的二次复杂度增加了模型的计算负担。为解决这一问题,论文提出了一种简单却有效的基线方法Mamba YOLO。结构化状态空间序列模型S4和 Mamba,其根植于 SSM ,两者均

#论文阅读#目标检测#人工智能
IF 2026 | SPGFusion:基于预训练视觉模型的语义先验引导红外与可见光图像融合

本文提出SPGFusion方法,利用CLIP和DINO预训练模型的语义先验实现红外与可见光图像的自适应融合。通过关联池化融合CLIP的全局语义和DINO的局部特征,生成无标注语义先验。设计语义自适应融合网络(包含CSAF和PSAF模块),利用跨模态注意力动态调整特征,突出关键语义信息。实验表明,该方法在视觉质量和语义精度上优于现有方法,且降低了对人工标注的依赖。主要创新在于引入预训练模型的语义先验

#论文阅读#目标检测#人工智能 +1
TPAMI 2024 | TIM Fusion :一种面向图像融合的任务引导、隐式搜索与元初始化深度模型

本文提出了一种任务引导、隐式搜索与元初始化深度模型(TIM Fusion)用于图像融合。该模型通过引入下游任务约束指导无监督融合学习,设计隐式架构搜索自动挖掘高效融合网络,并采用前置任务元初始化提升模型泛化能力。实验表明,TIM Fusion在视觉增强和语义理解等任务中表现出色,验证了其有效性和灵活性。主要创新点包括:任务引导的融合学习策略、高效的隐式架构搜索方法以及多任务快速适配的元初始化技术。

#论文阅读#目标检测#人工智能 +1
arXiv 2025 | IVGF:融合引导的红外和可见光通用框架

现有方法多采用任务特定框架,导致跨任务泛化能力受限。本文提出融合导向型红外可见通用框架IVGF,可轻松扩展至多种高级视觉任务。首先采用SOTA红外可见基础模型提取通用表征,继而设计特征增强模块和标记增强模块分别优化特征图与标记的语义信息。创新性地引入注意力引导融合模块,通过探索双模态互补信息实现高效融合。同时采用切割混合增强策略进行数据增强,进一步提升模型挖掘双模态区域互补性的能力。本文提出的方法

#论文阅读#计算机视觉#人工智能
AAAI 2025 | MambaYOLO:一种基于状态空间模型的简单目标检测基线

在深度学习技术飞速发展的推动下,YOLO系列为实时目标检测器树立了新标杆。此外,基于Transformer的架构已成为该领域最强大的解决方案,通过大幅扩展模型的感受野实现了显著性能提升。然而这种改进也带来了代价——自注意力机制的二次复杂度增加了模型的计算负担。为解决这一问题,论文提出了一种简单却有效的基线方法Mamba YOLO。结构化状态空间序列模型S4和 Mamba,其根植于 SSM ,两者均

#论文阅读#目标检测#人工智能
到底了