logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

CVPR | 2026 | RVM-MAE

视频自监督学习是视觉表征学习的核心研究方向,依托掩码自编码器范式的VideoMAE、V-JEPA等模型,已成为视频特征学习的主流方案。但现有视频模型普遍存在设计缺陷,多采用对称掩码与全局时空注意力机制,忽略视频时序的因果性与方向性,无法适配在线流式推理场景,且长序列处理时计算成本高昂、特征稳定性差。与此同时,现有视觉模型存在明显能力割裂:以DINOv2为代表的图像模型擅长挖掘空间几何、像素级精细特

#人工智能#计算机视觉#深度学习 +2
AAAI | 2024 | BEV-MAE

当前基于激光雷达的自动驾驶场景三维目标检测方法主要采用从头训练范式。然而该范式高度依赖大规模标注数据,而数据采集过程往往成本高昂且耗时。自监督预训练是缓解这种对海量标注数据依赖的有效解决方案图1:性能提升与预训练时间的权衡关系(所有模型均在完整Waymo数据集上完成预训练,随后使用Waymo数据集中的20%训练样本进行微调)BEV-MAE的曲线上升最快且曲线顶点最高,说明BEV-MAE学习速度快且

#计算机视觉#人工智能#深度学习 +2
arxiv | 2025 | DuGI-MAE: Improving Infrared Mask Autoencoders via Dual-Domain Guidance

红外成像技术在弱光环境及恶劣天气条件下具有关键应用价值。然而,由于红外图像具有独特特征,基于可见光数据训练的掩码自编码器(MAE)等基础模型在红外图像解析任务中表现欠佳尽管InfMAE效果显著,但仍存在信息标记缺失、全局关联建模不足及非均匀噪声处理不力等局限性图1:(a)典型场景的代表性红外图像。左图:原始红外图像,背景信号强烈常会掩盖实际目标;中图:图像熵图;右图:采用自适应频域调制(AFDM)

#算法#人工智能#深度学习 +2
arxiv | 2025 | DuGI-MAE: Improving Infrared Mask Autoencoders via Dual-Domain Guidance

红外成像技术在弱光环境及恶劣天气条件下具有关键应用价值。然而,由于红外图像具有独特特征,基于可见光数据训练的掩码自编码器(MAE)等基础模型在红外图像解析任务中表现欠佳尽管InfMAE效果显著,但仍存在信息标记缺失、全局关联建模不足及非均匀噪声处理不力等局限性图1:(a)典型场景的代表性红外图像。左图:原始红外图像,背景信号强烈常会掩盖实际目标;中图:图像熵图;右图:采用自适应频域调制(AFDM)

#算法#人工智能#深度学习 +2
AAAI | 2025 | CMT-MAE

本文提出CMT-MAE,一种创新的协作式掩码自编码器框架,通过师生模型协同工作提升视觉预训练效果。该方法突破传统MAE仅依赖教师模型或随机掩码的局限,首次让学生模型参与掩码选择与重建目标制定。核心创新包括:(1)两阶段训练范式,先基础学习后协作优化;(2)线性聚合师生注意力图实现高效协作掩码;(3)双重重建目标结合师生特征。实验表明,CMT-MAE在ImageNet分类(ViT-B/16微调85.

#算法
到底了