logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

NeurIPS 2025 Spotlight | 甩掉文本CoT!FSDrive:自动驾驶VLA新范式

《FutureSightDrive:基于时空视觉链式思考的自动驾驶框架》提出了一种创新的自动驾驶视觉推理方法。该研究突破传统文本链式推理的局限,通过构建统一的图像形式时空CoT(时空链式思考),使视觉语言模型能够以视觉方式进行未来场景预测和决策。核心创新包括:1)将VLM作为世界模型生成未来帧;2)采用渐进式生成策略确保物理约束;3)设计统一预训练范式激活视觉生成能力。实验表明,该方法在nuSce

文章图片
#自动驾驶#计算机视觉
NeurIPS 2025|MIT提出LGMP:面向预训练自监督视觉模型的数据集蒸馏

本文提出了一种针对预训练自监督视觉模型的数据集蒸馏新方法——线性梯度匹配(Linear Gradient Matching)。该方法通过优化合成图像,使其在预训练特征空间中产生的梯度与真实图像一致,从而仅需每类一张图像即可训练出高性能线性分类器。

文章图片
#图像处理#人工智能#计算机视觉
NeurIPS 2025 | 港中文提出COS3D:多模态融合语言与分割,创造开放词汇3D分割新范式!

语言场方法如 LangSplat、LEGaussians 等,通过可微分渲染将 CLIP 特征蒸馏至三维语言场中,实现对语言查询的响应,但其语言特征表达能力有限,导致分割边界模糊。为此,COS3D 提出协同场(collaborative field)概念,将实例场与语言场有机结合,通过双向映射机制在训练与推理阶段实现两者的协同优化,从而在分割质量与训练效率上均取得显著提升。COS3D 的核心思路是

文章图片
#人工智能#计算机视觉
水下图像模糊难分析?华科、国防科大提出NAUTILUS:首个水下多模态大模型,融合物理先验,带来清晰视角!

华中科技大学与国防科技大学联合提出首个水下多模态大模型NAUTILUS,突破传统水下视觉任务的局限。该研究创新性地构建了包含145万图像-文本对的NautData数据集,并设计了基于物理成像模型的视觉特征增强模块(VFE),在特征空间显式恢复水下退化图像信息。实验表明,NAUTILUS在8类水下任务中表现优异,显著提升识别准确性,且VFE模块可兼容主流多模态模型。研究成果为水下场景理解提供了新思路

文章图片
#人工智能#深度学习#计算机视觉
AAAI 2026|港科大等提出ReconVLA:利用视觉重构引导,刷新机器人操作精度!(含代码)

本文提出ReconVLA模型,通过隐式视觉grounding机制提升机器人操作精度。该方法让模型在训练中重建任务相关的凝视区域,引导视觉注意力聚焦目标物体。模型包含动作生成和视觉重构两个部分,使用扩散变换器从噪声中重建目标区域。

文章图片
#重构#机器人#计算机视觉 +1
水下目标检测新突破!哈工程&港理工提出U-DEC:端到端架构实现高精度实时检测

U-DECN的核心思路是在卷积编码器-解码器架构中引入多尺度特征、动态查询初始化与颜色去噪机制,以提升检测精度与速度,同时避免使用NMS和复杂注意力模块。U-DECN在卷积编码器-解码器架构中成功融合了多尺度特征、动态查询与颜色去噪机制,显著提升了水下目标检测的精度与速度,并在嵌入式设备上实现实时推理。的端到端水下目标检测模型,它基于卷积网络架构,融合了多尺度特征、动态查询初始化与颜色去噪机制,显

文章图片
#目标检测#目标跟踪#人工智能
ICCVW|ViT-YOLO:融合Transformer与YOLO的无人机图像目标检测新框架,突破尺度与背景复杂度瓶颈

本文提出了一种名为ViT-YOLO的混合目标检测框架,用于解决无人机图像中目标尺寸差异大、背景复杂等问题。该模型将多头自注意力机制嵌入CSP-Darknet主干网络以增强全局上下文信息提取,并引入加权双向特征金字塔网络进行多尺度特征融合。

文章图片
#计算机视觉
水下图像模糊难分析?华科、国防科大提出NAUTILUS:首个水下多模态大模型,融合物理先验,带来清晰视角!

华中科技大学与国防科技大学联合提出首个水下多模态大模型NAUTILUS,突破传统水下视觉任务的局限。该研究创新性地构建了包含145万图像-文本对的NautData数据集,并设计了基于物理成像模型的视觉特征增强模块(VFE),在特征空间显式恢复水下退化图像信息。实验表明,NAUTILUS在8类水下任务中表现优异,显著提升识别准确性,且VFE模块可兼容主流多模态模型。研究成果为水下场景理解提供了新思路

文章图片
#人工智能#深度学习#计算机视觉
李飞飞押注的3D世界模型,这篇论文一次性拆解明白!

本文系统综述了三维与四维世界建模方法,填补了该领域系统性综述的空白。研究聚焦从二维生成转向几何驱动的三维/四维建模,提出了基于视频、占据栅格和LiDAR的三类方法体系,并划分为数据引擎、动作解释器等四种功能类型。论文明确定义了世界建模概念,总结了VAE、GAN等生成模型在三维/四维数据上的应用,系统梳理了专用数据集(nuScenes、KITTI等)和评估指标(FID、IoU等)。实验表明,几何一致

文章图片
#计算机视觉
AAAI 2026|港科大等提出ReconVLA:利用视觉重构引导,刷新机器人操作精度!(含代码)

本文提出ReconVLA模型,通过隐式视觉grounding机制提升机器人操作精度。该方法让模型在训练中重建任务相关的凝视区域,引导视觉注意力聚焦目标物体。模型包含动作生成和视觉重构两个部分,使用扩散变换器从噪声中重建目标区域。

文章图片
#重构#机器人#计算机视觉 +1
    共 23 条
  • 1
  • 2
  • 3
  • 请选择