logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

结合代码读3DGS&世界模型论文(1)——ICCV 2025 3DGS & 世界模型新工作GWM论文及代码解读

本文介绍了ICCV 2025的工作《GWM: Towards Scalable Gaussian World Models for Robotic Manipulation》,提出了一种基于3D高斯表示的新型世界模型Gaussian World Model (GWM)。该模型通过结合3D高斯溅射与扩散Transformer,实现了机器人操作任务中未来场景的准确预测。GWM包含两个核心组件:3D高斯

文章图片
#3d#论文阅读#图像处理 +1
【Video Agent 22】(CVPR 2026)Symphony: A Cognitively-Inspired Multi-Agent System for LVU

本文介绍CVPR 2026智能体长视频理解新工作Symphony。Symphony通过模拟人类认知模式,将任务分解为多个专门化智能体协作完成,包括规划、定位、视觉感知、字幕和反思智能体。Symphony采用反思增强的动态推理框架,通过迭代优化推理过程提升准确性。实验在LVBench等四个数据集上验证了其有效性,性能较现有方法提升5.0%。该方法为长视频理解提供了一种新的认知启发式解决方案。

文章图片
#学习#多模态#语言模型 +2
【Video Agent 09】(Arxiv2601,Meta)Agentic Very Long Video Understanding

本文介绍Meta新作EGAgent。EGAgent是一种基于实体场景图的智能体框架,用于解决超长视频理解任务。该方法通过构建人物、物体和地点之间的时空关系图,结合视觉和音频搜索工具,实现对连续数天视频的多模态推理。实验表明,EGAgent在EgoLifeQA和Video-MME(Long)数据集上分别达到57.5%和74.1%的准确率,显著优于现有方法。该研究为可穿戴设备AI助手的长时记忆和推理能

文章图片
#论文阅读#音视频#计算机视觉 +1
【Video Agent 11】(Arxiv2504)VideoExpert: Augmented LLM for Temporal-Sensitive Video Understanding

本文介绍VideoExpert,一种增强型多模态大语言模型(MLLM),用于时间敏感的视频理解任务。现有MLLM在时序定位等任务上表现不佳,主要依赖语言模式而非视觉线索生成时间戳。VideoExpert创新性地集成两个并行专家模块:Temporal Expert处理高帧率压缩特征以捕捉动态变化并实现精确事件定位;Spatial Expert专注于内容细节分析和指令跟随。通过特殊token <

文章图片
#人工智能#机器学习#多模态 +3
【Video Agent 04】(NeurIPS 2025)Deep Video Discovery: Agentic Search with Tool Use for Long-form VU

本文介绍NeurIPS2025提出的Deep Video Discovery(DVD)智能体,用于解决长视频理解中的时空复杂性挑战。该方法将长视频分割为多粒度数据库,并设计三种搜索工具(Global Browse、Clip Search、Frame Inspect),使智能体能自主规划搜索策略。实验表明,DVD在LVBench上达到74.2%的准确率(结合转录后76.0%),显著优于现有方法。该工

文章图片
#论文阅读#音视频#多模态 +1
【Video Agent 13】(Arxiv2604, Meta)Tempo: Small Vision-Language Models are Smart Compressors for LVU

Meta研究团队提出Tempo框架,通过小型视觉语言模型实现长视频的高效压缩和理解。该框架采用查询感知的自适应token分配策略(ATA),动态为关键片段分配密集带宽(每帧16 token),同时将冗余内容压缩为最小时间锚点(每帧0.5 token)。实验显示,6B参数的Tempo在LVBench基准(4101秒视频)上以8K token预算取得52.3分,超越GPT-4o等专有模型。该方法证明意

文章图片
#语言模型#人工智能#自然语言处理 +2
【Video Agent 10】(Arxiv2508)Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding

Video-EM提出了一种基于事件的情景记忆框架,用于解决长视频理解中的关键帧冗余和叙事碎片化问题。该方法通过多粒度语义匹配定位相关时刻,将其组织为时间连贯的事件,并编码为具身情景记忆(包含时空线索和实体信息)。通过推理驱动的自反思循环,系统迭代优化事件粒度,去除冗余,最终生成紧凑可靠的事件时间线。实验表明,Video-EM在使用更少帧数的情况下,显著提升了长视频问答性能,且兼容现有视频大语言模型

文章图片
#人工智能#自然语言处理#计算机视觉 +3
【Video Agent 08】(Arxiv2601)VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning

VideoThinker提出了一种基于合成工具交互轨迹训练的智能体式视频大语言模型(VideoLLM),旨在解决长视频理解中的信息丢失和时间定位问题。该方法通过将视频转换为文本描述,利用大语言模型生成多步工具使用序列,再映射回真实视频帧,构建交错式视频推理数据集。设计了时间检索和时间缩放两类工具,支持动态推理和自适应时间探索。实验表明,VideoThinker在长视频基准上显著优于现有方法,验证了

文章图片
#人工智能
【Video Agent 03】(CVPR 2025)DrVideo: Document Retrieval Based Long Video Understanding

本文介绍CVPR 2025最新工作DrVideo,一种基于文档检索的长视频理解框架,旨在解决现有方法在处理长视频时面临的关键信息定位和长距离推理难题。DrVideo将长视频转换为文本文档,通过检索模块定位关键帧,并利用多阶段智能体交互循环动态补充缺失信息。该方法在EgoSchema(3分钟)、MovieChat-1K(10分钟)和Video-MME(平均44分钟)基准上显著优于现有技术,最高提升2

文章图片
#计算机视觉#开源#人工智能 +1
【Video Agent 12】(CVPR 2026,代码解读已更新)VideoITG:MVU with Instructed Temporal Grounding

本文介绍CVPR 2026工作VideoITG,通过指令驱动的时间定位优化视频理解任务中的关键帧选择。针对现有方法在复杂指令跟随和时间建模上的不足,作者设计了VidThinker自动标注流程,构建包含4万视频和50万标注的VideoITG-40K数据集。实验表明,该框架能以更少帧数达到或超越现有最优方法的性能,在VideoMME等基准上展现出显著优势。核心创新在于将用户指令直接整合到帧选择过程,实

文章图片
#论文阅读#计算机视觉#transformer +3
    共 50 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择