【Video Agent 04】(NeurIPS 2025)Deep Video Discovery: Agentic Search with Tool Use for Long-form VU
【Video Agent】(NeurIPS 2025)Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
写在前面:如果想了解更多关于长视频理解和视频智能体新工作,可以关注笔者的Github仓库:Awesome-Video-Agent。
论文简介 🍀
- 📖 题目:Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding
- 📅 来源:NeurIPS 2025
- 🏫 单位:Microsoft Research Asia、University of Science and Technology of China
- 🌍 主页:https://github.com/microsoft/DeepVideoDiscovery
- 💻 代码:已开源
- ✒️ 摘要:长视频理解由于其广泛的时空复杂性,以及在如此扩展的上下文下进行问答的困难,带来了重大挑战。尽管大语言模型(LLMs)在视频分析能力和长上下文处理方面已经表现出显著进展,但在处理信息密集的小时级长视频时仍然存在局限。为克服这些限制,论文提出了 Deep Video Discovery(DVD) 智能体,以在分段视频片段上利用一种智能体式搜索策略。不同于先前那些对不同查询统一套用预定义工作流的视频智能体,论文方法强调智能体的自主性与自适应性。通过在多粒度视频数据库上提供一组以搜索为中心的工具,DVD 智能体利用 LLM 的高级推理能力,基于其当前观察状态进行规划,并结合已收集到的信息,策略性地选择工具,为不同查询编排自适应工作流。论文在多个长视频理解基准上进行了全面评测,结果表明了论文方法的优势。DVD 智能体在具有挑战性的 LVBench 数据集上达到了当前最优性能,准确率达到 74.2%,显著超过所有先前工作;结合转录文本后,准确率进一步提升到 76.0%。代码已发布。
图一:左侧:论文Deep Video Discovery智能体的插图,它自主地对用户查询进行推理,迭代使用工具来获得最终答案。右:LVBench上的性能比较。
一、论文阅读
1.1 引言(Introduction)
- 现有方法的不足:
- 现有视频智能体虽然引入了搜索过程,但搜索流程通常由人工先验手动设计(VideoTree),对细粒度查询效率不高,也难适应语义上相关但时间上不邻近的信息。
- 现有方法通常对所有问题使用固定工作流,无法适配不同查询的信息需求和最优搜索策略。
- 论文的核心思想(贡献):
- 将长视频理解建模为多步信息搜索问题,提出Deep Video Discovery,面向不同查询的自主、自适应搜索范式,而非固定工作流。
- 论文设计了多粒度搜索工具Global Browse、Clip Search和Frame Inspect,分别支持全局理解、片段检索和细粒度细节提取。
- 论文在LVBench等基准上取得领先结果,在LVBench上达到74.2%,结合转录后达到76.0%。
长视频在日常生活中无处不在,涵盖电影、会议记录、体育比赛和综艺节目等多种领域。准确理解并解释这些长视频中的内容,仍然是一项本质上具有挑战性的任务,这要求模型能够在广泛的全局上下文中,同时整合并推理复杂的时空细节。要从长达一小时甚至更长的视频序列中有效检索相关信息,不仅需要关注细粒度的局部细节,还需要同时解释分布在长时间区间中的微妙语义关系。近年来,大语言模型(LLMs)和大型视觉语言模型(VLMs)在视频理解能力方面取得了显著提升,并将上下文长度处理能力提高到超过一百万个 token。然而,即便是这种扩展后的上下文长度,对于理解通常存在于一小时长视频中的信息密度而言,仍然是不足的。经验观察还表明,随着时间维度和信息密度的增加,模型有效遵循指令的能力以及推理清晰度也会下降。
与此同时,近期关于 LLM 推理能力的突破推动了能够执行复杂信息收集任务的智能体系统的发展,例如 Deep Research或 Deep Search。这些智能体方法表明,将困难任务分解为模块化子任务,能够实现迭代推理、信息搜索和内容综合。受这些成功的启发,论文将极长视频理解这一挑战概念化为一个多步信息搜索问题,其中视频充当探索环境,并被切分为多个更短的视频片段,作为可管理的信息单元。论文将该方法命名为 Deep Video Discovery(见图1左)。
尽管现有的视频智能体框架在其设计中纳入了搜索过程,但它们是依据人工先验手动设计搜索流程的。例如,VideoTree 和 VCA 都采用了从根节点导航到叶节点的树式搜索策略。这种方法缓解了 VLM 的上下文长度限制,但对于细粒度查询而言效率较低,因为这类查询可能更适合直接在叶节点之间进行检索。此外,语义相关的实体未必具有时间上的接近性,这可能会削弱树式搜索方法中回溯机制的效率。最关键的是,这些现有框架规定了固定工作流,并将其统一应用于所有查询类型,因而无法适应不同问题所需的多样化信息需求和最优搜索策略。
与通常依赖人工定义的刚性工作流的现有系统不同,论文的方法明确围绕一种面向不同查询的自主且自适应的智能体式搜索范式来设计。论文并不显式规定任务工作流或搜索行为,而是开发了在多种粒度上运行的模块化搜索工具,包括:(1) Global Browse,(2) Clip Search,以及 (3) Frame Inspect。Global Browse 使得对整个视频中的主体和全局上下文进行全局摘要与索引成为可能。Clip Search 实现了对分段片段内相关事件的高效语义检索。具体而言,Frame Inspection 使智能体能够在指定时间范围内,直接从像素级信息中提取细粒度细节。
借助这套以搜索为中心的工具集和多粒度视频数据库,论文中的智能体天然具备自主推理、动态策略编排和迭代决策的能力,从而能够主动发现并提取关键证据。通过利用最新 LLM 所固有的复杂推理能力,该智能体并不是仅仅独立地使用这些工具,而是将它们的互补优势自适应地组合成思维链与工具使用链,从而有效应对长视频中的多种时空复杂问题。最终,Deep Video Discovery 能够通过针对特定视频理解查询而定制的自适应搜索策略,自主地进行推理、规划并检索相关信息。
论文在长视频基准上进行了全面评测,展示了该智能体的效率和强大。特别是在具有挑战性的 LVBench 上,论文将当前最优性能大幅推进到 74.2%(如图1右所示),并在结合辅助转录文本后进一步达到 76.0%。论文还进行了一系列消融研究,展示了工具设计的有效性。此外,论文分析了不同推理模型在工具使用序列中的行为模式,为未来开发面向长视频理解任务的智能体提供了启示。
1.2 方法(Deep Video Discovery)
为以一种智能体搜索的方式解决长视频理解问题,论文首先从长视频构建一个多粒度的结构化数据库。随后,该数据库服务于在不同粒度上运行的以搜索为中心的工具。具体而言,论文中的 Deep Video Discovery 智能体由三个主要组成部分构成:多粒度视频数据库 D \mathcal{D} D、以搜索为中心的工具集 T \mathcal{T} T,以及作为智能体编排器的 LLM M M M。给定用户查询 Q Q Q,智能体进行迭代推理,以选择一个动作 A i ∈ T ∪ { A N S W E R } A_i ∈ \mathcal{T} ∪ \{ANSWER\} Ai∈T∪{ANSWER} 及其参数 P P P,从视频数据库 D 中收集信息,或者参考这一过程中的累积信息来决定回答该查询。在接下来的小节中,论文将依次介绍多粒度视频数据库构建(the multi-grained video database construction),以及带有工具使用的智能体式搜索与回答(Agentic Search and Answer with Tool Use)。
1.2.1 多粒度视频数据库构建(Multi-granular Video Database Construction)
给定一个超长输入视频 V V V,论文的目标是将其转换为一个数据库,该数据库既能够提供高效快速的检索,又能够在必要时提供视频的原始像素以获取细节信息。因此,论文将其设计为一种多粒度风格,从而能够为相应的搜索工具提供不同层级的视频信息。具体而言,论文首先将视频分割为片段,作为基本信息单元,然后使数据库包含覆盖整个视频的全局摘要信息、一个基于片段的字幕语料,以及来自片段的索引帧。图2(左)给出了一个概览。论文依次介绍这些组成部分。

图二:深度视频发现包括两个阶段:1)多粒度视频数据库构建。论文从不同层次提取视频信息,以实现全面理解,高效检索和保留原始内容。2)快速搜索和回答。智能体对用户查询进行迭代推理,并利用定制的工具集收集信息以回答。
时间分割(Temporal segmentation)。论文首先将输入视频 V V V均匀划分为一个由不重叠短片段组成的时间序列 { v i } i = 1 N \{v_i\}_{i=1}^{N} {vi}i=1N,其中总分段数 N = ⌈ l e n ( V ) t ⌉ N=\lceil \frac{\mathrm{len}(V)}{t} \rceil N=⌈tlen(V)⌉。在经验上,论文设置 t = 5 t=5 t=5秒,以在计算成本与语义及动作完整性之间提供适当的平衡。随后,所有视频片段都以每秒2帧被解码为帧 f i i = 1 N {f_i}{i=1}^{N} fii=1N,用于后续处理。
多粒度信息提取(Multi-granular information extraction)。论文的多粒度视频信息被设计为三个层级:全局视频层级、片段层级和帧层级(global video level, clip level and frame level)。具体而言,在全局层级,论文将视频内容总结为紧凑的、以主体为中心的表示。在片段层级,论文利用文本字幕来促进高效的信息检索;而在帧层级,论文保留根据其对应片段建立索引的原始解码帧,从而在需要时支持精确引用和细致分析。
为了在最小化字幕生成冗余的同时导出以主体为中心的全局表示,论文在整个片段字幕生成过程中维护一个渐进式结构化主体注册表 S S S。具体而言,给定一个视频片段 v i v_i vi和解码帧 f i f_i fi,论文提示一个大型VLM生成字幕 c i c_i ci,并在出现新主体时更新注册表。该过程表示为 S i , c i = V L M ( f i , S i − 1 ) S_i, c_i = VLM(f_i, S_{i-1}) Si,ci=VLM(fi,Si−1),其中 S 0 S_0 S0被初始化为空,而在字幕生成过程结束时,最终的主体注册表记为 S = S N S=S_N S=SN。注册表中的每个主体都由一组全面的属性表示,包括名称、外观、身份描述、相关动作以及在视频中对应的时间跨度。随后,获得的字幕 c i c_i ci使用一个语言嵌入模型被嵌入为一个稠密语义向量 e i ∈ R d e_i \in \mathbb{R}^d ei∈Rd,以促进下游应用中的快速检索。尽管经过精心设计,字幕生成中固有的感知压缩不可避免地会带来一些信息损失。为在必要时缓解这一问题,论文显式保留了解码帧 f i f_i fi及其对应的文本字幕和嵌入。
结果(Outcome)。最终数据库因此封装了解码帧、字幕及对应的嵌入三元组,从而形成一个结构化数据库 D = { S , { f i , c i , e i } i = 1 N } \mathcal{D}=\{S,\{f_i,c_i,e_i\}_{i=1}^{N}\} D={S,{fi,ci,ei}i=1N}。这一离线构建过程将冗长的原始视频转换为一组带有关联片段、可进行文本检索的结构化嵌入,同时还保留了像素分辨率下的完整视觉内容。所得数据库成为自适应工具使用的基础,使得能够进行全局信息浏览、视频片段尺度上的高效语义检索,以及将生成输出全面落实回其源帧。
1.2.2 带有工具使用的智能体式搜索与回答(Agentic Search and Answer with Tool Use)
借助已构建的多粒度视频数据库,论文设计了一组以搜索为中心的工具,能够实现全局信息理解、基于语义查询的高效片段检索,以及对原始视频内容中的细节探索。通过为一个具备推理能力的大语言模型配备这套工具集,论文构建了 Deep Video Discovery,使其能够如图2(右)所示,通过自主规划和策略性的搜索工具组合来处理长视频中的复杂用户查询。论文将这一阶段称为带有工具使用的智能体式搜索与回答(ASA)。论文通过两个小节介绍这一阶段:以搜索为中心的工具准备,以及智能体设计。
1)以搜索为中心的工具准备(Search-centric Tool Preparation)
利用已建立的视频数据库,论文开发了一套工具,旨在高效地从不同粒度的视频数据中收集信息。具体而言,论文将长视频划分为三个不同的层级,并引入对应的专门工具:(1) Global Browse,(2) Clip Search,以及 (3) Frame Inspect。考虑到使用 VLM 处理长视频所伴随的显著计算成本,论文的工具设计在效率与性能之间进行了精心平衡。论文方法的核心是一种智能体式搜索范式,其中智能体对用户查询进行分解,并使用合成的参数对工具进行策略性串联,从而实现迭代推理和信息收集以解决任务。通过这些工具的有效整合与协同使用,智能体逐步增强其对用户意图的理解,并在海量视频内容中精确定位相关信息。论文在接下来的段落中依次介绍这三个工具。
工具:Global Browse。Global Browse 工具以视频数据库和原始用户查询作为输入,并返回捕获高层上下文信息的全局摘要。论文构建了两种不同类型的全局信息:以主体为中心的摘要和以事件为中心的摘要。对于以主体为中心的摘要,由于其与查询无关,在构建多粒度视频数据集时就已预先构建。对于以事件为中心的摘要,论文在整个视频上均匀采样帧,并将这些采样帧输入 VLM。论文指示 VLM 描述与原始用户查询显式相关的值得注意的事件。当智能体调用时,Global Browse 工具会高效地检索并返回这些全局表示,从而为智能体提供对高层全局上下文信息的即时访问。
工具:Clip Search。Clip Search 提供一种中层粒度的检索能力,能够通过字幕嵌入实现对视频内容的快速高效探索。给定一个基于智能体当前内部推理上下文所合成的查询 Q ^ \hat{Q} Q^,该模块会检索一个排序后的前 k k k个相关视频片段列表及其字幕。具体而言,该工具计算所提供查询的嵌入与所有视频片段字幕的预计算嵌入之间的余弦相似度,并返回与排名最高的字幕匹配对应的片段。每个被检索到的观测同时包含对应字幕以及相关视频片段的时间范围。为实现准确而详细的理解,智能体可以迭代调用该工具,根据新获得的上下文知识逐步细化时间约束或重构其查询。这种迭代的查询链方法有效地将智能体引导至与原始高层查询相关的精确时间片段。
工具:Frame Inspect。Frame Inspect 接收视频中的一个时间范围 [ t s , t e ] [t_s, t_e] [ts,te]以及一个由智能体自由定义的子查询作为输入,返回开放格式的视觉问答(VQA)响应。每当需要明确的帧级细节,例如细微属性、目标计数或细粒度空间关系,而这些内容在字幕或全局摘要中没有被清楚描绘时,智能体都可以调用该工具。开放式的查询格式使智能体能够在很大程度上利用其推理能力,从而实现高度自适应的视觉检查。具体而言,Frame Inspect 工具从所请求的区间中加载原始帧,并使用这些帧和由智能体合成的查询来提示一个 VLM。为确保计算效率,论文将处理限制在最多50帧,对于超过该限制的帧进行均匀采样。因此,所得到的响应为智能体提供了准确的、以视觉为基础的证据,这对于细致的推理任务至关重要。
2)智能体设计(Agentic Design)
为了最大程度地利用现代 LLM 内在的推理与规划能力,论文有意避免人工指示显式的搜索工作流或工具使用模式。相反,论文使智能体能够通过一种精简的、类似于 ReAct 的迭代式 observe-reason-act 循环来进行推理、规划并采取行动。对于一个给定查询,智能体会基于其当前观测状态进行推理,策略性地选择搜索工具,为动作制定合适的参数,并根据已收集的证据动态地改进其内部推理。在 ASA 中,LLM 充当一个复杂的认知驱动器,在每次迭代中基于累积知识和经过推理的证据采取行动,从而强化其在自适应导航发现过程中的关键作用。
具体而言,如算法1所示,给定初始用户查询 Q Q Q、预定义动作空间 A = T ∪ { A N S W E R } A = \mathcal{T} \cup \{\mathrm{ANSWER}\} A=T∪{ANSWER}以及最大允许步数 N N N,论文中的智能体执行迭代推理,以策略性地在可用动作之间进行导航。智能体利用一个 LLM M M M 对当前对话历史进行推理,规划其即时动作,与工具集 T = { G L O B A L B R O W S E , C L I P S E A R C H , F R A M E I N S P E C T } \mathcal{T} = \{\mathrm{GLOBALBROWSE}, \mathrm{CLIPSEARCH}, \mathrm{FRAMEINSPECT}\} T={GLOBALBROWSE,CLIPSEARCH,FRAMEINSPECT}交互,并收集观测 O i O_i Oi。更具体地说,在每一步 t t t,智能体维护一个历史上下文 H i H_i Hi,反思以生成一个推理步骤 R i R_i Ri,选择一个伴随相关参数 P i P_i Pi的动作 A i ∈ T ∪ { A N S W E R } A_i \in \mathcal{T} \cup \{\mathrm{ANSWER}\} Ai∈T∪{ANSWER},并从环境中接收后续的观测结果 O i O_i Oi。这些组成部分,即推理、动作以及获得的结果,被依次附加到交互历史 H i H_i Hi中,为后续的推断迭代丰富上下文。该迭代过程会在智能体显式选择 A N S W E R \mathrm{ANSWER} ANSWER 动作时终止,或者在达到步数上限 N N N时终止,此时会提示智能体直接生成最终答案预测。随后,智能体输出针对原始用户查询的最终答案。

通过将 LLM 的复杂推理置于这一迭代循环的核心,这种方法赋予了智能体一种内在自主、由证据引导且灵活的行动机制。这种自主且迭代的范式促进了一种具有策略性且对上下文敏感的探询循环,从而使智能体能够有效利用可用工具,将原始查询迭代地分解为逐步细化的子查询,并在接收新观测时更新和改进查询表示。通过迭代推理和交互循环,并由从先前工具使用中收集到的更深入且愈发全面的观测所引导,智能体系统性地增强其对任务上下文的理解与解释,最终为给定问题带来更准确且信息更充分的答案。
1.3 实验(Experiments)
1.3.1 任务与数据集(Tasks & Datasets)
略。
1.3.2 实施细节(Implementation Details)
略。
1.3.3 对比实验(Comparison with State-of-the-arts)


1.3.4 消融实验(Ablation Study)


二、论文理解&总结
暂时省略,用到再分析。
三、代码学习
暂时省略,用到再分析。
写在最后
由于笔者🖊️精力有限且本文更多的目的是通过📒博客记录学习过程并分享更多知识,因此文中部分描述不太具体,如有不太理解💫的地方可在评论区👀留言。非特殊赶deadline⏰或假期⛱️期间,笔者会经常上线回复💬。如有不便之处,请海涵~
如果想了解更多关于长视频理解和视频智能体新工作,可以关注笔者的Github仓库:Awesome-Video-Agent。
另外,创造不易,转载请注明出处💗💗💗~
更多推荐




所有评论(0)