写在前面:如果想了解更多关于长视频理解和视频智能体新工作,可以关注笔者的Github仓库:Awesome-Video-Agent

论文简介 🍀

  • 📖 题目:Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding
  • 📅 来源:CVPR 2026
  • 🏫 单位:Institute of Automation, Chinese Academy of Sciences;Kuaishou Technology;School of Future Technology, University of Chinese Academy of Sciences.
  • 🌍 主页:https://arxiv.org/pdf/2603.17307
  • 💻 代码:https://github.com/Haiyang0226/Symphony
  • ✒️ 摘要:尽管多模态大语言模型智能体(MLLM agents)发展迅速并得到广泛应用,但其在长视频理解(LVU)任务中仍面临困难。这类任务具有信息密度高、时间跨度长等特点。近期关于长视频理解智能体的研究表明,简单的任务分解与协作机制不足以应对长链推理任务。此外,直接通过基于嵌入的检索压缩时间上下文,可能会丢失复杂问题中的关键信息。本文提出了Symphony这一多智能体系统,以缓解上述局限。该系统通过模拟人类认知模式,将长视频理解任务分解为细粒度子任务,并引入由反思机制增强的深度推理协作机制,从而有效提升推理能力。此外,论文提出了一种基于视觉语言模型(VLM)的定位方法,用于分析长视频理解任务并评估视频片段的相关性,从而显著增强对具有隐含意图和大时间跨度的复杂问题的定位能力。实验结果表明,论文在LVBench、LongVideoBench、VideoMME和MLVU上均取得了当前最佳性能,并在LVBench上较此前的当前最佳方法提升了5.0%。

在这里插入图片描述

图1(a)单智能体方法在处理需要多步推理的长视频理解任务时,其推理能力存在局限。(b)论文提出的多智能体系统通过沿功能维度进行任务分解与协作,增强了推理能力。

  

一、论文阅读

1.1 引言(Introduction)

  长视频理解(LVU)对于广泛的现实应用正变得越来越重要,例如体育赛事解说、智能监控和电影分析。有效的长视频理解需要强大的多模态理解能力,以便在较长时间跨度内跟踪实体及其关系,同时还需要先进的推理能力来处理复杂查询。然而,随着视频时长增加,信息密度和问题复杂度也显著提升,从而加剧了多模态理解与逻辑推理的挑战。尽管多模态大语言模型(MLLMs)近年来取得了长足进展,但其指令遵循能力和推理能力会在输入更长、任务复杂度更高时下降,这表明准确的长视频理解仍然是一个亟待解决的研究问题。

  基于多模态大语言模型的智能体已经成为长视频理解的主流范式。部分方法利用视觉语言模型(VLMs)构建视频数据库,并采用检索增强生成(RAG)来提取相关视频片段,从而缓解长序列带来的挑战。然而,对于复杂问题而言,生成有效的检索查询仍然是一个重要难题。视频数据库中普遍存在的噪声内容和冗余内容进一步加剧了这一困难,最终削弱了检索过程的准确性。另一类方法利用大语言模型(LLMs)的推理能力,通过分解任务并与外部工具进行多步交互来探索解空间。然而,由于所有推理过程都完全交由核心大语言模型负责,当任务复杂度超出模型的推理能力时,性能会显著下降。因此,现有范式受到定位能力和推理能力的双重限制,难以有效处理复杂的长视频任务。

  为了增强智能体处理复杂问题的能力,多智能体系统(MAS)通过智能体协作来利用群体智能,正受到越来越多的关注。VideoMultiAgent 将推理任务分解为面向不同模态的智能体,以减轻单个智能体的推理负担。然而,这种方法在跨模态信息交换与整合方面带来了挑战。类似地,LvAgent 优化了子智能体的任务分解,但依赖线性的协作流程,限制了推理过程中可探索的任务空间,也未能突破单智能体方法的能力上限。因此,尽管多智能体系统在长视频理解应用中展现出巨大潜力,但如何设计有效的子任务分解方式与协作模式仍然是一个关键挑战。

  为应对这些挑战,论文提出了如图1(b)所示的集中式多智能体系统Symphony。该系统通过模拟人类认知的不同维度来分解长视频理解任务,并通过一种由反思机制增强的动态协作机制来编排各个智能体。具体而言,规划智能体负责进行任务分解并编排执行过程,将子任务分派给专门的智能体,通过多轮交互促进证据的迭代积累。随后,反思智能体对推理链进行评估,以判断是否可以输出答案,或是否需要改进推理过程。这种协作策略显著减轻了单个模型的推理负担,同时只带来较低的计算开销。此外,论文提出了一种定位智能体,该智能体利用大语言模型分解查询并识别其意图,同时结合视觉语言模型分析视频片段与查询之间的相关性,从而实现稳健且精确的视频定位。

  论文的主要贡献总结如下:

  • 论文针对长视频理解任务中的推理瓶颈,提出了一种受认知启发的多智能体系统,将问题求解过程按照功能维度分解为多个专门化智能体。任务分解方法以及由反思机制增强的动态协作机制有效提升了系统的推理能力。

  • 论文为提升复杂问题的定位准确性提出了一种定位智能体。该智能体利用大语言模型和视觉语言模型的推理能力,对问题进行深层语义理解,从而实现更加精确的相关性评估。

  • 论文在四个长视频理解数据集上进行了全面评估。在最具挑战性的LVBench上,论文方法较此前的当前最佳方法高出5.0%。此外,论文在LongVideoBench、VideoMME和MLVU上分别取得了77.1%、78.1%和81.0%的成绩。

  

1.2 方法(Methodology)

  论文提出了一种由功能专门化智能体组成的多智能体系统,如图1(b)所示。第1.2.1节介绍系统概览,第1.2.2节详细介绍智能体之间的协作机制,第1.2.3节介绍论文提出的新型定位智能体。

1.2.1 概览(Overview)

  认知心理学通常将人类的认知能力分解为若干核心维度:感知、注意、推理、语言和决策。基于这一认知框架,论文提出了一种面向长视频理解任务分解的能力维度解耦范式,并通过多智能体系统加以实现。在该架构中,规划智能体和反思智能体共同负责推理与决策;定位智能体模拟注意功能,用于突出关键视频片段;字幕智能体分析文本字幕,以实现语言处理功能;视觉感知智能体则执行感知任务。与基于模态的划分方式相比,该方法能够减少由于模块之间紧密依赖而产生的交互成本,并显著降低信息整合的开销。通过这种策略,将认知负荷分配给不同的专门化模块,可以有效缓解单体架构中的能力过载问题,从而提升系统在复杂长视频理解任务中的准确性与可扩展性。

  具体而言,规划智能体作为中央协调器,负责全局任务规划、多智能体调度、信息整合,并最终生成答案。为了高效且全面地识别问题相关的视频片段及其中可能存在的线索,定位智能体会根据问题的复杂程度,在基于视觉语言模型(VLM)的相关性评分工具和基于CLIP的检索工具之间进行选择。字幕智能体处理视频字幕,并执行语义分析,以实现实体识别、情感分析和主题建模等功能。视觉感知智能体通过调用三个工具执行多维度视觉感知:帧检查器、全局摘要工具和多片段分析工具。最后,反思智能体对推理轨迹进行回顾性评估;当检测到逻辑不一致或证据不足时,反思智能体会生成纠正建议,以启动新一轮优化。

1.2.2 协作机制(Collaboration Mechanism)

  如图2所示,论文受到经典Actor-Critic框架的启发,设计了一种反思增强的动态推理框架,用于协调各个智能体解决长视频理解问题。规划智能体记为核心策略模型 π \pi π,利用大语言模型的推理能力为专门化智能体生成子任务,包括定位智能体( G G G)、视觉感知智能体( V V V)和字幕智能体( S S S)。

在这里插入图片描述

图2. Symphony中的反思增强动态推理框架。规划智能体制定任务计划,并动态调用其他智能体执行子任务。在获得初步解决方案后,反思智能体评估推理链 τ \tau τ,生成批评意见 C C C,以指导后续一轮的推理探索。

  具体而言,系统的动作空间定义为:
A = { G , V , S } . ( 1 ) A=\{G,V,S\}.\quad(1) A={G,V,S}.(1)

  受到近期关于验证器定律研究的启发,即验证一个解决方案通常显著容易于生成一个解决方案,论文引入了反思智能体,并将其表示为验证模型 ϕ \phi ϕ,用于验证推理过程和最终任务结果,并提供关键分析。该机制扩展了多智能体系统的探索空间,提高了推理的准确性。整个协作机制在算法1中进行了形式化描述。下面将详细介绍前向推理阶段和反思增强过程。在前向推理阶段,规划智能体根据当前状态评估并输出下一个专门化子任务,持续迭代,直到获得答案。状态 S S S由初始问题 Q Q Q 和历史轨迹 τ \tau τ 构成。在第 t t t 步,该过程可以表示为:

a t ​ = π ( S t ​ ) ∈ A , S t = ( Q , τ t − 1 ) , τ t − 1 = ( a 1 , o 1 , … , a t − 1 , o t − 1 ) . ( 2 ) a_t​=π(S_t​)∈A, \\ S_t=(Q,\tau_{t-1}), \\ \tau_{t-1}=(a_1,o_1,\ldots,a_{t-1},o_{t-1}).\quad(2) at=π(St)A,St=(Q,τt1),τt1=(a1,o1,,at1,ot1).(2)

  随后,具体的智能体执行动作 a t a_t at 并生成输出 o t o_t ot,更新系统状态 S t S_t St,然后不断执行前向推理过程,直到积累足够的证据以形成答案。在这一阶段,规划智能体专注于长视频理解任务中的核心逻辑推理,将模型能力集中用于根据不同查询动态构建解决路径。与现有固定流程相比,这种方法能够显著提升任务求解的准确性和效率。

  在验证阶段,反思智能体处理 S T S_T ST。如果推理过程被判断为严谨且证据充分,则终止流程;否则,反思智能体会识别推理链中的缺陷,并生成形式化表示为 C = ϕ ( S T ) C=\phi(S_T) C=ϕ(ST) 的批评意见,随后按照以下方式更新轨迹和状态:

τ t ′ = τ t ′ ∪ { C } , S t ′ = ( Q , τ t ′ ) . ( 3 ) \tau'_t=\tau'_t\cup\{C\}, \\ S'_t=(Q,\tau'_t).\quad(3) τt=τt{C},St=(Q,τt).(3)

  通过利用这一验证机制,反思智能体能够重新启动规划智能体的前向推理过程,显著扩展多智能体系统的探索空间,并在具有挑战性的任务上带来明显的性能提升。

在这里插入图片描述

  

1.2.3 定位智能体(Grounding Agent)

  定位旨在从视频 V V V 中识别出与给定查询相关的多个视频片段 S = { s 1 , s 2 , … , s n } S=\{s_1,s_2,\ldots,s_n\} S={s1,s2,,sn},从而消除无关内容的干扰。论文定义了一个查询映射函数 f f f,用于分析并增强问题 Q Q Q。该过程形式化表示为:

S = { s ∈ V ∣ sim ⁡ ( f ( Q ) , s ) ≥ θ } , ( 4 ) S=\{s\in V\mid \operatorname{sim}(f(Q),s)\geq\theta\}, \quad(4) S={sVsim(f(Q),s)θ},(4)

  其中, sim ⁡ ( ⋅ ) \operatorname{sim}(\cdot) sim()表示用于衡量查询与视频片段之间相关性的函数。长视频理解任务中普遍存在复杂问题,因此对定位能力提出了更高要求。具体而言,这种复杂性主要体现在两个方面:第一,问题存在歧义,其中可能包含模糊指代、抽象概念或没有明确实体的高层次动作;第二,问题需要多跳推理,即需要将多个相互关联场景中的证据串联起来,或者推断出隐含的中间场景。

  当使用问题进行基于CLIP的检索时,查询映射函数为:

f ( Q ) = Q , sim ⁡ ( f ( Q ) , s ) = CLIP ⁡ ( f ( Q ) , s ) . ( 5 ) f(Q)=Q, \operatorname{sim}(f(Q),s)=\operatorname{CLIP}(f(Q),s).\quad(5) f(Q)=Q,sim(f(Q),s)=CLIP(f(Q),s).(5)

  尽管这种方法对于简单问题有效,但其对显式语义匹配的依赖限制了它处理复杂问题的能力,因为复杂问题通常需要意图识别和逻辑推理。因此,论文利用大语言模型生成增强查询:

f ( Q ) = LLM ⁡ ( Q ) . ( 6 ) f(Q)=\operatorname{LLM}(Q). \quad(6) f(Q)=LLM(Q).(6)

  一方面,大语言模型可以利用其丰富的世界知识消解歧义,通过具体化模糊术语来明确问题含义;另一方面,大语言模型可以利用自身的推理能力推断缺失的上下文信息,并显式加入潜在的逻辑线索。

  与依赖文本图像对比学习的CLIP相比,视觉语言模型采用了更加先进的跨模态对齐策略,并表现出更强的推理能力。因此,基于视觉语言模型的相似性度量能够更加全面地理解查询与视觉内容之间的语义关系。基于此,论文提出了一种基于视觉语言模型的评分工具,其相似性度量定义为:

sim ⁡ ( f ( Q ) , s ) = VLM ⁡ ( f ( Q ) , s ) . ( 7 ) \operatorname{sim}(f(Q),s)=\operatorname{VLM}(f(Q),s). \quad(7) sim(f(Q),s)=VLM(f(Q),s).(7)

  具体而言,论文将视频划分为互不重叠的片段,并在每个片段内进行稀疏采样。视觉语言模型依据表1所示的标准确定相关性分数,并输出评分依据;整个过程以并行方式执行,以降低延迟。此外,定位智能体保留了基于CLIP的检索模块,并根据问题的复杂程度自主选择相应的处理范式。

在这里插入图片描述

图3。基于CLIP的方法利用原始查询进行检索,因此无法捕捉时间序列中的抽象概念和动作。论文的定位智能体分析查询,扩展并细化相关概念,并利用VLM评估增强查询与各视频片段之间的相似性,从而获得更加全面的定位结果。

在这里插入图片描述

  

1.2.4 结论(Conclusion)

  论文提出了Symphony,一种用于长视频理解的多智能体系统。受人类认知过程的启发,论文将复杂的长视频理解推理任务分解为四个组件:规划智能体、定位智能体、字幕智能体和视觉感知智能体,并采用反思智能体对推理轨迹进行评估。这种任务分解方法与反思增强的动态协作机制相结合,提升了系统的推理能力。为了改善复杂问题的定位性能,定位智能体利用大语言模型的推理能力对问题进行分析、分解和扩展,并结合基于视觉语言模型的相关性评分工具来检索相关视频片段。在四个基准数据集上的大量实验表明,受认知启发的Symphony取得了当前最佳性能。

  

1.3 实验(Experiments)

1.3.1 评测基准(Benchmarks)

  论文在四个具有代表性的长视频理解数据集上,对论文方法及其他当前最佳方法进行了全面评估。LVBench 包含平均时长为68分钟的视频,重点评估六个核心能力维度:时间定位(TG)、摘要(Sum)、推理(Rea)、实体识别(ER)、事件理解(EU)和关键信息检索(KIR)。LongVideoBench 包含3,763个视频及其字幕,并引入指代推理任务,用于评估细粒度信息检索能力和跨片段逻辑推理能力。MLVU 涵盖多种视频类型,并设置了九类不同任务,包括推理、描述、识别和摘要。Video-MME 建立了一个覆盖六个广泛领域的多模态评估框架,用于严格评估时空复合推理能力。在实验中,论文仅使用了长时长子集。

  

1.3.2 实施细节(Implementation Details)

  论文使用DeepSeek R1 作为规划智能体和反思智能体的推理模型,使用DeepSeek V3 作为字幕智能体的模型。视觉感知智能体和定位智能体均使用Doubao Seed 1.6 VL 作为视觉语言模型。输入序列最多包含40帧,分辨率上限为720p。对于基于视觉语言模型的评分工具,论文将片段时长 T T T 设置为60秒,并从每个片段中采样30帧。对于不含字幕的MLVU和LVBench,论文使用Whisper-large-v3 提取字幕。论文将智能体的调度轮数以及每个智能体内部的最大工具调用次数均设置为15,将反思智能体的最大调度轮数设置为3。

  

1.3.3 对比实验(Comparison with State-of-the-arts)

在这里插入图片描述

在这里插入图片描述
在这里插入图片描述

  

1.3.4 消融实验(Ablation Study)

在这里插入图片描述
在这里插入图片描述

在这里插入图片描述

在这里插入图片描述

  

1.4 补充材料(Additional Results)

1.4.1 定位智能体

  为了平衡准确性和效率,定位智能体会根据问题的复杂程度自适应地选择检索工具。对于涉及局限于单个场景中的实体的问题,例如“在一个墙上有老虎图案和地图的房间里,有一个穿白衬衫的男人。他正在做什么?”,只需要在相关场景中进行定位,随后使用视觉语言模型进行推理。在这种情况下,论文调用基于CLIP的检索工具,返回最具语义相似性的前15个视频片段作为定位结果,其中每个片段时长为10秒。对于复杂问题,论文使用基于视觉语言模型的评分工具,检索所有相关性分数大于1的片段。

  

1.4.2 视觉感知智能体

  视觉感知智能体利用大语言模型协调多个工具调用,从而有效执行视觉感知任务。该工具集包含以下组件:

  • 全局摘要工具(Global Summary) 用于需要理解整个视频内容或主题背景的子任务。给定视频时长 D D D,该工具在整个视频范围内均匀采样40帧,并生成一种编码高层次上下文语义的紧凑型全局表示。帧检查器用于对特定时间片段进行细粒度分析。该工具以时间区间 [ t s , t e ] [t_s,t_e] [ts,te]作为输入,并进行密集帧采样,最多采样40帧。当检查时长超过30秒的区间时,工具会额外引入一个“线索”参数,以降低遗漏关键信息的风险。除了均匀采样之外,工具还会根据给定线索额外检索10帧,从而确保更加全面和稳健的覆盖。

  • 帧检查器(Frame Inspector) 用于对特定时间片段进行细粒度分析。该工具以时间区间 [ t s , t e ] [t_s,t_e] [ts,te]作为输入,并进行密集帧采样,最多采样40帧。当检查时长超过30秒的区间时,工具会额外引入一个“线索”参数,以降低遗漏关键信息的风险。除了均匀采样之外,工具还会根据给定线索额外检索10帧,从而确保更加全面和稳健的覆盖。

  • 多片段分析工具(Multi-segment Analysis) 用于涉及非连续视频片段之间比较或推理的任务。该工具接收一系列时间区间 [ t s 1 , t e 1 ] , [ t s 2 , t e 2 ] , … , [ t s n , t e n ] [t_s^1,t_e^1],[t_s^2,t_e^2],\ldots,[t_s^n,t_e^n] [ts1,te1],[ts2,te2],,[tsn,ten] 作为输入。它能够进行直观的属性比较,例如比较时间上不连续片段中人物外观的变化;还能够识别不同片段之间潜在的信息差异,并支持随时间变化的因果分析。

  

1.4.3 Symphony中各智能体的提示词

  规划智能体提示词:

你是一名规划智能体,负责通过系统化推理和动态协作,在多智能体框架中解决复杂的长视频理解任务。作为核心认知与协调模块,你需要将高层次查询分解为可执行的子任务,管理专门化智能体之间的信息流,并综合证据以生成准确且有充分依据的结论。给定用户问题 Q Q Q以及此前已执行动作及其对应观测结果的历史轨迹,你的主要职责如下:
问题分析
Q Q Q进行全面的语义和逻辑分析。识别其核心组成部分、隐含假设、时间依赖关系或因果依赖关系,以及领域特定概念。判断查询涉及视觉内容、事件、物体交互、动作、对话,还是更高层次的推理,例如意图推断和叙事理解。
任务分解与推理策略
将主要问题分解为一系列细粒度且逻辑有序的子任务,这些子任务共同构成通向问题答案的有效推理路径。每个子任务都必须具有可执行性、具备上下文依据,并且能够减少不确定性或填补知识缺口。
动态规划与上下文决策
根据当前积累的证据作出每一次规划决策。评估已有观测结果是否充分、一致,并判断其置信度。如果信息不完整、存在歧义,或不足以高置信度地继续推理,则生成能够直接解决关键知识缺口且信息增益最大的下一个子任务。
智能体编排
根据所需信息选择并分派子任务给专门化智能体:定位智能体:用于确定视频中特定事件、动作、物体出现或场景转换的精确时间戳。当问题没有提供明确时间范围且需要进行时间定位时,使用该智能体。视觉感知智能体:用于分析指定时间区间内的视觉内容。该智能体能够识别物体、确定动作、描述场景、追踪空间关系,并回答详细的视觉问题。调用该智能体时必须同时提供明确指令和确定的时间范围。字幕智能体:用于检索、提取和分析与视频相关的字幕。该智能体适用于理解相关对话、叙事内容或与问题有关的文本线索。
终止与最终回答生成
当积累的观测结果足以全面回答问题,并且证据充分、一致且具有较高置信度时,调用“finish”动作。
关键规则:
操作必须具有自适应性、证据驱动性和目标导向性,并且始终维护明确的推理轨迹。通过减少冗余查询并最大化每一步的信息增益来优先提高效率。
当出现相互冲突的信息时,应使用视觉感知智能体比较不同片段,识别不一致之处并解决矛盾,从而得出连贯且可靠的结论。
重点关注定位智能体返回的结果以及相关片段的前后时间片段。
必须使用视觉感知智能体对定位智能体提供的场景描述进行二次检查。
请以JSON格式调用智能体:{
“reason”:为什么该智能体最适合执行当前任务;
“agent”:具体的智能体名称;
“instruct”:关于视频的具体问题。
}
用户的问题是:“{question}”视频时长:“{duration}”以下是执行历史:{history_str}

在这里插入图片描述

  反思智能体提示词:

请根据以下信息,评估整个问题求解过程以及所提出答案的可信度。
核心智能体为解决视频理解问题而执行的操作如下:{history}
原始视频理解问题:问题:{question}
核心智能体提出的最终答案:拟议答案:{proposed_answer}
评估标准:如果过程和答案可信且正确,则将“credible”设为true。如果发现任何错误,则将“credible”设为false,并简洁说明问题所在以及为什么拟议答案不正确。
请严格按照以下JSON格式回答:{
“credible”:布尔值,// true表示答案可信,false表示答案不可信;
“comment”:“简洁说明。如果credible为true,则此项为null。”
}
请仅返回JSON对象。

在这里插入图片描述

  字幕智能体提示词:

你是一名专门的字幕分析智能体。你的任务是根据用户问题分析视频字幕。
请根据以下信息进行分析:
原始视频理解问题:{question}
需要分析的完整视频字幕:{subtitles}
你的分析任务:
与问题相关的分析:从原始字幕中提取与问题直接相关的字幕片段。
实体与情感识别:利用字幕信息识别其中提到的关键实体及其相关情感。
总体内容摘要:仅根据字幕内容,简要总结视频所涉及的总体主题。
请严格按照以下JSON格式回答:
{
“relevant_subtitle_info”:“包含最相关字幕片段的多行字符串。每一项格式如下:\n[HH:MM:SS - HH:MM:SS]:实际字幕文本。\n例如:\n[00:15:32 - 00:15:35]:……\n[00:18:05 - 00:18:09]:……”;
“key_entities_and_sentiment”:“对主要实体及其情感的简要描述”;
“overall_topic”:“仅根据字幕内容对视频总体讨论主题进行的一句话总结”。
}
请仅返回JSON对象。

在这里插入图片描述

  视觉感知智能体提示词:

你是一名负责感知视频内容的智能体。你将接收来自上游智能体的指令。指令:Instruct_PLACEHOLDER
任务:遵循该指令,并使用工具分析视频内容,以获取关键信息。
工具使用指南:
视频多模态内容查看:为了获取详细信息,调用frame_inspector,并提供时间范围 [ H H : M M : S S , H H : M M : S S ] [HH:MM:SS,HH:MM:SS] [HH:MM:SS,HH:MM:SS]。确保时间范围超过10秒且小于60秒。如果需要检查更长的时间段,则将其拆分为多个连续的60秒区间,并按照相关性顺序依次检查。结束时间不得超过视频总时长。
如果需要粗略了解较长时间段或背景信息,例如整个视频或超过3分钟的时间范围,则使用global_summary_tool。
如果问题和选项涉及多个场景,则使用multi_segment_analysis_tool,并传入一个时间范围列表。调用规则:
可以多次调用工具,以完成指令中规定的任务。
一次只能调用一个工具。
工具参数中不得包含不必要的换行。
设置time_range参数时,必须确保时间单位格式正确。例如,03:21表示3分21秒,应写作00:03:21,而不是03:21:00。必须特别注意这一点。
任务完成:
任务完成后,总结对话内容,也就是感知任务的完成结果,并以“[answer]”开头回答指令,之后不得再调用任何工具。

任务完成:

在这里插入图片描述

  定位智能体提示词:

你是一名负责定位视频中与给定问题相关时间片段的智能体。首先分析问题,然后根据问题类型选择适当的工具,并生成增强查询。
问题信息:问题:QUESTION_PLACEHOLDER 视频时长:VIDEO_LENGTH
问题分析过程:
面对一个查询时,你必须进行全面分析,以确定问题的复杂程度,重点关注两个关键维度:问题歧义和多跳推理需求。
利用世界知识将抽象概念转化为具体视觉特征。
通过上下文分析和常识推理解决模糊指代。
将隐含动作转化为可观察的行为模式和视觉特征。
工具描述:
retrieve_tool
描述:根据文本线索检索视频中最相关的时间点。
使用场景:适用于简单感知问题,即目标是可以用少量关键词描述的特定物体或场景。
参数:cue:简短的描述性文本。frame_path:视频帧的路径。
返回结果:一组时间戳。
vlm_scoring_tool
描述:用于处理需要更深层理解视频内容的问题,例如识别动作、事件或场景。
使用场景:适用于需要场景理解的复杂问题。
参数:question:需要回答的问题。scoring_instruction:基于问题分析而生成的详细识别说明。frame_path:视频帧的路径。
返回结果:一组相关片段,每个片段包含时间戳、描述、相关性分数,分数范围为1至4,以及说明理由。
根据问题类型选择工具:
类型1:问题不涉及动作,是一个简单的感知问题,且包含详细的场景或人物描述。人物指代明确,没有歧义。此时调用retrieve_tool进行场景定位。
类型2:问题较为复杂,需要理解问题或选项中的场景,或者问题本身不直观。此时使用vlm_scoring_tool,以实现更加全面和准确的定位。
finish
描述:返回定位结果。
参数:answer:返回完整的定位结果;不得直接回答问题。

工具描述:

在这里插入图片描述

  基于VLM的评分工具提示词:

给定从一个1分钟视频片段中采样得到的一系列视频帧,以及一个问题。你的任务是:
分析问题,包括所有选项,与整个视频片段中视觉内容之间的相关性。
参考上游智能体对该问题的分析,在确定相关性分数时使用该分析。

问题:{USER_QUESTION}
上游智能体对该问题的分析:{SCORING_INSTRUCTION}
请严格按照以下JSON格式输出分析结果:{
“relevance_score”:整数,// 相关性分数范围为1至4;
“clip_caption”:“字符串”,// 对主要人物及其区别性特征、关键事件、动作和人物关系进行简洁描述。重点关注与问题相关的元素;
“reasoning”:“字符串”,// 对于分数2、3和4,解释推理过程;对于分数1,使用null。
}
评分标准:
4分:问题和选项中的关键元素清晰可见,足以直接回答问题。
3分:问题或选项中的相关元素出现,但需要结合其他信息才能作出判断。
2分:不存在直接相关性,但场景可能具有间接相关性,例如出现与问题中提到的动作或行为相关的视觉相似物体,出现与问题元素相关的物体,出现通过逻辑推理从问题延伸出的概念,或出现根据问题建立的关联。
1分:场景完全无关。
关于clip_caption的要求:
重点描述与问题相关的元素,包括可以通过视觉确认的主要人物、物体、事件、动作及其关系。
如果存在多个场景,则分别描述这些场景。注意事件发生的顺序。
只描述直接可观察到的内容。不得基于证据进行推断、想象或虚构不存在的场景。
如果问题涉及计数,例如问题中出现“多少”或“计数”,则清楚识别问题描述中的相关元素并进行计数。
推理指南:
4分:简要说明哪些元素能够支持答案,并输出答案。
3分:说明缺失或存在歧义的内容,例如“动作在片段3中开始,但无法确认是否完成”或“人物与描述相符,但没有观察到相关动作”。
2分:说明如何分解或扩展问题,例如“问题询问一名音乐家,而画面中出现一名手持吉他的人”。
1分:将reasoning设为null。必须全面、精确,并严格以视觉证据为依据。避免使用“第一次”等时间性表述。

在这里插入图片描述

  

二、论文理解&总结

  

三、代码学习

  暂时省略,用到再分析。

  

写在最后

  由于笔者🖊️精力有限且本文更多的目的是通过📒博客记录学习过程并分享更多知识,因此文中部分描述不太具体,如有不太理解💫的地方可在评论区👀留言。非特殊赶deadline⏰或假期⛱️期间,笔者会经常上线回复💬。如有不便之处,请海涵~

  如果想了解更多关于长视频理解和视频智能体新工作,可以关注笔者的Github仓库:Awesome-Video-Agent

  另外,创造不易,转载请注明出处💗💗💗~

更多推荐