AVIS:让大模型学会调用工具,解决视觉信息寻求难题
1. 项目概述:当大模型学会“看图找答案”
在人工智能领域,让机器理解图像并回答相关问题,已经不是什么新鲜事。从简单的“图片里有什么”到复杂的“为什么图片中的人在做这个动作”,视觉问答(VQA)技术一直在演进。然而,当我们把问题从“看图说话”升级到“看图求知”时,事情就变得棘手了。比如,给你一张埃菲尔铁塔的夜景照片,问“这座塔的设计师最初计划让它矗立多少年?”这类问题,不仅需要模型看懂图片内容,更需要它调用庞大的外部知识库,甚至需要像人类一样,知道该去哪里查找、如何筛选信息。
这正是“自主视觉信息寻求”任务的核心挑战。传统的视觉语言模型(VLMs)虽然在标准VQA上表现出色,但一旦遇到需要外部知识的“信息寻求型”问题,比如来自Infoseek或OK-VQA数据集的问题,表现往往不尽如人意。模型参数里记不住所有冷知识,而简单地接入搜索引擎又会导致动作空间爆炸、陷入循环或产生错误累积。
最近,一项名为AVIS的研究提出了一种新思路:它不再试图把海量知识塞进模型参数,而是让大型语言模型(LLM)扮演一个“总指挥”,动态地调用和协调一系列专用工具,像侦探破案一样,一步步搜集线索,最终拼凑出答案。这种方法在需要深度知识的视觉问答任务上取得了突破性的成绩。简单来说,AVIS让大模型学会了“遇到不懂的,知道该问谁、怎么问”,这或许是通向更通用、更可靠AI智能体的关键一步。
2. 核心思路拆解:从“全能选手”到“智慧调度员”
传统视觉语言模型的思路,是训练一个“全能型”模型,希望它既能理解像素,又能理解语言,还能记忆知识。这就像培养一个无所不知的学者,难度极大,且容易遇到知识瓶颈。AVIS则转换了思路,它认为模型不必“全知全能”,而应成为一个“智慧调度员”。其核心设计哲学是: 将复杂的知识推理任务,分解为一系列可执行的、工具化的子步骤,并由一个中央决策系统(LLM)来动态规划和管理这个过程。
2.1 为何要引入“工具调用”范式?
这背后有几个关键考量。首先, 知识的动态性与海量性 。世界知识是不断更新的,而模型参数是静态的。将最新知识或细分领域知识(如某个特定型号汽车的发动机参数)固化到模型中成本极高。通过工具调用,模型可以实时访问最新的网页、数据库或专业API。
其次, 任务的专业性分离 。计算机视觉模型(如目标检测、图像描述)和知识检索系统(如搜索引擎、知识图谱)是不同领域的专家。让一个模型同时精通两者,往往意味着两者都做不到顶尖。AVIS选择“让专业的工具做专业的事”,LLM只负责高层的规划和逻辑推理。
最后, 控制决策空间 。如果允许LLM在每一步无限制地调用任何工具,搜索空间将变得无比巨大,极易导致无效循环(比如反复搜索同一个关键词)或错误决策的链式传播。AVIS通过一个从人类行为中学习到的“决策图”来约束每一步可用的动作,极大地缩小了搜索范围,提高了决策效率和可靠性。
2.2 AVIS系统的三大核心组件
为了实现上述思路,AVIS构建了一个由三个核心组件协同工作的系统框架:
-
规划器(Planner) :这是系统的大脑,由LLM驱动。它的职责是在每个决策点,根据当前状态(已获得的信息、历史动作)和预设的决策图,决定下一步调用哪个工具,以及向该工具提交什么样的查询(Query)。例如,看到一张鸟的图片,问题问“这种鸟的学名是什么?”,规划器可能首先决定调用“图像描述工具”来获取鸟的视觉特征描述。
-
工作记忆(Working Memory) :这是一个不断更新的上下文存储区。它记录了整个信息寻求过程中所有工具调用的历史、它们的输入输出结果。这相当于侦探的案情板,避免了重复劳动,也为后续决策提供了完整的上下文。例如,工作记忆会记录:“步骤1:调用PALI生成图像描述,结果为‘一只蓝色羽毛、有冠的小鸟站在树枝上’”。
-
推理器(Reasoner) :同样由LLM驱动,它是系统的“质量检验员”和“信息提炼师”。当一个工具(如图像搜索API)返回结果后,推理器负责分析这个结果。它需要判断这个结果属于哪一类:
- 信息充分(Informative) :结果包含了有用的新信息。推理器会从中提取关键点,更新状态,并交还给规划器进行下一步决策。
- 信息不足(Uninformative) :结果没有帮助(比如搜索返回了无关内容)。推理器会通知规划器,在当前状态下重新选择另一个动作。
- 最终答案(Final Answer) :根据目前已收集的所有信息,已经可以自信地回答原始问题。推理器则直接生成最终答案,结束流程。
这个“规划-执行-推理-再规划”的循环,构成了AVIS动态决策的主干。整个过程是迭代的、自适应的,直到推理器认为信息足够为止。
注意 :这里的关键创新在于“推理器”的引入。许多早期工具调用框架只有“规划-执行”两步,执行完就汇总输出。AVIS增加了“推理”环节,让系统能对工具返回的原始、冗长、可能含有噪声的结果进行实时评估和提炼,这大大提升了信息处理的效率和走向最终答案的准确性。
3. 关键实现细节:如何让LLM学会“像人一样”决策?
让LLM自主调用工具听起来很美好,但实现起来最大的难点就是如何引导它做出合理、高效的决策,而不是胡乱的尝试。AVIS的解决方案非常巧妙: 向人类学习,并用学到的经验来约束和指导LLM。
3.1 基于用户研究的决策图构建
研究团队针对Infoseek和OK-VQA数据集中的难题,进行了一项精心设计的用户研究。他们为参与者提供了与AVIS系统完全相同的工具集(如PALI视觉模型、网页搜索、以图搜图等),并给出图像和问题。研究人员记录了参与者在解答每个问题时,调用工具的顺序、输入的查询以及如何根据返回结果调整策略。
通过对这些人类决策序列的分析,AVIS构建了一个 状态转移图 。这个图定义了系统在解决视觉信息寻求问题时可能处于的各个“状态”,以及在每个状态下,允许采取的“动作”集合。
例如,系统的初始状态可能是“分析图像”。在这个状态下,允许的动作可能仅限于:
- 调用PALI生成整体图像描述。
- 调用PALI进行初步的视觉问答(例如直接问“图片里有什么?”)。
- 调用目标检测工具,找出图片中的显著物体。
这个转移图就像一个“交通规则”,禁止了那些明显不合理或低效的动作(比如一开始就去进行以图搜图,却连搜什么都不知道),将巨大的动作空间修剪成一个可控的、有向的决策树。这从根本上防止了LLM陷入无效循环。
3.2 上下文示例引导的规划与推理
仅有规则还不够,LLM还需要具体的“例子”来模仿。AVIS从用户研究数据中,提取了大量人类决策的实例,并将它们作为“上下文示例”存储在系统中。
当规划器需要决定下一步动作时,它不仅仅参考规则(转移图)和当前记忆,还会从示例库中检索与当前情境最相似的几个人类决策案例。这些案例被组装进提示词(Prompt)中,提供给LLM。例如,提示词可能是:“当前状态是‘已获得物体描述:蓝色有冠小鸟’。在类似情况下,人类专家通常会先搜索‘蓝色有冠小鸟 种类’,或者调用知识图谱API查询‘有冠的蓝色鸣禽’。现在,请根据工作记忆中的信息[...],决定下一步动作。”
同样,推理器在判断工具输出时,也会参考人类在面对类似工具输出时是如何判断和提炼的示例。这种“规则+案例”的双重引导,极大地提升了LLM决策的质量和拟人化程度。
3.3 工具集的设计与协同
AVIS集成了三类关键工具,覆盖了信息寻求的不同维度:
-
计算机视觉工具 :用于从图像中提取原始视觉信息。这包括:
- 通用图像描述模型 :如PALI,生成对图像整体或指定区域的文本描述。
- 视觉问答模型 :同样是PALI,但用于回答针对图像的特定问题(如“鸟的喙是什么颜色?”),可以看作是一种受限的、基于视觉的知识查询。
- 目标检测器 :识别并裁剪出图像中的关键物体区域,这些区域可以作为后续图像搜索的输入。
-
网络搜索工具 :用于获取开放的、最新的世界知识和事实。这是获取外部知识的主要渠道。规划器需要生成精准的搜索查询词。
-
图像搜索工具 :这是一个非常巧妙的设计。它不仅仅是“以图搜图”找到相似图片,更重要的是利用互联网上已存在的、与相似图片关联的 元数据 。例如,上传一张鸟的裁剪图进行搜索,返回的结果可能包括:
- 知识图谱实体链接(如“这是‘冠蓝鸦’吗?”)。
- 相似图片的标题或描述文本。
- 电商网站上同类产品的标题(可能包含物种名)。
- 完全相同图片的周边文本信息。 这些元数据是未经整理的、碎片化的知识金矿,需要推理器进行仔细的筛选和提炼。
实操心得 :工具集的设计并非越多越好,而是要考虑工具之间的互补性和调用成本。视觉工具是“信息入口”,网络搜索是“知识广度”,图像搜索元数据是“知识深度和佐证”。规划器的核心能力之一,就是根据问题的性质,判断当前阶段最需要开拓的是哪一个维度。例如,对于识别特定型号的古董车,图像搜索的元数据(如汽车论坛的图片帖标题)可能比通用网页搜索更有效。
4. 工作流程全解析:一个完整的案例推演
为了更直观地理解AVIS是如何工作的,我们假设一个来自OK-VQA数据集的真实问题。图片内容是一尊著名的雕塑“思想者”(The Thinker),问题是:“这位雕塑家创作这件作品时,最初打算将它放在哪里?”
下面我们一步步推演AVIS可能的工作流程:
初始状态 :系统接收到图片和问题。
- 第一轮规划 :规划器查看决策图,在初始状态下可用的动作有:图像描述、视觉问答、目标检测。考虑到问题非常具体且涉及创作背景,直接问“这是什么”可能更高效。规划器决定调用 视觉问答工具(PALI VQA) ,查询:“图片中的雕塑是什么?”
- 第一轮执行与推理 :工具返回结果:“这是罗丹的雕塑《思想者》。” 推理器分析结果,认为这是 信息充分 的。它提取关键实体“罗丹”和“思想者”,存入工作记忆。状态更新为“已知雕塑名称和作者”。
- 第二轮规划 :规划器基于新状态(已知作品和作者)和决策图,决定可用的下一步动作。此时,动作可能包括:网页搜索、图像搜索、进一步视觉问答等。规划器参考类似的人类示例(如“已知画作名称,问其收藏博物馆”),决定调用 网页搜索工具 ,查询:“罗丹 思想者 最初 计划 放置 地点”。
- 第二轮执行与推理 :搜索引擎返回一系列网页摘要。推理器阅读这些摘要,发现信息混杂。有的说在巴黎,有的提到其他地点。它判断当前结果 信息不足 (无法确定唯一正确答案)。它将此结论反馈,系统状态回退到上一步。
- 第三轮规划 :规划器得知网页搜索未果,根据决策图和记忆(已尝试过网页搜索),它可能选择另一个动作:调用 图像搜索工具 ,上传“思想者”雕塑的裁剪图(由目标检测工具事先准备好或此时临时调用)。
- 第三轮执行与推理 :图像搜索返回了包含相似图片的页面元数据。推理器在其中一条元数据(可能来自一个艺术史资料网站)中发现了关键文本:“...罗丹最初为他的作品《地狱之门》创作了《思想者》,计划将其置于门楣之上...”。推理器提取出“地狱之门”和“门楣之上”作为关键信息。但它不确定这是否足以直接回答“放在哪里”的问题。
- 第四轮规划/推理 :推理器可能认为信息仍有模糊,需要更精确的表述。它可以将控制权交还给规划器,进行更精细的搜索,如搜索“地狱之门 门楣 具体位置”。也可能,推理器综合现有信息(“为《地狱之门》创作,计划置于门楣”),认为这已经构成了对“最初打算放置地点”的合格回答。于是,它判断可以输出 最终答案 。
- 最终输出 :推理器整合工作记忆中的所有信息,生成最终答案:“罗丹最初创作《思想者》时,是计划将其作为大型雕塑作品《地狱之门》的一部分,放置在《地狱之门》的门楣上方。”
整个过程中,工作记忆始终记录着:尝试过的动作、工具返回的原始结果、推理器提炼的信息。这确保了过程的连贯性,并避免了重复查询。
5. 效果评估与对比分析
AVIS在Infoseek和OK-VQA这两个需要外部知识的经典视觉信息寻求数据集上进行了测试,结果令人印象深刻。
5.1 在Infoseek数据集上的表现
Infoseek数据集强调对细粒度、具体实体知识的寻求。即使是强大的、经过在该数据集上微调(Fine-tune)的视觉语言模型,如OFA和PaLI,表现也不理想(准确率较低)。这是因为这些模型很难将海量、具体的实体知识全部编码进参数。
AVIS 无需任何针对Infoseek的微调 ,仅凭其工具调用和规划推理能力,在“未见过的实体”划分(Unseen Entity Split)上就达到了 50.7% 的准确率。这显著超过了同样基于PaLI和PaLM等大模型、但采用传统微调方法的基线模型。这强有力地证明了,对于需要大量外部知识的任务,AVIS这种“动态知识检索”范式比“静态知识编码”范式更具优势。
5.2 在OK-VQA数据集上的表现
OK-VQA数据集的问题同样需要外部知识,但其中许多知识更偏向“常识”而非极度冷僻的事实。AVIS在使用少量上下文示例(Few-shot)的情况下,取得了 60.2% 的准确率。
这个成绩超越了大多数使用零样本(Zero-shot)或少样本学习的前沿工作,如Flamingo、PaLI和ViperGPT。更重要的是,它也超过了多数在OK-VQA上直接进行端到端微调的模型,如REVEAL、ReVIVE等。然而,AVIS的成绩略低于直接在OK-VQA上微调的PaLI模型。
这个对比结果揭示了两种范式的适用场景:
- AVIS的优势领域 :需要 动态、细粒度、最新或长尾知识 的任务。当知识无法被完全预训练进模型时,AVIS通过工具调用能轻松胜出。
- 传统微调模型的优势领域 :当任务所需的知识是 通用、常见、相对稳定 的,并且有足够标注数据时,将这些知识通过微调“内化”到模型参数中,可能获得更直接、更快速的推理性能。PaLI在OK-VQA上的成功,部分原因在于其海量预训练数据已经包含了回答问题所需的许多常识。
5.3 与同类系统的横向比较
与之前探索LLM调用工具的工作相比,AVIS的进步是系统性的:
- 相比于Chameleon, ViperGPT等 :这些工作通常采用“先规划后执行”的两阶段静态流程。AVIS引入了“推理”环节和“动态决策”循环,使得系统能根据中间结果实时调整策略,适应性更强。
- 相比于WebGPT, ReAct等通用智能体 :这些方法赋予LLM极大的自由度,容易导致动作空间爆炸和错误累积。AVIS通过 从人类数据中学习的决策图 ,对每一步的可能动作进行了智能约束,将开放性问题转化为一个结构化的、可控的搜索过程,极大地提高了稳定性和成功率。
6. 潜在挑战与未来方向
尽管AVIS展示了强大的潜力,但在实际部署和更广泛的应用中,仍面临一系列挑战。
6.1 当前方法的局限性
- 延迟与成本 :AVIS的迭代式工具调用意味着一次问答可能涉及多次LLM API调用(规划器和推理器)以及多次外部工具调用(搜索、CV模型)。这会导致响应延迟显著高于单次推理的模型,且API调用成本更高。优化决策效率、减少不必要的迭代是关键。
- 决策图的泛化能力 :当前决策图来源于特定任务(视觉信息寻求)的用户研究。将其推广到全新的、未经研究的任务领域(如多模态科学推理、复杂交互任务)时,需要重新进行用户研究或设计新的约束规则,这限制了其开箱即用的能力。
- 工具的可靠性与误差传播 :AVIS严重依赖底层工具的质量。如果目标检测器漏掉了关键物体,或者搜索引擎返回了错误信息,后续的整个推理链都可能建立在错误的基础上。系统需要更强的错误检测和恢复机制。
- 复杂、多跳推理的挑战 :对于需要多个逻辑跳跃、结合多种信息源的问题,当前的线性迭代决策过程可能显得笨拙。如何让规划器进行更长期的“前瞻性”规划,是一个难点。
6.2 未来可能的演进方向
- 学习型决策器 :用强化学习或模仿学习来训练规划器和推理器,使其能自动优化决策策略,减少对人工构建的决策图和示例的依赖,提升泛化能力。
- 工具学习与创建 :不仅调用现有工具,还能根据任务需求,自动发现、组合甚至创建新的工具(如生成一个特定的数据库查询语句)。
- 不确定性量化与置信度管理 :让推理器不仅能提取信息,还能评估信息的可信度。当多个工具返回冲突信息时,系统应能进行权衡,或主动寻求更多证据。
- 与参数化知识的高效融合 :探索如何将AVIS的动态检索能力与大型基础模型的参数化常识更紧密地结合。例如,让规划器首先判断一个问题能否用内部知识快速解决,不能时再启动工具调用流程,实现效率与能力的平衡。
我个人在实际研究和项目开发中的体会是,AVIS代表了一种非常重要的范式转变:从追求“更大的模型”到追求“更聪明的系统”。它承认了单一模型的局限性,转而利用LLM强大的语言理解和规划能力,去集成和调度一个异构的“工具生态”。这条路虽然工程上更复杂,但可能是一条通往更稳健、更可扩展、更贴近人类问题解决方式的AI路径。对于开发者而言,与其等待一个全能模型,不如开始思考如何为你领域的特定问题,设计一套由LLM协调的专用工具链。
更多推荐
所有评论(0)