TRISHUL:面向大视觉语言模型 GUI 智能体的区域识别与界面层级解析研究(Hierarchy等级制度;统治集团;等级体系)

摘要

基于大视觉语言模型(LVLM)的技术最新进展,催生了多种技术范式下的大视觉语言模型驱动式图形用户界面(GUI)智能体。以 CogAgent 与 SeeClick 为代表的基于训练的技术方案,因依赖特定数据集开展训练,存在跨数据集与跨平台泛化能力薄弱的问题。(cross-dataset and cross-platform generalization:译为跨数据集与跨平台泛化能力)以 GPT-4V 为代表的通用型大视觉语言模型(LVLM),采用标记集合(Set-of-Marks, SoM)技术实现动作锚定;但标记集合标注信息的获取需要依赖超文本标记语言(HTML)源码等元数据,而此类元数据在不同平台间的可用性缺乏一致性。(Generalist LVLMs:译为通用型大视觉语言模型,action grounding:译为动作锚定,metadata like HTML source:译为超文本标记语言(HTML)源码等元数据)此外,现有技术方案往往仅专注于单一的图形用户界面(GUI)任务,未能实现对界面的综合性理解。针对上述局限性,本文提出一种全新的无训练式智能体框架 ——TRISHUL,该框架可增强通用型大视觉语言模型(LVLM)的能力,使其具备对图形用户界面的全局化理解能力。(holistic GUI comprehension:译为对图形用户界面的全局化理解能力)不同于以往仅聚焦于动作锚定(将指令映射至图形用户界面元素)或界面指代(基于指定位置描述图形用户界面元素)的研究方案,TRISHUL 框架实现了上述两项功能的无缝融合。该框架的核心模块为层级化界面解析单元(HSP)与空间增强型元素描述模块(SEED),二者协同作用,可生成兼具多粒度特性、空间属性与语义信息的图形用户界面元素表征。(GUI referring:译为界面指代;Hierarchical Screen Parsing (HSP):译为层级化界面解析单元(HSP);Spatially Enhanced Element Description (SEED):译为空间增强型元素描述模块(SEED))实验结果表明,TRISHUL 框架ScreenSpotVisualWebBenchAITWMind2Web 四大数据集的动作锚定任务中均展现出优越性能。此外,在界面指代任务方面,该框架在 ScreenPR 基准测试集上的表现超越了 ToL 智能体,为鲁棒且自适应的图形用户界面理解技术树立了全新标杆。

1.介绍

研发可通过自然语言指令操控数字设备的人工智能(AI)智能体,是一项长期以来的研究目标 [11, 26, 33]。此类智能体能够借助图形用户界面(GUI)实现任务自动化,进而提升生产效率。早期研究围绕简化场景展开探索 [11, 26, 33],后续研究工作 [2, 5, 6, 14, 23, 23, 24, 35, 37, 45] 则借助界面理解技术构建了更为复杂的智能体。近期研究方案 [8, 12, 34, 41, 47] 将大语言模型与结构化界面表征(如超文本标记语言、文档对象模型树、视图层级结构)相融合,以提升界面理解能力。

随着大视觉语言模型(LVLMs)的技术发展,相关研究 [8, 10, 13, 43, 46] 已融入视觉感知技术,以提升模型在 Mind2Web [8]、WebArena [47] 等基准测试任务中的性能表现。然而,这类模型在视觉锚定任务 [40] 中表现不佳,其运行严重依赖结构化元数据,而此类数据往往存在获取困难、数据噪声量大或数据失准等问题。SeeAct 模型 [46] 借助标记集合(SoM)技术 [40],优化了 GPT-4V 模型 [29] 的动作锚定性能,但对结构化数据的依赖使其仍存在应用局限性。

1.1相关工作与研究动机

近期研究聚焦于研发仅依赖视觉感知、以类人化方式与图形用户界面(GUI)交互的智能体。这类基于大视觉语言模型(LVLMs)的纯视觉驱动型图形用户界面智能体研究,主要沿两大技术路径演进:

基于端到端训练的图形用户界面(GUI)智能体:已有多项研究 [3, 7, 15, 32, 42] 针对多类平台 / 设备类型的图形用户界面导航任务,对大视觉语言模型(LVLMs)开展训练。

基于视觉感知工具的测试阶段辅助方案:已有研究借助视觉感知工具,为 GPT-4V 等通用型大视觉语言模型(LVLMs)提供辅助能力。MM-Navigator 模型 [39] 采用了预训练图标检测模块;与本研究同期开展的工作 Omniparser [28],构建了基于 YOLO-v8 [18] 的图标检测模块与基于 BLIPv2 [22] 的图标描述模块,以实现动作锚定功能;树镜智能体(ToL)[9] 则针对基于用户选点生成区域描述的界面指代任务,训练了专用感知模块。

多项图形用户界面(GUI)导航相关基准测试集 [27, 38] 与研究工作 [7, 46] 均指出,纯视觉驱动型图形用户界面导航智能体存在两项核心技术短板。其一,此类基于特定界面分布完成训练的方法,其性能在跨平台 / 设备类型场景下的泛化能力较弱。鉴于新类型界面的迭代速度日益加快,基于训练的技术方案在分布外样本上的泛化能力,仍是亟待解决的技术难题。其二,多数图形用户界面智能体(如 DigiRL [3]、SeeClick [7]、MM-Navigator [39])均针对专用图形用户界面相关任务(以动作预测与锚定为主)进行优化,且其性能验证往往依托来源多样但主题相似的任务与评价指标,因此这类智能体缺乏跨不同任务与界面的全面图形用户界面理解能力。

1.2贡献

为应对上述挑战,本文提出TRISHUL 框架—— 一种无训练式智能体框架,旨在实现全面的图形用户界面(GUI)界面理解。该框架为大视觉语言模型(LVLMs)赋予了执行多样化 GUI 交互任务所需的能力,其借助基础模型对 GUI 界面进行解析,构建丰富的层级化理解,进而提升模型的动作锚定与界面指代能力。

层级化界面解析(HSP):HSP 模块通过两个截然不同的粒度层级对图形用户界面(GUI)元素进行组织:一类是称为全局感兴趣区域(GROIs) 的宽泛区域,此类区域对相关组件进行聚类;另一类是图标、文本、图像等局部元素。这种层级化结构可捕捉不同 GUI 组件间的空间与语义关系,进而实现多层次、全方位的 GUI 界面理解。

空间增强型元素描述(SEED):如图 1 所示,SEED 模块通过分析局部元素与界面中其他元素的相对位置关系,为局部元素生成具备上下文感知能力与空间信息的功能描述。该模块通过关联邻近的图标与文本,能够生成高精准度的图形用户界面(GUI)元素功能描述,助力对各元素作用形成更细致的认知。

本文基于 ScreenSpot[7]、VisualWebBench[27]、Mind2Web[8] 与 AITW[31] 四大数据集对 TRISHUL 框架 开展评估,验证结果表明,集成 TRISHUL 框架的 GPT-4V [29] 与 GPT-4o [30] 模型,在动作锚定与情节式指令跟随任务中的性能超越了此前的最优技术方案。此外,本文通过 Screen PR 数据集验证了 TRISHUL 框架在界面指代任务中的有效性,为无障碍应用与用户交互反馈的优化提供支撑。

2.方法

本节概述了我们无训练屏幕理解模块HSP和SEED的设计,并阐明它们如何集成到我们的动作接地和图形界面转介代理中。

2.1 层级化界面解析

层级化界面解析流程在算法 1 中予以形式化定义。首先,将界面图像 I 输入 SAM 模型 [20] 与 EasyOCR 工具 [17] 进行处理。基于预设的面积阈值 Athresh-GROI​ 与 Athresh-LE​,对生成的边界框进行筛选,得到全局感兴趣区域(GROI)候选集与局部元素(LE)集合。局部元素指代图形用户界面(GUI)中文本、图标、按钮及图像对应的边界框。随后,通过执行重叠区域消除与筛选操作,剔除冗余及无效的局部元素,完成对图标与文本边界框的优化。

针对每个全局感兴趣区域(GROI)候选集,计算其内部包含的边界框数量,以及与该候选集存在交集的边界框数量。随后,基于候选集内边界框数量与 GROI 面积的比值,并结合交集边界框数量进行修正,得到每个候选集的信息评分 S。该评分可量化 GROI 的信息承载量,辅助系统在构建层级化结构树时,优先筛选面积更大、信息更丰富的区域。

最后,基于全局感兴趣区域(GROI)候选集的信息评分,对其执行 ** 非极大值抑制(NMS)** 算法。经筛选得到的 GROI 集合、图标及文本框,将作为最终的层级化结构返回;该结构包含了所有通过 GROI 聚类整合的相关图形用户界面(GUI)元素。关于重叠区域消除、筛选及非极大值抑制算法的具体细节,详见补充材料。

2.2 SEED:空间增强型元素描述生成

精准描述图形用户界面(GUI)局部元素的功能,是实现高效界面理解与动作锚定的核心前提。仅依靠视觉外观的描述方式存在局限性,原因在于相同图标在不同语境下可承载不同功能,而不同图标也可能表征相似功能,这会引发功能解读的歧义性。GUI 元素周边的文本信息与语义关联线索,可有效辅助功能的明确界定。将图标与邻近文本进行关联匹配,能够生成精准的元素描述;同时,语义关联关系(例如与输入框或按钮相关联的文本)则有助于识别具备操作属性的界面元素。

本文提出 ** 空间增强型元素描述(SEED)** 框架 —— 这是一种采用思维链(CoT)[36] 与上下文学习(ICL)[4] 技术,为所有图形用户界面(GUI)元素生成兼具空间属性与语义信息的功能描述的提示学习框架。SEED 框架的处理对象包含两类输入:一是标注有标记集合(SoM)格式标识标签的界面图像I;二是携带有检测元素边界框(由本文提出的 HSP 模块生成)及光学字符识别(OCR)提取文本描述信息的提示词。

其中 bicon,i​ 与 btext,i​ 分别为图标边界框与文本边界框,di​ 代表经光学字符识别(OCR)提取的文本描述信息。SEED 模块输出空间增强型描述符集合 A:

每个元素的属性包含边界框 b、标签 l(l 的取值范围为 {已配对、独立存在、图像、可操作文本})、关联元素集合 a 以及空间增强型功能描述信息 d。

SEED 基于语义信息与位置关系,将界面元素划分为配对元素独立元素两类。配对元素整合邻近文本或图标的描述信息,生成统一的功能描述;独立元素则仅依靠视觉特征信息完成描述。与交互组件(如输入框、搜索栏、按钮)相关联的文本元素被标记为可操作文本,嵌入式图标则被归类至图像类别。

本文采用上下文学习(ICL)技术 [4],并选取 ScreenSpot 数据集 [19] 中的 6 组样本作为示例。包含 SEED 模块详细信息的完整提示词,详见补充材料。

2.3 动作锚定的智能体化建模

本节阐述如何利用图形用户界面(GUI)的层级化特性,实现如图 2所示的、针对大视觉语言模型(LVLMs)的标记集合(SoM)格式增强型动作锚定。给定一张包含全局感兴趣区域集合 G、图标边界框集合 Bicon​、文本边界框集合 Btext​ 与光学字符识别(OCR)提取文本描述信息 dj​ 的界面图像 I,以及一条指令 Is​,本任务的目标是在单次步骤内,定位到完成该指令所需对应目标元素的边界框 B。

TRISHUL 采用两阶段执行动作锚定任务。第一阶段,将完整标注图像 Iannotated​、裁剪后的全局感兴趣区域集合 Gcropped​ 及指令 Is​ 输入至大视觉语言模型(LVLMs),由模型筛选出相关性最高的全局感兴趣区域(GROI)。模型输出每个全局感兴趣区域的描述信息 DG​,并给出相关性最高区域的标识编号。

全局感兴趣区域(GROI)候选区域的推荐准确率通过验证真实边界框的中点是否位于推荐的 GROI 内部进行评估。基于 GPT-4o 与 GPT-4V 模型,在 ScreenSpot 数据集 [19] 和 VisualWebBench 数据集 [27] 上的实验结果(见表 1),验证了本文所提 GROI 排序模块的有效性。

接下来,本文采用空间增强型元素描述(SEED)模块(详见 2.2 节),为推荐的全局感兴趣区域(GROI)内所有局部元素生成功能描述符。随后,将标注图像与功能描述符输入至标记集合(SoM)框架[40],以预测实现指令锚定所需的目标边界框。

2.4 图形用户界面指代任务的智能体化建模

本节阐述如何利用层级化界面解析模块,提升大视觉语言模型(LVLMs)在图形用户界面(GUI)指代任务中的性能,具体原理如图 3 所示。给定输入的图形用户界面截图 I,本任务需对用户指定的屏幕任意点 Pi​,生成其对应的内容与布局描述。具体流程为:首先基于输入截图检测所有局部元素及对应的全局感兴趣区域(GROI)候选集;随后定位包含该指定点的局部元素边界框,并进一步确定包含此局部元素的全局感兴趣区域。本文借鉴文献 [9] 中 ToL 智能体的提示学习方法,构建两类 “视图”(或称图像)以呈现该层级结构:第一类视图仅包含从原始图像中裁剪出的全局感兴趣区域,在该区域内用带标注的边界框突出显示目标局部元素,并标记用户输入的指定点;第二类视图展示完整截图,用带标注的边界框突出显示对应的全局感兴趣区域。最后将两类视图、指定点坐标 Pi​ 及输入提示词一并输入至大视觉语言模型,由模型生成对应的内容描述 D^c​ 与布局描述 D^l​。

3.1 ScreenSpot 与 VisualWebBench 数据集及实验

本研究基于 ScreenSpot 数据集 [19],对 TRISHUL 智能体的动作锚定能力开展评估。ScreenSpot 数据集包含 610 张来自移动平台(iOS、Android)、桌面平台(macOS、Windows)及网页平台的界面截图,并配套 1276 条与可交互图形用户界面(GUI)元素对应的任务指令。

传统的基于训练的方法通常在 ScreenSpot 这类数据集上完成模型训练,但受领域偏移问题的影响,这类方法在分布外样本(如 VisualWebBench 数据集样本)上的性能表现往往较差。因此,为评估本研究方法的泛化能力,同时采用 VisualWebBench 数据集 [27] 的动作锚定子集开展实验,该子集包含 103 组图像 - 指令配对样本。

实现细节:本研究实验所用数据集的动作锚定任务建模方法,详见 2.3 节内容。上述任务采用的具体提示词,可查阅补充材料。

遗憾的是,我们无法利用公开获取的权重与代码库,复现 OmniParser 在其研究中基于 ScreenSpot 基准测试所报告的实验结果。在表 2 中,我们呈现了通过自主实验,在 ScreenSpot 与 VisualWebBench 数据集上得到的 OmniParser 模型性能指标。鉴于上述结果不可复现的问题,加之研究资源有限,我们未能在 AITW 与 Mind2Web 基准测试上对其结果进行验证,因此在本研究的分析工作中,我们选择剔除该模型在这两项基准测试中的相关数据。

评估与结果:如表 2 所示,将 TRISHUL 智能体与大视觉语言模型(GPT-4V [29]、GPT-4o [30])结合后,其性能显著优于未集成该智能体的基准模型 GPT-4V 与 GPT-4o。本研究方法的性能同样超越 SeeClick [7]、CogAgent [15] 等任务专用模型;在 ScreenSpot 基准测试中,结合 GPT-4V 时整体准确率达到 61.9%,结合 GPT-4o 时整体准确率达到 72.2%。该性能表现不仅超过 SeeClick 模型的 53.4% 与 CogAgent 模型的 47.4%,还与 OmniParser 模型 72.6% 的准确率十分接近。在 VisualWebBench 数据集 [27] 上,SeeClick 模型在分布外数据上的准确率大幅下滑至 31%,与之不同的是,TRISHUL 智能体展现出优异的泛化能力,结合 GPT-4V 与 GPT-4o 时均实现了 68.0% 的稳定准确率,该结果与 OmniParser 模型 68.9% 的准确率表现高度持平。

我们进一步在表 2 中开展消融实验,以评估 SEED 模块与基于全局感兴趣区域(GROI)的动作锚定机制对 TRISHUL 性能的影响。移除 SEED 模块后(记为 TRISHUL†),在 ScreenSpot 数据集上,GPT-4V 的准确率出现8.5% 的显著下降,GPT-4o 的准确率下降 2.9%。同理,移除基于全局感兴趣区域(GROI)的动作锚定机制后(记为 TRISHUL∗),GPT-4V 的准确率下降 2.9%,GPT-4o 的准确率下降 1.1%。上述实验结果表明,这两个组件对 TRISHUL 的性能起到关键性作用

此外,我们通过将 TRISHUL 的各组件集成至现有锚定流程,验证了该智能体的模块化特性。如表 2 所示,OmniParser 模型所采用的基于 BLIPv2 生成的图标描述符,原本缺乏局部语义上下文信息;而通过 TRISHUL 的 SEED 模块对其进行增强后(记为 OmniParser∗),该模型在各类基于训练的方法中取得了最优性能

事实证明,我们所提出的基于全局感兴趣区域(GROI)的动作锚定方法,在网页与桌面平台中效果尤为显著;此类平台的图形用户界面(GUI)具有层级分明、内容密集的特点,能够借助结构化分解机制提升任务性能。然而,该方法在移动终端界面中的效果则相对有限,这是由于移动界面内各区域的语义区分度较低。相关详细信息可查阅补充材料。

最后我们发现,当 SEED 模块与 GPT-4o 结合时,其性能显著优于与 GPT-4V 的组合。这一现象表明,大视觉语言模型(LVLMs)推理能力的提升,能够有效增强 SEED 模块生成描述信息的准确性。

3.2 AITW 数据集及实验


为在移动导航基准测试集AITW[31] 上对 TRISHUL 进行性能评估,本研究采用文献 [7] 中定义的训练集 / 测试集划分方式。该基准测试集包含 30,000 条指令与 715,000 条轨迹,其数据集划分规则为每条指令仅保留一条轨迹,以此确保训练集与测试集之间无数据重叠。
实现细节:本研究采用与MM-Navigator[39] 相似的提示词格式,即通过标记集合(SoM)提示学习方法对屏幕中检测到的元素进行标注,并向模型同时输入标注图像与原始清晰图像。不同之处在于,本研究将 MM-Navigator 所采用的IconDet边界框替换为通过层级化界面解析方法生成的局部元素边界框,同时在输入提示词中,为所有局部元素附加了本文提出的空间增强型元素描述信息(详见 2.2 节)。具体提示词内容可查阅补充材料。

评估与结果 如表 3 所示,本研究沿用了 MM-Navigator 模型 [39] 所采用的基准模型设置。性能最优的基准模型引入了动作历史信息,且仅采用图像模态完成导航任务。MM-Navigator 原研究仅基于 GPT-4V 模型构建了基准模型,本研究额外基于 GPT-4o 模型运行了 MM-Navigator 的最优配置方案(图像 + 历史信息),以此与 TRISHUL 结合 GPT-4o 的性能表现形成对照。实验结果表明,TRISHUL 结合 GPT-4V 的性能优于所有已有的基于 GPT-4V 的基准模型,整体准确率达到 54.5%;TRISHUL 结合 GPT-4o 的平均准确率达到 60%,较 MM-Navigator 基于 GPT-4o 的基准模型性能提升超过 2.2%,达到当前最优水平。

3.3 Mind2Web 数据集及实验

为开展网页导航任务测试,本研究采用 Mind2Web 数据集 [8]。该数据集的测试集包含跨任务跨网站跨领域三个类别,对应任务数量分别为 252 项、177 项与 912 项。

实现细节:本研究采用文献 [39] 提供的预处理测试集。在推理阶段,将层级化界面解析(HSP)模块输出的检测到的局部元素信息,与原始清晰图像一并输入至模型。此外,在输入提示词中补充集成了由 SEED 模块生成的局部元素描述信息。具体提示词内容可查阅补充材料。

评估与结果:实验结果如表 4 所示,本研究在 HTML 与图像两种模态下,与多个基准模型展开对比。其中,GPT-4V+SoM 与 GPT-4V+Text 两种配置方案,分别对应 SeeAct 模型 [46] 采用图像标注与文本选项锚定的技术路线。在未借助任何解析后的 HTML 信息的前提下,TRISHUL 在几乎所有子类别中,性能均优于所有仅依赖图形用户界面(GUI)截图的方法。与其他基准模型相比,TRISHUL 在元素识别准确率步骤成功率两项指标上实现超越,同时在操作 F1 值指标上保持竞争力。这一结果表明,由 HSP 模块检测得到的局部元素信息,以及 SEED 模块生成的元素描述信息,可为网页导航任务提供极具价值的参考依据。尽管本研究方法的操作 F1 值优于各类基于 HTML 的方法,但在元素识别准确率与步骤成功率两项指标上仍存在短板 —— 其原因在于,边界框预测任务的复杂度要高于 HTML 元素选择任务。

3.4 屏幕点选读取任务

数据集与实验—— 本研究采用屏幕点选读取基准测试集 [9],对 TRISHUL 在图形用户界面(GUI)指代任务中的性能进行评估。该基准测试集的核心任务,是评估模型针对用户在界面上标记区域所生成的内容描述 
 与布局描述 
 的准确性。此基准测试集涵盖网页、移动终端、操作系统三大领域,共计 650 张界面截图。为验证本研究方法的有效性,实验分别采用 GPT-4o [30]、GPT-4V [29] 与 Claude-3.5-Sonnet [1] 三种大视觉语言模型(LVLMs),从而能够全面检验模型在不同大视觉语言模型上的性能表现。
评估与结果—— 为评估生成的内容描述与布局描述的质量,本研究沿用《屏幕点选读取》论文 [9] 提出的循环一致性评估方法。具体流程为:将智能体输出的描述结果 

 输入至一个辅助模型,并要求该辅助模型完成一项下游任务,以辅助模型的性能表现来表征描述结果的质量。实验选取基准模型 GPT-4o、Claude 模型,以及《屏幕点选读取》论文提出的 ToL 智能体作为对照方法,主模型则分别采用 GPT-4o、GPT-4V 与 Claude-3.5-Sonnet。同时,本研究还计算了BERT 分数[44] 与ROUGE-L 指标[25] 等语言相似度指标,以此评估生成描述与人工标注真实结果的契合度。

为进一步验证描述质量,本研究开展了两轮人工评估:第一轮评估将本研究方法与基准模型 GPT-4o 进行对比,第二轮评估则将本研究方法与 ToL 智能体进行对比,两轮评估均采用 GPT-4o 作为主大语言模型(LLM)。
本研究聘请了文献 [16] 提供的 10 名人工标注员,要求他们在本研究方法生成的描述与对比方法生成的描述中做出选择。研究人员向每位评估人员提供标注图像,并提出唯一问题:“给定带有标记点的图像,你更倾向于哪一份描述?” 最终采用多数投票制选定更优描述。
为确保评估结果无偏,标注员并不知晓各份描述由何种模型生成。所有标注员均按照最低工资标准获得报酬。

在 GPT-4V、Claude 及 GPT-4o 三种模型的所有评估指标中,TRISHUL 的性能均持续优于基准模型与 ToL 智能体(见表 5)。人工评估结果(见图 4)进一步验证了 TRISHUL 的有效性:在对比实验中,标注员对 TRISHUL 生成描述的偏好度达到 73%(相对 GPT-4o)与 62.8%(相对 ToL 智能体);TRISHUL 与 GPT-4o 持平的情况占比为 0.9%,与 ToL 智能体持平的情况占比为 0.6%

4 讨论

4.1 多候选方案采样分析

基于大视觉语言模型(LVLM)的图形用户界面(GUI)智能体,其设计目标是实现类人的界面交互行为。人类在与全新或复杂的图形用户界面交互时,往往会探索多种操作路径。而像 ** 单次通过率(pass@1)** 这类传统评价指标,在评估依赖探索机制的任务时,无法全面反映智能体的任务完成能力。最新研究 [21] 表明,通过对多条潜在操作路径进行采样与评估,再借助价值模型完成筛选,能够有效降低决策过程中的不确定性,进而提升任务成功率。

研究表明,ToL 智能体可作为移动智能体的验证层发挥有效作用 [9],能够精准识别操作路径的正误。基于这一研究结论,本研究提出将TRISHUL作为图形用户界面(GUI)智能体系统中的验证智能体,以实现高精度的多步点击锚定。表 6 中的实验结果显示,在 ScreenSpot 与 VisualWebBench 数据集的任务中,pass@2pass@3等多采样指标使各模型的锚定准确率提升超过 10%。此处的pass@k指标,用于表征由 TRISHUL 生成的排名前 K 的动作锚定候选方案。

4.2限制

在图 5 中,我们在各类数据集及其不同划分版本上,对 ** 局部元素完备性(Local Element Exhaustiveness, LEE)指标开展评估。
该 LEE 指标为二元评分机制:若真实标注(Ground Truth, GT)边界框的中点落在由层级化界面解析(Hierarchical Screen Parsing, HSP)** 模块检测出的任意一个局部元素边界框内,则评分为 1;反之则为 0。
低 LEE 评分表明,在局部元素检测环节之后的算法流程中存在性能瓶颈,而界面元素识别不完整是导致 Mind2Web、AITW 等轨迹级任务失败的首要原因。实验结果显示,LEE 评分与 TRISHUL 的性能表现呈强相关性,在 Mind2Web 数据集中尤为显著 —— 该数据集下受限的元素检测能力,严重制约了模型在网页导航任务中的效能发挥。
此外,TRISHUL 的智能体建模方案,还可作为一套独立的动作锚定框架,适配于图形用户界面(GUI)导航任务中的任意基础推理模型。未来研究将聚焦于提升模型的推理与规划能力。

4.3潜在负面影响

将 TRISHUL 应用于自主化图形用户界面(GUI)导航,引发了关于岗位替代数字鸿沟扩大伦理滥用风险的担忧。数据录入与软件测试领域的从业者或需开展技能重塑,而人工智能技术的不平等获取机会,可能会进一步加剧数字鸿沟。此外,未经授权的数据提取、非法监控等风险也必须得到妥善解决。

不过,通过负责任的技术开发举措 —— 例如制定人工智能伦理准则、构建人机协同模式、推进技术普惠计划 ——TRISHUL 能够在提升生产效率的同时,保障技术发展的公平性、安全性与包容性。

5 结论

本研究提出了TRISHUL—— 一套无需训练的智能体框架。该框架通过 ** 层级化界面解析(HSP)空间增强型元素描述(SEED)** 两大核心模块,使大视觉语言模型(LVLMs)具备对图形用户界面(GUI)的全面理解能力。其中,HSP 模块将界面元素组织为多粒度的层级结构,实现全局感兴趣区域(GROIs)与局部元素的有效区分;SEED 模块则可增强模型的空间上下文感知推理能力。

在 ScreenSpot、VisualWebBench、AITW、Mind2Web 及 ScreenPR 五大数据集上的实验结果表明,TRISHUL 的性能优于所有无训练方法,且可与基于训练的方法相媲美,同时还能保持卓越的跨任务与跨平台泛化能力。

附录

A.1. 模型规格与接口标识由于我们的所有工作都依赖 GPT-4V、GPT-4o 和 Claude 等闭源模型,为清晰起见,我们在此说明 API 调用中使用的模型标识符:

  • GPT-4V:gpt-4-vision-preview
  • GPT-4o:gpt-4o-2024-08-06
  • Claude:claude-3-5-sonnet-20241022

除非另有说明,所有实验的温度参数均设置为 0.0。

 图6。左侧由SAM + OCR生成的候选边界框,右侧是对应的HSP结果(图标+文本+图片)

图 7 屏幕点读任务提示词

图8。ScreenSpot和Visual WebBench每张图片的GROI数量分布

图9。ScreenSpot 和 Visual WebBench 的总 GROI 面积/图像面积分布

图10。指导引导的GROI提案生成

图11。SEED的提示

图12。ScreenSpot 和 VisualWebBench 的 SoM 接地提示

图13。AITW的能动任务跟随提示

更多推荐