Computer-Use Agent训练新范式!阿里通义提出ToolCUA,实现GUI与工具自主择优动态切换

原创 关注AI智能体 智猩猩AI 2026年5月29日 10:00

当前的多模态大语言模型(MLLM)正在向计算机操作智能体(CUA)演进。它们能像人一样看屏幕、点按钮、输入文字,完成如“在 LibreOffice 中创建数据透视表”等任务。

但问题来了:CUA既可以用鼠标点按(GUI 动作),也可以调用工具(如 API)。两者各有优劣:

  • GUI动作通用但步骤多、易出错

  • 工具调用高效但覆盖不全、不稳定

理想情况是两者结合,但现有模型要么过度依赖工具,要么几乎不用工具,导致效率低下甚至任务失败。

真正的难题不是“能不能调用工具”,而是何时该用 GUI、何时该切到工具。这是一个轨迹级别的决策问题,而不是单步动作的选择。

为破解这一难题,阿里通义实验室提出了ToolCUA,一种旨在学习最优GUI-工具路径编排的统一Agent。其根本性改进在于,不局限于单步动作模仿,而是通过路径级别的策略学习,让Agent动态判断何时切换动作空间。在关键的OSWorld-MCP基准测试中,ToolCUA取得了46.85%的准确率,相比基线模型实现了约66%的相对提升,并在纯GUI设置上提升了3.9%,首次在8B级模型中达到了最先进的性能,证明了混合动作空间训练的优越性。

图片

  • 论文标题:ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents

  • 论文链接:https://arxiv.org/pdf/2605.12481 

  • github地址:                        

    https://github.com/X-PLUG/ToolCUA  https://github.com/X-PLUG/MobileAgent

01

方法

想象一下:你教一个AI用电脑。它学会了点按、打字、滚动,但当你告诉它“可以用工具”时,它反而懵了——明明一个API就能搞定的事,它偏要点上十几下鼠标;明明点两下就能解决的问题,它却非要调个笨重的工具。这不是因为它笨,而是因为它根本不知道:什么时候该动手,什么时候该动脑

ToolCUA要解决的正是这个核心矛盾。它不是简单地让AI“多学一种技能”,而是设计了一套系统化的训练方法,教会AI在GUI和工具之间动态选择最优路径

图片

图1 ToolCUA三阶段训练范式

上图完整展示了ToolCUA的三阶段训练流程,接下来对各阶段核心设计展开拆解分析。

一、数据合成

混合动作训练的首要障碍是数据稀缺。真实的GUI-工具交错轨迹几乎无法规模化采集,而纯GUI轨迹虽然大量存在,却缺乏工具使用的监督信号。

图片

图1(a)  交错GUI-工具轨迹的自动合成流程

通过上述合成策略,流水线能够生成一条完整的GUI-工具交错轨迹,其中清晰呈现了Agent在执行任务过程中如何在工具调用与原子级GUI操作之间进行策略性切换。

图片

图2 由合成流水线生成的一条GUI-工具交错轨迹示例

轨迹真实模拟了实际应用场景中工具覆盖不完全的情况,同时自然产生了“GUI→工具”与“工具→GUI”两类关键边界转换点,为后续的强化微调提供了训练信号。

二、两阶段微调

数据就位后,模型需要经历两阶段微调。

图片

图1(b):工具引导的GUI强化微调流程

第一阶段为监督微调,让模型在合成数据上进行模仿学习,掌握工具调用的功能语义、参数规范以及执行后的状态反馈。

第二阶段针对关键切换点进行单步强化学习。研究者从全部轨迹中提取出所有边界转换步骤,让模型在这些“十字路口”反复尝试,校准其判断何时该继续点按、何时该切换工具。

三、在线强化学习

具备局部切换能力后,模型仍需追求全局最优。为此,ToolCUA在真实环境中引入在线强化学习,并设计了双重奖励机制。

图片

图1(c):在线强化学习与路径效率优化流程

  • 工具适用性奖励用于约束工具调用的恰当时机:对于适合工具的任务鼓励工具调用,对于不适合的场景则鼓励回避。

  • 路径效率奖励通过比较当前轨迹与同组轨迹的平均长度,对更短的执行路径给予额外激励。双重信号共同引导模型探索高效路径,实现从“完成任务”到“最优完成任务”的跃升。

通过这一环环相扣的三阶段训练范式,ToolCUA从一个只会机械执行指令的新手,逐步成长为能够在GUI与工具之间游刃有余、自主选择最优路径的智能体。

02

实验结果与分析

一、实验设置

实验基于OSWorld-MCP主数据集开展,内置150+工具、适配GUI与工具混合交互,并在Linux多应用任务、WindowsAgentArena上做泛化测试;基线包含Gemini、Claude、Qwen系列通用大模型及EvoCUA、GUI-Owl等专业CUA模型,以Qwen3-VL-8B-Instruct为底座,采用准确率、TIR工具调用合规率、ACS平均步数作为评价指标。

二、主实验定量结果

下图可直观展示了各类主流模型与ToolCUA的整体性能柱状对比。可以清晰看出,纯GUI动作方案普遍死板、步骤冗余;而GUI-Tool交错动作范式灵活高效,ToolCUA性能远超EvoCUA、Qwen、Gemini、Claude等基线模型,相对基线提升幅度高达66%,凸显 GUI 与工具协同编排策略的巨大优势。

图片

图3  (a) 工具增强动作与纯 GUI 动作效果对比;(b) ToolCUA 与各类模型性能对比。

表1对比了多款模型纯GUI模式与GUI+工具混合模式的性能差异。数据可见,现有主流模型接入工具后普遍出现准确率下滑,存在工具滥用或不敢调用两大极端问题;而ToolCUA是唯一混合模式优于纯GUI的模型,准确率提升3.9%,同时平均执行步数显著减少,证明模型具备精准判断何时用工具、何时用GUI的决策能力。

表 1  纯 GUI 模式与 GUI + 工具混合模式性能对比

图片

表2为OSWorld-MCP基准整体指标对比。ToolCUA-8B以46.85%准确率刷新同规模模型SOTA,大幅超越Qwen3-VL-8B基线,领先多数通用大模型与专业CUA模型。

表 2  OSWorld-MCP 基准综合指标对比

图片

二、消融实验结果分析

表3为纯GUI训练与GUI-Tool混合训练的消融对比。可以看出,同等训练投入下,纯GUI训练最终准确率仅42.05%,而本文混合训练范式可达46.85%,充分验证GUI与工具联合训练相比单一GUI交互训练具备明显优势,能够学到更高效的任务执行策略。

表 3  纯 GUI 训练与 GUI-Tool 混合训练消融实验结果

图片

图4为在线RL训练消融曲线。去除交错轨迹合成数据后,模型工具调用能力始终偏弱;去掉本文路径奖励后,准确率震荡明显且最终性能差距达7个百分点,证明离线合成轨迹数据与工具高效路径奖励,是模型收敛并习得最优路径策略的核心关键。

图片

图 4  在线强化学习训练消融对比曲线

三、跨平台泛化结果

表4为WindowsAgentArena跨平台泛化测试结果。模型仅在Linux环境训练,在未知Windows桌面任务上仍达到33.8%准确率,超越同尺寸及更大参数量的Qwen基线模型。

表 4  WindowsAgentArena 跨平台泛化能力测试结果

图片

图5展示多类桌面子任务精度分布。相较于基线与仅RFT训练版本,ToolCUA 在办公、代码、图像编辑等各类任务上均稳定领先,在多应用复杂任务上提升尤为明显,说明模型学到的GUI-Tool编排策略具备普适性,不局限于单一任务场景。

图片

图 5  不同模型在各类桌面子任务上的精度分布

03

总结

ToolCUA的发布,标志着计算机操作智能体从“能点按”向“会选择”迈出了关键一步。它不再盲目地依赖GUI动作,也不会毫无节制地调用工具,而是学会了在二者之间动态、理性地切换,找到那条既高效又可靠的执行路径。

这项研究的核心启示在于:真正的智能不是能做更多事,而是知道什么时候该做什么事。 对于CUA而言,工具调用能力固然重要,但更关键的是具备路径层面的判断力,这就像人类在使用电脑时,既会用鼠标点击图标,也会用快捷键、命令行或脚本,而不是死守一种方式。

END

2026中国AI智能体大会

7月2-3日,智猩猩主办的2026中国AI智能体大会将在杭州举行,设有开幕式,企业级AI智能体、AI智能体产品创新2场论坛,以及Coding Agent、自进化智能体、深度研究智能体、Computer-Use Agent、多智能体协同、Agent Skills、Agent Harness7场技术研讨会。

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐