Computer-Use Agent训练新范式!阿里通义提出ToolCUA,实现GUI与工具自主择优动态切换
Computer-Use Agent训练新范式!阿里通义提出ToolCUA,实现GUI与工具自主择优动态切换
原创 关注AI智能体 智猩猩AI 2026年5月29日 10:00
当前的多模态大语言模型(MLLM)正在向计算机操作智能体(CUA)演进。它们能像人一样看屏幕、点按钮、输入文字,完成如“在 LibreOffice 中创建数据透视表”等任务。
但问题来了:CUA既可以用鼠标点按(GUI 动作),也可以调用工具(如 API)。两者各有优劣:
-
GUI动作通用但步骤多、易出错
-
工具调用高效但覆盖不全、不稳定
理想情况是两者结合,但现有模型要么过度依赖工具,要么几乎不用工具,导致效率低下甚至任务失败。
真正的难题不是“能不能调用工具”,而是何时该用 GUI、何时该切到工具。这是一个轨迹级别的决策问题,而不是单步动作的选择。
为破解这一难题,阿里通义实验室提出了ToolCUA,一种旨在学习最优GUI-工具路径编排的统一Agent。其根本性改进在于,不局限于单步动作模仿,而是通过路径级别的策略学习,让Agent动态判断何时切换动作空间。在关键的OSWorld-MCP基准测试中,ToolCUA取得了46.85%的准确率,相比基线模型实现了约66%的相对提升,并在纯GUI设置上提升了3.9%,首次在8B级模型中达到了最先进的性能,证明了混合动作空间训练的优越性。

-
论文标题:ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents
-
论文链接:https://arxiv.org/pdf/2605.12481
-
github地址:
https://github.com/X-PLUG/ToolCUA https://github.com/X-PLUG/MobileAgent
01
方法
想象一下:你教一个AI用电脑。它学会了点按、打字、滚动,但当你告诉它“可以用工具”时,它反而懵了——明明一个API就能搞定的事,它偏要点上十几下鼠标;明明点两下就能解决的问题,它却非要调个笨重的工具。这不是因为它笨,而是因为它根本不知道:什么时候该动手,什么时候该动脑。
ToolCUA要解决的正是这个核心矛盾。它不是简单地让AI“多学一种技能”,而是设计了一套系统化的训练方法,教会AI在GUI和工具之间动态选择最优路径。

图1 ToolCUA三阶段训练范式
上图完整展示了ToolCUA的三阶段训练流程,接下来对各阶段核心设计展开拆解分析。
一、数据合成
混合动作训练的首要障碍是数据稀缺。真实的GUI-工具交错轨迹几乎无法规模化采集,而纯GUI轨迹虽然大量存在,却缺乏工具使用的监督信号。

图1(a) 交错GUI-工具轨迹的自动合成流程
通过上述合成策略,流水线能够生成一条完整的GUI-工具交错轨迹,其中清晰呈现了Agent在执行任务过程中如何在工具调用与原子级GUI操作之间进行策略性切换。

图2 由合成流水线生成的一条GUI-工具交错轨迹示例
轨迹真实模拟了实际应用场景中工具覆盖不完全的情况,同时自然产生了“GUI→工具”与“工具→GUI”两类关键边界转换点,为后续的强化微调提供了训练信号。
二、两阶段微调
数据就位后,模型需要经历两阶段微调。

图1(b):工具引导的GUI强化微调流程
第一阶段为监督微调,让模型在合成数据上进行模仿学习,掌握工具调用的功能语义、参数规范以及执行后的状态反馈。
第二阶段针对关键切换点进行单步强化学习。研究者从全部轨迹中提取出所有边界转换步骤,让模型在这些“十字路口”反复尝试,校准其判断何时该继续点按、何时该切换工具。
三、在线强化学习
具备局部切换能力后,模型仍需追求全局最优。为此,ToolCUA在真实环境中引入在线强化学习,并设计了双重奖励机制。

图1(c):在线强化学习与路径效率优化流程
-
工具适用性奖励用于约束工具调用的恰当时机:对于适合工具的任务鼓励工具调用,对于不适合的场景则鼓励回避。
-
路径效率奖励通过比较当前轨迹与同组轨迹的平均长度,对更短的执行路径给予额外激励。双重信号共同引导模型探索高效路径,实现从“完成任务”到“最优完成任务”的跃升。
通过这一环环相扣的三阶段训练范式,ToolCUA从一个只会机械执行指令的新手,逐步成长为能够在GUI与工具之间游刃有余、自主选择最优路径的智能体。
02
实验结果与分析
一、实验设置
实验基于OSWorld-MCP主数据集开展,内置150+工具、适配GUI与工具混合交互,并在Linux多应用任务、WindowsAgentArena上做泛化测试;基线包含Gemini、Claude、Qwen系列通用大模型及EvoCUA、GUI-Owl等专业CUA模型,以Qwen3-VL-8B-Instruct为底座,采用准确率、TIR工具调用合规率、ACS平均步数作为评价指标。
二、主实验定量结果
下图可直观展示了各类主流模型与ToolCUA的整体性能柱状对比。可以清晰看出,纯GUI动作方案普遍死板、步骤冗余;而GUI-Tool交错动作范式灵活高效,ToolCUA性能远超EvoCUA、Qwen、Gemini、Claude等基线模型,相对基线提升幅度高达66%,凸显 GUI 与工具协同编排策略的巨大优势。

图3 (a) 工具增强动作与纯 GUI 动作效果对比;(b) ToolCUA 与各类模型性能对比。
表1对比了多款模型纯GUI模式与GUI+工具混合模式的性能差异。数据可见,现有主流模型接入工具后普遍出现准确率下滑,存在工具滥用或不敢调用两大极端问题;而ToolCUA是唯一混合模式优于纯GUI的模型,准确率提升3.9%,同时平均执行步数显著减少,证明模型具备精准判断何时用工具、何时用GUI的决策能力。
表 1 纯 GUI 模式与 GUI + 工具混合模式性能对比

表2为OSWorld-MCP基准整体指标对比。ToolCUA-8B以46.85%准确率刷新同规模模型SOTA,大幅超越Qwen3-VL-8B基线,领先多数通用大模型与专业CUA模型。
表 2 OSWorld-MCP 基准综合指标对比

二、消融实验结果分析
表3为纯GUI训练与GUI-Tool混合训练的消融对比。可以看出,同等训练投入下,纯GUI训练最终准确率仅42.05%,而本文混合训练范式可达46.85%,充分验证GUI与工具联合训练相比单一GUI交互训练具备明显优势,能够学到更高效的任务执行策略。
表 3 纯 GUI 训练与 GUI-Tool 混合训练消融实验结果

图4为在线RL训练消融曲线。去除交错轨迹合成数据后,模型工具调用能力始终偏弱;去掉本文路径奖励后,准确率震荡明显且最终性能差距达7个百分点,证明离线合成轨迹数据与工具高效路径奖励,是模型收敛并习得最优路径策略的核心关键。

图 4 在线强化学习训练消融对比曲线
三、跨平台泛化结果
表4为WindowsAgentArena跨平台泛化测试结果。模型仅在Linux环境训练,在未知Windows桌面任务上仍达到33.8%准确率,超越同尺寸及更大参数量的Qwen基线模型。
表 4 WindowsAgentArena 跨平台泛化能力测试结果

图5展示多类桌面子任务精度分布。相较于基线与仅RFT训练版本,ToolCUA 在办公、代码、图像编辑等各类任务上均稳定领先,在多应用复杂任务上提升尤为明显,说明模型学到的GUI-Tool编排策略具备普适性,不局限于单一任务场景。

图 5 不同模型在各类桌面子任务上的精度分布
03
总结
ToolCUA的发布,标志着计算机操作智能体从“能点按”向“会选择”迈出了关键一步。它不再盲目地依赖GUI动作,也不会毫无节制地调用工具,而是学会了在二者之间动态、理性地切换,找到那条既高效又可靠的执行路径。
这项研究的核心启示在于:真正的智能不是能做更多事,而是知道什么时候该做什么事。 对于CUA而言,工具调用能力固然重要,但更关键的是具备路径层面的判断力,这就像人类在使用电脑时,既会用鼠标点击图标,也会用快捷键、命令行或脚本,而不是死守一种方式。
END
✦
✦
2026中国AI智能体大会
✦
7月2-3日,智猩猩主办的2026中国AI智能体大会将在杭州举行,设有开幕式,企业级AI智能体、AI智能体产品创新2场论坛,以及Coding Agent、自进化智能体、深度研究智能体、Computer-Use Agent、多智能体协同、Agent Skills、Agent Harness7场技术研讨会。
更多推荐




所有评论(0)