当马斯克的xAI团队在内部测试中让Grok尝试操作《英雄联盟》时,整个技术社区都在关注一个问题:大模型到底如何从"看懂像素"跨越到"精准点击"?

这不是简单的"AI打游戏"噱头,而是2025年以来最火热的技术赛道之一——GUI Agent(图形界面智能体)。从OpenAI的Operator到Anthropic的Computer Use,从Google的Project Mariner到各类开源项目,硅谷正在经历一场"让AI像人类一样操作电脑"的军备竞赛。

本文将剥离所有营销话术,从底层技术原理出发,深度拆解VLM(Vision Language Model)的Action Space设计、视觉语义映射机制,以及当前工业界与开源社区的真实进展。


一、技术背景:从"看图说话"到"看图操作"

传统VLM的能力边界长期停留在**Visual Question Answering(视觉问答)**阶段——模型能告诉你屏幕上有个"开始游戏"按钮,但无法伸出"手"去点击它。

这个能力鸿沟的核心在于Action Space(动作空间)的设计。在标准VLM架构中,输出被限制为自然语言Token;而GUI Agent要求模型输出可执行的结构化动作指令

GUI Agent范式

像素输入

视觉编码器

语言模型

Action Tokenizer

结构化动作

执行引擎

界面反馈

传统VLM范式

像素输入

视觉编码器

语言模型

文本描述

这个闭环架构的核心挑战在于:如何定义动作的粒度与表示方式?


二、Action Space的三种主流范式

当前业界对VLM Action Space的设计主要分为三大流派,各有优劣:

2.1 方案对比总览

维度 纯像素坐标 DOM/Accessibility Tree 混合语义空间
代表项目 SeeClick, OS-Atlas Operator(疑似), Omniverse Claude Computer Use
输入模态 纯截图 截图 + DOM树 截图 + 结构化元数据
动作表示 (x, y) 坐标对 元素ID / XPath 自然语言 + BBOX
精度上限 受限于分辨率 依赖DOM完整性 较高
游戏兼容性 ✅ 优秀 ❌ 差(无DOM) ⚠️ 中等
跨泛化能力 ⚠️ 中等 ✅ 优秀 ✅ 优秀
计算开销 中(需解析DOM)

2.2 深度拆解:纯像素坐标流派

SeeClick(来自清华大学和微软亚研院)为代表的技术路线,直接让VLM预测屏幕上的像素坐标。

核心原理:

模型接收截图输入后,输出格式为:

{
  "action_type": "click",
  "coordinate": [0.523, 0.671],
  "confidence": 0.94
}

其中坐标被归一化到 [0, 1] 区间,避免分辨率敏感问题。

技术难点——坐标精度损失:

这是纯像素流派最大的痛点。假设屏幕分辨率为 1920×1080,VLM输出的坐标误差哪怕只有 0.01,在实际像素层面就是 ±19像素 的偏移——这对于需要精准点击小目标的游戏场景是致命的。

清华大学在论文《SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents》中引入了CoT(Chain of Thought)推理增强

第一步

第二步

截图输入

CoT推理

目标元素定位

识别大致区域

精细化坐标预测

最终坐标输出

实验数据显示,引入CoT后,SeeClick在1366×768分辨率下的点击准确率从67.3%提升至82.1%


三、视觉语义映射:AI如何"理解"屏幕

3.1 Accessibility Tree:被低估的黄金数据源

大多数开发者熟悉的DOM Tree并不适合作为GUI Agent的唯一依据——它包含大量与交互无关的样式信息,且在游戏场景中完全失效。

**Accessibility Tree(无障碍树)**是更优的选择:

  • 体积精简:通常只有DOM的1/10大小
  • 语义纯净:仅保留可交互元素及其属性
  • 标准化:遵循WAI-ARIA规范

以下是一个典型Accessibility Node的简化结构:

{
  "nodeId": "btn-submit-42",
  "role": "button",
  "name": "Submit Form",
  "bounds": {"x": 120, "y": 340, "width": 80, "height": 32},
  "actionable": true,
  "state": {"focused": false, "disabled": false}
}

3.2 混合架构:Microsoft OmniParser的方法论

Microsoft在2024年发布的OmniParser采用了视觉检测与语义理解分离的架构:

输出层

语义层 - CLIP/Florence

检测层 - YOLOv8变体

输入层

原始截图

可交互元素检测

文本OCR提取

图标分类

元素描述生成

功能推断

结构化元素列表

BBOX + 语义标签

这种架构的优势在于解耦:检测层专注于"哪里有东西",语义层专注于"这是什么",最终由下游的VLM完成决策。


四、Headless Browser与执行引擎

当VLM做出决策后,如何将动作可靠地注入目标系统?这涉及执行引擎层的设计。

4.1 Playwright/Puppeteer方案

对于Web场景,Headless Browser是首选:

特性 Playwright Puppeteer Selenium
多浏览器支持 ✅ Chromium/FF/WebKit ⚠️ 仅Chromium ✅ 全平台
自动等待机制 ✅ 智能等待 ⚠️ 需手动 ❌ 需显式sleep
网络拦截 ✅ 原生支持 ✅ 原生支持 ⚠️ 有限
AI Agent适配性 ⭐⭐⭐⭐⭐ ⭐⭐⭐⭐ ⭐⭐

4.2 游戏场景的特殊挑战

游戏没有DOM,无法使用常规的元素定位器。当前主流方案包括:

  1. 纯视觉流:持续截屏 → VLM决策 → 模拟鼠标/键盘输入
  2. 内存读取:通过Hook获取游戏内部状态(存在法律与反作弊风险)
  3. API接入:部分游戏提供官方API(如League of Legends的Client API)

Riot Games为例,其LCU(League Client UI)实际上是一个Chromium应用,可以通过本地WebSocket连接获取实时数据:

wss://127.0.0.1:{port}/

这为AI Agent提供了一个"半结构化"的切入点——既不需要纯视觉猜测,也不涉及非法内存操作。


五、开源生态与可复现资源

以下是目前GUI Agent领域值得关注的开源项目与学术资源:

5.1 核心开源项目

项目名称 组织/团队 GitHub 技术特点
SeeClick 清华/微软 github.com/njucckevin/SeeClick 纯像素点击,CoT增强
OS-Atlas OpenGVLab github.com/OpenGVLab/OS-Atlas 多平台GUI grounding
OmniParser Microsoft github.com/microsoft/OmniParser 检测+语义分离架构
Agent-S Simular github.com/simular-ai/Agent-S 完整GUI Agent框架
OpenAI Operator OpenAI 非开源(API) SOTA商业方案

5.2 关键学术论文

  1. “SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents” (EMNLP 2024)

    • 清华大学 & 微软亚研院
    • 首次系统化解决VLM点击精度问题
  2. “OS-Atlas: A Foundation Action Model for GUI Agents” (arXiv 2024)

    • 上海AI Lab
    • 跨平台GUI预训练方法
  3. “On the Path to Universal Computer Control: The OSWorld Benchmark” (NeurIPS 2024)

    • 定义了GUI Agent的标准化评测框架

5.3 数据集资源

  • ScreenSpot:包含超过6000个GUI grounding标注
  • GUIAct:Android/Web/Windows跨平台动作数据集
  • Mind2Web:包含2000+真实网站的操作轨迹

六、技术展望:从"能操作"到"会操作"

当前VLM Action Space的研究仍处于早期阶段,几个关键瓶颈亟待突破:

长期目标 1-3年

实时策略决策

跨应用协作

人类意图对齐

近期突破 6-12月

多步推理链

动态界面适应

错误自纠正

当前能力

单步动作执行

简单任务规划

静态界面操作

关于"AI战胜Faker"这个命题,从技术角度而言,目前还处于"能操作游戏"而非"理解游戏策略"的阶段。真正能在MOBA类游戏中达到职业水准,需要的是:

  1. 实时视觉感知(60FPS+)
  2. 博弈论级别的策略推理
  3. 毫秒级反应速度
  4. 团队协作理解

这些能力远超当前VLM的范畴,更像是RL(强化学习)+ VLM的融合方向。


七、总结与行动建议

对于希望深入研究GUI Agent的开发者,建议的技术路径如下:

  1. 入门:从Playwright入手,理解浏览器自动化基础
  2. 进阶:部署SeeClick或OS-Atlas,在自己的应用上测试grounding效果
  3. 深入:研究OmniParser的检测-语义分离架构,尝试自定义场景
  4. 实践:参与Agent-S等开源项目,贡献代码或数据

核心资源链接

  • SeeClick: https://github.com/njucckevin/SeeClick
  • OS-Atlas: https://github.com/OpenGVLab/OS-Atlas
  • OmniParser: https://github.com/microsoft/OmniParser
  • Agent-S: https://github.com/simular-ai/Agent-S
  • OSWorld Benchmark: https://github.com/xlang-ai/OSWorld
  • Playwright: https://github.com/microsoft/playwright

GUI Agent是2024-2025年最值得关注的AI应用方向之一。它不只是"让AI玩游戏"的炫技,而是人机交互范式的根本性变革——未来的操作系统,可能不再需要人类学习复杂的菜单和快捷键,而是直接用自然语言告诉AI"我要做什么"。

那才是真正的"读懂屏幕,理解意图,精准执行"。

Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐