GUI Agent:AI如何“看图操作“
当马斯克的xAI团队在内部测试中让Grok尝试操作《英雄联盟》时,整个技术社区都在关注一个问题:大模型到底如何从"看懂像素"跨越到"精准点击"?
这不是简单的"AI打游戏"噱头,而是2025年以来最火热的技术赛道之一——GUI Agent(图形界面智能体)。从OpenAI的Operator到Anthropic的Computer Use,从Google的Project Mariner到各类开源项目,硅谷正在经历一场"让AI像人类一样操作电脑"的军备竞赛。
本文将剥离所有营销话术,从底层技术原理出发,深度拆解VLM(Vision Language Model)的Action Space设计、视觉语义映射机制,以及当前工业界与开源社区的真实进展。
一、技术背景:从"看图说话"到"看图操作"
传统VLM的能力边界长期停留在**Visual Question Answering(视觉问答)**阶段——模型能告诉你屏幕上有个"开始游戏"按钮,但无法伸出"手"去点击它。
这个能力鸿沟的核心在于Action Space(动作空间)的设计。在标准VLM架构中,输出被限制为自然语言Token;而GUI Agent要求模型输出可执行的结构化动作指令。
这个闭环架构的核心挑战在于:如何定义动作的粒度与表示方式?
二、Action Space的三种主流范式
当前业界对VLM Action Space的设计主要分为三大流派,各有优劣:
2.1 方案对比总览
| 维度 | 纯像素坐标 | DOM/Accessibility Tree | 混合语义空间 |
|---|---|---|---|
| 代表项目 | SeeClick, OS-Atlas | Operator(疑似), Omniverse | Claude Computer Use |
| 输入模态 | 纯截图 | 截图 + DOM树 | 截图 + 结构化元数据 |
| 动作表示 | (x, y) 坐标对 |
元素ID / XPath | 自然语言 + BBOX |
| 精度上限 | 受限于分辨率 | 依赖DOM完整性 | 较高 |
| 游戏兼容性 | ✅ 优秀 | ❌ 差(无DOM) | ⚠️ 中等 |
| 跨泛化能力 | ⚠️ 中等 | ✅ 优秀 | ✅ 优秀 |
| 计算开销 | 低 | 中(需解析DOM) | 高 |
2.2 深度拆解:纯像素坐标流派
以SeeClick(来自清华大学和微软亚研院)为代表的技术路线,直接让VLM预测屏幕上的像素坐标。
核心原理:
模型接收截图输入后,输出格式为:
{
"action_type": "click",
"coordinate": [0.523, 0.671],
"confidence": 0.94
}
其中坐标被归一化到 [0, 1] 区间,避免分辨率敏感问题。
技术难点——坐标精度损失:
这是纯像素流派最大的痛点。假设屏幕分辨率为 1920×1080,VLM输出的坐标误差哪怕只有 0.01,在实际像素层面就是 ±19像素 的偏移——这对于需要精准点击小目标的游戏场景是致命的。
清华大学在论文《SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents》中引入了CoT(Chain of Thought)推理增强:
实验数据显示,引入CoT后,SeeClick在1366×768分辨率下的点击准确率从67.3%提升至82.1%。
三、视觉语义映射:AI如何"理解"屏幕
3.1 Accessibility Tree:被低估的黄金数据源
大多数开发者熟悉的DOM Tree并不适合作为GUI Agent的唯一依据——它包含大量与交互无关的样式信息,且在游戏场景中完全失效。
**Accessibility Tree(无障碍树)**是更优的选择:
- 体积精简:通常只有DOM的1/10大小
- 语义纯净:仅保留可交互元素及其属性
- 标准化:遵循WAI-ARIA规范
以下是一个典型Accessibility Node的简化结构:
{
"nodeId": "btn-submit-42",
"role": "button",
"name": "Submit Form",
"bounds": {"x": 120, "y": 340, "width": 80, "height": 32},
"actionable": true,
"state": {"focused": false, "disabled": false}
}
3.2 混合架构:Microsoft OmniParser的方法论
Microsoft在2024年发布的OmniParser采用了视觉检测与语义理解分离的架构:
这种架构的优势在于解耦:检测层专注于"哪里有东西",语义层专注于"这是什么",最终由下游的VLM完成决策。
四、Headless Browser与执行引擎
当VLM做出决策后,如何将动作可靠地注入目标系统?这涉及执行引擎层的设计。
4.1 Playwright/Puppeteer方案
对于Web场景,Headless Browser是首选:
| 特性 | Playwright | Puppeteer | Selenium |
|---|---|---|---|
| 多浏览器支持 | ✅ Chromium/FF/WebKit | ⚠️ 仅Chromium | ✅ 全平台 |
| 自动等待机制 | ✅ 智能等待 | ⚠️ 需手动 | ❌ 需显式sleep |
| 网络拦截 | ✅ 原生支持 | ✅ 原生支持 | ⚠️ 有限 |
| AI Agent适配性 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐ |
4.2 游戏场景的特殊挑战
游戏没有DOM,无法使用常规的元素定位器。当前主流方案包括:
- 纯视觉流:持续截屏 → VLM决策 → 模拟鼠标/键盘输入
- 内存读取:通过Hook获取游戏内部状态(存在法律与反作弊风险)
- API接入:部分游戏提供官方API(如League of Legends的Client API)
以Riot Games为例,其LCU(League Client UI)实际上是一个Chromium应用,可以通过本地WebSocket连接获取实时数据:
wss://127.0.0.1:{port}/
这为AI Agent提供了一个"半结构化"的切入点——既不需要纯视觉猜测,也不涉及非法内存操作。
五、开源生态与可复现资源
以下是目前GUI Agent领域值得关注的开源项目与学术资源:
5.1 核心开源项目
| 项目名称 | 组织/团队 | GitHub | 技术特点 |
|---|---|---|---|
| SeeClick | 清华/微软 | github.com/njucckevin/SeeClick |
纯像素点击,CoT增强 |
| OS-Atlas | OpenGVLab | github.com/OpenGVLab/OS-Atlas |
多平台GUI grounding |
| OmniParser | Microsoft | github.com/microsoft/OmniParser |
检测+语义分离架构 |
| Agent-S | Simular | github.com/simular-ai/Agent-S |
完整GUI Agent框架 |
| OpenAI Operator | OpenAI | 非开源(API) | SOTA商业方案 |
5.2 关键学术论文
-
“SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents” (EMNLP 2024)
- 清华大学 & 微软亚研院
- 首次系统化解决VLM点击精度问题
-
“OS-Atlas: A Foundation Action Model for GUI Agents” (arXiv 2024)
- 上海AI Lab
- 跨平台GUI预训练方法
-
“On the Path to Universal Computer Control: The OSWorld Benchmark” (NeurIPS 2024)
- 定义了GUI Agent的标准化评测框架
5.3 数据集资源
- ScreenSpot:包含超过6000个GUI grounding标注
- GUIAct:Android/Web/Windows跨平台动作数据集
- Mind2Web:包含2000+真实网站的操作轨迹
六、技术展望:从"能操作"到"会操作"
当前VLM Action Space的研究仍处于早期阶段,几个关键瓶颈亟待突破:
关于"AI战胜Faker"这个命题,从技术角度而言,目前还处于"能操作游戏"而非"理解游戏策略"的阶段。真正能在MOBA类游戏中达到职业水准,需要的是:
- 实时视觉感知(60FPS+)
- 博弈论级别的策略推理
- 毫秒级反应速度
- 团队协作理解
这些能力远超当前VLM的范畴,更像是RL(强化学习)+ VLM的融合方向。
七、总结与行动建议
对于希望深入研究GUI Agent的开发者,建议的技术路径如下:
- 入门:从Playwright入手,理解浏览器自动化基础
- 进阶:部署SeeClick或OS-Atlas,在自己的应用上测试grounding效果
- 深入:研究OmniParser的检测-语义分离架构,尝试自定义场景
- 实践:参与Agent-S等开源项目,贡献代码或数据
核心资源链接:
- SeeClick: https://github.com/njucckevin/SeeClick
- OS-Atlas: https://github.com/OpenGVLab/OS-Atlas
- OmniParser: https://github.com/microsoft/OmniParser
- Agent-S: https://github.com/simular-ai/Agent-S
- OSWorld Benchmark: https://github.com/xlang-ai/OSWorld
- Playwright: https://github.com/microsoft/playwright
GUI Agent是2024-2025年最值得关注的AI应用方向之一。它不只是"让AI玩游戏"的炫技,而是人机交互范式的根本性变革——未来的操作系统,可能不再需要人类学习复杂的菜单和快捷键,而是直接用自然语言告诉AI"我要做什么"。
那才是真正的"读懂屏幕,理解意图,精准执行"。
更多推荐



所有评论(0)