用OSWorld第一的GUI Agent打麻将是什么体验?

关键词:GUI Agent、AI 麻将、纯视觉交互、端侧 Agent、VLA、Mano-P、开源 Agent、本地推理、Apple M4

引言:当 GUI Agent 走出办公场景

GUI Agent 领域最近一年进展迅速,从 Browser-Use、OpenCUA 到 Claude Computer Use,各路方案纷纷涌现。但几乎所有的 demo 和评测都集中在"办公自动化"这个场景:打开浏览器、填写表单、操作 SaaS 应用。

一个关键问题被忽略了:这些 Agent 的通用性到底如何? 换到非标准 UI、非结构化界面的场景,它们还能用吗?

明略科技开源的 Mano-P(GUI-VLA Agent for Edge Devices)给出了一个有趣的回答——用它来打麻将。

视频👇

用OSWorld第一的GUI Agent打麻将是什么体验?

一、Mano-P 是什么?

Mano-P 是明略科技开源的 GUI-VLA Agent,设计目标是在端侧设备上通过纯视觉理解和操作图形界面。

  • Mano:西班牙语"手"的意思
  • P:代表 Person + Party
  • 许可证:Apache 2.0
  • 仓库地址:https://github.com/Mininglamp-AI/Mano-P

与主流 GUI Agent 方案相比,Mano-P 有几个显著差异:

特性 Mano-P 基于 DOM/a11y 的方案 云端 VLM 方案
输入源 屏幕截图(纯视觉) DOM Tree / Accessibility API 屏幕截图
运行位置 本地端侧 本地 云端 API
隐私保护 数据不出本机 数据不出本机 数据上传云端
应用范围 任意 GUI 仅限有 DOM/a11y 的应用 任意 GUI
硬件要求 Apple M4 + 32GB 较低 无(调 API)

二、麻将场景:为什么是一个好的测试用例

GUI Agent 的能力边界在哪里?我们认为,游戏场景是一个很好的试金石。选择麻将作为测试场景,有以下几个原因:

2.1 高密度视觉信息

麻将界面上同时存在大量视觉元素:13 张手牌、桌面明牌、其他玩家的出牌区域、操作按钮(碰、杠、胡、过)等。这些元素在视觉上高度相似(都是麻将牌),且排列紧密,对模型的细粒度视觉理解能力提出了很高要求。

2.2 非标准 UI 布局

麻将游戏的界面不是标准的 Web/App UI。没有 HTML DOM,没有 accessibility tree,按钮和交互区域是游戏引擎渲染的图形元素。这排除了依赖 DOM 解析或 a11y API 的方案,只有纯视觉方案能工作。

2.3 需要推理的决策过程

出牌不是简单的"看到按钮点按钮"。Agent 需要:

  • 理解当前手牌组合
  • 评估听牌可能性
  • 判断其他玩家的出牌模式
  • 权衡进攻(做大牌)和防守(避免放炮)

这需要视觉理解和策略推理的深度结合。

2.4 异步交互流程

麻将是多人回合制游戏,Agent 需要等待其他玩家操作,处理不同时长的等待,识别"轮到我了"的界面变化,然后做出响应。这比点击一个网页按钮后等待页面加载要复杂得多。

三、技术原理:Mano-P 如何"看屏幕打牌"

3.1 纯视觉驱动架构

Mano-P 的核心是 Vision-Language-Action(VLA)架构。整个推理流程为:

屏幕截图 → 视觉编码 → 多模态理解 → 动作生成 → 执行操作

模型输入是原始屏幕像素,输出是具体的操作指令(点击坐标、滑动方向等)。全程不依赖 DOM、OCR 或任何结构化输入。

3.2 think-act-verify 循环推理

Mano-P 的推理过程不是一次性的"看→做",而是一个循环:

  1. Think(思考):分析当前屏幕截图,理解界面状态和上下文。在麻将场景中,这意味着识别手牌、桌面牌况、可用操作按钮
  2. Act(行动):基于分析结果,决定执行什么操作(点击哪张牌、是否碰杠)
  3. Verify(验证):操作执行后,再次截图,确认操作是否生效、界面是否发生预期变化

如果验证失败(例如点击没生效、界面没变化),Mano-P 会重新进入 Think 阶段,分析新的屏幕状态并调整策略。这种闭环推理机制对于游戏中各种异常情况(等待对手、网络延迟、动画过渡)至关重要。

3.3 三阶段训练管线

Mano-P 的训练分为三个阶段:

阶段 方法 目标
Stage 1 SFT(监督微调) 学习基本的 GUI 识别和操作能力
Stage 2 Offline RL(离线强化学习) 优化操作策略,减少无效动作
Stage 3 Online RL(在线强化学习) 在真实环境中交互学习,提升鲁棒性

这套训练方法的核心思路是逐步从"模仿人类操作"过渡到"自主探索最优策略",和 DeepSeek 等模型在推理能力上的训练思路有相似之处。

四、性能数据

4.1 Benchmark 评测

Mano-P 在主流 GUI Agent 评测中表现突出:

OSWorld(桌面应用操作评测)

模型 得分
Mano-P 72B 58.2%(专项模型第一)
opencua-72b 45.0%

WebRetriever Protocol I(Web 交互评测)

模型 得分
Mano-P 41.7
Gemini 2.5 Pro 40.9
Claude 4.5 31.3

4.2 端侧推理性能

4B 量化版本(w4a16)在 Apple M4 + 32GB RAM 上的实测数据:

指标 数值
Prefill 速度 476 tok/s
Decode 速度 76 tok/s
峰值内存 4.3 GB

这个性能意味着在本地设备上可以实现实时的 GUI 交互,无需云端 API 调用。

注意:目前端侧推理需要 Apple M4 芯片 + 32GB RAM 的硬件配置。

五、从打麻将看 GUI Agent 的通用性

麻将场景验证了一个重要的技术论点:纯视觉驱动的 GUI Agent 具备场景通用性。

传统的 RPA(Robotic Process Automation)方案依赖预定义的 UI 元素定位规则,换一个应用就需要重新配置。基于 DOM/a11y 的方案虽然更灵活,但受限于有结构化接口的应用。

而 Mano-P 的纯视觉方案意味着:

  • ✅ 能操作没有 API 的遗留系统
  • ✅ 能操作游戏、桌面应用等非 Web 场景
  • ✅ 能处理动态渲染、Canvas 绑定的复杂界面
  • ✅ 数据不出本机,满足隐私合规要求

从办公自动化到休闲娱乐,从结构化数据处理到非结构化的游戏交互——这验证了"AI for Personal"的技术可行性。

六、开源路线图

Mano-P 采用 Apache 2.0 许可证,三阶段开源:

阶段 内容 状态
Phase 1 Skill(基础能力) ✅ 已开源
Phase 2 本地模型 + SDK 即将发布
Phase 3 训练方法 计划中

七、总结

让 AI 打麻将,表面上是一个有趣的实验,本质上回答了 GUI Agent 领域的一个核心问题:纯视觉驱动的 Agent 能否真正做到场景无关?

Mano-P 通过麻将场景证明了:

  1. 纯视觉方案可以处理高密度、非标准的界面
  2. think-act-verify 循环推理可以应对异步交互场景
  3. 4B 量化模型在端侧设备上具备实时交互能力
  4. 同一套技术架构可以从办公自动化泛化到游戏交互

如果你对 GUI Agent 技术感兴趣,欢迎查看项目仓库和文档:

👉 GitHub: Mininglamp-AI/Mano-P

更多推荐