用OSWorld第一的GUI Agent打麻将是什么体验?
用OSWorld第一的GUI Agent打麻将是什么体验?
关键词:GUI Agent、AI 麻将、纯视觉交互、端侧 Agent、VLA、Mano-P、开源 Agent、本地推理、Apple M4
引言:当 GUI Agent 走出办公场景
GUI Agent 领域最近一年进展迅速,从 Browser-Use、OpenCUA 到 Claude Computer Use,各路方案纷纷涌现。但几乎所有的 demo 和评测都集中在"办公自动化"这个场景:打开浏览器、填写表单、操作 SaaS 应用。
一个关键问题被忽略了:这些 Agent 的通用性到底如何? 换到非标准 UI、非结构化界面的场景,它们还能用吗?
明略科技开源的 Mano-P(GUI-VLA Agent for Edge Devices)给出了一个有趣的回答——用它来打麻将。
视频👇
用OSWorld第一的GUI Agent打麻将是什么体验?
一、Mano-P 是什么?
Mano-P 是明略科技开源的 GUI-VLA Agent,设计目标是在端侧设备上通过纯视觉理解和操作图形界面。
- Mano:西班牙语"手"的意思
- P:代表 Person + Party
- 许可证:Apache 2.0
- 仓库地址:https://github.com/Mininglamp-AI/Mano-P
与主流 GUI Agent 方案相比,Mano-P 有几个显著差异:
| 特性 | Mano-P | 基于 DOM/a11y 的方案 | 云端 VLM 方案 |
|---|---|---|---|
| 输入源 | 屏幕截图(纯视觉) | DOM Tree / Accessibility API | 屏幕截图 |
| 运行位置 | 本地端侧 | 本地 | 云端 API |
| 隐私保护 | 数据不出本机 | 数据不出本机 | 数据上传云端 |
| 应用范围 | 任意 GUI | 仅限有 DOM/a11y 的应用 | 任意 GUI |
| 硬件要求 | Apple M4 + 32GB | 较低 | 无(调 API) |
二、麻将场景:为什么是一个好的测试用例
GUI Agent 的能力边界在哪里?我们认为,游戏场景是一个很好的试金石。选择麻将作为测试场景,有以下几个原因:
2.1 高密度视觉信息
麻将界面上同时存在大量视觉元素:13 张手牌、桌面明牌、其他玩家的出牌区域、操作按钮(碰、杠、胡、过)等。这些元素在视觉上高度相似(都是麻将牌),且排列紧密,对模型的细粒度视觉理解能力提出了很高要求。
2.2 非标准 UI 布局
麻将游戏的界面不是标准的 Web/App UI。没有 HTML DOM,没有 accessibility tree,按钮和交互区域是游戏引擎渲染的图形元素。这排除了依赖 DOM 解析或 a11y API 的方案,只有纯视觉方案能工作。
2.3 需要推理的决策过程
出牌不是简单的"看到按钮点按钮"。Agent 需要:
- 理解当前手牌组合
- 评估听牌可能性
- 判断其他玩家的出牌模式
- 权衡进攻(做大牌)和防守(避免放炮)
这需要视觉理解和策略推理的深度结合。
2.4 异步交互流程
麻将是多人回合制游戏,Agent 需要等待其他玩家操作,处理不同时长的等待,识别"轮到我了"的界面变化,然后做出响应。这比点击一个网页按钮后等待页面加载要复杂得多。
三、技术原理:Mano-P 如何"看屏幕打牌"
3.1 纯视觉驱动架构
Mano-P 的核心是 Vision-Language-Action(VLA)架构。整个推理流程为:
屏幕截图 → 视觉编码 → 多模态理解 → 动作生成 → 执行操作
模型输入是原始屏幕像素,输出是具体的操作指令(点击坐标、滑动方向等)。全程不依赖 DOM、OCR 或任何结构化输入。
3.2 think-act-verify 循环推理
Mano-P 的推理过程不是一次性的"看→做",而是一个循环:
- Think(思考):分析当前屏幕截图,理解界面状态和上下文。在麻将场景中,这意味着识别手牌、桌面牌况、可用操作按钮
- Act(行动):基于分析结果,决定执行什么操作(点击哪张牌、是否碰杠)
- Verify(验证):操作执行后,再次截图,确认操作是否生效、界面是否发生预期变化
如果验证失败(例如点击没生效、界面没变化),Mano-P 会重新进入 Think 阶段,分析新的屏幕状态并调整策略。这种闭环推理机制对于游戏中各种异常情况(等待对手、网络延迟、动画过渡)至关重要。
3.3 三阶段训练管线
Mano-P 的训练分为三个阶段:
| 阶段 | 方法 | 目标 |
|---|---|---|
| Stage 1 | SFT(监督微调) | 学习基本的 GUI 识别和操作能力 |
| Stage 2 | Offline RL(离线强化学习) | 优化操作策略,减少无效动作 |
| Stage 3 | Online RL(在线强化学习) | 在真实环境中交互学习,提升鲁棒性 |
这套训练方法的核心思路是逐步从"模仿人类操作"过渡到"自主探索最优策略",和 DeepSeek 等模型在推理能力上的训练思路有相似之处。
四、性能数据
4.1 Benchmark 评测
Mano-P 在主流 GUI Agent 评测中表现突出:
OSWorld(桌面应用操作评测):
| 模型 | 得分 |
|---|---|
| Mano-P 72B | 58.2%(专项模型第一) |
| opencua-72b | 45.0% |
WebRetriever Protocol I(Web 交互评测):
| 模型 | 得分 |
|---|---|
| Mano-P | 41.7 |
| Gemini 2.5 Pro | 40.9 |
| Claude 4.5 | 31.3 |
4.2 端侧推理性能
4B 量化版本(w4a16)在 Apple M4 + 32GB RAM 上的实测数据:
| 指标 | 数值 |
|---|---|
| Prefill 速度 | 476 tok/s |
| Decode 速度 | 76 tok/s |
| 峰值内存 | 4.3 GB |
这个性能意味着在本地设备上可以实现实时的 GUI 交互,无需云端 API 调用。
注意:目前端侧推理需要 Apple M4 芯片 + 32GB RAM 的硬件配置。
五、从打麻将看 GUI Agent 的通用性
麻将场景验证了一个重要的技术论点:纯视觉驱动的 GUI Agent 具备场景通用性。
传统的 RPA(Robotic Process Automation)方案依赖预定义的 UI 元素定位规则,换一个应用就需要重新配置。基于 DOM/a11y 的方案虽然更灵活,但受限于有结构化接口的应用。
而 Mano-P 的纯视觉方案意味着:
- ✅ 能操作没有 API 的遗留系统
- ✅ 能操作游戏、桌面应用等非 Web 场景
- ✅ 能处理动态渲染、Canvas 绑定的复杂界面
- ✅ 数据不出本机,满足隐私合规要求
从办公自动化到休闲娱乐,从结构化数据处理到非结构化的游戏交互——这验证了"AI for Personal"的技术可行性。
六、开源路线图
Mano-P 采用 Apache 2.0 许可证,三阶段开源:
| 阶段 | 内容 | 状态 |
|---|---|---|
| Phase 1 | Skill(基础能力) | ✅ 已开源 |
| Phase 2 | 本地模型 + SDK | 即将发布 |
| Phase 3 | 训练方法 | 计划中 |
七、总结
让 AI 打麻将,表面上是一个有趣的实验,本质上回答了 GUI Agent 领域的一个核心问题:纯视觉驱动的 Agent 能否真正做到场景无关?
Mano-P 通过麻将场景证明了:
- 纯视觉方案可以处理高密度、非标准的界面
- think-act-verify 循环推理可以应对异步交互场景
- 4B 量化模型在端侧设备上具备实时交互能力
- 同一套技术架构可以从办公自动化泛化到游戏交互
如果你对 GUI Agent 技术感兴趣,欢迎查看项目仓库和文档:
👉 GitHub: Mininglamp-AI/Mano-P
更多推荐



所有评论(0)