论文1: MMSkills (2605.13527) — 多模态技能包 + 分支加载

核心定位

首个将"可复用技能"形式化为多模态程序性知识的框架。针对视觉Agent: 不仅要知道做什么操作,还要识别相关视觉状态、解读进展/失败的视觉证据。

三大挑战 & MMSkills解法

挑战 MMSkills解法
Representation: 多模态技能包应包含什么? Textual Procedure + Runtime State Cards + Multi-View Keyframes
Generation: 从哪里生成?(不用人工标注) Agentic trajectory-to-skill Generator (5阶段pipeline)
Utilization: 如何使用?(避免context爆炸) Branch Loading: 临时分支检查 → 蒸馏 → 注入主线

技能包结构

MMSkills Example

Figure 1: 一个MMSkill实例。同一chart-creation任务中,纯文本指导无法识别active sheet状态;branch-loaded MMSkills将技能证据与实时屏幕对齐,返回状态感知的指导。

每个MMSkill = (Descriptor, Procedure, State Cards, Keyframes):

M = (D, P, S, K)

D: 紧凑描述符
P: 可复用文本过程
S = {S_j}: 运行时状态卡片
  - when_to_use / when_not_to_use
  - visible_cues / verification_cue
  - available_views
K = {K_j}: 多视图关键帧
  - full_frame (全局上下文)
  - focus_crop (局部视觉线索)
  - before/after (状态转移)

技能生成Pipeline

MMSkills Framework

Figure 2: MMSkills框架总览。左边: 技能包结构。中间: Generator将公开轨迹转换为技能库。右边: Branch-loaded agent在临时分支中检查技能证据后返回结构化指导。

公开轨迹池 → Phase0(嵌入+聚类) → Phase1(簇级技能规划)
           → Phase2(合并去重) → Phase3(文本初稿)
           → Phase4(图像接地+审计) → 多模态技能库

关键: 从非测试数据的公开轨迹中自动生成,靠meta-skill指导质量审计。

Branch Loading (分支加载)

传统做法: 直接将技能注入main context → 图像+状态卡造成context压力,且可能让agent锚定在参考截图而非实时环境。

MMSkills的做法:

  1. Gated View Selection: 根据实时观察选择相关状态卡和视图
  2. Branch Planning: 在临时分支中对齐证据与实时状态
  3. 返回结构化指导: (applicable, subgoal, plan, do_not_do, verify)
  4. 主线agent用指导做决策,执行动作仍基于实时截图

实验设计

Benchmarks: OSWorld, macOSWorld, VAB-Minecraft, Super Mario Bros
Model: Gemini 3.1 Pro, Gemini 3 Flash, Qwen3-VL-235B, GLM-5V, Kimi-K2.6, Qwen3-VL-8B
条件: No skill / Text-only / MMSkills

OSWorld核心结果 (Table 1):

Model No skill Text-only MMSkills
Gemini 3.1 Pro 44.08% 40.76% 50.11%
Gemini 3 Flash 36.65% 40.27% 47.97%
Qwen3-VL-235B 21.34% 28.57% 39.17%
Qwen3-VL-8B 10.78% 14.93% 25.40%

关键发现: text-only有时不如no-skill (Gemini 3.1 Pro从44%降到40%),但MMSkills一致优于两者。

消融实验

MMSkills Ablation

Figure 3: 消融结果。(A) 去掉State Cards或Keyframes均降性能;(B) Branch loading > Direct loading, 加上view selection最优。

消融 结论
去掉State Cards 性能降 → 状态区分能力关键
去掉Images 性能降 → 视觉证据必不可少
Direct load vs Branch load Branch显著优于直接注入
无View Selection 性能降 → 过滤无关视图关键

行为变化分析

MMSkills Behavioral Shift

Figure 4: OSWorld行为变化。(A) 动作分布: MMSkills让click-heavy agent转为更多结构化输入;(B) 减少每个任务的低层操作数;© 大幅减少重复行为(21.8%→6.2%)。

  • 减少探索性试错: click share 75.8% → 63.7%,keyboard/DONE增加
  • 减少重复动作: exact repeated actions 21.8% → 6.2%
  • 提升完成判断: DONE行为增加
  • 缩短轨迹: Qwen3-VL-235B步数从15.22 → 9.87

论文2: Visual Skills (2606.01414) — 技能应超越文本

核心论点

“Reusable agent skills should go beyond text and become multimodal assets for future multimodal agents.”

三个可复用视觉形式:

  1. Static Priors: 稳定空间约定 (布局模式、标准界面结构)
  2. Dynamic Priors: 即时视觉工作记忆 (当前任务的状态快照)
  3. Interleaved Visual Skills: 将有序文本步骤绑定到源帧/截图/页面区域

三个"不仅…还…":

  • 不仅描述做什么,还编码看哪里、怎么检查、如何验证视觉结果
  • Text-only skills在需要空间对应、视觉证据、状态感知交互的任务上有瓶颈
  • Visual skills通过保留空间参考、视觉边界和交互模式来超越

自动生成系统

自动将agent经验转换为可复用多模态技能:

  • 保留文本推理
  • 保留空间参考
  • 保留视觉边界
  • 保留交互模式
Logo

小龙虾开发者社区是 CSDN 旗下专注 OpenClaw 生态的官方阵地,聚焦技能开发、插件实践与部署教程,为开发者提供可直接落地的方案、工具与交流平台,助力高效构建与落地 AI 应用

更多推荐