具身智能之OneTwoVLA详解:如何统一推理与行动
写在前面
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09
导读
具身任务同时需要两种节奏:低层控制要快速、连续地生成动作,长程任务又要求机器人理解场景、规划步骤、发现失败并回应人类。常见双系统方案把两者交给不同模型:VLM 负责慢速推理,VLA 负责快速执行。两个模型彼此不了解能力边界,高层可能给出低层无法执行的指令;云端 VLM 的延迟还会让指导落后于现场状态。
OneTwoVLA 把 System One 与 System Two 放进同一个模型。它先预测一个决策 token:[BOA] 表示直接生成动作,[BOR] 表示更新自然语言推理。大部分时间走 acting mode,只在子任务完成、动作失败或需要人类输入等关键节点进入 reasoning mode。最新推理内容会继续作为后续动作的条件。
训练侧同样分成两部分:机器人轨迹被切成 reasoning interval 与 acting interval,并补上场景描述、整体计划、历史摘要和下一步动作;另一条自动化管线用 Gemini 2.5 Pro、FLUX.1-dev 合成 1.6 万条带具身推理的视觉语言数据,与机器人数据共同训练。实验覆盖长程任务、错误恢复、人机交互和开放世界视觉指代。
猫先生认为,OneTwoVLA 的技术重点不是让 VLA 输出更多思维文本,而是让推理发生的时机也成为策略要学习的决策。统一模型减少了高低层之间的接口错位,但
[BOR]何时出现仍依赖人工设计的训练区间,这也是它离真正自主分配计算量还差的一步。
- 论文标题:OneTwoVLA: A Unified Vision-Language-Action Model with Adaptive Reasoning
- OpenReview:https://openreview.net/forum?id=tWMfhoP3as
- arXiv:https://arxiv.org/abs/2505.11917
- 项目主页:https://one-two-vla.github.io/
- GitHub:https://github.com/Fanqi-Lin/OneTwoVLA
- 数据集:https://huggingface.co/datasets/Richard-Nai/onetwovla-dataset

图 1:原论文 Figure 1。OneTwoVLA 在长程执行中多次生成动作,只在场景变化、子任务边界等节点更新场景描述、计划、历史摘要和下一步指令。
原文脉络
第 1 节从双系统的协同与延迟问题出发,第 2 节将工作放在 VLA、机器人推理和视觉语言共同训练三条研究线上。第 3 节依次介绍统一框架、带具身推理的机器人数据整理,以及可扩展的视觉语言数据合成管线。第 4 节沿四种能力展开真实机器人实验:长程规划、错误检测与恢复、人机交互、视觉指代。第 5 节总结方法,并把人工推理区间、推理暂停和规模化推理效率列为主要限制。
1-2. 背景与相关工作:双系统的接口为何会失配
平坦式 VLA 可以根据图像和指令直接生成动作,但缺少显式任务状态,容易在长程执行里重复步骤或忘记进度。双系统方案用 VLM 生成子任务,再让动作模型执行,显式规划能力更强,却引入了两个独立模型之间的语义接口。
接口失配包含两类问题。其一,高层模型不知道动作策略的训练分布,可能要求不存在的物体或低层没学过的技能。其二,高层推理存在时延;等新指令返回时,机械臂可能已经进入不同状态,旧计划因此变成分布外输入。固定频率调用 VLM 还会在无需重新规划的动作阶段浪费时间。
π₀.₅ 等统一模型会在动作前预测子任务,ECoT-Lite 则尝试在测试时省去推理。OneTwoVLA 选择保留显式语言推理,同时让同一模型判断何时更新它,从模型边界和计算频率两侧处理失配。
3. 方法与核心架构:同一个模型学会 [BOR] 与 [BOA]
3.1 统一策略:先决定模式,再生成推理或动作
每个时间步的输入包括当前多相机图像、最近一次推理时刻的参考图像、任务指令和最新推理内容。acting mode 还会接收机器人本体状态。模型先预测决策 token:
[BOR](Beginning of Reasoning):自回归生成新的推理文本,直到[EOS],同时把当前图像保存为新的参考图像;[BOA](Beginning of Action):调用 action expert 生成一个 action chunk,并在环境中执行。
推理文本包含场景描述、计划、已完成步骤和眼前该做的动作。参考图像与这段文字属于同一时刻,可以缓解旧描述与当前画面不一致的问题。任务结束由推理内容中的 Task Finished 表示。

图 2:原论文 Figure 3。VLM 分支同时负责模式决策和文字推理;选择 [BOA] 后,action expert 根据图像、状态和最近推理生成连续动作块。
具体实例以 π₀ 为基础。VLM 用交叉熵学习决策 token 与推理文本,action expert 延续 π₀ 的 flow matching 损失来建模连续动作分布。两种输出共享视觉语言主干,因此推理内容与动作模型不再通过外部 API 拼接。
猫先生认为,
[BOR]/[BOA]把“是否值得重新思考”转成了一个轻量分类问题,而昂贵的文本生成只在[BOR]后发生。这个接口很简洁,但动作仍会忠实服从错误推理;统一性提高了推理对动作的约束力,也放大了错误推理的后果。
3.2 自适应推理如何获得监督
普通机器人数据只有 observation-action 对,没有“应该何时思考”的标签。作者先把专家轨迹切成两类区间:
- Reasoning interval 位于任务开始、子任务完成、失败恢复或人机交互附近。旧推理失效时监督
[BOR]和新推理;推理更新后再监督[BOA]与动作。 - Acting interval 覆盖连续执行阶段,主要监督
[BOA]和动作。由于 acting 区间远多于 reasoning 区间,训练中还可补充部分“旧推理应触发[BOR]”的样本,缓解二分类不平衡。
推理内容固定为四部分:与任务相关的场景描述、分解后的高层计划、记录已完成步骤的历史摘要、当前的下一步指令。错误恢复数据额外说明失败状态与纠正策略;交互数据把机器人的提问和人的回答追加到指令上下文。
标注管线分两阶段运行。Gemini 2.5 从每条轨迹均匀抽取的 32 帧中识别子任务边界,再以区间中点图像生成四类推理字段。Tomato-Egg 任务的人工抽查中,81.5% 的区间标注被判为正确,83.3% 的场景描述被判为合理。自动标注降低了成本,但仍保留约两成可见噪声。
3.3 合成 1.6 万条具身视觉语言数据
机器人示范可以教会模型执行已有任务,却很难覆盖开放世界物体和新指令。合成管线先让 Gemini 2.5 Pro生成多样的桌面场景描述,再由 FLUX.1-dev 生成图像;图像随机加入鱼眼畸变、机械夹爪合成和亮度适配,缩小与腕部相机画面的外观差异。Gemini 最后为每张图生成任务指令与推理答案。

图 3:原论文 Figure 15。每行依次为原始合成图、另一合成视角、加入鱼眼畸变与夹爪后的图像,以及二者共同使用的版本。
1.6 万条样本分为两类。视觉指代要求从空间关系、属性或语义描述中定位对象,并在推理里明确对象名称与位置;长程规划给出多步目标,要求生成逐步计划,部分样本还加入人机交互。OneTwoVLA-VL 将这些数据与原子技能机器人数据共同训练,用视觉语言监督激活预训练主干中的常识与开放词汇能力。
这条数据路线并不教连续控制,合成图也没有真实动力学。它提供的是“看懂场景—明确目标—形成计划”的监督,动作落地仍依赖真实机器人示范。
3.4 推理时延是否破坏闭环控制

图 4:原论文 Figure 2。OneTwoVLA 的 Tomato-Egg 总时长为 184 秒,接近无语言推理的 π₀(176 秒),明显短于固定调用 Gemini 的双系统(260 秒)。
acting mode 在 RTX 4090 上约需 0.102—0.104 秒,低于 0.2 秒的动作生成周期。reasoning mode 会随文本变长:20、100、200 个输出 token 分别约需 0.853、2.346、4.361 秒。Tomato-Egg 的一个 rollout 中,模型推理 5 次、合计 16 秒,占总时长 8.7%;Mountain Fuji 的推理占比约 10.4%。自适应触发降低了总开销,但每次长推理仍会让机器人原地暂停数秒。
4. 实验结果:推理、恢复、交互与开放世界泛化
4.1 长程任务规划
三项真实任务覆盖不同难点:Tomato-Egg 包含舀取等接触密集动作,Hotpot 要根据随机食材位置完成多步涮煮,Cocktail 要从近十种相似原料中调制三种饮品。每种方法在每项任务上测试 20 次。

图 5:原论文 Figure 6 左。OneTwoVLA 在 Tomato-Egg、Hotpot、Cocktail 上分别达到 85%、80%、95%,平均 87%。
OneTwoVLA 平均成功率为 87%,高于 π₀ 的 57% 和双系统的 63%。平坦式 π₀ 会丢失任务进度或重复步骤;双系统的 Gemini 2.5 Pro 有时提出动作策略没学过的原子命令,延迟也会使低层进入分布外状态。
泛化规划使用从未出现在机器人数据中的指令,包括打开冰箱找冰可乐、移开水果后取空盘、用杆子把远处物体扫近,以及根据“帮我保持清醒”准备咖啡。仅用机器人数据的 OneTwoVLA 平均成功率为 10%,π₀ 为 6%;加入合成 VL 数据后,OneTwoVLA-VL 达到 70%。

图 6:原论文 Figure 6 右。VL 共同训练在四项未见任务上带来 60 个百分点的平均提升,证据集中指向合成推理数据的作用。
4.2 错误检测与恢复
Hotpot 中的主要错误是夹爪与滤网错位,Tomato-Egg 中则包括倒油时瓶子滑落。作者分别收集恢复示范,让模型看到失败状态、纠正推理与后续动作。
| 方法 | Hotpot | Tomato-Egg | 总计 |
|---|---|---|---|
| OneTwoVLA | 5/6 | 3/4 | 8/10(80.0%) |
| π₀ | 3/7 | 5/7 | 8/14(57.1%) |
| Dual-System | 4/5 | 3/7 | 7/12(58.3%) |
OneTwoVLA 能在抓取失败后后退、重新对齐并重试。双系统的失败常来自响应过晚:高层发现瓶子未抓住时,机械臂已经到达倾倒姿态。样本量只有 10—14 次错误事件,80% 的结果说明机制可行,还不足以给出稳定的恢复率估计。
4.3 自然人机交互
OneTwoVLA 可以在歧义指令下提问,也能在执行中接受修改。例如人类临时要求改用柠檬伏特加,模型先更新计划,再放下原瓶并继续后续调制。Hotpot 与 Cocktail 共 20 次子任务级交互中,OneTwoVLA 完成 20/20,双系统完成 13/20。
加入 VL 数据后,20 种训练中未出现的交互场景成功率为 72.5%。未共同训练的 OneTwoVLA 难以理解这些新表达,说明统一架构解决了交互接口,语言覆盖面仍主要来自视觉语言数据。
4.4 视觉指代与开放世界目标定位

图 7:原论文 Figure 7。指令不直接给出对象名称,而是通过用途、属性或空间关系描述目标,模型需要先在推理中明确对象,再生成动作。
Single-Env 在同一环境、四个物体上测试空间、属性和语义指令;Open-World 使用 16 个环境、933 条有效示范和约 180 个物体训练,再到 8 个未见环境评测。测试对象还细分为机器人数据见过、仅合成 VL 数据见过、两类数据都没见过。
| 方法 | Single-Env | Open-World |
|---|---|---|
| π₀ | 5% | 3% |
| OneTwoVLA | 78% | 8% |
| OneTwoVLA-VL | 88% | 73% |
显式推理把 Single-Env 从 5% 提升到 78%,合成数据再把 Open-World 从 8% 提升到 73%。OneTwoVLA-VL 还能处理 Sprite、GoPro 等两类训练数据都未出现的物体。论文把它解释为合成 VL 数据重新激活了预训练 VLM 的 Web 知识;由于缺少更细的对象分组成功率,这项解释仍带有推断性质。
猫先生认为,最强的实验证据来自两组对照:统一推理将长程任务从 57% 提到 87%,VL 共同训练将开放世界指代从 8% 提到 73%。前者说明显式任务状态有价值,后者说明开放世界语义主要来自数据覆盖。两种收益不能全部归因于“自适应推理”这一个因素。
5. 局限与可复现性
[BOR] 的训练标签来自人工设定的候选节点与 Gemini 标注,模型学到的是监督数据中的推理时机。作者明确提出,未来需要用强化学习优化“什么时候想、想多久、想什么”,而非继续依赖启发式区间。
推理仍会造成 2—3 秒暂停,长文本甚至超过 4 秒。静态桌面操作可以容忍,动态环境和人机共域任务可能在暂停期间发生状态变化;异步推理与动作生成是更现实的后续方向。
失败案例还包括夹持不牢、倒液体洒出、食材位置识别错误,以及面对机器人数据和合成数据都未覆盖的玩具时持续指向错误对象。推理与动作高度一致并不保证任务正确:一旦推理选错目标,动作会稳定执行错误计划。
复现条件较重。每项任务训练 3 万步,使用 8 张 H100 约 10 小时;推理还依赖 π₀、Gemini 2.5 Pro、FLUX.1-dev 与真实机器人数据。官方已开放训练代码、Cocktail / Open-World 数据和部分合成数据,有利于复现核心管线,但论文全部长程任务数据与硬件评测仍难完整复制。
总结:自适应推理是一项策略能力,也是一项计算分配能力
OneTwoVLA 将推理、动作和模式决策统一到一个 VLA 中。[BOR] / [BOA] 让模型在关键节点更新文字化任务状态,其余时间继续快速输出动作;带推理的机器人轨迹建立推理—动作对应关系,1.6 万条合成 VL 数据扩展了新任务和开放世界对象的覆盖面。
读者应带走的判断有三点:统一模型缓解了高低层能力错位;显式任务状态显著帮助长程执行与恢复;开放世界泛化仍依赖更广的数据,而不是推理格式自动产生。 OneTwoVLA 把“何时使用慢思考”纳入了策略学习,下一步则要让这种计算分配摆脱人工区间,在动态环境中异步、可验证地运行。
推荐阅读
► 技术资讯: 魔方 AI 新视界
► 项目应用:开源视界
► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列
更多推荐


所有评论(0)