具身智能之Vlaser详解:推理分数高,不等于机器人更会动——VLM→VLA 迁移实验
写在前面
【从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git
AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09
导读
给机器人加入视觉语言模型,直觉上像是把“理解场景、规划任务、执行动作”接成一条自然链路。但这里藏着一个经常被跳过的问题:一个模型在具身问答、空间关系和视觉指代基准上更聪明,是否就一定能让机械臂完成更多闭环任务?
Vlaser 的价值,首先在于把这个问题做成了一组受控实验。作者从同一个 InternVL3 主干出发,分别加入通用具身推理数据,以及来自 Google Robot、WidowX、Aloha-AgileX 机器人观测域的问答、定位与空间数据,再用相同的动作数据微调 VLA。结果很直接:通用推理数据能显著抬高 12 个上游基准的平均分,却只给下游控制带来很小的收益;与机器人视角同域的数据,才明显改善 VLA 的训练收敛和任务成功率。
在方法上,Vlaser 用 InternVL3 处理图像与语言,再接入共享自注意力的 action expert,通过 flow matching 生成连续动作块。配套的 Vlaser-6M 覆盖 grounding、具身问答、空间智能、规划,以及约 200 万条同域多模态问答数据。2B 版本在 12 项具身推理基准上的平均分由 15.2 提升到 45.3;加入全部同域数据后,WidowX SimplerEnv 平均成功率由 41.8% 提升到 65.1%,RoboTwin 12 个任务的平均成功率由 55.8% 提升到 67.5%。
猫先生认为,这篇论文最重要的结论并不是“再造一个更强 VLA”,而是给 VLM 到 VLA 的迁移加了一条边界条件:能力标签相同不等于输入分布相同。 机器人真正缺少的可能不只是抽象推理能力,而是能在自身相机视角下稳定调用这些能力的数据接口。
- 论文标题:Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- OpenReview:https://openreview.net/forum?id=8xTDnj39Ti
- arXiv:https://arxiv.org/abs/2510.11027
- GitHub:https://github.com/OpenGVLab/Vlaser
- 模型与数据:https://huggingface.co/collections/OpenGVLab/vlaser

图 1:原论文 Figure 1。左上是 Vlaser-6M 的数据构成,右上汇总具身推理基准,左下展示训练收敛,右下给出 Google Robot 与 WidowX 的仿真执行片段。
原文脉络
论文第 1 节提出核心问题:上游具身推理能力能否迁移到下游 VLA 控制。第 2 节介绍 Vlaser 架构、Vlaser-6M 数据引擎和两阶段训练方案。第 3 节先评估 12 项具身推理基准,再进入 SimplerEnv 与 RoboTwin 的闭环控制实验,最后通过数据消融和推理配置分析收益来源。相关工作被放在第 4 节,第 5—6 节集中讨论仿真评测等限制,并总结“同域推理数据”对 VLA 的意义。
1、4. 问题背景:会回答,不代表会控制
VLA 通常沿两条路线发展。一条从机器人策略出发,把视觉、语言和动作放进同一个序列模型;另一条从 VLM 出发,希望利用大规模图文预训练中的常识、空间关系与任务规划能力。后者很有吸引力,因为 Web 数据远多于机器人轨迹,但 VLM 的能力通常在静态图片、第三人称画面和问答任务上被验证,而机械臂控制面对的是腕部或固定机位视频、连续状态变化和容错率很低的动作输出。
因此,“具身推理”至少包含两个层面:一是能否说对物体位置、空间关系和操作步骤;二是这些判断能否在当前机器人的观测分布中,为低层动作提供稳定表征。已有基准主要测第一层,Vlaser 试图测清两层之间到底隔着多远。
论文把训练数据区分为 OOD 推理数据和同域推理数据。这里的 OOD 不是说内容与机器人完全无关,而是图像分布来自互联网、通用数据集或不同场景;同域数据则直接从下游仿真环境和对应机器人视角中生成。这个划分贯穿后面的全部实验,也是理解结果的钥匙。
2. 方法:让视觉语言主干与动作专家协同训练
2.1 模型结构:VLM 负责理解,action expert 负责连续动作
Vlaser 的视觉语言主干采用 InternVL3,分别构建 2B 和 8B 版本:InternViT 将图像编码为视觉 token,Qwen2.5-1.5B 或 Qwen2.5-7B 负责语言建模。VLA 微调时,作者在主干旁加入机器人专用的 action expert,形成类似双专家混合模型的结构。
机器人状态被编码为 state token,加入噪声的连续动作被编码为 action token。视觉语言分支与动作分支保留各自的参数,但在自注意力层共享信息;动作序列使用非因果注意力,使一个 action chunk 内的多个时间步能够联合建模。最终,action expert 根据图像、指令和本体状态预测去噪方向,通过 flow matching 逐步还原连续动作。

图 2:原论文 Figure 2。左侧是 Vlaser-6M 上的多模态预训练,右侧是在视觉语言主干旁加入 action expert 的 VLA 微调;两条分支通过共享自注意力交换信息。
这种分工避免了把机械臂关节量强行当作普通文字 token,同时又让动作专家直接读取预训练主干中的视觉语义。默认设置一次预测 4 步动作,执行 4 步后重新观察;推理阶段用 10 次欧拉积分完成 flow matching 采样。
2.2 Vlaser-6M:通用能力与机器人视角分开构造
Vlaser-6M 并不是单一来源的数据集,而是围绕四种可迁移能力组织的数据混合:
- Grounding:约 150 万条高质量定位问答,另加入约 30 万条由 SA-1B 构造的点和框标注,坐标统一归一化到 0—1000;
- 具身问答:约 120 万条机器人场景问答,覆盖状态理解、可操作性和下一步行为;
- 空间智能:约 50 万条距离、方位、计数与三维关系样本,其中约 10 万条来自人工标注的三维场景数据;
- 规划:约 40 万条从目标到操作步骤的层级规划样本。
此外,作者从 SimplerEnv 和 RoboTwin 中抽取 Google Robot、WidowX、Aloha-AgileX 的画面,构造约 200 万条同域多模态问答。它们同样覆盖一般问答、规划、定位与空间关系,但画面来自之后要训练和评测的机器人观测域。
这个设计让实验可以比较三件事:只增强通用推理,是否有用;只加入某一类同域能力,哪类更有效;把同域 QA、空间和 grounding 合并,能否互补。
2.3 两阶段训练:先学会看和说,再学习怎么动
第一阶段在 Vlaser-6M 上做多模态监督微调,视觉语言模型以自回归语言损失学习回答、定位和规划。第二阶段加入 action expert,用机器人 demonstration 进行 VLA 微调,动作端采用 flow matching 损失。
作者并没有要求模型在每次控制前输出长篇推理链。这里的“synergistic embodied reasoning”主要体现在预训练表征为动作学习提供条件,而不是把可见思维过程直接插入控制循环。这样控制开销较低,也使研究问题更干净:若动作成功率变化,主要变量就是上游数据与表征,而不是额外的测试时推理流程。
猫先生认为,这种两阶段方案的优点是便于归因,但“同域推理数据有效”仍不能完全等价为“推理能力迁移成功”。同域问答同时改变了视觉分布、对象覆盖和语言描述,收益可能很大一部分来自视觉域对齐。论文证明了数据接口有效,却还没有把语义推理与观测适配的贡献彻底拆开。
3. 实验:上游高分与下游成功率并不同步
3.1 12 项具身推理基准:小模型追上通用大模型
评测覆盖 PointArena、Where2Place、Ego-Plan2、ERQA、EmbodiedBench、VLABench、MMSI-Bench、RefSpatial-Bench、VSI-Bench、PixMo-Points 和 Paco-LaVIS 等 12 项测试,涉及点定位、空间关系、规划与具身问答;其中 EmbodiedBench 分别在 ALFRED 和 Habitat 环境中计分。
| 模型 | 参数规模 | 12 项平均分 |
|---|---|---|
| InternVL3-2B | 2B | 15.2 |
| Vlaser-2B | 2B | 45.3 |
| InternVL3-8B | 8B | 22.3 |
| Vlaser-8B | 8B | 51.3 |
| Gemini-2.5-Pro | 未公开 | 44.4 |
Vlaser-2B 的平均分已经超过表中 Gemini-2.5-Pro,8B 版本进一步达到 51.3。规模更大并非处处占优:2B 在部分简单点定位任务上反而更好,8B 的优势更多出现在规划和复杂场景理解。这说明数据配方带来的任务适配,至少在这些基准上,比单纯扩大主干更关键。
3.2 WidowX:OOD 推理只涨 1.4 个点,同域数据涨 23.3 个点
WidowX SimplerEnv 包含把胡萝卜放到盘子、把茄子放入篮子、把勺子放到毛巾上和堆叠方块四项任务。
| 视觉语言初始化 | 四任务平均成功率 |
|---|---|
| InternVL3-2B | 41.8% |
| Vlaser-OOD | 43.2% |
| Vlaser-QA | 62.6% |
| Vlaser-Spatial | 60.8% |
| Vlaser-Grounding | 62.0% |
| Vlaser-All | 65.1% |
仅使用通用具身推理数据的 Vlaser-OOD,相比原始 InternVL3 只提高 1.4 个百分点;同域 QA、空间和定位数据分别带来约 19—21 个百分点提升,三类合并后的 Vlaser-All 达到 65.1%。论文还展示了更快的训练收敛,说明收益不只是最后几个检查点的偶然波动。

图 3:原论文 Figure 6。原始 InternVL3-2B 在四个示例中失败,而使用同域数据的 Vlaser 与 Vlaser-QA 能完成目标。定性案例用于观察行为差异,成功率结论仍应以批量评测为准。
3.3 Google Robot 与 RoboTwin:同域组合整体最稳,但并非全面领先
| 初始化方式 | Google Robot:Visual Matching | Google Robot:Variant Aggregation | RoboTwin 12 任务平均 |
|---|---|---|---|
| InternVL3-2B | 64.0% | 54.7% | 55.8% |
| Vlaser-OOD | 68.7% | 51.3% | 54.5% |
| Vlaser-All | 76.2% | 59.0% | 67.5% |
结果再次出现同样的分化:OOD 数据在 Google Robot 的视觉匹配设置中有帮助,却在 Variant Aggregation 和 RoboTwin 上略低于基线;Vlaser-All 则在三个汇总指标上都优于相同主干。RoboTwin 中,Vlaser-All 也高于 RDT-1B 的 36.8%。
但 Vlaser 不是所有对比中的第一名。Google Robot 上,Magma 分别达到 68.4% 和 62.6%,在 Variant Aggregation 上高于 Vlaser-All。更稳妥的结论是:Vlaser 验证了同域多模态预训练对多个机器人平台具有一致价值,而不是已经解决所有 VLA 泛化问题。
3.4 消融:改变动作块与采样步数,结论仍保持
作者继续改变预测长度、实际执行长度和 flow matching 采样步数。在多组配置中,Vlaser-OOD 相对 InternVL3 的增益都有限,同域 QA 初始化则持续领先。默认的“预测 4 步、执行 4 步、采样 10 次”不是唯一有效设置,因此主要收益不太可能只是控制超参数恰好匹配。
这组消融支持论文的中心判断:常见具身推理基准的上游分数与特定机器人上的低层闭环成功率没有稳定正相关。模型既要知道“该做什么”,也要在机器人自己的画面里认出“现在在哪里、目标是什么、怎样接近”。
5—6. 局限与结论:关键证据成立,但“推理迁移”仍需继续拆解
最直接的限制是没有真实机器人实验。SimplerEnv 与 RoboTwin 能提供可重复的大规模闭环评测,也比离线动作误差更接近真实控制,但仿真中的视觉、接触和动力学仍无法覆盖真实硬件的相机噪声、标定偏差、抓取滑移与安全约束。因此,论文能够证明同域数据在仿真域内有效,尚不能证明同样的增益会原样迁移到实机。
第二,实验把同域问答称为具身推理数据,但没有设置“同样图像、只做视觉自监督或图文描述”的严格对照。因而无法准确判断增益来自空间推理、任务语义,还是更基础的相机视角和对象外观对齐。后续研究需要控制图像来源与标注形式,拆分域对齐、语义监督和推理监督三项贡献。
第三,上游评测虽多达 12 项,但下游只覆盖有限机器人平台和操作基准;不同模型的动作数据、训练预算也会影响横向比较。Vlaser 已公开代码、模型与数据集合,便于复查核心结论,不过完整复现实验仍需要较大的多模态预训练和仿真评测成本。
Vlaser 最值得带走的不是某个单项分数,而是一条数据设计原则:要把 VLM 的知识交给 VLA,不能只问“数据是否包含机器人推理”,还要问“这些推理是否发生在机器人真正看到的世界里”。 通用数据负责扩展知识边界,同域数据负责建立可调用的视觉接口;两者协同,才可能让“会说”稳定地变成“会做”。
推荐阅读
► 技术资讯: 魔方 AI 新视界
► 项目应用:开源视界
► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列
更多推荐


所有评论(0)