《Vision-Language-Action Models for Robotics: A Review Towards Real-World Applications》论文核心内容总结
这篇是2025年发布的机器人视觉-语言-动作(VLA)模型领域最全面的全栈综述,区别于以往仅聚焦模型架构或动作表示的综述,它完整覆盖了VLA系统从软件算法到硬件部署的全流程,核心目标是为机器人领域研究者和开发者提供VLA模型落地真实世界的系统性指导与实践参考。
一、核心定位与VLA模型的明确定义
1. 研究背景与综述价值
随着大语言模型(LLM)和视觉-语言模型(VLM)的爆发,VLA模型成为机器人具身智能的核心范式——它通过规模化统一视觉、语言、动作三大传统独立的模态,学习能跨任务、物体、机器人本体、环境泛化的策略,让机器人以极少甚至零额外任务数据完成全新下游任务,解决传统机器人方案泛化性差、部署成本高的核心痛点。
2. 严格的VLA模型定义
论文明确了VLA模型的核心边界(Definition I.1):
-
必需输入:视觉观测 + 自然语言指令,可额外接入本体感知、深度、触觉等辅助模态;
-
核心输出:直接生成机器人底层控制指令,而非仅做高层任务规划、从预定义技能库中做选择;
-
排除范围:仅用视觉语言做高层推理、不落地到动作执行的系统,均不属于本文定义的VLA模型。
二、VLA模型落地的核心底层挑战
论文开篇就明确了制约VLA模型从实验室走向真实世界的四大核心挑战,也是全文综述的核心脉络:
-
数据瓶颈:同时对齐视觉、语言、动作三模态的大规模高质量数据集极度稀缺;机器人示教数据采集成本高、规模难扩展,而互联网视觉语言数据缺乏动作落地的标注。
-
本体迁移难题:不同机器人的关节配置、传感器、动作空间差异极大,VLA模型跨机器人本体的策略泛化仍是行业核心难题;人类示教数据也存在动作标注缺失、本体不匹配的问题。
-
计算与训练成本过高:VLA模型多基于大规模预训练VLM主干,领域适配、下游微调的计算开销极大,普通研究者和开发者难以实现端到端全量训练。
-
真实世界部署的鲁棒性缺失:现有VLA模型多在受控实验室环境验证,在非结构化真实场景中,面对动态干扰、突发故障、安全边界约束时,可靠性和泛化性严重不足。
三、VLA模型的发展演进与完整架构分类体系
这是论文的核心理论贡献,它梳理了VLA模型从早期CNN方案到现代多模态架构的完整演进路径,并提出了系统化的架构分类法。
1. 技术演进脉络
论文按历史发展将VLA架构分为四个阶段:
-
早期CNN端到端架构:以CLIPort为代表,首次将预训练VLM与端到端操作策略结合,验证了视觉-语言-动作联合学习的可行性,但存在模态融合不充分、规模化能力弱的问题;
-
Transformer序列模型阶段:以Gato、RT-1为代表,将多模态数据统一为token,用Transformer实现序列建模,成为VLA模型的基础范式;
-
扩散模型主导的生成式阶段:以Octo、RDT-1B为代表,用扩散模型实现连续、平滑的动作生成,解决了离散动作token的实时性和流畅度缺陷;
-
分层控制与思维链增强阶段:引入高层推理与底层控制的分层架构,通过思维链(CoT)搭建语言指令到底层动作的语义桥梁,提升长时序任务的推理能力。
2. 核心架构分类
论文将主流VLA模型分为三大类,其中核心的感知运动(Sensorimotor)模型又细分为7种主流架构变体,覆盖了当前几乎所有主流VLA方案:
| 架构大类 | 核心逻辑 | 代表模型 |
|---|---|---|
| 感知运动模型(核心主流) | 端到端联合学习视觉、语言、动作表征,输入图像+语言直接输出动作,是当前最主流的范式 | 细分7种变体: 1. Transformer+离散动作Token(RT-1、Gato、VIMA) 2. Transformer+扩散动作头(Octo) 3. 扩散Transformer(RDT-1B) 4. VLM+离散动作Token(RT-2、OpenVLA) 5. VLM+扩散动作头(Diffusion-VLA、DexVLA) 6. VLM+流匹配动作头(π₀、GraspVLA,最新趋势) 7. VLM+扩散Transformer(GR00T N1、CogACT) |
| 世界模型(World Models) | 基于语言指令预测未来视觉/状态演化,用预测结果辅助动作生成,提升长时序任务的规划能力 | UniPi、GR-1、FLARE |
| 可供性模型(Affordance-based Models) | 先基于语言指令预测动作相关的视觉可供性(可操作区域、目标位姿等),再基于可供性生成动作,提升空间定位精度 | CLIPort、VoxPoser |
同时,论文还详细拆解了VLA模型的模态处理模块:视觉编码主流采用ViT/ResNet预训练主干,语言模块基于开源/闭源预训练LLM,动作模块分为离散token化、连续扩散生成、流匹配三大主流方案,同时覆盖了本体感知、深度等辅助模态的融合策略。
四、VLA模型的完整训练范式与工程实现
论文系统梳理了VLA模型从预训练到推理部署的全流程训练体系,填补了以往综述对工程实现细节的覆盖空白:
-
三大训练范式:
-
监督学习(主流):基于专家示教数据的模仿学习,是当前VLA模型的核心训练方式;
-
自监督学习:用于视觉表征预训练、动作潜空间学习、语言-视觉对齐,降低对标注数据的依赖;
-
强化学习:分为端到端微调VLA策略、VLA做高层规划+强化学习做底层控制两类,解决稀疏奖励下的策略优化问题。
-
-
两阶段训练流程:
-
预训练阶段:核心是提升模型的泛化能力,主流方案是基于大规模多模态数据(机器人示教+互联网视觉语言数据+人类视频数据),用预训练VLM做主干,通过多任务辅助损失(目标检测、图像字幕、空间定位)实现领域适配;
-
后训练阶段:基于机器人/任务专属的高质量数据做微调,主流方案包括全量微调、冻结主干仅微调动作头、LoRA等参数高效微调,平衡性能与计算成本。
-
-
推理优化:针对真实世界部署的实时性需求,梳理了异步动作生成、分层提前退出、静态特征缓存等低延迟推理方案。
五、VLA模型的数据体系
数据是VLA模型泛化能力的核心,论文完整覆盖了VLA数据的全链路:
-
数据采集策略:详细对比了遥操作示教(主流)、主从臂映射、动作捕捉、虚拟示教、仿真数据生成等采集方式的优劣与适用场景;
-
公开数据集:系统梳理了当前主流的VLA三模态数据集,分析了各数据集的任务类型、模态覆盖、规模、本体适配性,为研究者选型提供参考;
-
数据增强方法:针对机器人数据稀缺的痛点,总结了视觉增广、动作空间增广、仿真数据增广、弱监督人类视频数据利用等主流方案。
六、真实世界落地全指南
这是这篇综述的核心特色,完全围绕真实世界应用展开,覆盖了落地的全环节:
-
主流机器人硬件平台:梳理了当前VLA模型适配的主流机器人本体,包括机械臂、移动机器人、人形机器人、双手机器人等,分析了不同本体的VLA适配要点;
-
评估基准与协议:从仿真环境评估、真实环境评估、世界模型评估三个维度,系统梳理了VLA模型的评估指标、基准测试集、标准化评估流程,解决了当前VLA模型效果对比不规范、不严谨的行业痛点;
-
真实世界应用场景:总结了VLA模型当前的核心落地场景,包括工业自动化、物流搬运、家庭服务、医疗辅助、自动驾驶等,同时分析了各场景的落地瓶颈与技术需求。
七、从业者实践指南、开放挑战与未来方向
-
可落地的实践建议:论文专门设置章节,基于全领域的研究成果,给从业者提供了可直接参考的实践指南,包括主干模型选型、数据策略、训练范式选择、架构设计取舍、部署优化等核心环节的最佳实践。
-
开放挑战与未来研究方向:论文明确了VLA模型走向大规模真实世界应用的核心待解决问题,包括多模态数据扩展、长时序推理能力、持续学习、安全强化学习、部署安全性、故障检测与恢复、标准化评估体系、全场景落地适配等,为领域未来的研究指明了方向。
八、论文的核心贡献
-
首次提出了VLA模型的标准化定义与边界,厘清了领域的研究范围;
-
构建了最全面的VLA架构分类体系,完整梳理了技术演进脉络与主流方案的优劣;
-
实现了VLA系统的全栈覆盖,从算法架构、训练范式,到数据体系、硬件平台、评估基准、落地应用,填补了以往综述对工程落地环节的覆盖空白;
-
提供了面向真实世界应用的实践指南,同时明确了领域的核心挑战与未来研究方向,为学术研究和产业落地都提供了系统性的参考。
更多推荐


所有评论(0)