Gemini Robotics 2:Humanoid 的新一代 VLA 系统
从脚掌到指尖——我们正在赋予机器人智能全身控制、精细灵巧操作与协同作业能力,使其能够完成各类复杂任务。
数十年来,我们一直憧憬机器人能够无缝融入人类生活、随时伸出援手。如今,这一愿景迈出了关键性一步。
绝大多数机器人依靠预编程或远程操控执行单一、重复的任务流程,它们无法自主学习,也难以适应充满未知变化的环境。此外,将已习得的技能从一款机器人机身迁移至另一款机身的难度极大。想要规模化攻克各类高难度作业场景,各类形态、尺寸的机器人都需要配套AI模型,使其具备自主思考、行动、交互的智能,安全完成各类工作。
此前我们已展示,Gemini的多模态理解能力能够驱动实体设备完成现实操作,对应的技术方案为Gemini Robotics。
今天,我们正式推出Gemini Robotics 2——支撑下一代真正具备自适应能力机器人的智能底层。随着该方案正式落地,这项重大技术突破实现了智能全身运动控制、高阶灵巧操作与多机器人协同作业三大核心能力。
Gemini Robotics 2可让机器人对每一个动作进行逻辑推演,解锁海量作业场景。举例来说,搭载该模型的Humanoid(可完成行走、下蹲、伸展、抓取物品等动作,整理杂乱房间;还能与其他机器人组队协作,更快完成工作。这套高阶智能可在设备本地on-device离线运行,且仅需数小时就能适配完全全新的机器人硬件本体。
我们通过三款高性能模型实现上述全部能力:
-
Gemini Robotics 2:谷歌当前最强VLA模型,可将视觉、语言输入转化为电机控制指令,驱动机器人执行动作。该模型能够完整控制Humanoid人形机器人从脚掌到指尖的全部躯体结构,同时适配各类双机械臂机器人;针对机械手与夹爪,它还实现了全新层级的精细灵巧操控能力。
-
Gemini Robotics ER 2:谷歌性能顶尖的具身推理模型,本质为VLM(视觉语言模型),充当机器人embodied agent(具身智能代理),实现机器人与人沟通、理解物理世界、规划时长达数分钟的多步骤任务。本次更新还新增多机器人组队协同作业功能。
-
Gemini Robotics On-Device 2:谷歌效率最优的轻量化VLA模型,专为机器人on-device本地离线运行优化。该模型仅需数小时数据训练,就能快速适配完全不同结构的机器人硬件本体。
我们使用同一模型checkpoint,让Gemini Robotics 2控制三款不同硬件设备:搭载SharpaWave机械手的Apptronik Apollo 2人形机器人、搭载Inspire机械手的Apollo 2人形机器人、配备Robotiq夹爪的Franka Duo机械臂,完成大量全身运动与精细抓取任务。



图中每根柱状条代表同一类技能下多项任务的平均success rate;针对多指精细操作任务,我们单独展示单任务性能。虽然Gemini Robotics 2在全身运动、夹爪精细操作任务上能达到中高success rate,但多指手部精细操控仍是尚存挑战的技术难点。
动态人形机器人:全身作业统筹控制
人类生活空间的布局完全适配人体动作逻辑,我们需要在狭小、堆满杂物的空间内完成伸手、弯腰、保持平衡等动作。此前版本模型仅能控制Humanoid人形机器人上半身完成桌面级操作,而Gemini Robotics 2将实体AI能力拓展至全身运动。
本系列模型首次实现完整人形机器人躯体全域控制,可将人类指令意图转化为智能全身动作调度。以控制Apptronik Apollo 2人形机器人为例:当下达指令“把洒水壶放到底层货架的绿色收纳箱里”时,Apollo会解析指令、走到桌边拿起洒水壶、移步货架并精准将其放入目标箱体。虽然机器人的运动速度仍有提升空间,但这项突破是实现更多复杂真实场景全身协同作业技能的关键一步。
赋予机械手与夹爪高阶精细操作能力
想要真正在家居、工业场景发挥实用价值,机器人必须具备细腻操控能力。Gemini Robotics 2针对各类end effector(无论是多自由度机械手还是简易夹爪)解锁全新层级的实体精细操控能力,大幅提升机器人实用性。
该模型可驱动Apollo 2人形机器人搭载的SharpaWave五指机械手(共22个DoF)完成打结、密封密封袋等精细动作;同时也能操控Franka Duo设备的标准双指平行夹爪,完成精密装填等高难度精细作业。我们仍在持续优化操作精度与运行速度,向人类级灵巧操控水平靠拢。
智能代理推理与多机器人协同,解锁复杂长时序任务
绝大多数现实作业都需要持续多步、长时序操作。为此,我们的具身推理模型Gemini Robotics ER 2充当机器人高层embodied agent,解析人类指令、与人交互;实时观测环境、推演完成任务所需步骤,调用VLA模型执行动作,并全程追踪作业进度直至任务完成。这套架构让机器人能够执行复杂多步骤任务,若某一步操作失败可自主修正,同时泛化适配全新场景与目标。
本次更新大幅提升机器人执行长时序任务流程的稳定性,整套流程可持续数分钟、包含上百次决策判断。Gemini Robotics ER 2能够精准识别任务起止节点、定位关键动作发生时刻,在任务进度感知层面实现跨越式升级。
除此之外,我们新增多机器人协同功能:不同类型机器人可互相通信、组队完成单一机器人无法独立实现的复杂作业流程。
on-device本地离线适配模型:快速兼容任意机器人硬件
大量机器人应用场景存在网络延迟、无互联网连接的限制。Gemini Robotics On-Device 2专为解决这类约束打造,是谷歌能效最高的VLA模型,原生支持机器人on-device本地部署。
该模型原生兼容多硬件本体,继承Gemini Robotics 1.5成熟的“动作迁移”技术。如今仅需少量数据样本(通常不足200组)、耗时数小时即可完成全新双机械臂硬件的适配,即便新设备在外形、传感器、DoF上与原有设备差异巨大也能兼容。文中演示了Dexmate、SO101、Trossen多款异构硬件平台搭载该模型完成多样化作业的效果。
Google DeepMind Gemini Robotics 1.5/1.6:通用物理智能的跨本体迁移与具身推理
持续践行安全、负责任机器人研发承诺
安全是机器人研究的底层核心。随着机器人实体操作能力不断增强,我们致力于打造端到端安全与价值对齐体系。每一次版本迭代,我们都采用多层防护方案,融合传统实体安全防护措施与完备AI安全框架。
Gemini Robotics 2针对真实环境不确定性、人机协同场景专项升级机器人安全能力。
我们推出全新benchmark ASIMOV-Agentic,用于embodied agent安全调度与不确定性处理能力评测。

举例来说,该benchmark可检测具身推理embodied agent是否能够拒绝VLA模型发起的危险操作指令;同时评测agent预判任务可行性、存在不确定风险时主动请求人工介入的能力。
https://huggingface.co/datasets/google/asimov_agentic
依托升级后的具身推理能力,Gemini Robotics ER 2是本系列至今在安全约束遵循、人机近距离交互两项测试中安全性最优的机器人模型。它可精准感知人类靠近,触发安全防护指令,若人员距离过近则控制机器人紧急停机——这是人机协同安全标准的核心硬性要求。
更多细节可查阅

迈向通用实体人工智能

Gemini Robotics 2是物理世界通用人工智能研发道路上的重要里程碑。想要释放机器人技术全部潜力,必须跳出单一任务自动化,向通用智能迈进。我们搭建这套底层智能体系,目标是打造能够与人类协同、解决各类复杂难题的物理世界AI。

更多推荐

所有评论(0)