【机器人“大脑”考试指南】RoboBench:给多模态大模型出的“真实世界生存题”,14个顶尖模型都栽了哪些坑?
摘要:RoboBench 是北京大学&北京人工智能研究院&复旦大学&北京科技大学&北京人形机器人创新中心机器人联合发布的 “大脑”(多模态大模型)的专业评估基准,用 5 大维度、25 项真实任务考模型,还让 MLLM 当 “世界模拟器” 判分,帮你看清机器人思考能力的真水平。
前言:
试想:家里的机器人听到你说 “我渴了”,能立刻反应过来 “要找杯子接水”,而不是等着你说 “去拿杯子、打开饮水机、接满水”?这背后全靠机器人的 “大脑”—— 多模态大语言模型(MLLM)。但这 “大脑” 到底好不好用?之前的评估要么只看 “最后有没有拿到水”,要么用的是仿真场景,完全不管真实世界里的 “机器人手臂不一样”“杯子被挡住了” 这些麻烦事。
现在,一份专门给机器人 “大脑” 出的 “终极考卷” 来了 ——北京大学&北京人工智能研究院&复旦大学&北京科技大学&北京人形机器人创新中心机器人联合发布的RoboBench(Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain)。它不光考模型 “能不能听懂话”“能不能看明白环境”,还考 “会不会灵活规划”“做错了能不能找原因”,甚至把单臂、双臂、移动机器人的真实场景都搬了进来。今天咱们就拆解这份 “考卷”,看看 14 个顶尖模型考得咋样,又暴露了哪些 “思考短板”。
一、这份 “考卷” 考什么?5 大维度,覆盖机器人 “思考全流程”
机器人要完成 “接水” 这样的任务,得走一套完整的 “思考流程”:先懂指令,再看环境,接着规划步骤,细化怎么动手,最后还得会找错。RoboBench 就照着这个流程,出了 5 大 “考核维度”,连图都画得明明白白(见图 1)。

咱们用 “接水” 任务拆解下这 5 个维度,就好懂了:
1)指令理解:考模型能不能听懂 “我渴了”(隐式指令),而不只是 “去接水”(显式指令)。之前很多模型只会 “照本宣科”,遇到含蓄的指令就懵了;
2)感知推理:考模型能不能 “看清楚”—— 比如 “杯子在桌子上”“饮水机在左边”“现在杯子是空的”,甚至 “刚才手没抓稳杯子是因为角度偏了”;
3)泛化规划:考模型能不能 “想步骤”—— 比如 “先走到饮水机旁→打开开关→拿杯子接水→关掉开关”,如果换成双臂机器人,还得想 “左手拿杯子,右手开开关”;
4)可用性预测:考模型能不能 “知道怎么动手”—— 比如抓杯子该捏杯柄(不是杯身),开饮水机开关该往哪个方向拧;
5)失败分析:考模型能不能 “找错”—— 比如没接到水,是因为 “没开开关” 还是 “杯子没放对位置”。
这 5 个维度下来,机器人 “大脑” 的 “理解、观察、规划、动手、反思” 能力就全被考到了,比之前只看 “接没接到水” 的评估全面多了。
二、“考题” 有多真实?从单臂到移动机器人,连 “遮挡” 都还原了
以前很多评估用的是仿真场景,机器人面对的都是 “摆得整整齐齐的杯子”“不会遮挡的环境”,到了真实世界根本不好使。RoboBench 偏要 “反着来”,把真实机器人会遇到的麻烦全搬进了 “考题”(见图 2)。

比如在 “物体” 上,它不光有常见的杯子、盘子,还有 “易碎的玻璃碗”“软乎乎的毛巾”“需要插电的微波炉”—— 这些物体的材质、功能都不一样,机器人得 “知道” 玻璃碗不能用力捏,毛巾要抓边角;
在 “机器人本体” 上,它覆盖了单臂、双臂、移动机器人 —— 比如单臂机器人只要 “自己动手”,双臂得 “分工合作”,移动机器人还得 “先走到目标旁”;
在 “场景” 上,它还加入了 “遮挡” 和 “多视角”—— 比如杯子被书挡住了,机器人得通过 “腕部相机”(不是只有前视相机)看到杯子,这和真实家里的场景一模一样。
更实在的是,这些 “考题” 的数据不是瞎编的,一部分来自大规模真实机器人任务数据(比如机器人实际接水、整理桌面的视频),一部分是团队自己采集的,连 “机器人没抓稳杯子”“开错饮水机开关” 的失败案例都有,完全没有 “仿真到真实” 的鸿沟。
三、怎么给 “大脑” 打分?MLLM 当 “世界模拟器”,比 “选择题” 靠谱 10 倍
以前评估机器人 “规划能力”,要么让模型做选择题(“下一步该 A 还是 B”),要么看文本相似度(比如模型说 “拿杯子”,真实答案是 “取杯子”,就判错),根本不管 “这步在真实世界能不能做”。
RoboBench 搞了个新招:让 MLLM 当 “世界模拟器”,模拟机器人执行计划的全过程,再打分(见图 5)。

举个 “接水” 的例子,这个 “模拟器” 会这么干活:
1)先看初始状态:从首帧图片里知道 “杯子在桌子上,饮水机开关是关的”(这就是真实环境的约束);
2)拆关键目标:比如 “接水” 的关键目标是 “打开开关→杯子接满水→关掉开关”;
3)模拟执行:一步步看模型的计划能不能实现这些目标 —— 比如模型说 “先拿杯子再开开关”,模拟器会判断 “没问题”;但如果模型说 “先开开关再找杯子”,模拟器会发现 “开关开了但没杯子,水会洒出来”,这步就判错;
4)最后打分:一方面看 “动作对不对”(比如该 “开开关” 没说成 “关开关”),另一方面看 “目标成没成”(到底接没接到水),两者平均就是最终分。
这种方式比 “选择题” 靠谱多了 —— 毕竟真实世界里,机器人的计划没有 “标准答案选项”,得看 “能不能真的做成事”。
四、14 个顶尖模型考得咋样?这些 “短板” 太扎心
研究团队拿这份 “考卷” 测了 14 个主流模型,包括 GPT-4o、Claude-3.7-Sonnet、Gemini-2.5-Pro 这些热门选手,结果发现:就算是最厉害的模型,也有一堆 “思考短板”(部分结果见图 6)。

咱们挑几个最明显的短板说说:
1)听不懂 “含蓄话”:“我渴了” 比 “去接水” 难 30%
模型在 “显式指令”(比如 “去接水”)上能考 40-50 分,但到了 “隐式指令”(比如 “我渴了”),得分直接掉到 10-20 分,平均差了 30%。说白了,模型只会 “照指令做事”,不会 “猜需求”—— 就像你跟孩子说 “我渴了”,孩子只会说 “哦”,不会主动去拿水。
2)看不清 “机器人视角”:换个相机就认不出杯子
在 “机器人视角识别” 题里,最好的模型才考 43 分(满分 100)—— 比如前视相机拍不到杯子,但腕部相机能拍到,模型就懵了,不知道 “换个角度看”。这就像你用手机自拍看不到身后的东西,不会转身用后置相机拍一样。
3)双臂协调 “手忙脚乱”:左手右手不知道分工
面对双臂机器人任务,模型普遍得分低 —— 比如该 “左手拿杯子,右手开开关”,模型可能让 “两只手都去拿杯子”,或者 “右手拿杯子,左手开开关”(但左手离开关更远)。这说明模型没搞懂 “不同手臂的分工”,就像人不会用两只手同时做冲突的动作一样。
4)做错了找不出原因:执行错误诊断得分只有 10-20 分
最扎心的是 “失败分析” 题:模型诊断 “规划错误”(比如漏了 “开开关”)还能得 40-60 分,但诊断 “执行错误”(比如杯子没抓稳是因为角度偏了),得分只有 10-20 分,连人类的一半(47 分)都不到。就像人知道 “没接到水是因为没开开关”,但不知道 “没抓稳杯子是因为捏错了地方” 一样,缺乏细粒度的 “动手反思” 能力。
五、RoboBench 的意义:给机器人 “大脑” 指条明路
看完这些结果,你可能会问:知道这些短板有啥用?其实 RoboBench 的价值,不光是 “给模型打分”,更像是 “给开发者指方向”:
-
比如模型听不懂 “含蓄话”,以后就可以在训练里加更多 “隐式指令 + 场景” 的数据,让模型学会 “结合场景猜需求”;
-
比如模型不会双臂协调,以后就可以在数据里标注 “左臂该干啥、右臂该干啥”,让模型理解 “分工”;
-
比如模型不会诊断执行错误,以后就可以加更多 “失败动作 + 原因” 的案例,让模型学会 “从动手细节里找错”。
简单说,RoboBench 就像一把 “精准的尺子”,帮我们看清机器人 “大脑” 到底哪里行、哪里不行,而不是盲目地 “堆数据、提参数”。未来有了它,我们离 “能听懂话、会灵活做事的家用机器人”,可能就更近一步了。
最后再总结下:RoboBench 不是一份 “为难模型” 的考卷,而是一份 “贴近真实” 的指南 —— 它告诉我们,机器人 “大脑” 的强大,不在于 “能做对仿真题”,而在于 “能应对真实世界的麻烦”。毕竟,我们需要的不是 “实验室里的完美机器人”,而是 “家里能帮你接水、整理桌面的靠谱帮手”,对吧?
项目页:https://robo-bench.github.io/
END
您的赞同支持是我努力坚持的动力!!
更多推荐

所有评论(0)