摘要:空间参照是体现机器人与3D物理世界交互的基本能力。 然而,即使使用强大的预训练视觉语言模型(VLM),最近的方法仍然无法准确理解复杂的3D场景,也无法动态推理指令指示的交互位置。 为此,我们提出了RoboRefer,这是一种3D感知的VLM,可以通过监督式微调(SFT)集成一个解耦但专用的深度编码器,首先实现精确的空间理解。 此外,RoboRefer通过强化微调(RFT)推进了广义多步空间推理,并针对空间指代任务量身定制了度量敏感的过程奖励函数。 为了支持SFT和RFT训练,我们引入了RefSpatial,这是一个包含2000万个问答对(2倍于之前的数量)的大规模数据集,涵盖了31种空间关系(之前为15种),并支持复杂的推理过程(最多5步)。 此外,我们引入了RefSpatial-Bench,这是一个具有挑战性的基准,填补了多步推理评估空间指代的空白。 实验表明,SFT训练的RoboRefer实现了最先进的空间理解,平均成功率为89.6%。 经过RFT训练的RoboRefer在RefSpatial-Bench上的平均准确率大幅领先于所有其他基线,甚至超过了Gemini-2.5-Pro 17.4%。 值得注意的是,RoboRefer可以与各种控制策略集成,以在混乱的现实场景中跨各种机器人(例如UR5、G1人形机器人)执行长期、动态的任务。Huggingface链接:Paper page,论文链接:2506.04308

一、研究背景和目的

研究背景

随着机器人技术的快速发展,机器人在日常生活和工业生产中的应用越来越广泛。为了实现更加自然和高效的人机交互,机器人需要具备理解复杂3D场景并根据指令进行精确操作的能力。空间指代作为机器人与3D物理世界交互的基本能力之一,对于机器人执行导航、抓取、放置等任务至关重要。然而,尽管现有的预训练视觉语言模型(VLMs)在视觉理解和语言处理方面取得了显著进展,但它们在准确理解复杂3D场景和动态推理指令指示的交互位置方面仍存在不足。

研究目的

本文旨在解决现有VLMs在空间指代任务中的局限性,提出一种新的3D感知VLM——RoboRefer。RoboRefer旨在通过集成解耦但专用的深度编码器,首先实现精确的空间理解,并通过强化微调(RFT)推进广义多步空间推理。为了支持SFT和RFT训练,本文还构建了一个大规模的数据集RefSpatial和一个具有挑战性的基准RefSpatial-Bench。实验表明,RoboRefer在空间指代任务中取得了显著的性能提升,能够集成到各种控制策略中,以在复杂的现实场景中跨不同机器人执行长期、动态的任务。

二、研究方法

1. RoboRefer模型架构

RoboRefer采用了一种3D感知的VLM架构,主要包括视觉编码器、大型语言模型(LLM)和多模态投影器。视觉编码器由图像编码器和深度编码器组成,分别处理RGB图像和深度图。图像编码器使用siglip-so400m-patch14-448模型,支持448×448分辨率以获取更丰富的视觉细节。深度编码器结构上镜像于图像编码器,并使用其权重进行初始化,将相对深度图编码为特殊图像,提供空间线索以增强3D理解。LLM采用Qwen2LLM主干,已在监督训练中通过大量数据进行了全面微调。多模态投影器将视觉和文本特征融合,用于预测或生成答案。

2. 监督式微调(SFT)

SFT阶段分为两步:深度对齐和空间理解增强。在深度对齐步骤中,仅更新深度投影器,通过RefSpatial(RGB-D)数据集训练,以对齐深度和语言空间。在空间理解增强步骤中,使用RefSpatial(RGB)和RefSpatial(RGB-D)数据集对所有模型参数进行微调,以提高指令跟随和指代能力。此外,还引入了辅助数据集,如指令调优数据、指代数据集和SAT、EmbSpatial基准训练集,以缩小RefSpatial与基准查询之间的分布差距。

3. 强化微调(RFT)

RFT阶段通过修改R1-V算法以支持3D感知架构,对SFT模型进行进一步训练。训练过程中,采用广义策略优化(GRPO)算法从当前策略中采样动作组,并根据可验证的标准为每个采样动作分配奖励。奖励函数包括结果格式奖励(ROF)、点L1奖励(RP)、过程格式奖励(RPF)和准确度奖励(RAcc)。通过奖励函数引导模型学习精确的空间指代和推理能力。

4. RefSpatial数据集构建

为了支持SFT和RFT训练,本文构建了RefSpatial数据集,包含2000万个问答对,覆盖31种空间关系,并支持复杂的推理过程(最多5步)。数据集来源于2D/3D图像和模拟数据,通过多阶段过滤和增强策略确保数据质量。此外,还构建了RefSpatial-Bench基准,用于评估具有多步推理的空间指代能力。

三、研究结果

1. 空间理解基准测试

在CV-Bench、BLINK val、RoboSpatial、SAT和EmbSpatial等公共单步空间理解基准测试中,RoboRefer表现出色。特别是在RoboSpatial基准上,RoboRefer-8B-SFT模型在Top-1和Top-2准确率上均达到最高水平。与Gemini-2.5-Pro等专有模型相比,RoboRefer在多个基准测试中均表现出色,证明了其在空间理解方面的优越性。

2. 空间指代基准测试

在RefSpatial-Bench基准测试中,RoboRefer同样表现出色。SFT训练的RoboRefer在平均成功率上达到89.6%,而RFT训练的RoboRefer进一步提高了性能,平均准确率比所有基线高出很大幅度,甚至超过了Gemini-2.5-Pro 17.4%。这表明RoboRefer在多步空间指代任务中具有显著优势。

3. 模拟器与真实世界评估

在模拟器评估中,RoboRefer在Open6DOR V2位置跟踪任务上表现出色,成功率接近100%。在真实世界评估中,RoboRefer能够集成到UR5机械臂和G1人形机器人的控制策略中,执行复杂的抓取和放置任务。实验结果表明,RoboRefer能够在混乱的现实场景中准确理解指令并执行精确操作。

4. 消融研究

消融研究结果表明,结合2D、3D和模拟数据对于SFT训练至关重要。去除任何一种数据源都会导致性能下降。此外,深度编码器在单步和多步空间指代任务中均表现出显著优势。过程奖励函数也提高了中间感知的准确性,从而提高了整体性能。

四、研究局限

尽管RoboRefer在空间指代任务中取得了显著进展,但仍存在一些局限性:

1. 依赖精确文本描述

RoboRefer依赖于精确的文本描述来精确定位特定对象的位置和放置目标。然而,在实际机器人场景中,人类指令往往模糊不清。解决这些问题通常需要复杂的视觉语言推理和基于人类先验知识的消除过程,这对当前模型构成挑战。

2. 计算效率

RoboRefer在训练过程中需要处理大量的RGB-D数据和复杂的模型架构,导致计算成本较高。尽管在推理阶段可以通过优化算法和硬件加速来提高效率,但在资源受限的环境中部署RoboRefer仍面临挑战。

3. 数据集多样性

尽管RefSpatial数据集已经覆盖了多种空间关系和复杂的推理过程,但仍可能存在数据偏差和局限性。未来需要进一步扩展数据集的多样性和覆盖范围,以提高RoboRefer的泛化能力。

五、未来研究方向

针对RoboRefer的局限性和潜在发展方向,未来研究可以关注以下几个方面:

1. 提高对模糊指令的理解能力

研究如何提高RoboRefer对模糊人类指令的理解能力,通过引入更复杂的视觉语言推理机制和人类先验知识,使模型能够在更广泛的场景中准确执行任务。

2. 优化计算效率

探索更高效的模型架构和训练算法,以降低RoboRefer的计算成本。例如,可以采用模型压缩、量化或知识蒸馏等技术来减小模型大小并提高推理速度。

3. 扩展数据集多样性

继续扩展RefSpatial数据集的多样性和覆盖范围,包括更多的空间关系、复杂的场景布局和不同的任务类型。此外,还可以考虑引入对抗性样本生成技术来提高模型的鲁棒性。

4. 跨领域应用

探索RoboRefer在其他领域的应用潜力,如自动驾驶、智能家居和虚拟现实等。通过跨领域合作和知识共享,推动RoboRefer技术的进一步发展和应用。

5. 结合多模态信息

研究如何结合其他模态的信息(如声音、触觉等)来提高RoboRefer的空间指代和推理能力。多模态信息的融合可以为机器人提供更全面的环境感知和更准确的决策依据。

6. 实时性能优化

针对实时应用场景,研究如何优化RoboRefer的实时性能。通过改进算法、优化硬件配置或采用分布式计算等技术手段,确保RoboRefer能够在实时环境中稳定运行并满足任务需求。

更多推荐