1. 从“看”到“懂”:为什么多模态大模型需要3D空间认知?

如果你用过ChatGPT看图说话,或者让Gemini描述一张照片,你可能会惊叹于它们对画面里“有什么”和“在干什么”的理解能力。一只猫在沙发上睡觉,一个男人在厨房做饭——这些2D层面的语义理解,现在的多模态大模型(MLLM)已经做得相当不错了。

但如果你问它:“沙发离电视柜有多远?”“从我现在站的位置看,书架在桌子的左边还是右边?”“这个房间的长、宽、高大概是多少?”你会发现,模型要么开始“胡言乱语”,要么给出一个非常模糊、甚至完全错误的答案。这就是当前大多数MLLM面临的核心瓶颈:它们能“看懂”画面里的物体和事件,却无法“理解”这些物体在真实三维世界中的空间关系、距离和尺度。

这背后的原因其实很直观。我们人类理解世界,天生就是三维的。我们看到一张桌子的照片,大脑会自动补全它的深度、厚度,以及它和周围物体的空间关系。但模型不同,它们接收的输入是纯粹的二维像素阵列(RGB图像)。传统的视觉编码器,比如CLIP、SigLIP,训练目标是把图像和文本对齐,学到的更多是“语义特征”——这张图里有“猫”和“沙发”的概念,而不是“猫距离相机2米,沙发深度0.8米”这样的几何信息。这就好比只给了模型一本带插画的词典,却没给它一把尺子和一个指南针。

这种能力的缺失,严重限制了MLLM在现实世界中的应用潜力。想象一下,你想让家庭机器人帮你“把茶几上的遥控器拿过来”,机器人不仅需要识别出“茶几”和“遥控器”,更需要精确知道它们在三维空间中的位置,才能规划路径、伸出手臂并抓取。在自动驾驶场景中,车辆需要判断前方障碍物的距离、旁边车道的宽度、行人运动的轨迹,这些都依赖于对三维空间的精确度量理解,而非仅仅是“前面有辆车”这样的语义标签。

最近,有两篇重磅论文——MM-SpatialSpatial-MLLM——就像给MLLM装上了“空间感知”的眼睛和大脑,试图从根本上解决这个问题。它们从不同的技术路径出发,共同指向一个目标:让大模型不仅能“看”到二维的像素,更能“认知”到三维的世界。我仔细研读了这两篇工作,发现它们不是简单的修修补补,而是在数据、架构和训练策略上进行了范式级的创新。接下来,我就结合自己的理解,带你深入看看它们是怎么做的,以及这背后代表了怎样的技术演进趋势。

2. MM-Spatial:为MLLM建立高精度的“3D标尺”

如果说之前的模型是在用“目测”猜距离,那么MM-Spatial的工作,就是率先打造了一把高精度的“激光测距仪”和一套标准的“考核试卷”。它的核心思路非常务实:要想让模型学会3D空间理解,首先得有一个能真正衡量这种能力的、高质量的评测基准,然后用更准确的数据去训练它。

2.1 构建黄金标准:CA-VQA数据集与Benchmark

之前很多研究也尝试让模型理解空间,但大家用的“尺子”都不一样,有的用单目深度估计(就是用一张图猜深度),有的用不太准的传感器数据,导致模型学到的能力参差不齐,也很难公平比较。MM-Spatial一上来就抓住了这个痛点:没有好的评测,就没有好的模型

他们构建了一个全新的数据集和评测基准,叫做CA-VQA。这个数据集厉害在哪里呢?我总结为三个“真”:

  1. 真值准:数据来源于CA-1M数据集,它使用了苹果ARKitScenes和专业的FARO激光扫描仪。这意味着每个场景都有激光雷达扫描出来的高精度深度真值,而不是靠算法猜的。这就好比学测量,老师给你的是游标卡尺量的标准答案,而不是肉眼估的。
  2. 标注细:不仅知道物体在哪,还知道它的精确3D姿态。数据里包含了带旋转的3D边界框(7-DOF OBB),以及超过33万个物体实例的开放词汇标签。甚至还有材质、颜色、形状等丰富的语义信息。这为问出各种角度的问题打下了基础。
  3. 问题全:基于这些丰富的数据,他们设计了七大类空间推理任务,形成了一个非常系统的考核体系:
    • 物体计数:房间里有多少把椅子?
    • 视角关系:从这张照片的视角看,门在窗户的左边吗?
    • 度量估计:这张桌子的长度大约是多少厘米?
    • 物体距离:沙发和茶几之间的距离是多少米?
    • 2D定位:在图片中,电视的中心像素坐标大概是多少?
    • 3D定位:在真实世界坐标系中,台灯的空间坐标(x, y, z)是多少?
    • 多选题:综合性的空间问题,给出几个选项。

为了让评测更公平,他们还用了一个很聪明的“盲过滤”算法。简单说,就是怕有些问题光靠语言常识就能蒙对(比如问“天空在上面还是下面?”)。他们会先用GPT-4o等几个很强的纯文本或基础视觉模型,只给问题不给图,让它们猜答案。如果好几个模型都能蒙对,就把这个样本从评测集里剔除。这样就确保了剩下的问题,模型必须“看图”才能回答,真正考验视觉空间理解能力。

2.2 模型架构与训练:给通用模型注入空间基因

有了好的“考题”,接下来就是训练一个“学霸”。MM-Spatial的模型架构是在一个强大的通用多模态模型(MM1.5)基础上进行改造的。

  • 视觉编码器:他们采用了DFN-CLIP。这个编码器在保持强大语义理解能力的同时,对细节和空间信息更敏感。
  • 处理高分辨率细节:对于单张输入图片,模型会把它划分成4个子图再加1张全局概览图,分别送入编码器。这就像我们看地图,既看全局布局,又放大看关键区域的细节,能更好地捕捉小物体和精确位置。
  • 融合深度信息:这是空间理解的关键。模型有三种方式利用深度信息:
    1. 直接使用:在训练和测试时,可以直接输入激光雷达测得的精确深度值(真值),这是最理想的情况。
    2. 工具调用:可以调用一个现成的单目深度估计算法,生成估计的深度图。
    3. 思维链(CoT)推理:模型完全靠自己,通过分析RGB图像,一步步推理出深度信息。这种方式最考验模型的内在空间认知能力。

训练分两步走:先用海量的通用图文数据训练模型的基础多模态能力,就像让模型先读完“小学和中学”;然后再用我们前面提到的那个高质量的CA-VQA空间数据集进行监督微调(SFT),相当于进行“空间几何专业”的大学培训。

2.3 效果与启示:从“大概齐”到“较真儿”

实测下来,MM-Spatial展现出了令人印象深刻的空间理解提升。在CA-VQA这个新基准上,它大幅超越了之前的模型。更有意思的是对比它自己在使用深度真值、深度估计和纯CoT推理三种模式下的表现:

  • 当允许使用深度真值时,模型在度量估计、3D定位等任务上表现最好,这证明了高质量数据是提升空间认知的基石
  • 即使只用RGB图像进行CoT推理,它的表现也远远好于之前的模型。这说明通过专门的训练,模型确实内化了一些空间推理的“直觉”,不再是瞎猜。

我自己的体会是,MM-Spatial这篇工作像是一位严谨的“基础科学研究者”。它告诉我们,要想让MLLM获得可靠的空间智能,不能停留在用有噪声的、低质量的数据上“炼丹”。必须从源头抓起,构建权威的评测标准干净准确的训练数据。它为解决3D空间认知问题,打下了一个非常坚实的数据和评测基础。然而,它的一个潜在限制是,对精确深度真值(激光雷达数据)的依赖较强,这在只有普通RGB视频的广泛场景下,获取成本很高。这就引出了下一个问题:如果只有手机拍的普通视频,我们还能让模型理解3D空间吗?

3. Spatial-MLLM:让模型从普通视频中“脑补”3D世界

Spatial-MLLM面对的是一个更“接地气”也更困难的挑战:仅凭普通的2D视频输入,就要让模型进行3D空间推理。我们手机里存满了视频,监控摄像头每天产生海量视频流,但绝大多数都没有深度信息。如果模型必须依赖激光雷达或深度相机,那应用范围就太窄了。Spatial-MLLM的目标,就是让模型学会从动态的视频序列中,自己推断出隐藏的3D结构。

3.1 核心创新:双编码器架构与空间感知采样

Spatial-MLLM的解决方案非常巧妙,它没有试图改造一个编码器让它同时干两件事,而是采用了“分工合作”的双编码器架构

  • 2D语义编码器:沿用了一个强大的、预训练好的视觉语言模型(Qwen2.5-VL)的视觉编码器(基于SigLIP2的ViT)。它的任务很专一:从视频帧中提取高层的语义特征——识别物体、场景、动作。这部分参数在训练时是冻结的,直接利用其现成的强大语义理解能力。
  • 3D空间编码器:这是论文的灵魂。他们引入了一个叫做VGGT的模型作为空间编码器。VGGT是一个在大量视频数据上预训练的模型,它的神奇之处在于,能从单目或多视角视频中,恢复出隐式的3D几何结构,比如预测每帧的深度图、估计相机的位姿(移动轨迹)。这部分编码器在训练时同样完全冻结

你可以这样理解:2D编码器是“内容专家”,负责回答“画面里有什么”;3D编码器是“结构专家”,负责回答“这些东西在三维空间里是怎么摆放的,相机是怎么运动的”。两个专家各司其职,通过一个轻量级的“连接器”(MLP)将它们的特征融合起来,再交给大语言模型(LLM)去进行综合推理,回答诸如距离、尺寸、方位等问题。

另一个让我拍案叫绝的设计是空间感知的关键帧采样。视频帧数多,信息冗余大,全送进模型显存吃不消。传统的均匀采样可能会漏掉那些视角独特、包含关键空间信息的帧(比如一个快速扫过房间角落的镜头)。Spatial-MLLM的做法很聪明:

  1. 先对视频均匀采样出128帧作为候选。
  2. 用冻结的VGGT空间编码器,为每一帧预测深度图和相机参数。
  3. 将这些深度图反投影成3D点云,并根据场景尺度自适应地划分成体素(3D空间中的小格子)。
  4. 将问题转化为:从128帧里选出最能代表整个场景的16帧。他们用了一个“贪心最大覆盖”算法,目标是让这16帧的点云所占据的体素,能最大程度地覆盖128帧总点云所占据的体素。

这就好比一个摄影师要选一组最能展现一个建筑全貌的照片,他会选择从正面、侧面、俯视等不同关键角度拍摄的,而不是连续拍一堆几乎相同的正面照。这个策略确保了用最少的计算资源,捕捉最全面的3D空间信息。

3.2 训练策略:从模仿到强化推理

有了好的架构,还需要好的训练方法。Spatial-MLLM使用了SFT(监督微调)+ RL(强化学习) 的两阶段策略,这个组合拳效果显著。

  • 第一阶段:SFT(模仿学习)。他们基于ScanNet室内数据集(RGB-D数据转成的视频),构建了一个包含12万对问答的Spatial-MLLM-120k数据集。问题涵盖了物体计数、尺寸估计、距离、方向等七大类空间任务。在这个数据集上,用标准的交叉熵损失训练模型,让模型学会“模仿”正确的答案。这相当于教模型基础知识。
  • 第二阶段:GRPO(强化学习)。这是让模型“变得更聪明”的关键。他们采用了一种叫Group Relative Policy Optimization的方法。简单说,就是让模型对同一个问题生成多条不同的推理路径(思维链),然后根据一个奖励函数来评判哪条路走得更好。奖励函数针对不同类型的答案(数值型、多选型、文本型)进行了专门设计。为了启动这个强化学习过程,他们先用一个超大的模型(Qwen2.5-VL-72B)生成了一些高质量的推理示例作为“种子”。这个过程鼓励模型不仅要答对,还要有逻辑清晰、步骤合理的推理过程,从而显著提升了复杂空间推理的准确性。

3.3 效果与启示:解锁纯视频输入的3D理解

在多个标准空间推理基准(如ScanQA、SQA3D,以及更具挑战性的VSI-Bench)上,Spatial-MLLM在“仅使用视频输入”的模型中达到了最先进的水平。这证明了它的双编码器架构和训练策略是行之有效的。

在我看来,Spatial-MLLM更像是一位“工程实践家”。它直面了“只有普通视频”这一最大现实约束,通过巧妙的模型设计(利用冻结的预训练专家模型)和高效的算法(空间感知采样),在不大幅增加数据获取成本和计算开销的前提下,显著提升了模型的空间智能。它开辟了一条新路:无需昂贵的3D传感器,仅凭海量存在的2D视频,也能训练出具备强大3D空间认知能力的MLLM。这对于机器人、增强现实(AR)等应用来说,意义重大。

4. 对比与融合:两条路径,一个未来

把MM-Spatial和Spatial-MLLM放在一起看,非常有意思。它们代表了提升MLLM空间认知能力的两种不同但互补的技术范式。

我们可以用一个简单的表格来对比它们的核心思路:

特性 MM-Spatial Spatial-MLLM
核心目标 建立高精度3D空间评测基准,用精准数据提升模型度量能力 实现仅从2D视频中进行3D空间推理
数据依赖 强依赖精确的3D真值(激光雷达深度、3D标注) 仅需普通RGB视频,利用预训练模型恢复几何
架构核心 改进的通用视觉编码器 + 深度信息融合机制 双编码器(语义+空间冻结专家)+ 动态关键帧采样
训练重点 高质量数据监督微调(SFT) SFT + 强化学习(RL)优化推理链
优势 空间度量精度高,评测标准严谨统一 适用性广,成本低,易于扩展到海量视频数据
挑战 高质量3D数据获取成本高,难以大规模推广 对复杂、遮挡严重或纹理缺失场景的几何恢复仍有挑战

MM-Spatial走的是“自上而下”的路线。它先定义了什么是好的空间认知(通过CA-VQA基准),然后利用能获得的最优质数据去逼近这个目标。它追求的是精确性和可靠性,为领域树立了一个黄金标准。

Spatial-MLLM走的是“自下而上”的路线。它从最广泛可得的视频数据出发,利用先进的预训练模型(VGGT)作为“几何先验”,让模型学会从动态视觉信息中“脑补”出3D结构。它追求的是实用性和可扩展性

那么,未来的方向在哪里?我认为必然是两者的融合

  1. 数据驱动的融合:我们可以利用MM-Spatial这类方法产生的精准标注数据,来进一步微调或校准像Spatial-MLLM这类从视频中学习几何的模型,提升其度量精度。
  2. 架构上的借鉴:MM-Spatial中处理高分辨率细节和融合多源深度信息的思想,可以借鉴到视频模型中,以处理更精细的空间查询。而Spatial-MLLM的双编码器、冻结专家模型思路,也为如何在通用MLLM中高效引入空间模块提供了参考。
  3. 训练策略的互补:SFT+RL的训练范式被证明对复杂推理任务非常有效,这同样可以应用到需要精确数值输出的空间度量任务中,结合MM-Spatial的高质量数据,可能会产生更强大的模型。

5. 重塑未来:空间智能将如何改变人机交互

当MLLM真正具备了可靠的空间认知能力,它就不再只是一个聊天机器人或者图片描述工具,而会进化成一个能够理解并与物理世界交互的智能体。这种变革的影响是深远的。

家庭服务机器人领域,机器人将能真正理解“把餐桌左边第二个抽屉里的剪刀拿过来”这样的指令。它需要识别“餐桌”、“抽屉”、“剪刀”,更需要理解“左边第二个”的空间序数关系,以及抽屉的3D位置以便打开。Spatial-MLLM的技术可以让机器人仅通过自身的摄像头就能理解家庭环境布局。

对于自动驾驶,车辆对周围环境的理解将从当前的“物体检测与跟踪”层面,深入到“场景的3D重建与推理”层面。不仅能知道旁边有辆车,还能更准确地估计它的速度、距离,预测其可能的轨迹,甚至理解复杂路口的三维拓扑结构,做出更安全、更拟人化的决策。

增强现实(AR)与混合现实(MR) 中,设备需要将虚拟物体无缝、稳定地锚定在真实世界中。这需要极其精确的对现实场景的3D理解。具备空间智能的MLLM可以作为AR系统的“大脑”,实时理解场景的几何和语义,指导虚拟物体的放置、遮挡和交互,让《钢铁侠》中的全息界面离我们更近一步。

甚至在我们日常的内容创作中,你可以对一段视频说:“帮我把从左向右飞过的那只鸟的轨迹用红线标出来”,或者“估算一下这个房间的装修大概需要多少桶油漆”。模型需要理解时空中的运动、物体的尺寸和空间的体积。

我过去在尝试将AI与智能硬件结合时,最深的一个感触是,很多失败不是算法不精,而是AI对物理世界的“无知”造成的。一个机械臂可能会因为几厘米的误差而打翻杯子,一个扫地机器人可能会在复杂的桌椅腿中困住。MM-Spatial和Spatial-MLLM所代表的,正是让AI从“数字世界的智者”迈向“物理世界的行者”的关键一步。这条路还很长,比如如何应对光照剧烈变化、严重遮挡、非刚性物体等极端场景,如何将这种能力高效地部署到资源有限的边缘设备上,都是需要持续攻关的难题。但毫无疑问,我们已经看到了清晰的方向和令人兴奋的曙光。下一次当你再问AI关于空间的问题时,它的回答,或许会超乎你的想象。

更多推荐