ICCV 2025 | Mamba-3VL:单一模型攻克18类异构任务,重新定义具身智能大模型能力边界
论文链接:https://openaccess.thecvf.com/content/ICCV2025/papers/Wang_Mamba-3VL_Taming_State_Space_Model_for_3D_Vision_Language_Learning_ICCV_2025_paper.pdf(ICCV’25)
当具身智能从实验室走向真实场景,“任务适配性” 始终是横亘在通用化道路上的核心壁垒:一个具身模型能否打破 “单任务专精” 的局限,同时搞定感知、理解、交互、生成等多类型异构任务?其能力边界究竟能延伸至何种程度?
ICCV 2025 收录的论文《Mamba-3VL: Taming State Space Model for 3D Vision-Language Learning》给出了答案。来自清华大学、上海交大人工智能学院、腾讯 ARC Lab、Anyverse Intelligence(无界动力)等机构的团队,将状态空间模型Mamba引入 3D 视觉-语言学习,打造出通用具身大模型 Mamba-3VL。
该模型不仅凭借三大核心方法创新突破技术瓶颈,更精准支持 18 类异构任务(附完整任务清单),从基础 3D 感知到高级具身交互全覆盖,系统性探索并刷新了具身模型的能力上限!
一、核心方法创新:三大技术突破破解 3D - 语言异构任务适配难题
传统具身模型多依赖 Transformer 架构,但面临两大致命短板:
- Transformer 的二次方计算复杂度,难以处理 3D 点云的稀疏高维数据与长序列语言指令;
- 固定的注意力机制无法灵活适配感知、生成、交互等差异巨大的异构任务,导致 “适配一类任务就要重构一次模块”。
Mamba-3VL 的突破性在于,以 Mamba(状态空间模型)为核心架构,搭配三大原创技术设计,彻底解决了异构任务适配痛点,实现 “效率、性能、通用性” 三者兼得:

(一)创新点 1:多模态 Mamba Mixer 模块 —— 重构3D -语言交互范式
针对 3D 空间关系建模与跨模态融合难题,该模块创新设计 “双扫描 + 通道扭曲” 机制对点云,视觉,语言多种模态进行高效融合:
- 关系优先空间扫描:融合近邻实例扫描(NIS)与远距实例扫描(FIS),NIS 捕捉局部空间关联(如 “相邻物体”“接触关系”),FIS 强化长程依赖理解(如 “场景远端物体关联”),解决 3D 点云无序性导致的空间关系丢失问题;
- 通道扭曲跨模态融合:将 3D 实例查询与文本提示嵌入按通道级联,构建混合特征链,通过通道-wise 扫描让模型在每个空间位置都能感知任务上下文,实现视觉几何与语言语义的深度绑定,完美适配生成、推理等不同任务的模态交互需求。
(二)创新点 2:实例感知动态位置适配器(IDPA)—— 精细化空间语义建模
为解决传统固定位置嵌入无法适配不同任务空间精度需求的问题,IDPA 实现 “几何先验 + 语义调制” 双驱动的动态位置编码:
- EdgeConv 几何嵌入:通过 KNN 算法构建局部物体代理,利用 EdgeConv 层融合邻域特征,将 3D 物体的相对距离、朝向等几何先验注入位置嵌入,提升空间关系建模精度;
- 语言调制实例适配器(LISA):基于文本提示的语义信息,动态扭曲 3D 实例的空间特征,让位置嵌入与任务上下文对齐(如 “寻找红色物体” 时,优先强化红色物体的位置表征),大幅提升异构任务的适配灵活性。
(三)创新点 3:统一查询解码框架 + 多任务输出头 —— 全任务兼容的架构设计
为避免多任务适配时的模块重构,模型采用 “统一输入 - 灵活输出” 的设计思路:
- 通用查询生成:将点云、多视角图像、体素等 3D 数据统一编码为实例查询,搭配文本提示编码为任务查询,通过堆叠 Mamba Mixer 与 IDPA 层,实现所有任务的统一特征提取;
- 多任务输出头:设计三大通用输出头 —— 分割头(处理分割类任务)、Grounding头(处理视觉Grounding任务)、生成头(处理描述生成、对话交互任务),通过多任务联合训练,让模型无需修改架构即可适配不同类型任务,兼顾训练效率与推理通用性。
二、18 类异构任务完整清单!具身模型能力边界大揭秘
论文通过系统性实验,验证了 Mamba-3VL 在 “3D 视觉 - 语言基础任务→高级具身交互任务” 全链路的通用性,覆盖 4 大任务维度、18 类具体异构任务(每类任务均附清晰定义与应用场景),且全部实现 SOTA 级性能:

(一)3D 视觉 - 语言基础理解任务(6 类)—— 筑牢具身智能的 “感知与理解基石”
- 单目标指代分割:根据文本指令(如 “橙色地毯旁的木质书架”),精准分割 3D 场景中对应的单个物体;
- 多目标指代分割:响应复杂指令(如 “沙发旁的咖啡桌和书架上的黑色背包”),同时分割多个目标物体;
- 边界框引导指代分割:结合文本指令与边界框提示,实现更高精度的 3D 物体分割;
- 单目标视觉Grounding:将文本描述与 3D 场景中的单个物体精准匹配(如定位 “卧室里的圆形床头柜”);
- 多目标视觉Grounding:一次性匹配多个文本描述与对应的 3D 物体,支持复杂场景的多目标定位;
- 3D 密集描述生成:自动为 3D 场景中的物体生成详细描述,涵盖颜色(如 “白色床垫”)、形状(如 “矩形书桌”)、空间关系(如 “浴缸右侧的马桶”)。
(二)3D 语言推理与问答任务(4 类)—— 赋予具身智能 “逻辑思考能力”
- 基础 3D 问答(QA):解答与 3D 场景相关的事实性问题(如 “桌子周围有几把椅子?”“垃圾桶是什么颜色?”);
- 情境推理问答:处理需要逻辑推理的复杂问题(如 “面对白板时,我的右侧是否有垃圾桶?”“烤箱数量是奇数还是偶数?”);
- 多跳推理问答:通过多步逻辑推导回答问题(如 “书架左侧的桌子上,靠近窗户的物品是什么?”);
- 3D 场景对话生成:与人类进行场景相关的自然对话,如回应 “描述客厅的家具”“我想整理厨房,该怎么做?” 等指令。
(三)3D 实例分割任务(2 类)—— 强化具身智能的 “精细感知能力”
- 闭集 3D 实例分割:对已知类别的 3D 物体进行精准分割,如识别并分割场景中的 “床、沙发、桌子” 等常见物体;
- 开集 3D 实例分割:无需重新训练,即可分割未见过的类别物体,适配开放场景的感知需求。
(四)高级具身交互与规划任务(6 类)—— 迈向 “能行动、会规划” 的实用具身智能
- 任务规划:根据人类指令生成多步骤执行计划(如 “整理客厅”→“1. 摆放椅子面向桌子;2. 清理桌面杂物;3. 擦拭桌椅;4. 检查照明温度”);
- 具身导航:根据文本指令规划移动路径(如 “从入口出发,前往东北角落靠近床的椅子”),在 Habitat 等仿真环境中实现高成功率导航;
- 机器人操作:完成复杂的物理世界操作任务,如 “将蓝黑相间的运动鞋装进棕色盒子”“把积木放入碗中”,在 CLIPort 机器人平台上表现优异;
- 3D 场景对话交互:进行场景感知型对话,如回应 “我想给卧室加些装饰,有什么建议?”“描述卧室里的物品” 等开放式指令;
- 跨模态检索:支持 “文本→3D 物体”“3D 物体→文本” 双向检索,如通过 “圆形咖啡桌” 检索对应 3D 物体,或为 3D 物体生成检索关键词;
- 开放场景适配任务:无需大幅微调,即可适配室内家居、办公场景、工业环境等不同异构场景的交互需求。
三、性能与泛化双突破!具身智能的实用化新起点
Mamba-3VL 不仅凭借三大方法创新实现 18 类异构任务全覆盖,更在核心 benchmark 上刷新性能纪录:

- 在 ScanRefer、Nr3D、Sr3D 等 3D 视觉接地数据集上,均超越 PQ3D 等 SOTA 模型,ScanRefer 数据集 Unique 指标达 79.9%、Multiple 指标达 48.9%;
- 在 Scan2Cap 密集描述任务中,Cider@25 指标达 91.2%、Cider@50 指标达 84.0%,生成描述更精准、更连贯;
- 在机器人操作与具身导航任务中,unseen 任务成功率远超 CLIPort、LEO 等模型,展现出极强的泛化能力;
- 线性计算复杂度较 Transformer 模型效率提升显著,处理大规模 3D 场景时无性能衰减。
更重要的是,Mamba-3VL 仅需微调 1% 的 LLM 参数,即可快速适配新的具身任务,为后续低成本拓展任务边界提供了可能。




四、研究意义:重新定义通用具身智能的发展方向
Mamba-3VL 的研究不仅在技术上实现了 “18 类异构任务全覆盖” 的突破,更在理念上为具身智能的发展提供了关键指引:
- 打破任务壁垒:证明具身模型可以通过统一架构 + 模块化创新,适配 “感知 - 理解 - 推理 - 交互” 全链路任务,无需为单一任务设计专属模块;
- 效率与性能兼得:线性计算复杂度解决了传统模型 “处理大规模 3D 数据效率低下” 的痛点,为真实场景部署奠定基础;
- 拓展能力边界:首次系统性验证了具身模型处理 18 类异构任务的可行性,为未来探索 “百任务、千任务通用具身智能” 提供了蓝本。
相关技术可直接应用于机器人交互、自动驾驶场景理解、虚拟现实、智能家居控制等领域。
随着 Mamba-3VL 的出现,具身智能正从 “单场景专精” 迈向 “全场景通用”,一个能够灵活应对 18 类异构任务的 “全能型” 具身时代,正在加速到来!
具身求职内推来啦
国内最大的具身智能全栈学习社区来啦!
推荐阅读
从零部署π0,π0.5!好用,高性价比!面向具身科研领域打造的轻量级机械臂
工业级真机教程+VLA算法实战(pi0/pi0.5/GR00T/世界模型等)
具身智能算法与落地平台来啦!国内首个面向科研及工业的全栈具身智能机械臂
VLA/VLA+触觉/VLA+RL/具身世界模型等!具身大脑+小脑算法与实战全栈路线来啦~
MuJoCo具身智能实战:从零基础到强化学习与Sim2Real
Diffusion Policy在具身智能领域是怎么应用的?为什么如此重要?
1v1 科研论文辅导来啦!
更多推荐
所有评论(0)