作者:Wenlong Liang, Rui Zhou, Yang Ma, Bing Zhang, Songlin Li, Yijia Liao, Ping Kuang单位:电子科技大学论文标题:Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning论文链接:https://arxiv.org/pdf/2508.10399v1主要贡献从具身智能决策和学习的角度,聚焦于大模型的赋能作用:对于层次化决策,具身智能涉及高级规划、低级执行和反馈增强,论文对相关工作进行了回顾和分类;对于端到端决策,具身智能依赖于视觉 - 语言 - 行动(VLA)模型,论文回顾了 VLA 模型及其增强方法。同时,论文还回顾了大模型如何增强模仿学习中的策略和策略网络构建,以及强化学习中的奖励函数设计和策略网络构建。对具身智能决策和学习的全面综述:论文不仅回顾了层次化和端到端决策范式,还比较了它们的优缺点。在具身智能学习方面,除了模仿学习和强化学习,还涉及了迁移学习和元学习。此外,论文还探讨了世界模型及其在决策和具身智能学习中的作用。采用双重分析方法,深入洞察:通过水平分析,对不同的方法(如不同的大模型、层次化与端到端决策、模仿学习与强化学习等)进行回顾和比较;通过垂直分析,追溯核心模型或方法的演变,详细阐述其起源、后续进展和开放性挑战。这种双重分析方法既提供了宏观层面的概览,又深入洞察了具身智能的主流方法。介绍研究背景与目标具身智能的目标:具身智能在这里插入图片描述
(Embodied AI)旨在开发具有物理形态的智能系统,使其能够在真实世界环境中感知、决策、行动和学习,被认为是一种实现人工通用智能(AGI)的有前途的方法。这些智能系统通过与环境的交互来产生真正的智能。面临的挑战:尽管具身智能的研究已经持续了数十年,但要使智能体在开放、无结构和动态的环境中达到人类水平的智能,以执行通用任务仍然是一个挑战。早期的具身智能系统基于符号推理和行为主义,依赖于僵化的预编程规则,导致适应性和智能程度有限。研究进展与现状机器学习的推动:机器学习尤其是深度学习的发展,显著降低了智能体对精确环境建模的依赖,例如视觉引导的规划和基于强化学习的控制,但这些模型通常针对特定任务的数据集进行训练,在泛化和迁移能力方面仍面临挑战。大模型的突破:近年来大模型的突破显著提升了具身智能的感知、交互和规划能力,为通用具身智能体奠定了基础。然而,具身智能领域仍处于起步阶段,面临着泛化、可扩展性和无缝环境交互等挑战。研究的必要性现有研究的不足:现有的综述主要关注大模型本身,对大模型与具身智能体的协同作用关注较少。一些综述涉及这种整合,但倾向于关注组件,而不是系统地分析整体范式以及这些组件如何相互作用以提高智能。此外,由于该领域的快速发展,早期的综述无法跟上最新进展。本研究的定位:本研究聚焦于大模型赋能的具身智能的决策和学习方面,分析和分类研究,找出最新进展,指出剩余的挑战和未来方向,为研究人员提供清晰的理论框架和实践指导。研究贡献与结构研究贡献:本研究的主要贡献包括从具身智能的角度关注大模型的赋能作用,对层次化决策和端到端决策范式进行综合回顾和比较,以及采用双重分析方法深入洞察具身智能的主流方法。研究结构:论文的组织结构清晰,包括引言、大模型和具身智能的基础知识、层次化自主决策、端到端自主决策、具身智能学习、世界模型、面临的挑战和未来展望以及总结等部分。基础知识具身智能具身智能系统的基本组成:具身智能系统通常包含两个主要部分,即物理实体和智能体。物理实体(如人形机器人、四足机器人和智能车辆等)负责执行动作并接收反馈,而智能体则构成了认知核心,实现自主决策和学习。具身智能系统的工作过程:具身智能系统通过解释人类的意图(从语言指令中获取)、主动探索周围环境、感知环境中的多模态元素以及执行任务所需的动作来完成具身智能任务。这一过程模仿了人类的学习和问题解决范式。人类学习与具身智能体的对比:上图展示了人类学习和具身智能体学习的对比。人类通过从各种资源(如书籍、教学材料和在线内容)中学习技能,而具身智能体则通过模仿学习从人类演示或视频数据中获取技能,并通过强化学习在执行任务时优化策略。具身智能的核心:具身智能的核心在于使智能体能够在开放动态环境中自主决策和学习新知识。自主决策可以通过层次化范式(将感知、规划和执行分为不同模块)和端到端范式(将这些功能集成到一个统一框架中)实现。在这里插入图片描述
具身智能学习则通过模仿学习和强化学习实现,使智能体能够通过与环境的长期交互来优化行为策略。大模型大模型的定义与分类:大模型包括大型语言模型(LLM)、大型视觉模型(LVM)、大型视觉语言模型(LVLM)、多模态大型模型(MLM)和视觉 - 语言 - 行动(VLA)模型等,它们在架构、数据规模和任务复杂性方面取得了显著突破,展现出强大的感知、推理和交互能力。大型语言模型(LLM):BERT:2018年,谷歌发布的BERT是一个双向Transformer模型,通过自监督任务进行预训练,在自然语言处理任务上取得了显著成果。GPT系列:OpenAI发布的GPT系列模型,基于Transformer架构,通过自回归训练在大规模无监督语料库上生成连贯文本,不断推动了生成模型的发展。GPT-3首次展示了零样本和少样本学习能力,为未来研究铺平了道路。其他模型:如Codex、ChatGPT、PaLM、InstructGPT、Vicuna、Llama系列等,这些模型在语言理解、生成和推理方面不断取得进步,为大语言模型的发展做出了贡献。大型视觉模型(LVM):Vision Transformer(ViT):将Transformer架构应用于计算机视觉领域,将图像划分为固定大小的块,并使用自注意力捕捉全局依赖关系。DINO和DINOv2:基于ViT,采用自监督学习,通过自蒸馏方法生成高质量的图像表示,无需标记数据即可捕捉语义结构。MAE(Masked Autoencoder):利用自监督学习重建被掩盖的视觉输入,能够在大规模未标记图像数据集上进行预训练。SAM(Segment Anything Model):在1100万张图像上进行预训练,支持多种分割任务,如语义分割、实例分割和目标分割,并通过用户反馈进行微调,展现出强大的适应性。大型视觉语言模型(LVLM):CLIP:通过对比学习在大规模图像 - 文本对上训练图像和文本编码器,使配对样本的特征对齐,未配对样本的特征最小化,从而创建与文本语义相匹配的视觉表示。在这里插入图片描述
BLIP和BLIP-2:采用双向自监督学习融合视觉和语言数据,通过“引导”策略提高预训练效率,在视觉问答和图像描述生成等任务上表现出色。Flamingo:在少样本学习方面表现出色,能够处理多模态数据,即使在样本数量极少的情况下也能支持跨模态推理。GPT-4V:将传统的GPT扩展到处理联合图像 - 文本输入,能够生成图像描述并回答视觉问题,展现出强大的多模态推理能力。DeepSeek-V3:采用动态稀疏激活架构,引入混合路由机制,结合任务特定专家和动态参数分配,实现了高计算效率的跨模态融合。多模态大型模型(MLM):Video-Chat:通过对话建模增强视频分析,在动态视觉内容理解方面表现出色。VideoLLaMA:在Llama架构的基础上,整合视觉和音频输入,实现强大的视频内容分析。Gemini:为多模态设计,能够高效处理文本、图像和音频,用于图像描述和多模态问答。PaLM-E:将多模态输入转换为统一向量,然后输入到PaLM模型中进行端到端训练,展现出强大的多模态能力。视觉 - 语言 - 行动(VLA)模型:RT-2:提出了VLA的概念,利用预训练的视觉 - 语言模型将动作空间离散化为动作标记,并通过联合微调互联网数据和机器人数据实现泛化。其他VLA模型:如BYO-VLA、3D-VLA、PointVLA等,这些模型在视觉输入处理、动作生成准确性和计算效率等方面进行了改进,以提高VLA模型的性能。大模型的通用能力增强大模型的局限性:大模型在推理能力、幻觉现象、计算成本和任务特异性方面仍存在局限性。增强方法:上下文学习:通过精心设计的提示使大模型能够实现零样本泛化,无需额外训练和调整即可处理新任务。最近的研究集中在优化提示技术上,如自动化提示生成和动态示例选择,以提高ICL在不同领域的鲁棒性。X of Thoughts:包括链式思考(Chain of Thoughts, CoT)和树形思考(Tree of Thoughts, ToT)等推理框架,通过在提示中加入中间推理步骤或探索多种推理路径来提高大模型解决复杂问题的能力。图结构的思考(Graph of Thoughts, GoT)进一步扩展了ToT,采用图结构来表示中间状态和关系,提高了非线性推理的灵活性。检索增强生成:从外部知识库中检索相关信息,并将其输入到大模型中以产生准确的响应。这种方法可以缓解大模型知识过时或不完整的问题,确保其能够访问最新和特定领域的信息。最近的进展包括混合检索机制和微调策略,以提高检索的准确性和效率。推理与行动:将推理与行动执行相结合,使大模型在执行任务时能够产生明确的推理痕迹。通过要求大模型在行动前阐述其思考过程,ReAct提高了决策的透明度,并在动态交互环境中提高了性能。强化学习从人类反馈:将人类偏好整合到大模型的训练中,使其与人类价值观和意图保持一致。使用人类反馈作为奖励信号,RLHF提高了模型生成有帮助、无害和诚实输出的能力。通过提示模型生成多种响应,人类可以根据质量和安全性对其进行排名或评分,并使用这些反馈来优化模型的未来生成,确保其连贯性和伦理考虑。模型上下文协议:由Anthropic引入的开源标准,为大模型与外部数据源、工具和服务的交互提供了标准化接口。MCP提高了大模型的互操作性和适应性,使其能够与各种外部系统无缝集成。最近的开发集中在扩展其与多模态输入的兼容性,并优化其在实时环境中的性能。具身大模型具身大模型的作用:大模型通过整合多种模态(如文本、视觉、音频和触觉),为具身智能体提供了强大的感知、推理和行动能力,从而在复杂环境中构建复杂的系统,发挥着在自主决策和具身智能学习中的重要作用。不同大模型对具身智能体的赋能:LLM(大型语言模型):通常作为认知骨干,处理自然语言输入,理解上下文细微差别,并生成可操作的响应。LVM(大型视觉模型):通常用于感知任务或在任务执行过程中作为可调用的API,利用预训练的视觉编码器预测对象类别、姿态和几何形状。LVLM和MLM(大型视觉语言模型和多模态大型模型):通过整合LLM与多种模态,进一步增强智能体的能力,使智能体能够理解跨文本、视觉和音频的人类指令,生成与上下文相关的响应或行动。VLA模型:学习从视觉和语言输入到可执行行动的端到端映射,这种简化的流程使智能体能够解释复杂指令、感知动态环境并执行精确的物理运动,从而实现更强大和多功能的具身智能系统。分层自主决策高层规划高层规划的目标是根据任务指令和感知到的环境信息生成合理的计划。传统方法依赖于基于规则的规划,例如使用规划领域定义语言(PDDL)进行描述,通过启发式搜索规划器验证动作的前提条件并选择最优动作序列。在这里插入图片描述
然而,这些方法在非结构化或动态环境中适应性较差。大模型凭借其零样本和少样本泛化能力,为解决这一挑战提供了新的思路,主要分为以下几种方式:结构化语言规划:一种策略是直接利用大语言模型(LLM)作为规划器,借助其泛化能力生成计划。但这种方法可能会因为 PDDL 的严格语法和语义导致生成不可行的计划。为了解决这一问题,LLV 引入了外部验证器,如 PDDL 解析器或环境模拟器,通过错误反馈迭代优化 LLM 生成的计划。另一种策略是利用 LLM 自动化生成 PDDL 文件,减少人工建模的工作量。例如,LLM+P 让 LLM 创建 PDDL 域文件和问题描述,然后由传统规划器求解,结合了语言理解和符号推理的优势。自然语言规划:自然语言提供了更大的表达灵活性,允许 LLM 将复杂任务分解为子任务。然而,自然语言规划容易生成不可行的计划,因为其输出往往基于经验而非实际环境。例如,当指令为“打扫房间”时,LLM 可能会提出“取出吸尘器”,而没有验证吸尘器是否可用。SayCAN 方法将 LLM 与强化学习结合,通过评分机制过滤掉不切实际的动作,选择高价值的动作。Text2Motion 进一步增强了空间交互任务的规划,通过几何可行性检查避免不合理的动作。Grounded Decoding 方法则通过灵活的解码策略,将 LLM 的输出与实时环境状态相结合,动态生成可行的动作。编程语言规划:编程语言规划将自然语言指令转换为可执行的程序,利用代码的精确性定义空间关系、函数调用和控制 API,实现动态高层规划。例如,CaP 将任务规划转换为代码生成,生成具有递归定义函数的 Python 风格程序,扩展功能库以适应新任务。Instruct2Act 方法则结合多模态基础模型,统一感知、规划和控制,利用视觉 - 语言模型进行准确的对象识别和空间关系理解,为 LLM 提供精确的环境感知信息,从而生成更准确的规划。低层执行低层执行是将高层规划生成的子任务转化为具体的物理动作,通常依赖于预定义的技能列表。这些技能列表是执行具体任务所需的基本能力或动作模块,例如感知相关技能(如目标识别和障碍物检测)和运动相关技能(如目标抓取和移动)。低层执行的实现涉及控制理论、机器学习和机器人工程学,其发展经历了从传统控制算法到基于学习的控制,再到模块化控制的过程:传统控制算法:传统控制算法主要利用经典的基于模型的技术,具有清晰的数学推导和物理原理。例如,比例 - 积分 - 微分(PID)控制用于调整机器人关节控制的参数以最小化误差;状态反馈控制通常与线性二次调节器(LQR)结合,利用系统状态数据优化性能;模型预测控制(MPC)通过滚动优化预测状态并生成控制序列,适用于无人机路径跟踪等任务。这些传统控制算法具有数学可解释性、低计算复杂度和实时性能,能够可靠地执行任务。然而,它们在动态环境中适应性较差,难以处理高维不确定系统动态,需要与数据驱动技术(如深度学习和强化学习)结合以增强泛化能力。基于学习的控制:机器人学习是机器学习和机器人学的交叉领域,使智能体能够从大量数据(包括人类演示、仿真和环境交互)中开发控制策略和低层技能。模仿学习通过从专家演示中学习策略,能够快速开发策略并减少探索时间。例如,Embodied-GPT 利用 7B 语言模型进行高层规划,并通过模仿学习将计划转换为低层策略。强化学习则通过迭代试验和环境奖励优化策略,适用于高维动态环境。Hi-Core 采用双层框架,其中 LLM 设置高层策略和子目标,而强化学习在低层生成具体动作。这些基于学习的控制方法具有强大的适应性和泛化能力,但训练通常需要大量数据和计算资源,且策略的收敛性和稳定性难以保证。模块化控制:模块化控制将 LLM 与预训练的策略模型(如 CLIP 进行视觉识别和 SAM 进行分割)结合。通过为 LLM 配备这些工具的描述,它们可以在任务执行过程中动态调用。例如,DEPS 将多个不同模块结合,根据任务需求和预训练模型的自然语言描述完成检测和动作;PaLM-E 将 LLM 与视觉模块结合用于分割和识别;CLIPort 利用 CLIP 进行开放词汇检测。这种模块化方法通过利用共享的预训练模型,确保了在多样化任务中的可扩展性和可重用性。然而,挑战依然存在。首先,调用外部策略模型可能会引入额外的计算和通信延迟,尤其是在实时任务(如自动驾驶)中,这种延迟可能严重影响响应效率。其次,智能体的整体性能高度依赖于预训练策略模型的质量。如果策略模型存在缺陷(例如泛化能力不足或训练数据存在偏差),即使 LLM 具备强大的规划能力,执行结果仍可能不尽如人意。因此,优化模块之间的通信效率、提高策略模型的鲁棒性以及设计更智能的调用决策机制至关重要。反馈与增强分层决策架构通过任务描述和示例提示引导任务规划。为了确保任务规划的质量,需要引入闭环反馈机制。反馈可能来自大模型自身、人类或外部环境:大模型的自我反思:大模型可以作为任务规划器、评估器和优化器,从而在没有外部干预的情况下迭代优化决策过程。智能体获取动作反馈,自主检测和分析失败的执行情况,并从以往的任务中持续学习。通过这种自我反思和优化机制,大模型能够生成稳健的策略,在长序列规划、多模态任务和实时场景中具有优势。自我反思可以通过两种方式实现:基于执行失败或前提条件错误重新提示:DEPS 采用“描述、解释、规划、选择”框架,LLM 描述执行过程,解释失败原因,并重新提示以纠正计划缺陷,增强交互性。内省机制:Self-Refine 使用单个 LLM 进行规划和优化,通过多次自我反馈循环独立评估和优化输出。Reflexion 在此基础上进一步引入长期记忆,存储评估结果,并结合多种反馈机制增强计划的可行性。ISR-LLM 在基于 PDDL 的规划中应用迭代自我优化,生成初始计划,进行合理性检查,并通过自我反馈优化结果。Voyager 针对编程语言规划,通过从执行失败中提取反馈构建动态代码技能库,使智能体能够适应复杂任务。人类反馈:人类反馈通过建立与人类的交互式闭环机制增强规划的准确性,使智能体能够根据人类反馈动态调整行为。例如,KNOWNO 引入不确定性测量框架,允许 LLM 识别知识空白,并在高风险或不确定场景中寻求人类帮助。EmbodiedGPT 采用规划 - 执行 - 反馈循环,智能体在低层控制失败时请求人类输入。这种人类反馈与强化学习和自监督优化相结合,使智能体能够迭代优化规划策略,更好地与动态环境条件保持一致。YAY Robot 允许用户通过命令暂停机器人并提供指导,促进实时基于语言的纠正。反馈被记录下来,用于策略微调和定期查询,实现实时和长期改进。IRAP 允许与人类进行交互式问答,以获取特定任务的知识,从而实现精确的机器人控制。环境反馈:环境反馈通过与环境的动态交互增强基于 LLM 的规划。Inner Monologue 将多模态输入转化为语言描述,用于“内心独白”推理,使 LLM 能够根据环境反馈调整计划。TaPA 整合开放词汇目标检测,为导航和操作定制计划。DoReMi 检测计划与实际结果之间的差异,并利用多模态反馈动态调整任务。在多智能体设置中,RoCo 利用环境反馈和智能体间通信实时纠正机器人臂的路径规划。基于 LLM 的规划通常需要将反馈转换为自然语言。VLM 通过整合视觉输入和语言推理简化了这一过程,避免了反馈转换。ViLaIn 将 LLM 与 VLM 结合,从语言指令和场景观察中生成机器可读的 PDDL,以高精度驱动符号规划器。ViLA 和 Octopus 利用 GPT4-V MLM 从环境反馈中生成计划,整合感知数据以实现强大的零样本推理。Voxposer 进一步利用 MLM 提取空间几何信息,从机器人观察中生成 3D 坐标和约束图,以填充代码参数,从而增强空间精度。端到端自主决策视觉 - 语言 - 行动模型端到端自主决策的核心是将多模态输入(例如视觉观察和语言指令)直接映射到动作输出,而不是像分层决策那样将感知、规划和执行分解为不同的模块。这种决策方式主要通过视觉 - 语言 - 行动(VLA)模型实现,其关键组成部分包括:标记化与表示:VLA 模型使用视觉、语言、状态和动作四种标记类型来编码多模态输入,为基于上下文的动作生成奠定基础。视觉标记和语言标记将环境场景和指令编码为嵌入向量,形成任务和上下文的基础。状态标记捕捉智能体的物理配置,包括关节位置、力矩、夹持器状态、末端执行器姿态以及物体位置等信息。动作标记基于先前的标记自回归生成,代表低层次的控制信号(例如关节角度、力矩、车轮速度)或高层次的运动原语(例如“移动到抓取位置”、“旋转手腕”),使 VLA 模型能够作为语言驱动的策略网络。多模态信息融合:通过交叉模态注意力机制(通常在 Transformer 架构内实现),将视觉标记、语言标记和状态标记融合为统一的嵌入向量,用于决策。该机制动态权衡每种模态的贡献,使 VLA 模型能够基于任务联合推理对象语义、空间布局和物理约束。动作解标记化:将融合后的嵌入向量传递给自回归解码器(通常在 Transformer 架构内实现),以生成一系列对应于低层次控制信号或高层次运动原语的动作标记。动作生成可以是离散的或连续的。在离散动作生成中,模型从预定义的动作集合中选择动作,例如特定的运动原语或离散化的控制信号,并将这些动作映射为可执行命令。在连续动作生成中,模型输出精细的控制信号,通常通过最终的 MLP 层从连续分布中采样,从而实现精确的操作。VLA 模型的增强尽管 VLA 端到端决策架构具有强大的功能,但在复杂的具身任务中仍存在一些限制。为了应对这些挑战,研究人员提出了以下增强方法:感知能力增强:为了提高感知能力,BYO-VLA 优化了标记化和表示组件,通过运行时观察干预机制,利用自动化的图像预处理过滤掉由遮挡物体和杂乱背景引起的视觉噪声。在这里插入图片描述
TraceVLA 关注多模态信息融合组件,引入视觉轨迹提示到交叉模态注意力机制中。通过将轨迹相关数据与视觉、语言和状态标记相结合,TraceVLA 增强了时空感知能力,从而能够精确预测动作轨迹。对于三维感知,3D-VLA 结合三维大模型和基于扩散的世界模型,处理点云和语言指令,生成语义场景表示,并预测未来的点云序列,从而在复杂的三维环境中超越二维 VLA 模型,更好地理解三维物体之间的关系。轨迹动作优化:离散动作空间限制了未定义或高精度动作的表达。基于扩散的增强方法可以通过建模复杂的机器人行为来提供更平滑、更可控的动作。Octo 结合 Transformer 和扩散模型来生成机器人动作。它通过 Transformer 处理多模态输入,提取视觉 - 语言特征,并使用条件扩散解码器基于这些特征迭代优化动作序列,从而生成平滑且精确的轨迹。通过模块化设计和高效的微调,Octo 实现了跨任务泛化,仅需少量特定于任务的数据。Diffusion-VLA 将语言模型与扩散策略解码器结合到统一框架中。它使用自回归语言模型解析语言指令并生成初步的任务表示,然后通过扩散策略解码器优化动作序列。Diffusion-VLA 在整个框架内进行端到端训练,联合优化语言理解和动作生成。扩散过程在每一步纠正自回归输出中的不连续性,确保动作轨迹的平滑性和鲁棒性。与 Octo 相比,Diffusion-VLA 的计算成本更高,但更适合于需要深度语义 - 动作关联的复杂任务。训练成本降低:VLA 模型在复杂任务中需要较高的计算成本,这限制了其在资源受限的具身平台上的应用。为了降低训练成本,研究人员提出了优化方法,以提高推理速度、数据效率和实时性能,同时保持任务性能。π0 利用流匹配来表示复杂的连续动作分布。与扩散模型中使用的多步采样相比,π0 通过连续流场建模优化动作生成过程,从而减少计算开销并提高实时性能。与 Diffusion-VLA 和 Octo 相比,π0 在计算效率和控制精度方面的改进使其更适合于资源受限的具身应用,尤其是需要高精度连续控制的任务。此外,TinyVLA 通过设计轻量级的多模态模型和扩散策略解码器实现了推理速度和数据效率的显著提升。OpenVLA-OFT 使用并行解码而不是传统的自回归生成,在单次前向传递中生成完整的动作序列,而不是逐个生成,从而减少了推理时间。主流 VLA 模型近年来出现了大量的 VLA 模型,具有不同的架构和能力。为了更好地理解和部署这些模型,上表根据架构、贡献和能力对它们进行了总结和比较。以下是一些主要的 VLA 模型:RT-2:开创性的大规模 VLA 模型,通过在基于互联网的视觉问答和机器人数据集上进行联合微调,解锁了先进的新兴功能。Seer:通过扩展预训练的文本到图像扩散模型,从语言指令中高效预测未来视频帧。Octo:首个在大规模多机器人数据集(800k + 轨迹)上训练的通用策略模型,是一个强大的开源基础模型。Open-VLA:开源替代 RT-2,具有优越的参数效率和强大的泛化能力,通过高效的 LoRA 微调实现。Mobility-VLA:利用演示视频作为环境先验,使用长上下文 VLM 和拓扑图进行基于复杂多模态指令的导航。Tiny-VLA:在速度和精度上超越 Open-VLA,消除了预训练需求,实现了 5 倍更快的推理速度,适用于实时应用。Diffusion-VLA:利用基于扩散的动作建模实现精确控制,具有更强的情境意识和可靠的序列规划能力。Point-VLA:在长范围和空间推理任务中表现出色,通过保留预训练的二维知识避免重新训练。VLA-Cache:通过在动作解码器中引入动态令牌缓存机制,提高了动作生成的效率和准确性。π0:采用流匹配技术生成平滑、高频(50Hz)的动作轨迹,适用于实时控制。π0 Fast:引入基于离散余弦变换(DCT)的高效动作标记化方案,显著加快了训练速度,适用于高频率任务。Edge-VLA:为边缘设备优化的 VLA 模型,具有 30 - 50Hz 的推理速度,与 Open-VLA 相比具有可比的性能,适用于低功耗、实时部署。分层与端到端决策的比较分层和端到端决策是实现具身智能自主决策的两种不同范式,它们在设计哲学、实现策略、性能特征、应用领域等方面各有特点。上表对它们进行了详细比较,以下是主要区别:架构:分层:感知依赖于专用模块(例如 SLAM、CLIP),高层规划依赖于结构化语言、自然语言或编程语言,低层执行依赖于预定义的技能列表,反馈通过 LLM 自我反思、人类反馈和环境反馈实现。端到端:将感知、规划和动作生成集成在一个大型神经网络(例如 VLA)中,直接从多模态输入映射到动作,无需模块分解。性能:分层:在结构化任务中表现可靠,但在动态环境中表现有限。端到端:在复杂、开放的任务中具有强大的泛化能力,但依赖于训练数据的质量和多样性。可解释性:分层:具有高可解释性,因为模块设计清晰。端到端:由于神经网络的黑箱特性,可解释性较低,难以分析决策过程。泛化能力:分层:对模块协调问题敏感,可能在未见场景和任务中适应性较低。端到端:在大规模多模态数据集上训练,具有强大的泛化能力,但对训练数据的分布敏感。实时性:分层:由于模块间通信和协调的延迟,在复杂场景中可能产生较长的处理时间。端到端:通过减少模块间的信息传递,最小化处理开销,适合实时应用。计算成本:分层:虽然每个模块的训练成本较低,但模块间的协调需要额外的开销。端到端:端到端训练的计算成本较高,尤其是在大规模数据集上。应用领域:分层:适用于结构化环境中的任务,如工业自动化、自动驾驶等。端到端:在复杂、动态的环境中表现更好,例如人机协作、服务机器人等。具身学习具身学习方法具身学习的目标是使智能体能够在与环境的交互中获得复杂技能,并不断优化自身能力,以实现精确的决策和实时适应。具身学习可以通过多种学习策略的协调来实现,主要包括以下几种方法:模仿学习模仿学习允许智能体通过模仿专家的演示快速获得初始策略,是一种高效的学习方法,尤其适用于有高质量数据的任务,如机器人操作。其训练过程是监督式的,使用专家状态 - 动作对(s,a)的数据集,目标是最小化专家动作的负对数似然,从而学习一个策略 π(a|s),使其尽可能接近专家的行为。其目标函数为:其中, 是专家演示的集合,每个演示 包含一系列长度为 L 的状态 - 动作对 (,)。在连续动作空间中,策略 π(·) 通常被建模为高斯分布,目标函数可以通过预测动作和专家动作之间的均方误差(MSE)来近似。模仿学习具有样本效率高的优点,因为它避免了大量的试错,但它对演示数据的质量和覆盖范围高度依赖,在未见场景中表现不佳。通过将模仿学习与强化学习结合,可以解决这一局限性,即用模仿学习初始化策略,然后通过与环境的交互来优化策略,从而提高对未见情况的鲁棒性。强化学习强化学习是具身学习中的主导方法之一,它使智能体能够通过与环境的试错交互来学习策略,非常适合动态和不确定的环境。在每个时间步 t,智能体观察到状态 s,并根据其策略 π(a|s) 选择动作 a。执行动作后,智能体会收到奖励函数 R(s,a,g) 给出的奖励 r,环境根据状态转移概率 T(s′|s,a) 转移到新状态 s′,并给出观察 o′。强化学习的目标函数是最大化预期累积奖励:其中,γ∈[0,1) 是折扣因子,用于平衡即时奖励和长期奖励。强化学习在优化复杂任务的策略方面表现出色,但需要大量的探索,这在计算上是昂贵的。通过将模仿学习与强化学习结合,可以改善这一问题,即用模仿学习提供初始策略以减少探索,然后通过与环境的交互来优化策略。迁移学习当从头开始训练需要大量样本和时间时,可以应用迁移学习来减轻负担。它允许智能体通过在相关目标任务上使用从源任务中学到的知识(如策略、特征或表示)来加速学习。给定一个由状态 s∈S、动作 a∈A 和策略 π(a|s) 定义的源任务,迁移学习将源策略 π_s 适应于具有不同动态或目标的目标任务。目标是最小化源策略 π_s 和目标策略 π_t 之间的差异,通过使用少量目标任务数据对策略进行微调来实现。该过程由目标任务的特定任务损失引导,同时通过 Kullback-Leibler(KL)散度约束策略对齐:其中,θ_t* 表示目标任务的最优策略参数,θ_s 和 θ_t 分别是源策略和目标策略的参数,D_KL 衡量源策略 π_s 和目标策略 π_t 之间的差异,L_t 是目标任务的特定任务损失,λ 是平衡策略对齐和任务性能的正则化参数。此过程确保转移的知识与目标任务的状态转移概率 T(s′|s,a) 和奖励函数 R(s,a,g) 一致。在具身环境中,迁移学习使智能体能够在不同环境和目标之间重用学到的行为,减少训练时间。然而,源任务和目标任务之间的显著差异可能导致负迁移,即由于知识不匹配而导致性能下降。元学习元学习也可以用于具身 AI,使智能体能够学习如何学习,以便能够迅速从少量样本中推断出新任务的最优策略。在每个时间步 t,智能体接收到观察 ρ∈Ω 和目标 g,并根据适应于任务特定动态的元策略选择动作 a,任务特定动态由状态转移概率 T(s′|s,a) 和奖励函数 R(s,a,g) 定义。目标是通过最小化任务特定数据上的损失来优化跨任务的预期性能。在模型无关元学习(MAML)的背景下,这通过学习一组初始模型参数 θ 来实现,这些参数可以快速适应新任务,只需进行少量更新。具体来说,对于一组任务 T_i,MAML 优化元目标如下:其中,θ* 表示最优元策略参数,L_T_i 是任务特定的损失,f_θ 是由参数 θ 参数化的模型,θ_i 是经过梯度更新后的任务特定参数,学习率是 α,外层优化最小化适应后跨任务的预期损失。元学习使智能体能够通过微调预训练模型来快速适应新任务,使用少量演示或交互。元策略可以嵌入到大模型中,并在训练期间进行优化,以处理多样化任务。尽管元学习具有优势,但它需要大量的预训练以及跨任务的大量样本,这在建立通用学习策略时,尤其是当任务在状态空间或动态方面差异显著时,带来了挑战。大模型增强的模仿学习模仿学习的主要目标是通过模仿演示者的动作使智能体达到专家级性能。为了实现这一目标,策略网络 π 需要能够准确地将观察 o 和目标 g 映射到动作 a,以确保在复杂、动态、部分可观测的环境中实现高保真度的模仿。此外,模仿学习还应使智能体能够泛化到未见状态、目标或环境,这对于机器人操作、自主导航和人机交互等实际应用至关重要,因为环境动态和任务要求通常会偏离训练场景。大模型在模仿学习中的应用主要体现在以下几个方面:基于扩散模型的策略网络扩散模型在处理复杂的多模态分布方面表现出色,可用于生成多样化动作轨迹,从而增强策略的鲁棒性和表达能力。近期的研究开始将扩散模型整合到策略网络中,以克服传统模仿学习的局限性。例如,Pearce 提出了一种基于扩散模型的模仿学习框架,通过迭代添加和移除噪声来优化专家演示,从而捕获动作分布的多样性并生成多样化动作序列。DABC 采用两阶段过程训练策略网络,首先通过行为克隆预训练基础策略网络,然后通过扩散模型细化动作分布的建模。Diffusion Policy 提出了一种将扩散模型作为决策模型的策略网络,用于视觉驱动的机器人任务。它以视觉输入和机器人当前状态为条件,使用 U-Net 作为去噪网络,基于视觉特征和状态向量预测去噪步骤,从而生成连续动作序列。为了增强策略网络的空间感知能力,3D-Diffusion 提出了一种基于 3D 输入的扩散策略框架,使用简单的 3D 表示作为输入,利用扩散模型生成动作序列,从而通过捕获空间信息提高视觉运动策略的泛化能力。与 2D 策略网络相比,3D-Diffusion 能够更好地理解几何关系和空间约束。基于 Transformer 的策略网络Transformer 架构可以通过将专家轨迹视为序列数据,并利用自注意力机制建模动作、状态和目标之间的依赖关系,从而增强模仿学习。这种端到端的方法最小化了中间步骤的误差累积,提高了策略的一致性和准确性。例如,Google 的 RT-1 首次展示了 Transformer 在机器人控制中的潜力,通过结合大规模、多样化的数据集(130k + 轨迹,700 + 任务)和预训练的视觉 - 语言模型,显著提高了对未见任务和场景的任务泛化能力。后续工作 RT-Trajectory 引入了“轨迹草图”方法,通过整合低层次视觉线索来增强端到端 Transformer 的任务泛化能力。斯坦福大学的 ALOHA 利用 Transformer 的编码 - 解码结构,从多视图图像中生成机器人臂动作序列,实现了低成本硬件上的精确双臂操作。其后续研究采用动作分块策略来预测多步动作序列,显著提高了长期任务的稳定性和一致性。Mobile ALOHA 将原始任务扩展到全身协调的双臂操作任务,引入了移动平台和遥操作接口,以处理更复杂的双臂任务。对于 3D 空间操作,HiveFormer 和 RVT 利用多视图数据和 CLIP 进行视觉 - 语言特征融合,并直接预测 6D 抓取姿态,在 RLBench 和真实世界机器人臂任务上实现了最先进的性能,突出了 Transformer 在复杂空间建模方面的优势。为了抓取可变形物体(例如织物或软材料),Man 提出了一种结合视觉和触觉反馈的 Transformer 框架,通过探索性动作优化抓取参数。Google 的 RoboCat 采用跨任务、跨实体的具身模仿学习,整合 VQ-GAN 对视觉输入进行标记化,使用决策 Transformer 预测动作和观察,仅用少量样本就能实现快速策略泛化。RoboAgent 采用了类似的编码 - 解码结构,通过融合视觉、任务描述和机器人状态来最小化动作序列预测误差。CrossFormer 提出了一种基于 Transformer 的具身模仿学习架构,用于跨具身任务,通过在大规模专家数据上进行训练,统一处理操作、导航、移动和飞行任务,展示了多任务学习的潜力。大模型增强的强化学习通过与环境的交互,强化学习使智能体能够开发出最优的控制策略,适应各种未见场景,在动态环境中保持鲁棒性,并从有限的数据中学习,从而在现实世界中实现复杂的任务。最初,强化学习基于基本技术,如策略搜索和价值函数优化,例如 Q-learning 和 SARSA。随着深度学习的兴起,强化学习与深度神经网络相结合,形成了深度强化学习(DRL)。DRL 使智能体能够从高维输入中学习复杂的策略,取得了显著的成就,例如 AlphaGo 和 Deep Q-Network(DQN)。DRL 使智能体能够在新环境中自主学习,无需明确的人工干预,从而在从游戏到机器人控制等广泛应用中发挥作用。后续进展进一步提高了学习效果。例如,近端策略优化(PPO)通过剪辑概率比率提高了策略优化的稳定性和效率。软演员 - 批评家(SAC)通过引入最大熵改进了探索和鲁棒性。尽管取得了这些进展,但强化学习在构建策略网络 π 和设计奖励函数 R(s,a,g) 方面仍面临挑战。大模型在强化学习中的应用主要体现在以下几个方面:奖励函数设计设计奖励函数一直是强化学习中的一个挑战,因为它的复杂性和任务特定性。传统奖励函数由领域专家手动设计,需要全面考虑各种因素和专业知识,例如任务完成、能源消耗、安全性以及每个因素的权重,这相当困难。手动设计往往会导致稀疏或比例不当的奖励,引发诸如奖励黑客等问题,即智能体利用意外信号来最大化奖励,而没有实现预期目标。大模型为这一问题提供了有希望的解决方案,通过生成奖励信号 r 或奖励函数 R(s,a,g),减少对手动设计的依赖,并捕获复杂的多模态反馈。例如,Kwon 等人和 Language to Rewards(L2R)分别引入了零样本和少样本方法,利用 GPT-3 直接从文本行为提示中产生奖励信号,将高层次目标转化为硬件特定的控制策略。然而,它们的稀疏奖励限制了在复杂任务中的使用,且成功生成高度依赖于精确的提示或特定模板。Text2Reward 通过改进这一点,从环境描述和示例中生成密集、可解释的 Python 奖励函数,并通过人类反馈迭代细化,从而在机器人操作和运动任务中实现高成功率。Eureka 利用 GPT-4 从任务和环境提示中创建密集奖励,通过采用自动化迭代策略优化奖励函数,减轻了 Text2Reward 对人类反馈的依赖,超越了人类制作的奖励。此外,Auto MC-Reward 实现了完整的自动化,通过多阶段流程为 Minecraft 提供服务,其中奖励设计器生成奖励信号,验证器确保质量,轨迹分析器通过失败驱动的迭代细化奖励。尽管 Auto MC-Reward 显著提高了效率,但其专注于特定领域的特性限制了其泛化能力,与 Eureka 和 Text2Reward 相比。策略网络构建离线强化学习从预先收集的数据集中学习最优策略,无需在线交互。然而,对静态数据集的依赖可能导致错误,因为数据集中缺失的动作可能导致错误。策略正则化可以通过约束与行为策略的偏差来缓解这一问题。然而,策略表达能力的限制和次优的正则化方法可能导致性能不佳。为了增强离线强化学习的策略表达能力和适应性,研究人员提出了利用扩散模型、基于 Transformer 的架构和 LLM 来构建策略网络的方法:基于扩散模型的策略网络构建:扩散模型通过迭代加噪和去噪建模复杂的动作分布,从而增强策略的表达能力。例如,DiffusionQL 将扩散模型作为基础策略,通过在 Q-learning 框架内最大化价值函数目标来训练,以生成适合离线数据集中多模态或非标准动作分布的高回报策略。然而,扩散模型需要大量的去噪步骤才能从完全加噪的状态中产生动作。为了减轻这一负担,EDP 引入了一种高效的采样方法,通过在单步中从中间加噪状态重构动作,显著减少了计算开销。EDP 可以与各种离线强化学习框架集成,同时保持策略的采样效率。基于 Transformer 的策略网络构建:Transformer 基于自注意力机制,能够捕获轨迹中的长期依赖关系,从而提高策略的灵活性和准确性。例如,决策 Transformer 将离线强化学习重新构建为条件序列建模问题,将状态 - 动作 - 奖励轨迹作为序列输入,并应用监督学习从离线数据集中生成最优动作。基于此,Prompt-DT 通过引入提示工程增强了少样本场景中的泛化能力,使用带有任务特定编码的轨迹提示来指导新任务的动作生成。为了提高动态环境中的适应性,Online Decision Transformer(ODT)通过离线强化学习预训练 Transformer 以学习序列生成,然后通过在线强化学习交互进行微调。Q-Transformer 将 Transformer 的序列建模与 Q 函数估计相结合,自回归地学习 Q 值以生成最优动作。在多任务离线强化学习中,Gato 采用了基于 Transformer 的序列建模方法,但它严重依赖于数据集的最优性,并且由于模型庞大而导致训练成本高昂。基于 LLM 的策略网络构建:基于 Transformer 的序列建模能力,LLM 为离线强化学习任务引入了一种新范式,通过利用预训练知识来简化任务。例如,GLAM 使用 LLM 作为策略智能体,为语言定义的任务生成可执行的动作序列,这些序列通过 PPO 在线优化,以提高长视域规划中动作序列的一致性。LaMo 使用 GPT-2 作为基础策略,通过 LoRA 进行微调以保留先验知识,将状态 - 动作 - 奖励序列转换为语言提示,以生成与任务对齐的策略。Reid 探索了 LLM 的可转移性,使用预训练的 BERT 并通过外部知识库进行增强。在 D4RL 基准测试中的评估表明,Reid 在性能上超越了决策 Transformer,同时减少了训练时间,展示了 LLM 在离线强化学习中的效率。世界模型世界模型的设计世界模型是环境的内部模拟或表示,它使智能体能够在模拟环境中进行学习和决策,而无需依赖于真实世界的交互。世界模型的设计方法可以分为以下几种类型:潜空间世界模型潜空间世界模型通过将环境状态编码到低维潜空间中来预测环境动态。例如,Recurrent State Space Model (RSSM) 是一种典型的潜空间世界模型,它通过将潜状态分解为确定性和随机部分来考虑环境的确定性和随机性因素。基于 RSSM 的模型包括:PlaNet:结合了 RSSM 和 Gated Recurrent Unit (GRU) 以及 Convolutional Variational AutoEncoder (CVAE),利用 CNN 进行潜空间动态建模,并通过模型预测控制实现动作规划。Dreamer:在 PlaNet 的基础上进一步发展,通过在潜空间中学习行为策略,实现了从想象序列中学习行为。Dreamer V2:使用演员 - 评论家算法,从世界模型生成的想象序列中学习行为,性能在 Atari 200M 基准测试中与人类玩家相当。Dreamer V3:通过引入对称对数预测、层归一化和指数移动平均值来优化性能,超越了连续控制任务中的专门算法。基于 Transformer 的世界模型基于 Transformer 的世界模型利用注意力机制处理高维、连续或多模态环境,克服了传统 CNN 和 RNN 的局限性。例如:IRIS:是最早应用 Transformer 的世界模型之一,通过将图像标记化并使用自回归 Transformer 预测未来标记,展示了在低数据量 Atari 100k 设置中的卓越性能。Genie:基于空间 - 时间 Transformer,通过在大规模无标记互联网视频数据集上进行自监督学习,提供了可操纵、生成性和交互性环境的新范式。TWM:提出了基于 Transformer-XL 的世界模型,通过将 Transformer-XL 的分段级递归机制迁移到世界模型中,能够捕获环境状态之间的长期依赖关系。STORM:利用随机 Transformer,将状态和动作融合为单个标记,提高了训练效率,并在 Atari 100k 基准测试中与 Dreamer V3 相匹配。基于扩散的世界模型基于扩散的世界模型通过在原始图像空间中生成预测视频序列来模拟环境动态。例如:Sora:利用编码网络将视频和图像转换为标记,然后通过大规模扩散模型进行加噪和去噪过程,最终将标记映射回原始图像空间以生成多步图像预测。UniPi:利用扩散模型在图像空间中建模智能体轨迹,从语言输入和初始图像生成未来关键视频帧,并通过时间序列的超分辨率生成一致、高质量的图像序列。UniSim:通过在互联网数据和机器人交互视频上联合训练扩散模型,进一步提高了轨迹预测能力,能够为高级和低级任务生成长序列视频轨迹。联合嵌入预测架构联合嵌入预测架构(JEPA)通过引入层次化规划和自监督学习,克服了传统数据驱动世界模型缺乏常识的局限性。JEPA 的架构包括感知模块和认知模块,通过潜变量形成世界模型,捕捉关键信息并过滤冗余信息,支持高效决策和未来场景规划。世界模型在决策中的应用世界模型为智能体提供了强大的内部表示,使其能够在采取实际动作之前预测环境动态和潜在结果。世界模型在决策中的主要作用包括:模拟验证在机器人技术中,测试决策可能既昂贵又耗时,尤其是在顺序和长期任务中,当前决策对后续表现有深远影响。世界模型通过模拟验证缓解了这一问题,允许智能体在没有现实承诺的情况下“尝试”动作并观察可能的结果。例如:NeBula:通过贝叶斯滤波构建概率信念空间,使机器人能够在包括未知环境在内的多样化结构配置中有效推理,提供了一种在不确定性下预测结果的复杂方式。UniSim:是一个生成真实世界交互的生成模拟器,能够从高级指令和低级控制中模拟视觉结果,包含一个统一的生成框架,将动作作为输入,并整合不同数据集以适应不同领域。知识增强为了在真实世界中成功完成任务,智能体通常需要丰富的知识和环境常识。世界模型可以通过提供预测性和背景知识来增强智能体的决策能力。例如:World Knowledge Model:通过在任务开始前提供全局先验知识,并在任务过程中维持局部动态知识,模仿人类的心理世界知识,从而实现优于人类的表现。Agent-Pro:将智能体与环境(尤其是与其他智能体在交互任务中的互动)的互动转化为信念,这些信念代表了智能体对环境的社会理解,并为后续的决策和行为策略更新提供信息。世界模型在具身学习中的应用与模型无关的强化学习通常计算成本高昂,且在数据稀缺或复杂的场景中效率低下。基于模型的强化学习通过利用世界模型来模拟环境动态,从而优化学习过程。世界模型在具身学习中的主要作用包括:状态转移模拟传统强化学习是无模型的,直接从智能体 - 环境交互中学习,这在计算上是密集的,并且在数据稀缺或复杂的场景中不切实际。基于模型的强化学习通过利用明确捕获状态转移和动态的世界模型来缓解这些限制,允许智能体在模拟环境中进行安全、成本效益高且数据高效的学习。例如:RobotDreamPolicy:通过学习世界模型并在其中开发策略,显著减少了与真实环境的交互。DayDreamer:利用基于 RSSM 的 Dreamer V2 世界模型,将观察结果编码到潜空间中并预测未来状态,实现了真实机器人中的快速技能学习,并具有高样本效率。SWIM:通过在大规模人类视频数据上进行训练,理解丰富的人类互动并获得有意义的可操作性,然后通过机器人数据进行微调以适应机器人领域。数据生成除了增强学习和优化策略外,世界模型(尤其是基于扩散的世界模型)还可以用于合成数据,这对于具身 AI 来说尤其有价值,因为收集多样化和广泛的现实世界数据是具有挑战性的。例如:SynthER:利用基于扩散的世界模型生成低维离线 RL 轨迹数据,以增强原始数据集。MTDiff:将基于扩散的世界模型应用于多任务轨迹生成,使用专家轨迹作为提示来指导与特定任务目标和动态一致的智能体轨迹生成。VPDD:使用大规模人类操作数据集训练轨迹预测世界模型,然后仅使用少量标记的动作数据对动作生成模块进行微调,显著减少了对广泛机器人互动数据的需求。挑战与未来展望具身数据稀缺具身智能的训练需要大量多样化数据,但目前高质量的具身数据仍然不足。原因包括机器人设计的多样性、真实世界交互的复杂性以及不同任务的具体要求等。尽管有一些具身数据集(如VIMA和RT-1),但与视觉 - 语言数据集相比,它们的规模仍然较小。为解决数据稀缺问题,研究人员尝试了以下方法:利用世界模型生成数据:例如SynthER利用基于扩散的世界模型合成数据,增强离线强化学习的轨迹数据集,提升性能。整合大规模人类数据:例如Ego4D利用互联网视频数据,提供真实世界动态和观察,帮助机器人任务理解人类行为和互动。但人类形态与机器人形态的差异可能导致数据不匹配和性能下降。持续学习具身智能系统应能够通过与开放动态环境的持续交互自主更新知识并优化策略,同时保留先前习得的能力。然而,持续学习面临以下挑战:灾难性遗忘:学习新任务时会破坏先前习得的知识,例如机器人在适应新地形时可能丢失原有导航技能。自主探索效率低:当前方法难以在高维状态空间或稀疏奖励场景中平衡探索新体验和利用已有知识。现实世界的不可预测性:传感器退化或机械磨损等问题增加了持续学习的复杂性,需要智能体具备自诊断和自修复能力。为应对这些挑战,研究人员探索了以下方法:经验回放:通过定期回顾历史数据来减轻灾难性遗忘。正则化技术:在学习新任务时约束权重更新,保留先前任务知识。数据混合策略:将新旧数据分布按比例混合,减少特征扭曲。计算与部署效率具身智能的复杂模型对训练和部署的计算资源要求高。例如,Diffusion-VLA需要大量高端GPU和大规模轨迹数据集进行训练,推理时延时长,难以满足实时控制需求;Transformer-based VLA(如RT-2)模型复杂,部署在资源受限的边缘设备(如真实机器人)上困难。为提高效率,研究人员采取了以下策略:参数高效微调:如LoRA通过仅更新低秩矩阵显著降低微调成本,但可能影响复杂任务性能。模型压缩技术:包括知识蒸馏和量化。例如,TinyVLA通过知识蒸馏将大模型压缩至约1000万参数,并结合快速采样算法和4位量化,实现30ms推理延迟和2GB内存占用,适合边缘设备。硬件加速:如MiniGPT-4通过硬件优化提升性能,但缺乏跨平台通用性。模拟到现实的差距具身智能需要大量数据训练,但收集真实世界数据成本高且不切实际。模拟器通过提供大规模多样化数据集缓解了这一问题,但模拟与现实之间存在“模拟到现实的差距”,导致智能体在现实世界中表现不佳。差距体现在:物理动态不准确:如摩擦、碰撞、流体行为难以准确建模。视觉渲染差异:如光照、相机曝光、材质属性难以模拟。例如,模拟器训练的策略在现实世界中可能因微小差异而失败,且模拟无法完全复制现实的复杂性。尽管先进模拟器(如Genesis)通过精确物理建模和逼真渲染缩小了差距,但“模拟到现实的差距”仍是具身智能面临的主要挑战。结论与未来工作结论:大模型为具身智能的发展提供了强大的支持,显著提升了感知、规划、学习和交互能力。通过分层和端到端决策范式的对比分析,以及对具身学习和世界模型的深入研究,本文展示了大模型在具身智能中的广泛应用和潜力。然而,具身智能领域仍面临诸多挑战,如数据稀缺、持续学习、计算效率和模拟到现实的转移等问题。未来工作:数据生成与增强:利用世界模型和扩散模型等技术生成高质量的具身数据,以缓解数据稀缺问题。持续学习机制:开发更有效的持续学习算法,解决灾难性遗忘问题,提高具身智能系统在动态环境中的适应能力。模型压缩与优化:探索更高效的模型压缩和优化技术,降低大模型在边缘设备上的部署成本,提高实时性和响应速度。模拟到现实的转移:进一步缩小模拟环境与真实环境之间的差距,提高从模拟到现实的转移效率和成功率。多模态融合:加强视觉、语言、触觉等多模态信息的融合,提升具身智能系统的感知和理解能力,使其能够更好地适应复杂的真实世界任务。

更多推荐