logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

具身智能行为学习需要什么数据?(六)

可穿戴人工智能或自我人工智能本质上是一种机器人应用。智能眼镜、神经腕带和 AR 耳机(Meta Project Aria、VisionPro)等设备使用人工智能来感知用户的环境、理解空间背景并做出预测。

文章图片
#机器人#计算机视觉#人工智能 +2
具身智能体驾驭综述:从大模型到物理安全控制

在过去的十年中,人工智能已经从被动模式识别转变为主动数字代理推理。大型语言模型 (LLM) 和视 觉-语言模型 (VLM) 的出现催生了一波基础模型浪潮,这些模型展示了深刻的常识推理、复杂的工具 使用和⻓期序列规划。随后,视觉-语言-动作(VLA)模型和空间世界模型(WM)尝试将这些推理能 力直接投射到机器人技术中,将高级指令和视觉输入直接映射到低级末端执行器轨迹或关节扭矩命令 中。然而,将生成模

文章图片
#人工智能#机器人#计算机视觉 +3
具身智能体驾驭综述:从大模型到物理安全控制

在过去的十年中,人工智能已经从被动模式识别转变为主动数字代理推理。大型语言模型 (LLM) 和视 觉-语言模型 (VLM) 的出现催生了一波基础模型浪潮,这些模型展示了深刻的常识推理、复杂的工具 使用和⻓期序列规划。随后,视觉-语言-动作(VLA)模型和空间世界模型(WM)尝试将这些推理能 力直接投射到机器人技术中,将高级指令和视觉输入直接映射到低级末端执行器轨迹或关节扭矩命令 中。然而,将生成模

文章图片
#人工智能#机器人#计算机视觉 +3
HadAgent:基于推理证明区块链共识的驾驭-觉察去中心化智能AI服务

26年4月来自美国Kean大学、Norte Dame大学和南佛罗里达大学的论文“HadAgent: Harness-Aware Decentralized Agentic AI Serving with Proof-of-Inference Blockchain Consensus”。工作证明(PoW)区块链共识机制消耗大量计算资源却无法产生有效输出,而大语言模型(LLM)智体的快速增长又对GPU

文章图片
#区块链#人工智能#机器学习 +2
AgenticNav:作为工具-调用驾驭的零样本视觉-语言导航

26年6月来自上海交大和华为公司的论文“AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness”。最近,连续环境中的零样本视觉-语言导航 (VLN-CE) 通过大型视觉-语言模型 (VLM) 变得可行。然而,现有的方法通常依赖于学习的航路点预测器来提出可导航的动作。这严重限制模型的动作空间,并且无

文章图片
#人工智能#深度学习#计算机视觉 +3
AgenticNav:作为工具-调用驾驭的零样本视觉-语言导航

26年6月来自上海交大和华为公司的论文“AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness”。最近,连续环境中的零样本视觉-语言导航 (VLN-CE) 通过大型视觉-语言模型 (VLM) 变得可行。然而,现有的方法通常依赖于学习的航路点预测器来提出可导航的动作。这严重限制模型的动作空间,并且无

文章图片
#人工智能#深度学习#计算机视觉 +3
WorldArena:用于评估具身世界模型感知与功能效用的统一基准

26年2月来自清华、上交大、港大、普林斯顿、中科院、中科大、北大和新加坡国立的论文“WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models”。尽管世界模型(World Models)凭借其通过基于动作的条件预测来推断环境动态的能力,已成为具身智

文章图片
#人工智能#深度学习#语言模型 +2
综述:从物理模拟器和世界模型中学习具身智能(下)

25年7月来自南京大学、香港大学、中南大学、地平线机器人公司、中科院计算所、上海交大、慕尼黑工大和清华大学的论文“A Survey: Learning Embodied Intelligence from Physical Simulators and World Models”。对通用人工智能 (AGI) 的追求已将具身智能 (embodied intelligence) 置于机器人研究的前沿。

文章图片
#机器人#人工智能#计算机视觉 +2
BeyondMimic:从运动追踪到通过引导扩散实现多功能人形机器人控制

25年11月来自UC Berkeley和Stanford大学的论文“BeyondMimic: From Motion Tracking to Versatile Humanoid Control via Guided Diffusion”。类人机器人的类人外形使其在运动技能方面拥有独特的优势,能够像人类一样灵活敏捷。通过学习人类示范动作,可以提供一种可扩展的方法来获取这些能力。然而,以往的研究要么

文章图片
#机器人#机器学习#深度学习
ASAP:对齐模拟和真实世界物理,学习敏捷人形机器人全身技能

25年2月来自Nvidia的论文“ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills”。人形机器人具有无与伦比的多功能性,可以执行类似人类的全身技能。然而,由于模拟和现实世界之间的动态不匹配,实现敏捷和协调的全身运动仍然是一项重大挑战。现有的方法,如系统识别 (

文章图片
#机器人#计算机视觉#深度学习 +2
    共 1424 条
  • 1
  • 2
  • 3
  • 143
  • 请选择