logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

具身智能语言规划之SayCan详解:让大模型“会说”,也让机器人“能做”

本文介绍了SayCan方法,它通过结合大语言模型(LLM)和机器人技能的价值函数,实现语言指令到物理动作的有效规划。LLM负责评估技能与指令的相关性(Say),而价值函数判断技能在当前状态下的可执行性(Can)。两者分数相乘后选择最优动作,逐步完成复杂任务。实验表明,该方法在101条指令测试中达到84%的规划成功率,但受限于低层技能覆盖率,执行成功率为74%。该方法的关键创新在于明确了语言模型与物

文章图片
#机器人
具身智能真实数据之DROID详解:真实世界数据如何把机器人策略从实验室推向日常场景

DROID 的贡献可以收束为三件事:用统一、可移动和可复现的硬件栈把数据采集扩展到多机构;用协议把场景、任务、物体、视角和交互位置的变化系统化;用标准 Diffusion Policy 证明这些变化能够转化为更好的分布外鲁棒性。它没有解决所有机器人本体和动作空间的差异,也没有让模型脱离目标域示范就自动完成任意新任务。机器人数据集的竞争力不只看轨迹数,还要看这些轨迹是否来自足够多的真实世界条件。这也

文章图片
#机器人
具身智能开放策略之Octo详解:开放策略如何把多机器人经验变成可微调的通用底座

Octo(An Open-Source Generalist Robot Policy)要回答的问题,是机器人策略能不能像视觉或语言模型一样,先在多种机器人、多种任务上预训练,再用少量目标域数据迁移到新的平台。论文发布了一个完整开放的通用机器人策略:模型、训练代码、数据处理流程和检查点都可获得。它使用 Open X-Embodiment 中筛选出的 25 个数据集、约 80 万条轨迹进行训练,并在

文章图片
#机器人
具身智能之通用机器人RoboCat详解:一个能用少量示范快速学会新任务和新机器人的自我改进智能体

RoboCat是一种自我改进的通用机器人智能体,能够通过少量示范快速学习新任务并适应新机器人。它采用视觉目标条件的Transformer架构,将异构机器人数据统一为可变长度token序列,支持不同自由度与规格的机械臂。核心创新在于构建“预训练-微调-自主采集-再训练”的闭环:通用模型通过少量人工示范微调后,可自主生成数据并回流至训练集,持续提升性能。实验显示,RoboCat在未见任务(如KUKA

文章图片
#机器人
具身智能之通用机器人RoboCat详解:一个能用少量示范快速学会新任务和新机器人的自我改进智能体

RoboCat是一种自我改进的通用机器人智能体,能够通过少量示范快速学习新任务并适应新机器人。它采用视觉目标条件的Transformer架构,将异构机器人数据统一为可变长度token序列,支持不同自由度与规格的机械臂。核心创新在于构建“预训练-微调-自主采集-再训练”的闭环:通用模型通过少量人工示范微调后,可自主生成数据并回流至训练集,持续提升性能。实验显示,RoboCat在未见任务(如KUKA

文章图片
#机器人
具身智能之通用机器人RoboCat详解:一个能用少量示范快速学会新任务和新机器人的自我改进智能体

RoboCat是一种自我改进的通用机器人智能体,能够通过少量示范快速学习新任务并适应新机器人。它采用视觉目标条件的Transformer架构,将异构机器人数据统一为可变长度token序列,支持不同自由度与规格的机械臂。核心创新在于构建“预训练-微调-自主采集-再训练”的闭环:通用模型通过少量人工示范微调后,可自主生成数据并回流至训练集,持续提升性能。实验显示,RoboCat在未见任务(如KUKA

文章图片
#机器人
具身智能低成本操作之ALOHA详解:低成本双臂硬件如何学会精细操作

ALOHA 通过低成本 leader-follower 双臂、四路 50Hz RGB 视觉和可维修结构,把高质量双臂示范采集变成普通实验室可承担的工程;ACT 则用 action chunking、temporal ensemble 和 CVAE,把长、高频、带噪的人类轨迹转化为平滑闭环控制。六个真实任务的结果表明,约十分钟示范足以让廉价硬件获得有用的精细操作能力。猫先生认为,ALOHA 最值得留

文章图片
#机器人
具身智能低成本操作之ALOHA详解:低成本双臂硬件如何学会精细操作

ALOHA 通过低成本 leader-follower 双臂、四路 50Hz RGB 视觉和可维修结构,把高质量双臂示范采集变成普通实验室可承担的工程;ACT 则用 action chunking、temporal ensemble 和 CVAE,把长、高频、带噪的人类轨迹转化为平滑闭环控制。六个真实任务的结果表明,约十分钟示范足以让廉价硬件获得有用的精细操作能力。猫先生认为,ALOHA 最值得留

文章图片
#机器人
具身智能跨本体学习之Open X-Embodiment详解:让22种机器人共享同一套操作经验

Open X-Embodiment 将 60 个机器人数据集统一为跨本体学习底座,并用 RT-1-X 与 RT-2-X 验证多机器人数据的正迁移。

文章图片
具身智能动作生成之Diffusion Policy详解:如何改变机器人模仿学习

Diffusion Policy 将机器人视觉运动策略建模为条件动作扩散过程,并通过动作序列预测、滚动时域控制和视觉条件实现多模态、稳定且可实时执行的机器人模仿学习。

文章图片
    共 44 条
  • 1
  • 2
  • 3
  • 4
  • 5
  • 请选择