logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

迭代去噪还是一步生成,物理AI 世界模型 的账

这条路线在动作生成上的落点,是最新成果 PhysBrain 1.5:具身理解、动作生成与未来状态预测三件事被统一进同一个自回归模型,动作由模型自身按动作块预测,不从迭代生成的未来帧里反解。在数字 AI 的既有模型上做延续、靠微调把能力接出来,这条路固然成熟,但在深度机智的判断里,第二笔是推演的长度:预测的未来越远,单次推演越重,能把未来想得越久的模型,往往也是让机器人等得越久的模型。同期已有工作指

文章图片
#人工智能
机器人基础模型换地基:先做三维空间定位

—机器人基础模型所依赖的预训练骨干,据论文判断并不直接要求操作所需的显式空间度量,物体在三维空间里的位置与范围,只能从机器人演示里隐式学出来。它需要更多样的三维定位数据与模型,而三维框只是定位的一种形态,稠密的三维实例分割可能给出更细的几何监督。论文的位置也划得清楚:体素表征与多视投影、模型内部的几何感知表征、语言条件的三维价值图、可供性预测,都在往显式空间结构上走,在具身智能领域,论文把这道题提

文章图片
#机器人#人工智能#计算机视觉
谁当具身主干,物理AI 世界模型 与 VLA 之争

前端是数据基座:In-Context Data CollectionICDC 情境数采把人类操作发生时的物理交互与因果关系一并记下,全模态第一人称采集系统提供采集能力,DeepAct 多模态数据集把这条链路沉淀成可复用的人类第一视角素材,近期,深度机智还迭代推出的Ego360人类全景真实数据体系,以全景视频更加完整地记录人类动作经验,为模型提供更加丰富的任务上下文。在动作侧,模型保留各数据源的原生

文章图片
#人工智能
单台远程摄像头,把导航的观测源挪出机器人

训练数据的来路同样不走常规:作者没有采集真实轨迹,而是在仿真环境里程序化随机生成世界——障碍物的尺寸、形状、密度与布局随机,摄像头的位置与角度也随机——再用经典导航规划器自动采集专家轨迹。往下追问一层,各家选择先扎稳的位置并不相同。作者给出的理由是,与移动机器人相比,这类摄像头已在真实环境中广泛部署,持续录下的画面本身就是一张始终最新的地图,且通常已连到网络计算资源,密集的视觉处理可以委托过去。把

文章图片
#机器人
机器人学新技能,动作坐标系要不要跟着变

在四条真机任务流、五条归一化协议的对照中,据作者自测,这条一次性标定后冻结的做法在平均表现与跨任务顺序的稳定性上都位于前列;论文给出的做法是把坐标系的确定提前——在持续学习开始之前,只用两类先验(预期部署场景的粗略描述与目标本体的能力),按接触关系的变化把操作拆成动作基元,据此采集一小组与任务无关的标定轨迹,从中一次估出统计量,此后全程冻结,训练、回放与推理共用同一套坐标。论文讨论的是视觉-语言-

文章图片
#人工智能
人类演示补成机器人域,触觉共训才成立

论文的做法是在三处各补一次:动作这一路,手套采到的人手动作在捏取时有厘米级指尖误差,先以一台头显作伪真值做一次性校正,再重定向到一台十来个自由度的触觉灵巧手上;视觉这一路,人手被从两路立体视图里整体抹掉,换成用机器人录像像素着色的机器人手网格,再重跑一遍立体匹配,让人类点云带上与机器人点云相同的立体误差与可见性;论文作者指出,此前补人类演示的几种做法,多数只处理看得见的那一路——把本体从画面里遮掉

文章图片
#机器人
物理AI 物理推理 从哪来,一份能力来源盘点

本体对齐一格管动作空间与身体形态对不对得上,边界在硬件自由度与数据表示的匹配——这七格按「来源维度」切分,与开篇那篇论文按「能力形成来源」切的七类分法不同,不必逐格对应。深度机智给出的来源组合是:数据来源取人类经验,监督形式取由人类视频转化来的动作标签,本体对齐交给向人看齐的自研的 Prime 系列机器人本体,三段串成一条闭环。,不设任务专用分支。它的预训练阶段,具身监督全部来自人类交互视频,使用

文章图片
#人工智能
300 台机器人常驻乐园,具身智能开始算运营账

配套的工程同样是这笔账的一部分:一套把游客流量与机器人业务物理隔离的「5G 切片 + 边缘设备本地部署 + 安全隔离」架构、为机器人配置的独立网络切片、一个具身智能文旅景区运营运维一站式管理平台,以及覆盖空间、人身、充电消防、AI、数据、运营六个维度的常态化部署安全方案。9 月 24 日,横琴长隆飞船乐园焕新开园,超 300 台具身智能机器人同日进场,分布在 100 余个交互体验点,覆盖文娱商演、

文章图片
#机器人
满分之后看什么,物理AI 物理推理 的失败恢复题

另一项工作则直接算起了纠错的账——当不熟悉的对象、传感器、本体或者接触方式落在已验证范围之外,又没有可用的兜底方案时,纠正一次失败需要新的机器人数据、一次策略更新,以及回归测试。一个方向是执行前的风险预测:用动作条件的世界模型预测候选动作块的任务进度与物理风险,再把预测结果耦合到与本体相关的安全约束上,让机器人在动作发出之前就知道这一步值不值得走。在深度机智的判断里,真实人类行为的记录不只是训练数

文章图片
#人工智能#机器学习
不搭场景、不写脚本:野外采数据的视角

它先解决数据从哪来:用头戴式 VR 设备与手部追踪器,在家庭、超市、快递站、工厂、药店、办公室这类真实场所采双臂人类行为,开放式、无脚本,操作者按当地情境自行计划并完成任务,没有预设的动作序列。论文挑的是补表示这一条,把视角差学掉:用一个可微的几何变换模块学机器人视角到人头戴视角的变换、再取逆,把人类的头戴相机观测扭到机器人视角上,再交给与机器人图像相同的编码器,最终喂给一个视觉-语言-动作模型。

文章图片
    共 72 条
  • 1
  • 2
  • 3
  • 8
  • 请选择