logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Hydra-0 深度解读:把机器人动作翻译成像素运动的世界模型

Hydra-0 通过将机器人动作投影为图像平面上的action flow(可见点轨迹),实现跨平台视觉动力学建模。该方法将关节角、末端位姿等异构控制信号统一为可共享的视觉中间表示,使模型仅需学习“画面如何变化”,而非特定机器人控制语法。训练时结合真实数据与仿真生成流,部署时利用几何投影确保条件与观测对齐;通过潜变量聚合与高斯传播,高效融合稀疏轨迹信息。实验表明,其运动误差降低90.4%,物体预测误

文章图片
#机器人
GigaBrain-0.7:三系统架构下,具身基础模型逼向 Scaling 的临界点

具身智能的分论坛在 WRC 2026 上抛出了最锋利的问题:通用世界模型真的"通用"了吗?在生数科技给出的 L1-L5 分级里,L1 是生成"世界演化"的视频模型,L5 是调度多个智能体的"世界组织者",而评价一个模型处在哪一级,要看它是否具备理解、预测、行动三种能力耦合而成的闭环反馈。这个坐标系的另一端,站着的正是极佳视界刚发布的。

文章图片
#机器人
智能体如何在一个未知的多层楼里连续找完三样东西:LifelongCrossNav 的持久 3D 语义记忆

LifelongCrossNav提出一种统一框架,解决未知多楼层环境中序列式多物体导航难题。针对现有方法在跨楼层通行与持久记忆间的割裂,该工作构建支撑感知的稀疏3D体素地图,同时保留几何结构与语义记忆,通过七类体素状态精确区分楼层、楼梯与可通行区域,并设计统一导航策略实现探索、楼梯穿越与历史目标复用的无缝切换。在新基准HM3D-MFMON上验证,显著优于平面表示与单任务方法,为服务机器人落地提供关

文章图片
#机器人
JEPA-WAM 深度解读:让机器人学会预测世界的变化

JEPA-WAM 通过冻结的 V-JEPA 2.1 联合编码当前与未来帧,构建保留 patch 对应关系的转移目标,以在不生成视频的前提下学习状态演化。共享预测器同时完成潜在状态转移预测与动作条件提取,提升模型在相机、背景、物体布局变化下的泛化能力。在 LIBERO-Plus 等基准上,未预训练即达 79.2%,迁移后达 86.3%;真实双臂实验也验证其对分布偏移的鲁棒性。该方法在保持低推理延迟的

文章图片
#人工智能
Real-Time Chunking:动作分块策略上真机时,那半秒延迟到底怎么消化

Real-Time Chunking(RTC)解决机器人动作分块在真实执行中的延迟错位问题:因推理耗时导致动作段切换时出现停顿或冲突。论文将此建模为图像补全问题,利用伪逆引导(ΠGDM)在去噪过程中软约束前缀动作,确保时间连续性。后续工作通过训练阶段前缀条件进一步降低推理开销,实现端到端延迟从135ms降至108ms。结合异步调度与软掩码机制,真机实验显示系统在200ms延迟下仍能稳定运行,显著提

文章图片
#人工智能
WALA:用稀疏未来帧训练可执行潜动作的两阶段框架

WALA(World- and Action-supervised Latent Actions)面向机器人操作策略学习,处理的是带动作标注的机器人演示数据稀缺、而大规模人类视频缺乏动作标签这一核心矛盾。它没有简单地在视觉-语言-动作模型上堆砌更多机器人数据,而是通过语义-几何潜动作模型预训练与潜世界监督下的策略学习两个阶段,把无动作视频中的场景演变转化为对潜动作的约束。从 RoboCasa-GR

文章图片
#机器人
测试时训练(TTT):从序列建模的快速权重,到图像恢复与机器人操作的实例自适应

测试时训练(TTT)通过在推理阶段动态更新快速权重,实现序列建模与恢复任务的实例自适应。其核心是将每条输入序列视为临时数据集,利用自监督损失(如重构损失)在前向传播中对小规模参数进行梯度更新,从而在保持线性复杂度的同时增强长程依赖建模能力。外层训练学习“如何学习”的元策略,内层则针对具体输入实时优化权重,不改变主模型参数,避免漂移。该范式在文本、图像恢复(TTTIR)与机器人控制(RoboTTT)

文章图片
#人工智能
RL2-VLA:在 VLA 潜变量上做强化学习,让测试时 steering 只在失败时开启

RL2-VLA 针对视觉-语言-动作模型在域外指令下的性能衰退问题,提出一种测试时增强框架:冻结基础VLA,通过轻量强化学习(RL)策略在VLA潜变量上进行可微引导,结合失败检测与验证器,仅在必要时干预动作生成。其核心创新在于区分“是否介入”与“如何介入”,避免对可靠策略过度扰动。通过在潜空间施加RL steering,生成更具多样性的候选动作,突破原分布局限,显著提升OOD泛化能力。

文章图片
#人工智能
TrAct:用视觉轨迹把机器人的“预测“和“控制“接起来

TrAct提出以视觉轨迹替代动作作为世界模型与策略的共享接口,解决动作条件化预测中因本体差异和欠定映射导致的幻觉问题。通过联合预测动作与2D轨迹(夹爪+场景网格点),并用轨迹条件化世界模型生成可评估的未来画面,再以视觉-语言模型在图像空间直接对照指令打分,实现更可靠的闭环决策。该方法将评估锚定于可解释的图像空间,显著提升仿真(0.27→0.55)与真机任务成功率(0.49→0.76),并在视频质量

文章图片
#计算机视觉
世界动作模型近期工作:从预测未来到指导行动

世界动作模型(WAM)旨在让机器人在统一框架下同时解决“执行动作后世界如何变化”与“应采取何种动作达成目标”两大问题。区别于传统视频生成模型,WAM聚焦于行动相关的未来表征,摒弃对无关视觉细节的过度建模。其核心在于将未来预测作为训练监督或推理工具,而非必须生成完整视频。当前研究呈现三类路径:显式联合生成未来与动作(如GR-1、UD-VLA)、仅用未来辅助训练(如LiLa-WAM)、测试时以未来模拟

文章图片
#计算机视觉#人工智能
    共 809 条
  • 1
  • 2
  • 3
  • 81
  • 请选择