logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

Physically Embodied Gaussian Splatting

【分析】论文将实时状态跟踪、前向物理模拟、新视角渲染和在线视觉校正统一到同一种机器人世界表示中。这种任务组合具有价值,但实验仍然更侧重于状态跟踪,而不是完整的动作条件规划基准。论文提出 Gaussian–粒子双重表示,通过刚性绑定关系连接 PBD 物理粒子与 3D Gaussian 外观。系统在每一帧先执行物理预测,再把多视角 RGB 重建残差转换为视觉力,以 30 Hz 的频率闭环校正物理状态。

文章图片
#3d
PIN-WM: Learning Physics-Informed World Models for Non-Prehensile Manipulation(学习基于物理信息的世界模型用于非抓取操作)

非抓取操作(例如受控的推/戳)虽然构成了一项基础的机器人技能,但由于其对涉及摩擦和恢复系数的复杂物理交互高度敏感,其学习仍然具有挑战性。为了实现鲁棒的策略学习和泛化,我们选择学习一个非抓取操作中涉及的3D刚体动力学世界模型,并将其用于基于模型的强化学习。我们提出了PIN-WM,一个基于物理信息的世界模型(Physics-Informed World Model),能够从视觉观测中以端到端的方式高效

文章图片
#学习#机器人
基于 3D Gaussian Splatting / 动态 Gaussian 表示的机器人世界模型:研究型文献综述

本综述系统梳理 2023—2026 年把 3DGS 或动态 Gaussian 表示用于机器人世界模型的代表性研究,并围绕预测表征、动作条件机制、动态建模、接触处理、数据集、计算资源、评测指标和闭环实验进行比较。检索显示:2023 年主要是 3DGS 表示本身的奠基期,明确面向机器人未来预测的工作从 2024 年出现;到 2025—2026 年迅速分化为三条路线:(1)学习式 Gaussian 未来

#机器人
GWM: Towards Scalable Gaussian World Models for Robotic Manipulation (面向可扩展的高斯世界模型用于机器人操作 ICCV 2025)

由于真实世界交互的低效性,在已学习的世界模型(world model)内部训练机器人策略正成为一种趋势。已有的基于图像的世界模型和策略已经展现出一定的成功,但它们缺乏鲁棒的几何信息,而这对三维世界的一致空间和物理理解至关重要——即便这些模型已经在互联网规模的视频源上进行了预训练。基于3D的世界模型让机器人从“看图说话”升级为“空间推演”,所以就算换环境、换光照,它依然能精准地规划动作。为此,我们提

文章图片
#机器人
Video World Model 和 3DGS WM 针对具身智能数据集场景的区别

是:从少量真实观测中,自动获得具有可辨识性和可迁移性的质量、质心、静/动摩擦、恢复系数、刚度、阻尼等参数,再准确预测任意新外力和接触条件下的未来多视角视频。:本质上更接近“神经渲染 + 物理仿真”的混合体,可以生成带物理标签的交互轨迹,适合训练强化学习、系统辨识和模型预测控制。对“受力物体”这种任务,受力大小、摩擦系数、质量分布等关键量无法被精确建模,只是隐式地“模仿”训练视频中的运动模式。能输出

文章图片
#3d
ContactGaussian-WM:从视频中学习基于物理的世界模型(2026.2 arXiv)

开发能够理解复杂物理交互的世界模型,对于推进机器人规划与仿真至关重要。然而,现有方法在数据稀缺且接触丰富的动态运动场景下,往往难以精确地对环境进行建模。为应对这些挑战,我们提出了 ContactGaussian-WM,一个可微分的基于物理的刚体世界模型,能够直接从稀疏且富含接触的视频序列中学习复杂的物理规律。我们的框架包含两个核心组件:(1)一种统一的 Gaussian 表示,同时用于视觉外观和碰

文章图片
#学习
到底了