
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
SEW-Mimic技术解析摘要(150字) SEW-Mimic是一种用于上半身人形机器人遥操作的闭式几何重定向求解器,通过重新定义重定向为方向对齐问题而非位置匹配,解决了现有方法在计算速度和姿态相似度上的不足。该算法基于三个经典几何子问题的闭式解,实现高速(0.33ms)、高精度的姿态映射,无需迭代优化。核心创新包括方向对齐的数学框架、安全滤波器设计及开源实现验证。实验表明其在速度、精度和策略学习
摘要:NVIDIA GEAR实验室最新研究SONIC首次将规模化训练范式引入人形机器人控制领域,通过21万GPU小时训练出42M参数的通用全身控制器。该研究突破性地将"运动追踪"确立为基础任务(类比NLP中的语言建模),利用动作捕捉数据的密集监督特性,在100M帧训练数据上实现99.6%的新运动类型追踪成功率。其关键技术包括FSQ量化器构建的通用令牌空间、生成式运动规划器架构,以及与VLA模型的无
Kimodo是一项系统性工程,通过大规模高质量数据、精心设计的运动表示、创新的两阶段去噪架构,在运动质量、控制精度和泛化能力上实现了显著突破。它不仅推动了可控人体运动生成领域的边界,更重要的是,它提供了一个实用、直观且高效的运动创作工具,并展示了在机器人领域的直接应用前景,为后续研究(特别是如何进一步扩展数据和模型)奠定了坚实基础。
摘要:NVIDIA GEAR实验室最新研究SONIC首次将规模化训练范式引入人形机器人控制领域,通过21万GPU小时训练出42M参数的通用全身控制器。该研究突破性地将"运动追踪"确立为基础任务(类比NLP中的语言建模),利用动作捕捉数据的密集监督特性,在100M帧训练数据上实现99.6%的新运动类型追踪成功率。其关键技术包括FSQ量化器构建的通用令牌空间、生成式运动规划器架构,以及与VLA模型的无
本文介绍了斯坦福与英伟达联合提出的PointWorld框架,这是一种通过3D点流统一表示物理状态与机器人动作的创新方法。研究者构建了包含200万轨迹、500小时的大规模数据集,训练基于PointTransformerV3的3D世界模型,使机器人仅凭单张RGB-D图像就能预测动作引发的3D场景变化。实验表明,该模型遵循规模化定律,参数扩展至10亿时性能持续提升,并在真实环境中零样本完成了刚性推动、可
本文摘要(150字): Dex-BEV提出了一种创新的3D对齐框架,解决了现有视觉-语言-动作模型在机器人操控中的两个核心问题:输入缺乏3D感知和输入-输出空间不对齐。通过将多视角观测统一映射到共享BEV坐标系,并结合顶点频谱技术实现深度感知,系统显著提升了跨本体、跨视角的泛化能力。实验表明,在仿真和真实场景中,Dex-BEV相比基线方法成功率提升最高达23.3%,尤其在视角扰动和跨平台迁移任务中
在 Python 开发中,代码风格问题常引发团队讨论。为了终结这些无谓的争论,专注于更重要的事情,开发者们创造了各式各样的自动化工具。其中,Google 的 YAPF 以其高灵活性著称;而 Black 则凭借不妥协的固执风格横扫社区,成为事实标准;一颗耀眼的新星 Ruff 更是标榜着颠覆性的性能和集成的全方位功能。
摘要 本文提出GRITS框架,用于机器人食物舀取任务中的溢出规避。GRITS通过结合引导扩散策略和溢出预测器,在保证任务成功率的同时显著降低食物溢出风险。具体而言,该方法在仿真环境中构建多样化数据集训练溢出预测器,并在扩散策略推理阶段利用预测器作为可微分引导信号优化轨迹。实验结果表明,GRITS在10种未见食物类别上实现了82%的任务成功率和仅4%的溢出率,相比无引导基线方法溢出率降低40%以上。
RIGVid系统创新性地利用视频扩散模型生成任务演示视频,使机器人无需物理演示即可学习复杂操作。系统流程包括:1)基于语言指令生成潜在视频并用VLM过滤无效结果;2)通过6D位姿跟踪器提取物体轨迹;3)以具身无关方式重定向到机器人。
本文提出了一种名为Real-Time Chunking (RTC)的新型推理算法,用于解决机器人控制中视觉-语言-动作模型(VLA)推理速度慢导致的实时控制问题。RTC通过软掩码机制和基于流匹配的引导生成技术,在不重新训练模型的情况下实现边执行边思考的异步控制。实验表明,RTC在高延迟条件下仍能保持动作平滑性和任务成功率,显著优于传统同步推理和分块方法。该方法适用于各类扩散或流匹配模型,为机器人实







