
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
Cosmos-Predict2.5是统一Text2World、Image2World、Video2World的流式视频世界模型,经2亿视频训练并引入强化学习优化,较前代在质量和指令对齐上显著提升。配套Cosmos-Reason1文本编码器增强控制,并通过Cosmos-Transfer2.5支持多模态控制,以及动作条件生成,为机器人仿真提供可靠方案。
Cosmos-Reason1提出多模态大语言模型,通过视频感知物理世界,结合物理常识与具身推理,生成自然语言决策。模型采用分层本体和二维本体定义推理能力,经物理AI监督微调与强化学习两阶段训练,并利用基于规则可验证的奖励优化性能,显著提升物理常识推理和具体决策能力。
本文解读了去噪扩散概率模型(DDPM)的核心思想及其在图像合成中的应用。该模型受非平衡热力学启发,通过正向加噪和反向去噪的马尔可夫链过程,学习数据分布。正向过程将真实图像逐步加噪为标准高斯分布,反向过程则通过训练神经网络预测噪声或均值,实现从噪声到图像的生成。文章重点分析了模型的关键参数化选择:固定方差以简化训练目标,将复杂的协方差预测转化为噪声预测的均方误差任务。虽然这种简化牺牲了对数似然性能,
本文提出了一种低成本远程操作系统(ALOHA)和新型模仿学习算法ACT(Action Chunking with Transformers),用于精细双手操作任务。ALOHA系统采用两套低成本机械臂(总预算2万美元)实现关节映射遥操作,通过3D打印组件增强回驱功能。ACT算法通过动作分块(预测未来k步动作序列)减少复合误差,并引入Transformer架构的条件变分自编码器(CVAE)来建模动作多
代码开源,但没有research blog了。GR00T N1.7的新增功能GR00T N1.7基于N1.6构建,具有新的VLM骨干网和代码级改进。N1.6的主要变化新的VLM骨干网:Cosmos-Reason2-2B(Qwen3 VL架构),取代了N1.6中使用的Eagle骨干网。支持灵活的分辨率,并以其原生纵横比对图像进行编码,无需填充。简化的数据处理管道(processing_gr00t_n
SONIC提出了一种基于大规模运动跟踪的通用人形控制框架,通过扩大模型规模和数据量实现自然全身运动。其核心贡献包括:(1) 实时运动规划器连接运动跟踪与任务执行,实现交互式控制;(2) 统一token空间支持VR设备、视频、文本等多模态输入。系统采用密集运动捕捉监督训练PPO策略,通过专用编码器处理不同输入模态并量化为通用token,再由解码器生成动作。实验表明,该系统能实现高精度远程操作和复杂运
SONIC提出了一种基于大规模运动跟踪的通用人形控制框架,通过扩大模型规模和数据量实现自然全身运动。其核心贡献包括:(1) 实时运动规划器连接运动跟踪与任务执行,实现交互式控制;(2) 统一token空间支持VR设备、视频、文本等多模态输入。系统采用密集运动捕捉监督训练PPO策略,通过专用编码器处理不同输入模态并量化为通用token,再由解码器生成动作。实验表明,该系统能实现高精度远程操作和复杂运
本文提出了一种结合视觉-语言-动作模型(VLA)与强化学习的高效在线学习方法。核心创新是引入RL令牌(RLT)作为VLA与强化学习的接口:1)通过自编码器结构压缩VLA输出为紧凑的RL令牌表示;2)基于该表示训练轻量级的行动者-评论家网络;3)使用正则化器将学习策略锚定在VLA建议动作附近。这种方法既保留了VLA的预训练知识,又能通过在线强化学习快速优化策略。实验表明,该方法仅需数小时实际交互即可
本文提出多尺度具身记忆模型(MEM),通过融合视觉和语言模态实现长视野机器人控制。系统采用双路径架构:1)视频编码器压缩短期视觉记忆,通过改进的ViT结构实现时空注意力高效计算;2)语言记忆机制记录语义事件,支持分钟级任务规划。创新性地将动作预测分解为高级策略(基于语言记忆生成子任务)和低级策略(执行短期动作),在保持预训练模型兼容性的同时,显著扩展了记忆时长和处理能力。该方法有效解决了长视野任务
本文提出RECAP方法,通过优势条件策略实现视觉语言动作模型(VLA)的强化学习训练。该方法整合演示数据、自主收集数据和专家干预,首先通过离线RL预训练通用VLA模型π*0.6,再针对下游任务进行优化。核心创新在于:1)使用多任务价值函数Vπref评估状态价值;2)基于优势函数Aπ生成改进指标It指导策略优化。实验表明,该方法能显著提升任务成功率和执行效率。相比传统方法,RECAP通过价值函数引导







