
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
极大提升数据效率(1个演示就能训练)显著增强泛化能力(跨场景、跨任务)无需复杂奖励函数或价值函数,训练更稳定。

WikiChat:从 WikiPedia 中检索数据来提高 LLM 的事实性的聊天机器人

论文精读:Chain-of-Thought Prompting Elicits Reasoning in Large Language Models使用思维链提示来增强语言模型的表现

GRAM 是第一个“生成式基础奖励模型”,通过无监督预训练 + 有监督微调 + 标签平滑,显著提升了奖励模型在多个任务上的泛化能力,且只需极少标注数据。场景用法没有标注数据直接用 GRAM 做奖励模型有少量标注数据微调 GRAM,快速适配做 RLHF用 GRAM 替代传统判别式 RM做评估用 GRAM 做自动评价器(代替 GPT-4)

关键词:#具身智能 #双臂机器人 #benchmark。

核心贡献公开了 GR00T-N1-2B 模型权重、训练数据、仿真环境(GitHub+HuggingFace),降低通用机器人研究门槛;技术突破:双系统 VLA 架构解决 “推理慢 + 动作笨” 的矛盾,数据金字塔解决 “数据稀缺”,为后续通用机器人模型提供范式;落地验证:在真实 GR-1 人形机器人上实现 “语言指令控制双手操作”,证明基础模型在人形机器人上的可行性。局限性任务范围:目前仅支持 “

本文提出了,一个可扩展的仿真框架,通过集成 MLLM-based 任务生成、本体适应行为合成和全面的领域随机化,解决了现有合成数据生成方法的局限性。实验结果表明,RoboTwin 2.0 在提高策略对杂乱环境的鲁棒性、对未见任务的泛化能力以及跨本体操作方面具有显著效果。该框架为鲁棒的双臂操作提供了统一的基准和可扩展的仿真到现实管道,未来的工作将重点放在现实世界部署和多对象任务复杂性上。

ConRFT 是一种高效、安全、实用的VLA模型强化微调方法,只需 20 个演示+ 1 小时在线训练,就能让机器人在复杂真实任务中达到 96% 成功率,比传统方法快、稳、强。后续可探索 “更智能的奖励设计”“感知 - 动作联合微调”,进一步提升 VLA 模型的通用操控能力。

RoboBench是一个面向具身智能的多模态大语言模型评估基准,旨在系统性评估 MLLMs 作为机器人"具身大脑"的认知能力。该基准针对动态非结构化环境中的操作任务,定义了五个核心评估维度:指令理解、感知推理、广义规划、可操作性预测和失败分析,覆盖 14 项能力、25 项任务和 6092 个问答对。1)构建真实场景数据集,整合大规模真实机器人数据与自采数据,涵盖单臂/双臂/移动操作、多视角遮挡场景

关键词:#具身智能 #双臂机器人 #benchmark。








