
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文开发了一套能让AI游戏角色在玩《宝可梦》时“自己教自己”怎么玩得更好的系统,不用每次失败后重头开始,而是像人一样从经验中积累技能和记忆,持续变强。
腾讯团队研发了一套专为机器人设计的视觉语言模型(VLM),通过独特的架构和训练方法,让机器人能更精准地看懂世界、进行空间推理并规划行动。

只用了很少的真机训练数据(7.5k条),通过“P图”扩充数据和“预测动作片段”而非单步动作,训练出了一个能听懂人话、在没见过的厨房场景里也能完成多种复杂任务的通用机器人。
本文提出了一种名为 RoboClaw 的机器人框架,通过让机器人自己“收集数据、学习技能、执行复杂任务”,解决了长程任务中依赖人工重置环境和技能衔接脆弱的难题。

在模拟实验中,当推理延迟较高时,其性能甚至优于推理时RTC。RTC在模拟和真实世界的灵巧操作任务中(如点燃火柴)都表现出极强的延迟鲁棒性,显著提升了任务完成速度和成功率。这篇论文提出了一种名为“实时分块”(RTC)的推理算法,让机器人能在不等待模型计算完成的情况下,平滑地执行下一个动作序列,从而解决了大型模型推理延迟高导致的动作卡顿问题。这篇论文提出了一种名为“训练时RTC”(Training-t

作者为了解决现有AI数字人反应慢、像“机器人”的问题,提出了一个名为的原生流式模型,它能在一个里同时处理音视频的输入输出,实现了约550毫秒的超低延迟全双工交互。这篇论文最大的贡献是证明了用一个统一的模型就能搞定实时的音视频交互,不再需要繁琐的模块拼接。目前的局限是生成的视频分辨率还较低(192p),但这为未来开发真正“活”的数字人指明了方向,值得精读其架构设计思路。

作者为了解决VLA模型泛化能力差、需要大量演示数据的问题,提出了一个名为Agentic-VLA的在线自适应框架,通过让模型在交互中自我进化和利用过往经验,在LIBERO基准测试中将长程任务成功率提升了12.3%,并将收敛速度提高了2.4倍。这篇论文最大的贡献是证明了通过引入“智能教练”机制(动态奖励、语言引导、经验记忆),可以让VLA模型具备像人一样的持续学习能力。虽然目前主要在仿真环境中验证,且
Google DeepMind团队构建了基于Veo视频基础模型的生成式评估系统,用于在名义场景、分布外(OOD)场景及安全测试中评估双臂机器人的Gemini Robotics策略,并通过1600+次真实世界实验,验证该系统能准确预测策略相对性能、OOD下性能退化及安全漏洞。
逆动力学就是解决这个问题的方法。:与逆动力学相反,正向动力学则是当你知道作用在机器人上的力(例如电机提供的扭矩)时,预测机器人将会如何移动的过程。也就是说,给定机器人的当前状态(如位置和速度)以及施加于其上的力,正向动力学能够告诉我们接下来会发生什么,机器人将怎样改变它的位置或速度。在机器人学中,“inverse dynamics”(逆动力学)和 “forward dynamics”(正向动力学)

只用了很少的真机训练数据(7.5k条),通过“P图”扩充数据和“预测动作片段”而非单步动作,训练出了一个能听懂人话、在没见过的厨房场景里也能完成多种复杂任务的通用机器人。







