
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
本文提出了一种名为StableWorld的方法,通过智能地“扔掉”那些开始变模糊或变形的历史画面,只保留清晰的画面作为参考,从而让AI生成的长视频在长时间互动中保持稳定,不再“崩坏”。
本文发布了一个名为 EmbodiedScan 的超大规模室内3D场景数据集,并基于此提出了一个名为 Embodied Perceptron 的基准模型,旨在解决具身智能体在第一人称视角下对3D环境进行全方位感知和理解的问题。

作者通过收集海量机器人操作数据,发现并验证了数据 scaling law,证明了只要收集足够多样的环境和物体数据,简单的模仿学习就能让机器人学会零样本泛化。

本文开发了一套能让AI游戏角色在玩《宝可梦》时“自己教自己”怎么玩得更好的系统,不用每次失败后重头开始,而是像人一样从经验中积累技能和记忆,持续变强。
腾讯团队研发了一套专为机器人设计的视觉语言模型(VLM),通过独特的架构和训练方法,让机器人能更精准地看懂世界、进行空间推理并规划行动。

只用了很少的真机训练数据(7.5k条),通过“P图”扩充数据和“预测动作片段”而非单步动作,训练出了一个能听懂人话、在没见过的厨房场景里也能完成多种复杂任务的通用机器人。
本文提出了一种名为 RoboClaw 的机器人框架,通过让机器人自己“收集数据、学习技能、执行复杂任务”,解决了长程任务中依赖人工重置环境和技能衔接脆弱的难题。

在模拟实验中,当推理延迟较高时,其性能甚至优于推理时RTC。RTC在模拟和真实世界的灵巧操作任务中(如点燃火柴)都表现出极强的延迟鲁棒性,显著提升了任务完成速度和成功率。这篇论文提出了一种名为“实时分块”(RTC)的推理算法,让机器人能在不等待模型计算完成的情况下,平滑地执行下一个动作序列,从而解决了大型模型推理延迟高导致的动作卡顿问题。这篇论文提出了一种名为“训练时RTC”(Training-t

作者为了解决现有AI数字人反应慢、像“机器人”的问题,提出了一个名为的原生流式模型,它能在一个里同时处理音视频的输入输出,实现了约550毫秒的超低延迟全双工交互。这篇论文最大的贡献是证明了用一个统一的模型就能搞定实时的音视频交互,不再需要繁琐的模块拼接。目前的局限是生成的视频分辨率还较低(192p),但这为未来开发真正“活”的数字人指明了方向,值得精读其架构设计思路。

作者为了解决VLA模型泛化能力差、需要大量演示数据的问题,提出了一个名为Agentic-VLA的在线自适应框架,通过让模型在交互中自我进化和利用过往经验,在LIBERO基准测试中将长程任务成功率提升了12.3%,并将收敛速度提高了2.4倍。这篇论文最大的贡献是证明了通过引入“智能教练”机制(动态奖励、语言引导、经验记忆),可以让VLA模型具备像人一样的持续学习能力。虽然目前主要在仿真环境中验证,且







