logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

智能体在真实世界中的感知与行动融合最新综述!探索多模态具身大模型:发展,数据集与未来方向

论文系统地回顾了具身多模态大模型的发展,分析了基础大模型的技术进步及其在具身任务中的应用。通过分析多个数据集的影响,识别了高质量数据在模型性能提升中的重要性。尽管EMLMs在多个领域取得了显著进展,但仍需解决跨模态对齐、计算资源效率和泛化能力等挑战。未来的研究应关注跨模态预训练和自监督学习,以实现更高效、更灵活的具身智能系统。本文的研究为EMLMs的未来发展提供了有价值的参考和启示。

文章图片
#人工智能#深度学习
香港大学强化学习驱动连续环境具身导航!VLN-R1:基于强化微调的视觉语言导航

VLN-R1通过整合LVLM和强化学习微调,为连续环境中的视觉语言导航提供了一种有效的解决方案

文章图片
#人工智能#深度学习
中山&清华:基于大模型的具身智能系统综述

本文综述了基于大模型的具身智能系统,介绍了大模型在具身智能中的感知与理解作用、控制层级、系统架构以及数据来源,并探讨了当前面临的挑战和未来发展方向!

文章图片
#人工智能#深度学习
浙大具身智能VLN+VLA统一框架!ODYSSEY:开放世界环境下四足机器人的长期探索与操作

论文提出面向四足机器人的长期移动操作任务的统一框架ODYSSEY,通过将分层任务规划与全身控制相结合,成功实现了从模拟到现实的迁移,并在多样化环境和长期任务中展现出强大的泛化能力!

文章图片
#机器人#人工智能
清华大学具身智能多传感器融合感知综述:背景、方法、挑战与展望

具身智能多传感器融合感知在具身AI中具有重要的作用,通过整合多种传感器数据,可以显著提高系统的感知能力和决策准确性!

文章图片
#人工智能#无人机#机器人 +1
迈向通用具身智能:具身智能的综述与发展路线

论文提出具身AGI的五级分类体系(L1-L5):从仅能完成单一任务的初级阶段(L1)到能够独立完成开放式任务且行为类似人类的高级阶段(L5),为具身AI的发展提供了明确的里程碑!

文章图片
#人工智能#深度学习#机器人
北师大具身AI的虚拟世界扩展!UNREALZOO:为具身智能打造高逼真度的虚拟世界

论文提出了UnrealZoo,一个多样化的照片级虚拟世界合集,旨在推动具身AI研究的发展。通过提供高质量的虚拟环境和优化的编程接口,UnrealZoo能够支持高效的单智能体和多智能体系统交互。实验结果表明,多样化的训练环境对智能体的泛化能力和鲁棒性至关重要,而基于RL的方法在处理动态环境和社交互动方面表现出色。未来的工作将继续丰富虚拟世界的场景、实体和交互任务,推动具身AI在现实世界中的应用。

文章图片
#人工智能#深度学习
中科院空天院无人机视觉语言导航新基准!AeroVerse:模拟、预训练、微调和评估空中无人机具身世界模型的测试基准

论文通过开发AeroVerse基准套件,解决了UAV具身世界模型的研究空白,提升了UAV智能体的端到端自主感知、认知和行动能力。构建了第一个大规模的真实世界图像-文本预训练数据集AerialAgent-Ego10k和虚拟图像-文本-姿态对齐数据集CyberAgent-Ego500k。首次明确了五个航天具身下游任务,并构建了相应的指令数据集。开发了基于GPT-4的自动化评估方法SkyAgent-Ev

文章图片
#人工智能#深度学习#无人机
纽约大学具身智能体在城市空间中的视觉导航之旅!CityWalker:从海量网络视频中学习城市导航

CityWalker通过利用大规模网络视频数据,显著提升了城市导航的性能,证明了数据扩展对于开发鲁棒导航策略的潜力。

文章图片
#人工智能#深度学习
清华大学具身智能最新万字综述!形态、行动、感知与学习的协同效应

论文总结了具身智能的发展,特别是具身人工智能(EAI)的研究。提出了统一的具身智能框架,强调了形态学、动作、感知和学习之间的协同作用。未来的研究可以从这些组件的内在联系中受益。

文章图片
#人工智能
    共 283 条
  • 1
  • 2
  • 3
  • 29
  • 请选择