logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

解锁具身智能时空密码!LLaVA-ST:多模态大模型的细粒度时空理解

论文提出的LLaVA-ST是首个能够端到端处理细粒度时空多模态理解任务的MLLM。通过引入LAPE和STP模块,LLaVA-ST显著提高了模型在多个基准测试中的性能。实验结果表明,LLaVA-ST在处理时空交错任务时具有显著优势,并且在开放式视频问答和多选题视频问答任务中也表现出色。LLaVA-ST的提出为未来的MLLMs在细粒度多模态理解任务上的改进提供了重要的参考。

文章图片
#人工智能#深度学习
ACL-2024 | 具身智能空间理解能力几何?EmbSpatial-Bench:视觉语言大模型在具身任务中空间理解水平测试基准

论文提出了EmbSpatial-Bench和EmbSpatial-SFT,用于评估和改进LVLMs在具身任务中的空间理解能力。实验结果表明,当前典型的LVLMs在具身场景中的空间理解能力较弱,但通过指令微调可以显著提高其性能。该研究为LVLMs在具身AI系统中的应用提供了重要的基准和数据支持。

文章图片
#人工智能#深度学习
arXiv-2024 | 具身智能体要上天!CITYNAV:基于地理信息的无人机视觉语言导航数据集

论文介绍了CityNav,一个城市规模的空中视觉语言导航数据集,包含了32,637个描述和人类标注的轨迹,为基准测试和开发先进的智能空中智能体提供了宝贵的资源。通过实验验证,提出的MGP模型显著提高了导航性能,并在具有挑战的条件下保持了鲁棒性。尽管如此,CityNav任务仍需要更复杂的规划和高级的空间推理能力。

文章图片
#人工智能
纽约大学具身智能体在城市空间中的视觉导航之旅!CityWalker:从海量网络视频中学习城市导航

CityWalker通过利用大规模网络视频数据,显著提升了城市导航的性能,证明了数据扩展对于开发鲁棒导航策略的潜力。

文章图片
#人工智能#深度学习
清华大学具身智能最新万字综述!形态、行动、感知与学习的协同效应

论文总结了具身智能的发展,特别是具身人工智能(EAI)的研究。提出了统一的具身智能框架,强调了形态学、动作、感知和学习之间的协同作用。未来的研究可以从这些组件的内在联系中受益。

文章图片
#人工智能
阿德莱德学习推理与导航!PEAP-LLM:基于大语言模型的参数高效动作规划

提出了参数高效的动作规划器PEAP-LLM,使智能体能够在每个位置与LLM交互以获得单步指令,从而提高导航效率!

文章图片
#人工智能
南科大一个数据集摆平具身任务!ARIO:用于多功能、通用具身智能体的标准统一数据集

论文提出的ARIO标准和新数据集显著改善了具身AI数据集的不足,提供了更丰富、更多样化和更大规模的数据。通过提供统一的数据格式和标准化的数据处理流程,ARIO为开发更强大、更通用的具身AI智能体铺平了道路。

文章图片
#人工智能#深度学习
清华大学具身智能多传感器融合感知综述:背景、方法、挑战与展望

具身智能多传感器融合感知在具身AI中具有重要的作用,通过整合多种传感器数据,可以显著提高系统的感知能力和决策准确性!

文章图片
#人工智能#无人机#机器人 +1
解锁具身智能时空密码!LLaVA-ST:多模态大模型的细粒度时空理解

论文提出的LLaVA-ST是首个能够端到端处理细粒度时空多模态理解任务的MLLM。通过引入LAPE和STP模块,LLaVA-ST显著提高了模型在多个基准测试中的性能。实验结果表明,LLaVA-ST在处理时空交错任务时具有显著优势,并且在开放式视频问答和多选题视频问答任务中也表现出色。LLaVA-ST的提出为未来的MLLMs在细粒度多模态理解任务上的改进提供了重要的参考。

文章图片
#人工智能#深度学习
ICCV-2025 | 斯坦福人形机器人自主导航!LookOut:真实环境人形机器人第一人称视角导航

论文提出了LookOut模型,用于从第一人称视角视频预测未来6D头部姿态轨迹,以实现人形机器人在真实世界中的无碰撞导航,并贡献了相应的数据收集流程和数据集,通过实验验证了模型的有效性和泛化能力!

文章图片
#机器人#人工智能
    共 282 条
  • 1
  • 2
  • 3
  • 29
  • 请选择