logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

复旦&清华OccLLaMA:首个自动驾驶具身世界模型!全面增强Occ、规划等一切任务!

多模态大语言模型的兴起刺激了其在自动驾驶中的应用。最近基于MLLM的方法通过学习从感知到动作的直接映射来执行动作,忽略了世界的动态以及动作和世界动态之间的关系。相比之下,人类拥有世界模型,使他们能够基于3D内部视觉表示来模拟未来状态,并相应地计划行动。为此,我们提出OccLLaMA,一个占据-语言-动作生成世界模型,它使用语义占据作为一般的视觉表示,并通过自回归模型统一视觉-语言-动作(VLA)模

文章图片
#自动驾驶#人工智能#机器学习 +3
具身智能方向,开源顶会方案大盘点(第一期)

点击下方卡片,关注「3D视觉工坊」公众号选择星标,干货第一时间送达来源:计算机视觉工坊添加小助理:cv3d008,备注:方向+学校/公司+昵称,拉你入群。文末附3D视觉行业细分群。扫描下方二维码,加入「3D视觉从入门到精通」知识星球,星球内凝聚了众多3D视觉实战问题,以及各个模块的学习资料:近20门秘制视频课程、最新顶会论文、计算机视觉书籍、优质3D视觉算法源码等。想要入门3D视觉、做项目、搞科研

一文搞懂ROS2 Nav2:概念解析和源码编译安装的踩坑总结

当我们执行到叶子节点时,也就是具体最终执行的动作,比如ComputePathToPose节点,就是规划机器人起点到终点的全局路径。PipelineSequence:也是行为树控制节点,可以有多个孩子,这里假设由两个孩子,左边的孩子是child1,右边的孩子是child2,如果child1执行成功,则会执行child2,如果child2返回RUNNING,则又会去执行child1,主要特点是在某个子

完爆全部YOLO家族!RT-DETRv3突破目标检测网络的极限!

RT-DETR是第一款基于实时端到端转换器的物体检测器。它的效率来自于框架设计和匈牙利匹配。然而,与YOLO系列等密集监督检测器相比,匈牙利匹配提供的监督要稀疏得多,导致模型训练不足,难以实现最佳结果。为了解决这些问题,我们提出了一种基于RT-DETR的分层密集正监督方法,命名为RT-DETRv3。首先,我们引入一个基于CNN的辅助分支,它提供密集的监督,与原始解码器协作来增强编码器特征表示。其次

文章图片
#目标检测#人工智能#transformer +3
无惧遮挡 & 小目标!复旦开源UAV-DETR:无人机图像的高效端到端目标检测

我们设计了UAV-DETR,一个专门设计用于无人机图像的实时端到端物体检测器。通过引入MSFF-FE模块、FD模块和SAC模块,UAV-DETR有助于缓解在航空图像中检测小物体和遮挡物体的困难。在VisDrone和UAVVaste数据集上的实验结果表明,我们的方法在保持实时推理速度的同时,比现有方法在类似计算成本下实现更高的准确性。未来的工作将侧重于提高其对噪声的鲁棒性。对更多实验结果和文章细节感

文章图片
#开源#无人机#目标检测 +4
3D重建大一统!Stability AI开源SPAR3D:0.7秒从单个图像生成3D对象!

我们提出了SPAR3D,这是一种简单而有效的单视图3D重建方法。我们模型的核心是基于点采样的两阶段设计。我们首先通过点扩散生成稀疏点云,然后结合点云和图像重建高精度网格。这种设计使我们能够充分利用基于回归和生成建模的优势。在标准基准测试和实景图像上的评估表明,SPAR3D以快速的推理速度显著优于以往最先进的方法。我们将在论文发表时发布我们的模型,并希望我们的工作对未来研究实现高质量3D内容的可扩展

文章图片
#3d#人工智能#自动驾驶 +3
ECCV‘24开源 | 最强跟踪一切!

我们提出了一个简单的,自我监督的方法来跟踪任意点(TAP)问题。我们训练一个全局匹配转换器,通过对比随机行走在视频中寻找循环一致的轨迹,使用转换器的基于注意力的全局匹配来定义时空图上随机行走的转移矩阵。在点之间执行“所有对”比较的能力允许模型获得高空间精度并获得强对比学习信号,同时避免了最近方法的许多复杂性(例如从粗到细的匹配)。为此,我们提出了许多设计决策,允许通过使用周期一致性的自我监督来训练

文章图片
#3d#人工智能#开源 +1
无需训练的开源插件3DGS-to-PC:将3DGS直接转换为稠密点云或Mesh!

在本研究中,我们提出了3DGS-to-PC框架,该框架能够从3DGS(三维几何形状)场景中稳健地生成高质量的点云表示。我们的方法通过分析高斯分量对渲染图像中像素颜色的贡献,有效地计算出高斯颜色,从而确保生成的点云中颜色表示的准确性。点的分布与每个高斯分量的体积成正比。利用马氏距离识别出的离群点将被移除并重新生成,以确保3DGS场景的真实表示。该框架还支持通过泊松表面重建生成网格,该方法应用于从预测

文章图片
#3d#自动驾驶#计算机视觉 +1
清华最新综述!基于深度学习的6D目标位姿估计

点击下方卡片,关注「计算机视觉工坊」公众号选择星标,干货第一时间送达作者:Jian Liu |编辑:计算机视觉工坊添加小助理:dddvision,备注:方向+学校/公司+昵称,拉你入群。文末附行业细分群扫描下方二维码,加入3D视觉知识星球,星球内凝聚了众多3D视觉实战问题,以及各个模块的学习资料:近20门视频课程(星球成员免费学习)、最新顶会论文、计算机视觉书籍、优质3D视觉算法源码等。想要入门.

#深度学习#人工智能
机器人姿态学习与控制的最优解!Robo-GS:实现机械臂与环境的联动建模

Real2Sim2Real在机械臂控制和强化学习中起着至关重要的作用,然而,由于机器人及其操纵的对象的复杂物理属性,弥合这一差距仍然是一个重大挑战。现有的方法缺乏全面的解决方案来精确地重建具有空间表示及其相关物理属性的真实世界对象。我们提出了一个具有混合表示模型的Real2Sim管道,该模型集成了网格几何、3D高斯核和物理属性,以增强机械臂的数字资产表示。这种混合表示是通过高斯网格像素绑定技术实现

文章图片
#机器人#学习#人工智能 +4
    共 77 条
  • 1
  • 2
  • 3
  • 8
  • 请选择