
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
最近做雷达视觉前融合算法,在笔记本/服务器搭建深度学习环境,并运行模型验证,这里记录下过程和经验教训。

本文围绕3D目标检测任务,提出了——一种基于查询的雷达-相机融合Transformer框架,突破了传统BEV融合的性能瓶颈。图1 RaCFormer 的动机。(a) 以往的方法通常通过拼接或交叉注意力的方式将来自图像视角转换和雷达点云编码的 BEV 特征进行融合。(b) 相比之下,RaCFormer 采用基于查询的融合框架,同时采样雷达增强的图像视角特征、摄像机变换后的 BEV 特征以及雷达编码的

本文围绕3D目标检测任务,提出了——一种基于查询的雷达-相机融合Transformer框架,突破了传统BEV融合的性能瓶颈。图1 RaCFormer 的动机。(a) 以往的方法通常通过拼接或交叉注意力的方式将来自图像视角转换和雷达点云编码的 BEV 特征进行融合。(b) 相比之下,RaCFormer 采用基于查询的融合框架,同时采样雷达增强的图像视角特征、摄像机变换后的 BEV 特征以及雷达编码的

查询最初被初始化为 BEV 空间中的稀疏柱体集合。区别于传统方法使用3D参考点作为query初始化,SparseBEV采用BEV空间的柱体作为query初始形式:每个query包含位置(x,y,z)、尺寸(w,l,h)、旋转θ、速度[vx,vy]及对应的D维特征,z初始化为0、h初始化为4m,引入了更合理的空间先验,相比参考点可带来0.5NDS的性能提升。要缩小稀疏方法与稠密方法的性能差距,需要同

自动驾驶的核心感知任务(3D目标检测、BEV语义分割)长期采用不同范式:多相机3D检测主流为图像视角方法(如FCOS3D、PGD),而BEV语义分割由BEV视角方法主导,无法复用计算资源,且图像视角方法对目标位置、朝向、速度的感知精度有限。BEV空间与自动驾驶下游任务(路径规划、决策)的定义空间一致,更易精准感知目标的平移、尺度、朝向、运动速度等几何属性,且具备支撑多任务统一建模的潜力。2D检测的

这篇论文提出了——面向雷达3D目标检测的跨模态知识蒸馏框架,核心目标是将激光雷达(LiDAR)的特征知识迁移到雷达模型中,解决雷达数据固有的稀疏、噪声大、分辨率低的问题。图1. 提出的RadarDistill方法示意图。我们的RadarDistill方法能够实现从LiDAR特征向雷达特征的知识迁移,从而提升用于鸟瞰图(BEV)目标检测的雷达特征质量。

Sparse4D v2通过结构、效率、训练优化三重改进,验证了稀疏感知算法可以同时兼顾高精度、高推理效率、端到端适配性,为自动驾驶多视图时序感知提供了新的基线方案。

纯视觉BEV感知是自动驾驶的主流技术方向之一:它将多摄像头采集的2D图像特征转换为统一的自车坐标系下3D BEV特征,成本远低于激光雷达方案,同时能为3D目标检测、运动预测、语义地图分割等下游自动驾驶任务提供语义丰富、空间统一的输入基础。

最近做雷达视觉前融合算法,在笔记本/服务器搭建深度学习环境,并运行模型验证,这里记录下过程和经验教训。

黑色的样本是非核心对象。从接收到点云开始,先对点云做标定、坐标转换、噪点剔除、动静分离,再分别对动态目标和静态目标做聚类,然后根据聚类结果做目标的特征分析和检测等,之后对符合条件的聚类结果做目标起始、关联和跟踪等处理,输出目标结果。其中,ϵ描述了某一样本的邻域距离阈值,MinPts描述了某一样本的距离为ϵ的邻域中样本个数的阈值。有了朝向之后,可以计算聚类点云在朝向方向上的投影,从而计算长宽,这样聚








