激光雷达点云的深度学习 3D 目标检测,其本质是从无序、稀疏、非均匀分布的三维点集 P = {pᵢ = (xᵢ, yᵢ, zᵢ, rᵢ)}ᵢ₌₁^N 中,回归出目标的 3D 定向包围盒(3D Bounding Box)及类别属性。

一个完整的点云深度学习检测算法,通常由
---------------------------------------------→ 点云表征(Representation) ---------------------------------------------→
---------------------------------------------→ 特征提取骨干网络(Backbone) ---------------------------------------------→
---------------------------------------------→ 俯视图融合压缩(Neck/BEV) ---------------------------------------------→
---------------------------------------------→ 检测头(Detection Head) ---------------------------------------------→
---------------------------------------------→ 损失函数与后处理 ---------------------------------------------→
构成。

下面系统性地介绍点云深度学习检测的主流技术流派、核心处理机制及检测全链路方法。


一、 六大核心方法流派(按空间表征划分)

点云检测的核心分歧在于如何将“无序、不规则的三维点”转化为神经网络可以高效计算的结构。目前业界演进出六大流派:

                             ┌── 1. 基于原始点 (Point-based): PointNet++, PointRCNN
                             ├── 2. 基于体素 (Voxel-based): VoxelNet, SECOND
激光雷达点云                   ├── 3. 基于柱状体 (Pillars): PointPillars, PillarNet
深度学习检测方法 ───────────────┼── 4. 基于距离图 (Range-view): LaserNet, RangeDet
                             ├── 5. 混合表征 (Point-Voxel Hybrid): PV-RCNN, Voxel-RCNN
                             └── 6. 基于 Transformer (Attention-based): TransFusion, SST, DSVT

1. 基于体素的方法 (Voxel-based)

  • 核心思路:
    • 将 3D 空间划分为细小的规则立方体(如 0.05m × 0.05m × 0.1m 的 Voxel),将无序点离散化为三维网格。
  • 关键技术:
    • 体素特征编码(VFE):每个体素内的所有点,通过简单的全连接层(MLP)提取局部统计特征并池化为单个向量。
    • 稀疏 3D 卷积(Sparse Convolution):由于三维空间 99% 的体素为空,常规 3D 卷积无法承受。采用流形稀疏卷积(Submanifold Sparse Conv),仅在包含点云的非空体素上进行卷积,计算量降低数十倍。
  • 代表作:
    • SECOND、Part-A²。

2. 基于柱状体的方法 (Pillar-based)

  • 核心思路:
    • 体素的极端工程化优化版本。在 X-Y 轴划分网格,但在 Z 轴(高度)不切分,形成贯通上下的一根根柱子(Pillar)。
  • 关键技术:
    • 柱内通过 PointNet 提取特征后,直接将三维点云拍平(Scatter)成为标准的 2D 鸟瞰图(BEV 伪图像)。
    • 后续全部使用成熟且极速的 2D CNN 进行多尺度特征提取与目标回归。
  • 代表作:
    • PointPillars、PillarNet。

3. 基于原始点的方法 (Point-based)

  • 核心思路:
    • 摒弃任何离散化网格,完全保留原始点云的高精度空间坐标,直接使用连续空间操作。
    • 关键技术:
      • FPS(最远点采样):均匀筛选空间骨架点。
      • Ball Query(球状检索)与 Set Abstraction:聚合邻近点的相对几何坐标。
    • 特点:对小物体的定位精度极高,但由于点云之间频繁的近邻距离计算(O(N²)),耗时极长,很难在车载端实时运行。
  • 代表作:
    • PointRCNN、3DSSD。

4. 混合表征方法 (Point-Voxel Hybrid)

  • 核心思路:
    • 结合体素的高效率与原始点的高精度。
  • 典型架构:
    • 第一阶段通过 3D 体素卷积快速提取全局上下文并生成候选框(Proposals);第二阶段通过最远点采样在候选框内部聚合原始点特征,进行超高精度的二次微调(Refinement)。
  • 代表作:
    • PV-RCNN、Voxel-RCNN。

5. 基于距离图的方法 (Range View / Range Image)

  • 核心思路:
    • 激光雷达采集点云时本质是按激光线束(俯仰角 θ)和旋转步进(水平方位角 φ)进行的。因此可直接将点云投影展开为一张 H × W 的二维柱面全景图(Range Image,通道为 [r, x, y, z, 反射率])。
  • 特点:
    • 天然密集、无信息损失,可直接跑 2D 卷积。但缺点是物体尺度在远近距离会发生严重畸变(近大远小),导致 3D 回归难度大。
  • 代表作:
    • LaserNet、RangeDet。

  1. 基于 3D Transformer 的检测方法 (前沿趋势)
  • 核心思路:

    • 利用自注意力机制(Self-Attention)捕捉点云长距离依赖,克服稀疏点云上下文断裂的难题。
  • 关键技术:

    • SST (Single Stride Transformer):在局部体素块内部做 Attention,彻底取消下采样,保留细粒度特征。
    • DSVT (Dynamic Sparse Voxel Transformer):由旷视/清华提出,动态划分窗口并行做 Attention,是目前各大榜单(nuScenes / Waymo)的 SOTA 方案。
    • TransFusion:在 BEV 特征图上使用 Object Query 进行两阶段的注意力和图像交叉融合。

    二、 核心检测头(Detection Head)分类

    提取到 BEV 特征后,如何预测 3D 边界框?业界主要分为两大路线:

    1. 基于锚框(Anchor-based Head)

    • 原理:在 BEV 的每个格子上,预先放置多个不同尺寸、预设朝向(如 0^∘, 90^∘)的先验 3D Anchor。
    • 流程:网络预测真实框相对于 Anchor 的偏移量 (Δ x, Δ y, Δ z, Δ l, Δ w, Δ h, Δ θ)。
    • 缺点:3D 空间下目标的旋转角是连续的(0 ∼ 360^∘),预设 Anchor 数量庞大,导致计算冗余,正负样本极度不平衡。

2. 无锚框中心点预测(Anchor-free / Center-based Head - 业界绝对主流)

  • 代表:
    • CenterPoint。
  • 原理:
    * 将 3D 物体抽象为 BEV 上的一个中心点。
    1. 热力图分支(Heatmap):预测目标中心所在的位置概率峰值。
    2. 亚像素偏置(Sub-voxel Offset):预测 [dx,dy][dx, dy][dx,dy] 弥补体素化网格造成的坐标量化误差。
    3. 尺寸与绝对高度回归:回归实际高度 z 以及尺寸 [l,w,h][l, w, h][l,w,h]。
    4. 旋转角无奇异回归:网络回归 sin(θ) 与 cos(θ),完美解决角度在 ±π 处的边界突变跳跃。
    5. 速度回归:直接输出二维相对速度 [vₓ, v_y],天然支持多目标追踪。

三、 损失函数(Loss Functions)的设计

3D 检测的损失函数通常是多任务联合损失(Multi-task Loss):

  Lₜₒₜₐₗ = λ{cls}L{cls} + λ{reg}L{reg} + λ{dir}L{dir} + λᵢₒᵤLᵢₒᵤ
  1. 分类损失(L_{cls}):
    • 通常采用 Focal Loss 或 Gaussian Focal Loss,解决背景点云和前景物体之间极度不平衡(背景占 99% 以上)的问题。
  2. 位置与尺寸回归损失(L_{reg}):
    • 采用 Smooth L1 Loss 或 L1 Loss,对空间偏差、长宽高做鲁棒回归。
  3. 朝向判断损失(L_{dir}):
    • 当网络预测朝向为 θ 时,由于长方体对称性,反向预测(偏差 180^∘)在几何 IoU 上看起来差别很小,但在自动驾驶中会致命地将车头错判为车尾。因此专门设计二分类方向交叉熵损失(Direction Bin
      Loss),明确区分车头朝向。
  4. 3D IoU 辅助损失(Lᵢₒᵤ):
    • 引入 3D DIoU / GIoU,将位置、尺寸、角度耦合在一起作为全局约束,大幅提升 3D Bounding Box 的装配紧凑度。

四、 后处理:3D 非极大值抑制(3D NMS)

由于网络在目标周围会输出密集的冗余候选框,必须通过 NMS 进行过滤:

  • BEV 旋转 NMS(Rotated NMS):3D 目标很少在空中重叠,因此绝大多数系统直接在俯视图(BEV)二维旋转多边形上计算 IoU,剔除重叠多余框。
  • 基于中心点距离的局部极值筛选:在 CenterPoint 等现代网络中,直接在热力图上用 3 × 3 的 MaxPool 提取局部极大值,大幅减少了对传统耗时 NMS 的依赖。

五、 总结与量产选型建议

需求场景推荐算法方案核心技术特征为什么选它?
嵌入式端侧量产 (低算力/极致低延时)PointPillars柱状化 + 全 2D CNN算子成熟,零 3D 卷积,能在高通、TI、地平线等低功耗芯片上跑出 5~10ms。
主流乘用车高阶智驾 (L2+/城市 NOA)CenterPoint (SECOND / Voxel Backbone)3D 稀疏卷积 + Center Head兼顾极佳的 3D 定位精度、超强的朝向角回归以及对小物体的高检出率。
DSVT / TransFusionSparse Transformer 架构全局特征捕捉能力强,远距离点云稀疏区域识别率显著提升。
离线数据闭环 (自动标注/真值生成)PV-RCNN / 混合集成模型Point-Voxel 双阶段细化不计计算耗时,追求极致的 AP 指标,为感知大模型生成训练真值。

更多推荐