深度学习(17)目标检测模型相关结构总结

  • 总结模型中常用结构的含义与作用
  • 不定时更新

1. 常用术语


👉自顶向下(Top-Down)

  • 从“整体 → 局部”
  • 先有全局,再逐步细化

👉 自底向上(Bottom-Up)

  • 从“局部 → 整体”
  • 先有细节,再逐步组合

👉 上采样(Upsample)

图变大(分辨率 ↑)
细节更密集
常用于恢复空间信息

👉 下采样(Downsample)

图变小(分辨率 ↓)
信息更抽象
常用于提取语义


2. 模型基础

  • 卷积(Convolution) 👉 提取特征(最核心)
  • 池化(Pooling) 👉 降采样、压缩信息
  • 全连接(FC) 👉 做决策(分类/回归)

2.1 卷积

  • 👉 用一个“小窗口”在图像上滑动,提取局部特征
    在这里插入图片描述
    在这里插入图片描述

2.2 池化层

  • 👉 在局部区域取一个“代表值”

  • 常见:

    • Max Pool(最大值)
    • Avg Pool(平均值)
      在这里插入图片描述

2.3 全连接层

  • 👉 把所有特征“拉直”后做决策
    在这里插入图片描述

3. 模型结构

  • 模型中的常见结构

3.1 特征金字塔(FPN)

  • FPN(Feature Pyramid Network)及其演进结构通常被称为模型的**“颈部”(Neck)。它的核心作用是特征融合**,即解决卷积神经网络中“深层语义强但位置糊”与“浅层位置精但语义弱”的矛盾。
    在这里插入图片描述
  • 结构:
    FPN

3.2 PANet (Path Aggregation Network) —— 目前 YOLO 系列的标配

  • 这是 FPN 最直接、最成功的继承者,也是 YOLOv5 到 YOLOv11 默认使用的结构。

  • 结构特点:

    • 在 FPN 的“自顶向下”(Top-Down)路径之后,额外增加了一个**“自底向上”(Bottom-Up)**的路径。
  • 作用分析:

    • 缩短定位信息路径:在 FPN 中,底层的精确位置信息要传到最顶层(P5)需要经过几十甚至上百层卷积。PANet 通过快捷的自底向上路径,让顶层特征也能快速获得底层的精确位置信息。

    • 提升大目标精度:这对大目标的定位非常有帮助。

    • 使用场景:通用目标检测,平衡大小目标的综合性能。

在这里插入图片描述

3.3 BiFPN (Bidirectional Feature Pyramid Network) —— 追求极致效率

  • 由 Google 在 EfficientDet 中提出。

  • 结构特点:

    • 双向融合 + 跳层连接:在同一层级之间增加连接,跳过不必要的节点。

    • 加权特征融合:并不是简单的 Concat(拼接)或 Add(相加),而是给不同层的特征分配不同的学习权重(Weighted Fusion)。

  • 作用分析:

    • 自动筛选重要特征:模型会发现某些层对当前目标的贡献更大,从而给它更大的权重。

    • 轻量化:用更少的参数量实现了比 PANet 更强的特征融合能力。

    • 使用场景:对模型体积和推理延迟极其敏感,但又需要高精度的移动端或嵌入式场景。
      在这里插入图片描述

3.4 ASFF (Adaptively Spatial Feature Fusion) —— 解决尺度不一致

  • 这是一种更“细粒度”的融合方式。

  • 结构特点:

    • 它在特征融合时,会让每个层级都去观察其他所有层级的信息。例如,P3 层在融合时,会同时参考 P4 和 P5 经过缩放后的特征,并为每个像素点计算一个空间权重。
  • 作用分析:

    • 过滤干扰:如果 P5 层的某个区域对 P3 检测小目标有干扰,ASFF 的空间权重会将其抑制。

    • 极致的小目标优化:对于像乒乓球这种物体,ASFF 能有效利用全局信息来辅助定位,减少背景干扰。

  • 使用场景:极小目标检测,或者背景极其复杂的场景。
    在这里插入图片描述

3.3 NAS-FPN —— AI 设计的结构

  • 利用神经架构搜索(NAS)技术自动寻找的最佳融合方式。

  • 结构特点:

    • 其连接方式往往“不按套路出牌”,看起来杂乱无章,没有明显的上下行规律,是经过数千次实验跑出来的最优拓扑。
  • 作用分析:

    • 性能上限极高:在特定任务上通常能打破人工设计的性能瓶颈。
  • 缺点:结构复杂,不符合人类的直观理解,且对硬件推理加速(如 TensorRT)不一定友好。

在这里插入图片描述

4. 骨干网络

  • 在目标检测任务中,**骨干网络(Backbone)**是整个算法的“特征提取器”。它的质量直接决定了下游任务(检测、分割等)的上限。

  • 为了让你清晰地掌握这一领域,我将骨干网络按照经典卷积、轻量化、检测专用、以及现代Transformer/State-Space四大类进行详细整理。

4.1 经典通用型(Classic CNNs)

  • 这类网络最初为图像分类设计,但因其强大的通用特征提取能力,成为了检测领域的基石。
    在这里插入图片描述

在这里插入图片描述

4.2 轻量化型(Lightweight Backbones)

  • 主要用于移动端、嵌入式设备(如手机、无人机)。
    在这里插入图片描述

4.3 检测专用/高效型(Detection-Oriented)

  • 这类网络伴随 YOLO 等实时检测框架发展,专门针对检测性能进行了优化。
    在这里插入图片描述

4.4. 现代 SOTA 型(Transformers & Hybrid)

进入 2024-2026 年,Backbone 的主流正向“全局建模”和“大核卷积”演进。
在这里插入图片描述

更多推荐