在计算机视觉领域,图像分割是连接图像识别与场景理解的关键技术。它不再满足于 “识别图像中有什么”,而是深入到 “每个像素属于什么” 的细粒度层面。本文将结合技术分享会议内容,从基础概念、核心类型、数据集、评估指标到网络架构,全方位拆解图像分割技术,帮助读者构建完整的知识体系。

一、图像分割:比目标检测更精细的 “像素级分类”

图像分割的核心目标,是为图像中的每个像素分配一个类别标签,实现 “像素级别的分类”。如果说目标检测是用矩形框圈出目标的大致范围,那么图像分割就是精准勾勒出目标的轮廓 —— 小到发丝、树叶,大到建筑、车辆,都能通过分割明确区分。

从场景构成来看,图像分割的处理对象可分为两类:

  • 前景(Things):可数的独立目标,比如行人、汽车、动物等,每个目标都是一个可区分的 “个体”。
  • 背景(Stuff):不可数的区域,比如天空、草地、路面、墙面等,通常以 “区域” 形式存在,没有明确的个体边界。

这种对 “像素归属” 的精准定义,让图像分割在多个领域落地:

  • 人像抠图:精准分离人物与背景,实现美颜、换背景等效果;
  • 医学影像:提取肿瘤、血管、器官等组织,辅助医生诊断;
  • 遥感分析:识别农田、建筑、水体,支持土地规划与灾害监测;
  • 自动驾驶:区分行人、车辆、道路标线,为决策提供环境感知依据。

二、图像分割的 “三层境界”:语义、实例与全景

根据对 “类别” 和 “个体” 的区分程度,图像分割可分为三个核心类型,层层递进,满足不同场景需求。

1. 语义分割(Semantic Segmentation):只分 “类别”,不分 “个体”

语义分割的核心是 “类别划分”—— 将同一类别的所有像素归为一组,不区分个体差异。例如在街景图中,所有行人都会被标记为 “红色”,所有汽车标记为 “蓝色”,但无法区分 “行人 A” 和 “行人 B”、“汽车 1” 和 “汽车 2”。

它的输出是一张与原图尺寸相同的 “掩膜(Mask)”,每个像素的颜色代表其所属类别,相当于给图像 “染色”,直观呈现不同类别区域的分布。

2. 实例分割(Instance Segmentation):既分 “类别”,也分 “个体”

实例分割在语义分割的基础上更进一步:不仅要区分类别,还要区分同一类别下的不同个体。例如在街景图中,不仅能识别出 “行人” 类别,还能为每个行人分配唯一的 ID(如行人 1、行人 2),用不同颜色标记每个行人的轮廓。

这种特性让实例分割能有效处理 “遮挡问题”—— 即使两个行人相互遮挡,也能通过个体 ID 和轮廓区分各自的像素范围,这对自动驾驶、目标跟踪等场景至关重要。

3. 全景分割(Panoptic Segmentation):“前景 + 背景” 全覆盖

全景分割是语义分割与实例分割的结合,实现 “前景实例化 + 背景语义化” 的全图覆盖。它的规则是:

  • 前景(Things):按实例分割处理,每个个体分配唯一 ID;
  • 背景(Stuff):按语义分割处理,只划分类别,不区分个体。

例如在一张包含 “行人、汽车、天空、草地” 的图像中,全景分割会为每个行人、汽车分配唯一 ID(实例化),同时将天空、草地标记为不同类别(语义化),最终输出一张覆盖全图像素的、信息最完整的分割结果。

三、图像分割的 “数据基石”:三大经典数据集

高质量的数据集是模型训练与评估的基础。目前图像分割领域有三大常用数据集,各有侧重,覆盖不同场景需求。

1. VOC 数据集:计算机视觉的 “入门级竞赛标杆”

VOC(PASCAL Visual Object Classes)是世界级计算机视觉挑战赛的官方数据集,也是很多初学者的 “第一份分割数据集”。它的核心特点的:

  • 类别设置:4 大类(动物、人物、车辆、室内物品),共 20 小类,涵盖常见目标(如猫、狗、汽车、自行车、沙发等);
  • 数据规模:VOC 2007 包含 9963 张图片、24640 个目标;VOC 2012 扩展到 23080 张图片、54900 个目标;
  • 标注任务:从 2007 年开始支持语义分割与实例分割标注,共 2913 张标注图(1464 张训练图、1449 张验证图);
  • 适用场景:适合基础分割模型的训练与测试,尤其适合入门学习。

2. Cityscapes 数据集:街景分割的 “专业级标杆”

Cityscapes 数据集专为街景图像分割设计,聚焦自动驾驶、智能交通等场景,数据真实性和复杂性极高。它的核心特点是:

  • 场景覆盖:包含 50 个城市在春、夏、秋三季的街景图,涵盖晴天、阴天、雨天等不同天气,以及白天、傍晚等不同时段;
  • 类别设置:共 30 个类别,细分为 “平面(道路、人行道)”“人类(行人、骑行者)”“车辆(汽车、公交车)”“建筑(房屋、隧道)” 等,贴合街景实际场景;
  • 数据规模:5000 张精细标注图(2975 张训练图、500 张验证图、1525 张测试图),另有 20000 张粗略标注图,满足不同训练需求;
  • 适用场景:自动驾驶场景下的语义分割、实例分割模型训练,是该领域的 “标准测试集”。

3. COCO 数据集:复杂场景的 “综合级标杆”

COCO(Common Objects in Context)数据集以 “场景理解” 为核心,聚焦真实、复杂的日常场景,数据多样性和挑战性最强。它的核心特点是:

  • 场景特点:选取超市、公园、客厅等复杂日常场景,图像中目标数量多、遮挡严重、背景复杂,更贴近真实世界;
  • 类别设置:共 91 类,以 “人类 4 岁小孩能识别” 为标准,其中 82 类有超过 5000 个实例,覆盖 “动物、食物、家具、交通工具” 等;
  • 适用场景:复杂场景下的图像分割、目标检测、关键点检测等任务,是衡量模型泛化能力的重要基准。

四、语义分割的 “评分标准”:如何衡量模型好坏?

模型训练后,需要通过量化指标评估性能。语义分割的核心评估指标围绕 “像素分类准确性” 和 “区域重叠度” 展开,常用的有以下 4 种:

1. 逐像素精度(Pixel Accuracy, PA)

最直观的指标,计算 “被正确分类的像素数” 占 “总像素数” 的比例。公式为:PA=∑i=0k​∑j=0k​pij​∑i=0k​pii​​其中,pii​ 是 “类别 i 被正确分类为 i” 的像素数,k 是类别总数。缺点:如果数据中存在 “类别不平衡”(如背景像素占比 90%),即使模型只对背景分类正确,PA 也会很高,无法反映模型对小类别(如前景目标)的分割能力。

2. 平均像素精度(Mean Pixel Accuracy, MPA)

为解决 PA 的 “类别不平衡” 问题,MPA 先计算 “每个类别的正确分类像素比例”,再取所有类别的平均值。公式为:MPA=k+11​∑i=0k​∑j=0k​pij​pii​​优势:能反映模型对每个类别的分割能力,尤其对小类别更公平。

3. 交并比(IoU)与平均交并比(mIoU)

IoU 是分割任务的 “核心指标”,衡量 “模型预测的区域” 与 “真实标注的区域” 的重叠程度,公式为:预测区域真实区域预测区域真实区域IoU 的取值范围为 [0,1],值越大表示重叠度越高,分割越精准。

mIoU 则是对所有类别的 IoU 取平均值,综合反映模型对所有类别的分割性能,是语义分割的 “黄金标准”。

4. 加权平均交并比(FWIoU)

为进一步优化 mIoU,FWIoU 根据 “每个类别的像素数量占比” 为 IoU 加权。类别像素占比越高,权重越大,公式为:FWIoU=∑i=0k​∑j=0k​pij​1​∑i=0k​∑j=0k​pji​+∑j=0k​pij​−pii​pii​×∑j=0k​pij​​优势:更贴合实际场景中 “大类别更重要” 的需求(如街景分割中 “道路” 类别占比高,FWIoU 会更关注其分割精度)。

五、图像分割网络的 “核心架构”:编码器 - 解码器与反卷积

图像分割需要输出与原图尺寸相同的掩膜,而传统卷积网络会通过 “池化层” 不断压缩特征图的空间维度(如下采样),导致输出尺寸远小于输入。如何解决 “尺寸恢复” 问题?答案是 “编码器 - 解码器” 架构,其中 “反卷积” 是解码器的核心模块。

1. 编码器:负责 “提取特征,压缩尺寸”

编码器通常由卷积层和池化层堆叠而成,核心任务是:

  • 用卷积层提取图像的 “层级特征”:浅层卷积提取边缘、纹理等低级特征,深层卷积提取目标形状、语义等高级特征;
  • 用池化层(如最大池化)压缩特征图的空间维度(如将 4×4 特征图压缩为 2×2),减少计算量,同时扩大感受野(让深层特征能捕捉更大范围的上下文信息)。

简单来说,编码器的作用是 “把图像变小,把特征变精”。

2. 解码器:负责 “恢复尺寸,生成掩膜”

解码器的核心任务是将编码器输出的 “小尺寸、高精度特征图” 恢复到 “原图尺寸”,生成最终的分割掩膜。而实现 “尺寸恢复” 的关键技术,就是反卷积(Transposed Convolution),也叫 “转置卷积”。

(1)反卷积:不是 “逆卷积”,而是 “卷积的转置”

很多人误以为反卷积是 “卷积的逆操作”,但实际上两者是 “转置关系”—— 如果卷积是将输入 X 通过矩阵运算得到输出 Y(Y = C × X,C 是卷积矩阵),那么反卷积就是将 Y 通过转置矩阵得到 X'(X' = C^T × Y,C^T 是 C 的转置),最终 X' 的尺寸与原输入 X 一致。

以 “3×3 卷积核,输入 2×2,输出 4×4” 为例,反卷积的实现逻辑是:

  1. 在输入特征图的像素之间补零,扩大输入尺寸;
  2. 用与卷积相同的卷积核滑动计算,最终得到更大尺寸的输出特征图。
(2)反卷积的作用:上采样恢复分辨率

通过反卷积,解码器可以逐步将编码器输出的小尺寸特征图 “放大”(如下采样时从 224×224→112×112→56×56→28×28,反卷积时则从 28×28→56×56→112×112→224×224),最终恢复到与原图相同的分辨率,再通过分类层为每个像素分配类别,生成分割掩膜。

3. 编码器 - 解码器:分割网络的 “标准范式”

编码器负责 “降维提特征”,解码器负责 “升维生掩膜”,两者结合形成 “编码器 - 解码器” 架构,这是目前主流图像分割网络(如 U-Net、FCN、SegNet)的核心框架。

以经典的 FCN(全卷积网络)为例:

  • 编码器:采用 VGG16 等预训练网络,去掉全连接层,保留卷积和池化层,输出 16×16 的特征图;
  • 解码器:通过 3 次反卷积,将 16×16 的特征图逐步上采样到 256×256(与原图尺寸一致),同时融合编码器不同层级的特征(补充细节信息),最终输出像素级的类别预测。

六、总结:图像分割的技术脉络与应用展望

从 “像素级分类” 的基础概念,到 “语义 - 实例 - 全景” 的三层进阶,再到 “编码器 - 解码器” 的架构实现,图像分割技术已形成完整的技术体系。它不仅是计算机视觉的核心研究方向,更在医疗、自动驾驶、遥感、娱乐等领域发挥着不可替代的作用。

未来,随着 Transformer 等新技术的融入,图像分割将朝着 “更高精度、更快速度、更强泛化能力” 的方向发展 —— 例如在医学影像中实现 “亚像素级” 的肿瘤分割,在自动驾驶中实现 “实时高分辨率” 的街景分割。对于开发者而言,掌握本文梳理的基础概念、数据集、评估指标与网络架构,将为深入研究图像分割技术奠定坚实的基础。

更多推荐