深度学习视角下的图像分割
一、图像分割
简单来说,图像分割就是预测目标轮廓、对像素进行细粒度分类的过程。比如在一张街景图里,它能把 “行人”“汽车”“天空”“路面” 的每一个像素都准确划分开,让计算机像人眼一样,清晰分辨图像中的不同元素。
从构成来看,图像中的元素可分为两类:
- 前景(Things):可数的具体目标,比如行人、汽车、动物等,每一个都是独立的个体。
- 背景(Stuff):不可数的场景元素,比如天空、草地、路面等,通常是大面积连续的区域。
而根据分割的精细度和目标,图像分割又分为 “三层境界”,这也是业界最核心的分类方式:
| 分割类型 | 核心目标 | 关键特点 |
|---|---|---|
| 语义分割(Semantic Segmentation) | 区分 “类别” | 每个像素只属于一个类别(如 “猫”“狗”),不区分同一类别的不同个体 |
| 实例分割(Instance Segmentation) | 区分 “个体” | 只关注前景目标,不仅分类别,还会给同一类别下的不同个体分配唯一 ID(如 “猫 1”“猫 2”) |
| 全景分割(Panoptic Segmentation) | 兼顾 “类别与个体” | 同时处理前景和背景,前景目标区分个体,背景区域只分类别,是语义分割与实例分割的结合 |
举个例子:一张有两只猫和一片草地的图,语义分割会把 “猫”“草地” 分开;实例分割会标注 “猫 1”“猫 2”,但不管草地;全景分割则会同时标注 “猫 1”“猫 2” 和 “草地”。
二、图像分割能用来做什么
技术的价值在于落地,图像分割的应用场景早已渗透到多个领域:
- 人像抠图:我们常用的修图软件、视频会议的虚拟背景,背后都是图像分割在精准提取人像区域。
- 医学影像:在 CT、MRI 影像中,分割技术能帮医生快速定位肿瘤、血管、器官等,辅助诊断和手术规划。
- 遥感分析:通过分割卫星图像,可识别耕地、建筑、森林等区域,用于土地规划、灾害监测。
- 自动驾驶:车载摄像头采集的图像中,分割技术能实时区分行人、车辆、交通信号灯、路面,为决策系统提供关键信息。
- 材料科学:在材料显微图像中,分割不同成分的区域,帮助研究材料结构与性能的关系。
三、训练模型离不开的 “数据集”
想要让图像分割模型学会 “分辨像素”,高质量的标注数据集是基础。目前业界常用的三大数据集各有特点,适用于不同场景:
1. VOC 数据集:经典入门级数据集
- 类别设置:分为 4 大类(如 “动物”“车辆”)、20 小类,覆盖常见目标。
- 数据规模:VOC 2007 有 9963 张图片、24640 个目标;VOC 2012 有 23080 张图片、54900 个目标;专门用于分割任务的标注图共 2913 张(1464 张训练图、1449 张验证图)。
- 特点:从 2007 年开始支持语义分割和实例分割标注,数据量适中,是很多初学者的首选数据集。
2. Cityscape 数据集:聚焦城市场景
- 场景特点:包含 50 个城市在春、夏、秋三季不同时间段、不同天气的街景图,场景真实且复杂。
- 类别设置:共 30 个类别,细分了城市场景中的元素(如 “人行道”“交通信号灯”“护栏”)。
- 数据规模:5000 张精细标注图(2975 张训练、500 张验证、1525 张测试),还有 20000 张粗略标注图,适合训练城市场景相关的分割模型(如自动驾驶)。
3. COCO 数据集:复杂场景的 “试金石”
- 场景特点:以 “复杂日常场景” 为核心,比如超市、公园、客厅等,图像中目标数量多、遮挡情况常见,更贴近真实世界。
- 类别设置:共 91 类,以 “人类 4 岁小孩能辨识” 为标准,其中 82 类有超过 5000 个实例,类别覆盖更全面。
- 特点:更注重 “场景理解”,不仅能用于分割,还支持目标检测、关键点检测等任务,是评估模型泛化能力的重要数据集。
四、怎么评估分割结果
训练出模型后,需要用科学的指标来判断分割效果。语义分割常用的评估指标有以下几种:
1. 像素级精度(Pixel Accuracy, PA)
最直观的指标,计算所有被正确分类的像素数占总像素数的比例。公式可以简单理解为:PA = 正确分类的像素数 / 总像素数。优点是计算简单,缺点是容易受 “类别不平衡” 影响 —— 比如背景像素占比极高时,即使前景分割得差,PA 也可能很高。
2. 平均像素精度(Mean Pixel Accuracy, MPA)
为了解决 PA 的缺陷,MPA 会先计算每个类别内被正确分类的像素比例,再求所有类别的平均值。这样即使是样本量少的类别,其分割精度也能被重视。
3. 交并比(Intersection over Union, IoU)
分割任务的 “核心指标”,计算模型预测的目标区域与真实目标区域的交集,除以两者的并集。公式为:IoU = 交集面积 / 并集面积。IoU 越接近 1,说明分割结果越精准;若为 0,则完全没分对。
4. 平均交并比(mIoU)与加权平均交并比(FWIoU)
- mIoU:计算所有类别的 IoU,再求平均值,是衡量整体分割效果的常用指标。
- FWIoU:考虑每个类别的像素数量占比,给像素多的类别赋予更高权重,再计算加权后的 IoU 平均值,更贴合实际应用中 “重要类别优先” 的需求。
五、图像分割网络的核心:卷积与反卷积
图像分割模型的本质,是 “先压缩特征,再恢复尺度”,这就依赖两大核心模块:
1. 卷积模块(编码器):提取图像特征
卷积模块的作用是对输入图像进行卷积和下采样,逐步压缩图像的空间维度(比如从 224×224 缩小到 28×28),同时扩大特征通道数,捕捉图像的高层语义特征(如 “边缘”“纹理”“目标轮廓”)。过程中通常会用 “最大池化(Max Pooling)” 来下采样,减少计算量的同时,保留关键特征。
2. 反卷积模块(解码器):恢复图像尺度
经过卷积模块后,图像尺寸变小,无法直接与原图对齐进行像素级分类。反卷积(也叫转置卷积)的作用就是对压缩后的特征图进行上采样,逐步恢复到原图的空间维度(比如从 28×28 恢复到 224×224),最终输出与原图大小一致的 “分割掩膜”(每个像素对应一个类别标签)。
举个简单的例子:
- 卷积:输入 4×4 的图像,用 3×3 的卷积核,输出 2×2 的特征图(下采样)。
- 反卷积:输入 2×2 的特征图,用 3×3 的卷积核,输出 4×4 的特征图(上采样)。
反卷积的关键是通过 “稀疏矩阵乘法”,在扩大尺寸的同时,保留卷积模块提取的特征信息,确保恢复后的分割结果精准。
六、总结
图像分割作为计算机视觉的重要分支,其核心是 “像素级的分类与定位”。从语义分割到全景分割,技术不断向 “更精细、更全面” 的方向发展;而高质量数据集、科学的评估指标,以及 “卷积提取特征 + 反卷积恢复尺度” 的网络结构,是支撑这一技术落地的关键。
更多推荐
所有评论(0)