深度学习图像分割
在实际应用中,图像分割的价值广泛体现:
日常场景:人像抠图、图片编辑美化;
专业领域:医学组织提取(辅助疾病诊断)、遥感图像分析(地理勘探);
前沿领域:自动驾驶(识别道路、障碍物)、材料图像分析(工业检测)。
图像分割技术按精度和任务目标,可分为三个核心层次,层层递进覆盖不同需求:
1. 语义分割(Semantic Segmentation)
核心目标是给每个像素分配唯一的语义类别(如 “汽车”“行人”“天空”),输出整体掩膜。它不区分同一类别的不同个体,仅关注 “是什么”,是最基础的分割任务。
2. 实例分割(Instance Segmentation)
聚焦前景目标,不仅要识别类别,还要区分同一类别的不同个体(如区分两辆不同的汽车)。输出结果包含目标边框、类别属性和个体 ID,支持多像素对应多 ID 的标注。
3. 全景分割(Panoptic Segmentation)
融合语义分割与实例分割的优势,给每个像素同时分配语义类别和唯一实例 ID。既覆盖背景场景分类,又能区分前景个体,实现 “全景 + 实例” 的完整分割,是当前主流的高阶任务。
高质量数据集是模型训练的核心,以下三大数据集支撑了多数分割任务的研发:
1. VOC 数据集
经典计算机视觉挑战赛数据集,包含 4 大类、20 小类目标;
2007 年版本含 9963 张图片、24640 个目标,2012 年版本扩充至 23080 张图片、54900 个目标;
提供语义分割和实例分割标注,训练集 1464 张、验证集 1449 张,总计 2913 张标注图。
2. Cityscape 数据集
聚焦街景场景,涵盖 50 个城市的春夏秋三季街景,包含 30 个类别;
标注分为精细标注(5000 张,含训练 2975 张、验证 500 张、测试 1525 张)和粗略标注(20000 张);
专门适配自动驾驶场景,支持语义分割与实例分割任务。
3. COCO 数据集
以复杂日常场景为核心,注重场景理解,共 91 个类别(82 类有超过 5000 个实例);
类别划分以人类 4 岁小孩可辨识为标准,数据贴近真实生活,适合通用场景分割模型训练。
图像分割网络的核心逻辑是 “特征提取 - 尺度恢复”,主要由两大模块和关键技术支撑:
1. 网络核心模块
卷积模块:负责从输入图像中提取深层特征,通过卷积核滑动计算捕捉目标纹理、形状等信息;
反卷积模块(上采样):将提取的低分辨率特征图恢复到原图尺度,实现像素级的分割预测。
2. 关键技术:转置卷积
转置卷积是实现上采样的核心技术,与普通卷积呈转置关系:
普通卷积:输入 4×4 特征图,经 3×3 卷积核计算,输出 2×2 特征图(下采样);
转置卷积:输入 2×2 特征图,通过 3×3 卷积核反向计算,输出 4×4 特征图(上采样);
更多推荐
所有评论(0)