在计算机视觉领域,图像分割是连接图像识别与场景理解的关键技术。它通过对图像像素进行细粒度分类,让机器能够精准区分目标轮廓与背景,为自动驾驶、医学影像分析等核心场景提供底层技术支撑。

一、图像分割:是什么与用在哪?

1. 核心定义

图像分割本质是像素级的分类任务—— 它不再局限于识别图像中 “有什么目标”,而是进一步预测目标的精确轮廓,将不同像素划分到对应的类别中。例如在一张街景图中,图像分割能明确区分 “行人”“车辆”“路面” 等不同对象的像素范围,实现比图像分类更精细的场景解析。

2. 典型应用场景

图像分割的应用已渗透到多个行业,核心场景包括:

  • 人像抠图:影视后期、电商修图中精准分离人物与背景;
  • 医学组织提取:从 CT、MRI 影像中分割肿瘤、血管等组织,辅助疾病诊断;
  • 遥感图像分析:识别卫星影像中的农田、建筑、水体,支持国土规划;
  • 自动驾驶:实时分割道路、行人、障碍物,为决策系统提供环境信息;
  • 材料图像分析:检测材料微观结构中的缺陷、成分分布。

二、图像分割的 “前景与背景”:Things 与 Stuff

在图像分割任务中,场景通常被划分为两类元素,这一划分是后续技术层次的基础:

  • 物体(Things):指可数的前景目标,如行人、车辆、动物等,每个目标具有独立的个体属性;
  • 事物(Stuff):指不可数的背景区域,如天空、草地、路面、墙面等,通常作为场景的 “环境载体” 存在。

例如在一张公园图像中,“小孩”“小狗” 属于 Things,“草坪”“蓝天” 则属于 Stuff。

三、图像分割的三层境界:从 “分类” 到 “全景”

根据任务精细度的不同,图像分割可分为三个核心层次,三者的目标与输出形式差异显著:

技术层次

核心目标

输出特点

典型场景

语义分割(Semantic Segmentation)

给每个像素分配语义类别(如 “车”“树”“路”)

只区分类别,不区分个体(同一类目标像素标注相同)

城市街景的 “类别分布分析”

实例分割(Instance Segmentation)

仅关注前景 Things,同时输出类别 + 个体 ID + 边框

区分同一类目标的不同个体(如 “车 1”“车 2”),不处理 Stuff

自动驾驶中 “行人 / 车辆计数”

全景分割(Panoptic Segmentation)

融合语义与实例分割,给每个像素分配语义类别 + 唯一实例 ID

同时覆盖 Things(带个体 ID)和 Stuff(仅类别),实现 “全场景覆盖”

机器人导航的 “全环境感知”

简单来说:语义分割解决 “是什么”,实例分割解决 “是谁”,全景分割则解决 “所有东西是什么、是谁”。

四、图像分割的 “数据基石”:三大核心数据集

高质量的标注数据集是图像分割模型训练的关键。目前行业内最常用的三大数据集各有侧重,覆盖不同场景需求:

1. VOC 数据集:经典基准数据集

背景:源于 PASCAL VOC 计算机视觉挑战赛,是早期图像分割的 “标准测试场”;

类别划分:包含 4 大类(动物、车辆、家具、人物)、20 小类;

数据规模

  • VOC 2007:9963 张图片,24640 个标注目标;
  • VOC 2012:23080 张图片,54900 个标注目标;
  • 分割专用标注:共 2913 张图(1464 张训练图、1449 张验证图)
  • 支持任务:从 2007 年起支持语义分割与实例分割。

2. Cityscape 数据集:街景分割专用数据集

背景:聚焦城市街景场景,包含 50 个城市在春 / 夏 / 秋三季、不同时间段的街景图;

类别划分:共 30 个类别,涵盖 “路面、行人、车辆、建筑、植被” 等街景核心元素;

数据规模

  • 精细标注图:5000 张(2975 张训练、500 张验证、1525 张测试);
  • 粗略标注图:20000 张;
  • 支持任务:语义分割与实例分割,是自动驾驶街景分割的核心训练数据。

3. COCO 数据集:复杂场景理解数据集

背景:以 “场景理解” 为目标,专门选取复杂日常场景(如商场、街道、家庭);

类别划分:共 91 类,以 “人类 4 岁小孩可辨识” 为标准,其中 82 类有超过 5000 个实例标注;

数据特点:图像包含多目标、遮挡、复杂背景,更贴近真实世界场景;

支持任务:覆盖语义分割、实例分割,同时支持目标检测、关键点检测等多任务。

五、如何评价分割效果?四大核心评估指标

图像分割的效果需要通过像素级的指标量化,常用指标分为两类:基于 “准确率” 的指标和基于 “重叠度” 的指标。

1. 基于准确率的指标

  • Pixel Accuracy(PA,逐像素精度):最基础的指标,计算 “所有被正确分类的像素数” 占 “总像素数” 的比例。

缺点:易受 “类别不平衡” 影响(如背景像素占比高时,PA 会被拉高)。

  • Mean Pixel Accuracy(MPA,平均像素精度):先计算每个类别的 “正确像素占比”,再求所有类别的平均值。

优势:解决了类别不平衡问题,更公平地反映每个类别的分割效果。

2. 基于重叠度的指标

  • IoU(交并比):衡量 “模型预测的目标区域” 与 “真实标注区域” 的重叠程度,是分割任务的 “核心指标”。

意义:IoU 越高,分割越精准(IoU=1 表示完全匹配)。

  • mIoU(平均交并比):计算所有类别的 IoU,再求平均值,是行业内评价分割模型的 “主流标准”。
  • FWIoU(加权交并比):根据每个类别的 “像素占比” 给 IoU 加权,再求平均值。

优势:更侧重 “像素占比高的大类”,适合对核心类别精度要求高的场景(如医学分割中的 “肿瘤” 类)。

六、图像分割网络的 “核心架构”:编码器 - 解码器

分割网络的核心目标是 “提取图像特征” 并 “恢复像素级分辨率”,因此普遍采用 “编码器 - 解码器” 结构,关键模块包括卷积模块(编码器)反卷积模块(解码器)

1. 核心模块:卷积与反卷积

  • 卷积模块(编码器)

作用:通过卷积层提取图像特征,通过池化层(如 Max Pooling)降低图像分辨率(缩小尺寸),聚焦 “高层语义信息”(如 “这是车”)。

示例:输入 4×4 图像,用 3×3 卷积核,输出 2×2 特征图(分辨率降低,特征更抽象)。

  • 反卷积模块(解码器 / 转置卷积)

作用:通过 “上采样” 将低分辨率特征图恢复到 “原图尺寸”,同时结合编码器的浅层特征(如边缘、纹理),精准定位像素类别。

示例:输入 2×2 特征图,用 3×3 反卷积核,输出 4×4 图像(分辨率恢复,保留细节)。

2. 典型网络结构

以基础分割网络为例,流程如下:

  1. 编码器(卷积 + 池化)

224×224 输入 → 卷积提取特征 → 池化(224×224→112×112)→ 重复卷积 + 池化 → 最终得到 28×28 低分辨率特征图;

  1. 解码器(反卷积 + 上采样)

28×28 特征图 → 反卷积上采样(28×28→56×56)→ 结合编码器对应层的浅层特征 → 重复反卷积 + 上采样 → 最终输出 224×224 的像素级分割结果(掩膜)。

这一结构的核心逻辑是:编码器 “压缩信息”,解码器 “还原细节”,两者结合实现 “精准分割”。

七、总结:图像分割的技术脉络与未来

从基础概念到网络结构,图像分割的技术体系围绕 “更精细、更全面、更鲁棒” 的目标不断演进:从语义分割的 “类别划分”,到全景分割的 “全场景覆盖”;从 VOC 的 “小数据集基准”,到 COCO 的 “复杂场景支撑”;从简单的 PA 指标,到主流的 mIoU 标准。

未来,随着 Transformer、扩散模型等新技术的融入,图像分割将在 “小样本分割”(少数据训练)、“实时分割”(满足自动驾驶低延迟需求)、“跨模态分割”(结合文本、红外等信息)等方向持续突破,进一步拓展在医疗、自动驾驶、机器人等领域的应用边界。

Logo

腾讯云面向开发者汇聚海量精品云计算使用和开发经验,营造开放的云计算技术生态圈。

更多推荐