COCO 实例分割

译自英文

COCO实例分割是来自COCO数据集的一项计算机视觉任务,要求对80个物体类别生成像素级掩码,用于基准测试目标检测和分割模型。

COCO实例分割是计算机视觉中的一个基准任务,由微软COCO(常见物体上下文)数据集定义。其目标是检测图像中每个物体实例,并生成像素级掩膜,精确勾勒出每个实例的轮廓,区分同一类别的不同物体。该任务涵盖80个“物体”类别,这些是可计数的对象,如人、汽车和狗,与“背景”类别(如天空或草地)相对。它广泛用于评估深度学习模型在需要同时进行定位和细粒度空间理解的任务中的性能。

COCO数据集最初由微软团队于2014年发布,实例分割标注在2015年的版本中新增。该数据集包含超过200,000张图像,标注了超过150万个物体实例,其边界由多边形定义。官方评估指标是平均精度(AP),在交并比(IoU)阈值从0.5到0.95(步长为0.05)上取平均,并额外提供小、中、大物体的指标。这一指标通常称为COCO AP,已成为比较实例分割模型的事实标准。

模型演变

早期实例分割方法基于物体检测框架。Mask R-CNN架构由Kaiming He及其Facebook AI Research同事于2017年提出,扩展了Faster R-CNN检测器,在边界框回归的同时增加了一个预测分割掩膜的分支。Mask R-CNN在先前方法基础上取得了显著改进,并设定了强基线,在COCO测试集上达到约35 AP。其成功推广了使用ResNet骨干网络和特征金字塔网络进行多尺度特征提取的做法。

后续模型提高了准确性和效率。YOLACT于2019年提出,采用实时方法生成原型掩膜,并结合每个实例的系数,在牺牲一定准确性的情况下实现更快推理。2020年,Cascade Mask R-CNN变体通过应用级联检测器提高了AP。DETR模型于2020年由Facebook AI提出,使用Transformer编码器-解码器架构,将物体检测视为集合预测问题,消除了锚框和非极大值抑制等手工组件。DETR及其后继者,如Mask2Former(2021年),将实例、全景和语义分割任务统一到单一掩膜分类框架下。

评估与指标

COCO实例分割的主要指标是平均精度(AP),通过按置信度对所有预测掩膜排序,并在不同IoU阈值下测量精度和召回率来计算。官方COCO评估还分别报告IoU为0.50和0.75时的AP,以及不同物体尺寸的AP:小(面积小于32^2像素)、中(介于32^2和96^2之间)和大(大于96^2)。挑战赛还跟踪固定检测数量下的平均召回率(AR)。这些指标支持细致比较,因为模型可能在检测大物体方面表现优异,但在小物体上存在困难。

COCO测试开发集用于年度挑战赛,但研究人员通常报告验证集(val2017)上的结果以加快迭代。数据集分为train2017(约118,000张图像)和val2017(5,000张图像)。官方评估服务器确保评估一致性,但许多论文也使用pycocotools库在本地计算指标。

应用与影响

实例分割对于需要精确物体边界的应用至关重要,如自动驾驶、机器人、医学成像和增强现实。在自动驾驶中,分割行人、车辆和道路物体有助于感知系统理解场景。在机器人领域,像素级掩膜支持对特定物体的抓取和操作。COCO基准推动了这些领域的快速进步,最先进模型从2017年的约35 AP提升到2024年的超过60 AP,主要归功于神经网络架构、数据增强技术和训练策略的进步。

该任务也是相关问题的基石。全景分割结合了实例和语义分割,要求模型为每个像素标注类别和实例ID。COCO数据集已扩展包含全景标注,Mask2Former等模型可处理这两种任务。此外,实例分割用于生成模型的图像编辑,精确掩膜允许进行针对性修改。

挑战与局限

尽管取得了进展,COCO实例分割仍具挑战性。小物体因像素信息有限而特别困难,遮挡或重叠的实例可能使模型混淆。80个物体类别分布不均,常见类别如人和汽车占主导,而罕见类别如吹风机和牙刷示例较少。数据集也存在偏差,如图像主要来自西方背景,这可能影响模型泛化能力。截至2025年,研究人员继续通过更好的损失函数模型剪枝以提高效率,以及开发更大、更多样化的数据集来解决这些问题。

另一个局限是训练最先进模型的高计算成本,通常需要多个GPU和数天训练时间。这引发了对高效架构和剪枝技术的兴趣。COCO基准仍是衡量进展的关键工具,但有人认为它正在饱和,促使创建更具挑战性的基准,如LVIS(大词汇实例分割),其包含超过1,200个类别。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·instance-segmentation·dataset·benchmark
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史