译自英文

COCO-Panoptic是一个用于全景分割的基准数据集和评估指标,将COCO数据集中的stuff和thing类别统一起来,以实现计算机视觉中的整体场景理解。

COCO-Panoptic是一个用于全景分割的基准数据集和评估指标,全景分割是一项计算机视觉任务,它统一了语义分割(将每个像素分类到某个类别)和实例分割(检测并分割出单个对象实例)。作为Common Objects in Context(COCO)数据集的扩展而引入,它提供了一种标准化的方式来训练和评估那些在单一输出中同时预测“stuff”(无定形背景区域,如天空、草地和道路)和“things”(可计数对象,如人、汽车和动物)的模型。该基准已成为该领域事实上的标准,推动了场景理解在自动驾驶、机器人和增强现实等应用中的进展。

该基准在2019年由Alexander Kirillov、Kaiming He、Ross Girshick和Piotr Dollár发表的论文《Panoptic Segmentation》中提出,并在IEEE/CVF计算机视觉与模式识别会议(CVPR)上展示。作者将全景分割定义为一个新任务,并通过重新标注现有COCO数据集的一个子集创建了COCO-Panoptic。该数据集包含118,000张训练图像、5,000张验证图像和20,000张测试图像,源自原始COCO的train/val/test划分。它包含80个“thing”类别(原始COCO对象类别)和53个“stuff”类别的标注,总计133个类别。stuff标注以密集的逐像素标签形式添加,覆盖了水、地面和天空等区域,这些区域在COCO实例标注中此前未被标记。

COCO-Panoptic引入了一个统一的评估指标,称为全景质量(PQ)。PQ将分割质量和识别质量合并为一个分数,计算为检测质量(DQ)与分割质量(SQ)的乘积。对于每个类别,PQ通过匹配预测段和真实段(IoU阈值为0.5)、累加真阳性,并除以真阳性之和加上假阳性和假阴性的一半来计算。该指标平等对待stuff和things,避免了对任何一方的偏见。这种设计鼓励模型在小型对象和大型背景区域上都表现良好,这是全景分割中的一个关键挑战。

任务定义及与先前工作的关系

全景分割介于语义分割和实例分割之间。语义分割为每个像素分配一个类别标签,但不区分类别内的单个对象(例如,两辆车会被合并)。实例分割分别识别每个对象,但通常忽略未标记的背景区域。全景分割产生一个单一的标注,其中每个像素要么是一个thing实例(带有ID),要么是一个stuff类别,从而提供完整的场景描述。COCO-Panoptic基准正式化了这一任务,建立在早期关于组合分割工作的基础上。值得注意的是,该数据集使用与COCO相同的图像,确保与现有模型和工具的兼容性,同时扩展了标注的粒度。

数据集统计与标注过程

COCO-Panoptic的标注流程涉及大量人力。stuff类别采用两阶段方法进行标注:首先,众包工作者在彩色图像上为每个stuff区域绘制多边形;其次,质量控制审查员纠正重叠和边界。每个标注存储为带有16位类别ID的单通道PNG掩码。数据集包括“panoptic”JSON文件(包含段信息)和密集掩码图像。原始COCO实例分割标签被保留用于things,但在实例掩码与stuff区域重叠的地方(例如,一个人站在人行道上),thing掩码下方的stuff标签被排除,确保标签的像素排他性。这种细致的标注产生了具有高内部和跨标注者一致性的数据集,如随附论文所报告(人类标注者的PQ被用作参考上限)。

评估与挑战

COCO-Panoptic引入了一个官方评估服务器,允许研究人员提交预测并接收所有133个类别的PQ分数。实现高PQ的挑战在于处理大型无定形stuff区域(需要全局上下文)和小型密集thing实例(需要精确边界)。早期基线扩展了现有架构,如基于Residual Network (ResNet)的特征提取器和U-Net风格的解码器,但该任务激发了新颖的设计。例如,一些方法对stuff和things使用独立的头,然后融合结果,而另一些方法则采用端到端的基于Transformer的方法(例如Mask2Former)。该基准在公平比较方法方面发挥了重要作用,顶级分数从2019年验证集上的约42 PQ提高到近期最先进模型的超过60 PQ。该指标对类别不平衡也具有鲁棒性,因为每个类别贡献相等,这很关键,因为像“sky”这样的stuff类别覆盖的像素远多于“toothbrush”实例。

影响与相关基准

COCO-Panoptic的成功影响了后续的数据集和任务。它已被扩展到视频(例如Cityscapes-VPS),并被应用于实际场景。该基准与Artificial intelligenceDeep learning研究的目标一致,在这些研究中,整体感知是具身智能体的垫脚石。值得注意的是,COCO-Panoptic标注被用于COCO-Stuff数据集(该数据集为所有COCO图像提供仅stuff标签),并已被整合到Detectron2和MMDetection等主要框架的Data Augmentation工具包中。评估指标PQ已被广泛采用,许多论文将其与平均交并比(mIoU)和平均精度(AP)等传统指标一起报告。截至2025年,COCO-Panoptic仍然是被引用最多的全景分割基准,尽管ADE20K和Cityscapes等较新的数据集也提供全景标注,通常使用PQ进行比较。该基准的设计原则,特别是统一指标和stuff/thing整合,已成为现代场景理解任务的模板。

未来方向

正在进行的研究解决了COCO-Panoptic的局限性,如其固定的133个类别和静态图像。扩展包括开放词汇全景分割(使用Large language model嵌入来识别未见过的类别)和视频流上的全景分割。然而,该基准的核心思想仍然具有影响力:它表明,一个精心标注、平衡的数据集加上一个有意义的单一指标可以加速一个领域的发展。研究人员继续使用COCO-Panoptic进行模型预训练,其权重或特征通常被转移到下游任务,如基于Cross-Attention的Transformer。随着Neural network架构的演变,该基准提供了一个稳定的衡量标准,确保进展得到一致衡量。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·benchmark·panoptic-segmentation·dataset
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史