COCO-Stuff 164K是一个用于语义分割和场景理解的大规模数据集,作为微软常见对象上下文(COCO)数据集的扩展而构建。它为“stuff”类(无定形背景区域,如天空、草地和道路)和“thing”类(可计数对象,如人、汽车和狗)提供了密集的像素级标注。该数据集包含164,000张图像,每张图像标注了172个语义类别之一,使其成为训练和评估计算机视觉任务(如语义分割、实例分割和场景解析)模型的最全面资源之一。
该数据集于2018年由弗莱堡大学的研究人员(包括Holger Caesar、Jasper Uijlings和Vittorio Ferrari)引入,并发表在论文《COCO-Stuff: Thing and Stuff Classes in Context》中。它基于原始COCO-Stuff数据集(包含10,000张图像)构建,扩展至完整的COCO训练和验证划分。172个类别分为80个thing类(与COCO的thing类别相同)和92个stuff类,其中包括自然和人造背景元素。
构建与标注
COCO-Stuff 164K的标注过程涉及自动和手动步骤。初始的stuff标注通过深度学习模型与人工精化的组合生成。该数据集利用了COCO现有的thing类标注(由众包工作者创建),并为stuff类添加了像素级掩码。最终标注通过一系列质量控制检查进行验证,以确保164,000张图像的一致性和准确性。
数据集中的每张图像每个像素标注一个标签,标注以紧凑的游程编码格式提供,以减少存储需求。数据集分为118,000张图像的训练集和5,000张图像的验证集,其余图像保留用于测试(测试集的标注未公开发布)。
在深度学习中的应用
COCO-Stuff 164K已成为语义分割的标准基准,这是机器学习和深度学习中的一项任务,模型为图像中的每个像素分配类别标签。它广泛用于评估神经网络架构的性能,包括基于残差网络和U-Net的模型,以及基于变换器的方法。数据集中stuff和thing类的多样性挑战模型同时理解细粒度对象边界和大规模上下文区域。
该数据集还用于全景分割,这是一项统一语义分割和实例分割的任务,要求模型同时预测stuff和thing标签。这推动了统一架构的研究,这些架构可以在单次前向传播中处理两类类别。
基准与评估指标
COCO-Stuff 164K的主要评估指标是平均交并比(mIoU),它衡量预测分割掩码与真实掩码在所有类别上的平均重叠。研究人员还报告每类IoU和像素准确率。数据集的官方评估服务器允许模型进行公平比较,排行榜跟踪随时间推移的最先进成果。
自发布以来,该数据集已被数百篇研究论文使用,顶级模型在验证集上取得了超过50的mIoU分数,变换器架构和注意力机制的进步推动了显著进展。
与其他数据集的关系
COCO-Stuff 164K是源自COCO的数据集家族的一部分,包括COCO-Stuff 10K和原始COCO数据集。它补充了其他场景理解数据集,如专注于城市驾驶场景的Cityscapes,以及覆盖更广泛室内和室外场景的ADE20K。该数据集对上下文和stuff类的强调使其在自动驾驶、机器人和增强现实等应用中特别有用,在这些应用中,理解背景区域与检测对象同等重要。
该数据集公开可用于研究目的,并托管在官方COCO网站上。它通常与人工智能研究实验室和云平台的预训练模型结合使用,并且仍然是推动计算机视觉领域发展的关键资源。