COCO-Stuff是一个用于语义分割和场景理解的大规模数据集,作为微软通用对象上下文(COCO)数据集的扩展而创建。它通过为COCO现有的离散对象(称为“things”)标注补充了密集的像素级标签,用于标注无定形背景区域(称为“stuff”),例如天空、草地、道路和墙壁。这种双重标注方案使模型能够同时识别可计数的对象和不可计数的背景材料,这对于自动驾驶、机器人和图像描述等任务至关重要。
该数据集于2018年由弗莱堡大学的研究人员引入,由Alexander Kirillov领导,此后已成为计算机视觉领域的标准基准。它基于2017年COCO的训练/验证分割,在原有的80个thing类别基础上增加了172个stuff类别,总共产生182个语义类别。标注通过自动化算法与人工验证相结合的方式生成,确保了高质量,同时控制了人工标注的成本。
标注结构
COCO-Stuff提供两种类型的标注:每个stuff类别的像素级掩码和原始COCO的thing实例掩码。stuff类别按层级组织,包含172个类别,涵盖自然(例如,水、山)和人工(例如,建筑物、栅栏)背景。数据集中的每张图像都有一个单一的stuff掩码,为每个像素分配一个类别ID,包括用于未标记或模糊区域的“void”标签。这种结构支持语义分割(其中每个像素都被分类)和全景分割(其中things和stuff被组合成统一输出)。
基准角色
COCO-Stuff被广泛用作评估语义分割算法的基准。标准评估指标是所有172个stuff类别的平均交并比(mIoU),在使用完整182类别设置时,会单独报告thing类别的结果。在COCO-Stuff上训练的模型通常作为其他任务(如实例分割或场景图生成)的预训练骨干。数据集的多样性,,覆盖80个对象类别和172种背景类型,跨越164,000张图像,,使其成为泛化能力的挑战性测试,因为模型必须处理在少量训练样本中出现的稀有stuff类别,如“摩天大楼”或“河流”。
与其他数据集的关系
COCO-Stuff补充了ADE20K和Cityscapes等其他分割数据集。虽然ADE20K提供了更广泛的150个类别(包括things和stuff),但COCO-Stuff提供了继承自COCO的更详细的thing标注。Cityscapes专注于具有30个类别的城市驾驶场景,而COCO-Stuff则覆盖一般的日常场景。这使得COCO-Stuff成为一个中间地带:它拥有COCO的规模(超过200,000张图像),但增加了纯对象检测数据集所缺乏的背景理解。研究人员通常使用COCO-Stuff训练模型,然后在特定领域数据集上进行微调,利用其多样化的背景覆盖。
技术影响
COCO-Stuff推动了Deep learning多个领域的进步。它在全景分割的发展中起到了关键作用,全景分割是2019年正式提出的任务,统一了语义分割和实例分割。像U-Net变体和基于ResNet的编码器这样的架构通常在此数据集上进行评估。该数据集还支持弱监督学习的研究,其中模型从图像级标签而不是像素掩码中学习,以及领域自适应,其中在COCO-Stuff上训练的模型在来自不同分布的真实世界图像上进行测试。其标注已被用于训练Artificial intelligence应用中的模型,用于自动驾驶和Robotics,在这些应用中,理解对象及其周围环境至关重要。
可用性和使用
COCO-Stuff在研究用途下公开可用,遵循与原始COCO数据集相同的条款。官方仓库提供了下载和预处理标注的脚本,以及用于mIoU评估的代码。该数据集托管在COCO网站上,并在学术平台上镜像。截至2024年,它仍然是计算机视觉领域引用最多的数据集之一,引用次数超过2,000次。其持续的相关性在于,自发布以来,没有类似规模的同时包含thing和stuff标注的数据集出现,使其成为评估场景理解模型的事实标准。研究人员还可以访问一个名为COCO-Stuff 164k的变体,它指的是2017年分割中使用的全部164,000张图像,而不是较小的10,000张图像测试子集。
未来方向
COCO-Stuff的成功激发了扩展其额外模态(如深度或视频)的努力。然而,截至2025年,尚未发布官方后续版本。数据集的局限性包括对西方场景的偏向以及缺乏细粒度的stuff类别(例如,不同类型的植被)。这些空白正在被像OpenPanoptic和Halcyon这样的新数据集所解决,但COCO-Stuff仍然是最广泛使用的基准。其对Machine learning研究的影响体现在许多已发表的论文中报告了在其上的结果,并且它继续作为训练模型的基础,这些模型为现实世界的Computer vision系统提供动力。