英語からの翻訳

COCO(Common Objects in Context)是一个用于目标检测、分割和图像描述的大规模图像数据集,包含超过33万张图像,涵盖80个物体类别,并带有250万个标注实例,广泛用作计算机视觉领域的基准数据集。

COCO(Common Objects in Context)是一个用于计算机视觉任务的大规模数据集,主要涉及目标检测、图像分割和图像描述。它由微软的研究人员于2014年创建,旨在通过聚焦自然情境中的目标,以及包含多个目标和复杂场景的非典型图像,来解决早期数据集的局限性。该数据集包含超过33万张图像,其中超过20万张已标注,涵盖80个目标类别,共250万个标注实例。COCO已成为评估机器学习模型在视觉任务中表现的标准基准,推动了深度学习架构和神经网络设计的发展。

与以往仅包含单一居中目标的数据集不同,COCO强调情境理解。每张图像通常包含多个目标、交互关系以及多样化的背景,这使得检测和分割任务更具挑战性,也更贴近实际应用。其标注包括每个实例的分割掩码、边界框、人体关键点,以及每张图像的自然语言描述。这种丰富性使得模型能够同时进行多任务训练和评估,例如实例分割、全景分割和密集描述。

数据集构成与标注

COCO数据集发布了三个主要版本:2014年、2015年和2017年。其中2017年版本使用最为广泛,包含11.8万张训练图像、5000张验证图像和4.1万张测试开发(test-dev)图像。标注内容包括目标实例(带有多边形分割掩码)、stuff类别(如天空、草地)、图像描述以及人体关键点(17个身体关节点)。80个目标类别来源于日常常见物体,包括人、自行车、汽车、狗、猫和家具等。标注过程通过Amazon Mechanical Turk众包完成,并经过严格的质量控制。每张图像由多名标注者进行标注,结果经过合并和验证,以确保标签的高度一致性。平均每张图像包含7.7个实例,约3.5个不同类别,反映了真实世界的复杂性。

评估指标

COCO引入了现代视觉研究中广泛使用的标准评估指标。主要指标是平均精度(AP),在IoU(Intersection over Union)阈值从0.5到0.95之间以0.05为步长进行平均计算。这一“COCO AP”指标强调定位的精确性。次要指标包括IoU为0.5和0.75时的AP,以及针对小、中、大目标的AP,以评估模型在不同尺度上的鲁棒性。对于分割任务,AP基于掩码IoU而非边界框IoU计算。官方评估服务器提供测试开发(test-dev)和测试挑战(test-challenge)分区的排名,推动了检测器性能的快速提升。自2015年以来,COCO每年举办研讨会和挑战赛,吸引了来自学术界和工业界的顶尖研究团队,包括卡内基梅隆大学斯坦福人工智能实验室伯克利人工智能研究等机构。

对计算机视觉研究的影响

COCO在推动目标检测和分割领域的发展中发挥了关键作用。许多里程碑式的架构都在COCO上进行了基准测试,包括Faster R-CNN(2015年)、Mask R-CNN(2017年)以及YOLO系列变体。数据集的复杂性促使研究界开发出更鲁棒的模型,推动了特征金字塔网络、无锚点检测器和基于注意力机制的方法的发展。COCO还促进了Transformer-based视觉模型的兴起,例如2020年提出的DETR(Detection Transformer),该模型将检测问题视为集合预测任务。该数据集为数百万次模型迭代提供了训练和评估平台,成为学术论文中进行横向比较的事实标准。除了检测任务,COCO的图像描述标注也推动了视觉-语言模型的研究,这些模型后来与生成式人工智能大语言模型的进展相结合。关键点标注的可用性则促进了姿态估计研究,影响了人机交互和机器人等领域。

扩展与社区资源

COCO衍生出了多个数据集和工具。COCO-Stuff数据集(2017年)为91个stuff类别提供了像素级标注,支持全景分割研究。关键点标注被扩展用于多人姿态估计任务。COCO的数据格式被许多其他数据集采用,如LVIS(Large Vocabulary Instance Segmentation)和Open Images,促进了互操作性。COCO API是一个用于加载、可视化和评估标注的Python和MATLAB工具箱,已成为标准工具。此外,在COCO上进行预训练已成为其他视觉领域迁移学习的常见做法。最近的工作,如2023年提出的Segment Anything Model(SAM),也利用了COCO作为训练数据的一部分,显示了其持续的相关性。截至2025年,COCO仍然是重要的基准数据集,尽管一些更新的数据集提供了更多类别或更高分辨率的图像,偶尔会作为补充。

局限性与批评

尽管COCO取得了成功,但它也存在局限性。其80个类别偏向西方语境,缺乏许多文化特定物体。数据集是静态的,图像收集自2014年,无法反映当代场景。虽然标注错误率相对较低,但仍存在一定误差。类别分布不均衡,常见物体(如“人”和“汽车”)的样本远多于稀有物体。密集标注的要求使得扩展到更多类别的成本高昂,尽管研究人员提出了主动学习和自动化标注方法,但成本问题依然存在。此外,COCO的评估指标侧重于定位精度,可能无法完全区分语义错误和空间错误。尽管存在这些问题,COCO的影响力依然持久,它通常是评估新架构的首选基准,确保持续产生可比较的研究成果。

未来方向

随着更新的数据集(如Objects365和Open Images V6,均于2019年发布)的出现,COCO作为基准的地位正在演变,这些新数据集提供了更多类别或图像。然而,COCO的遗产由其定义的评估实践所巩固。现代人工智能系统,尤其是用于自动驾驶和增强现实的系统,仍然依赖在COCO上训练的神经网络模型进行感知。COCO的设计原则、、情境化目标、密集标注和严格的评估指标、、影响了后续的数据集,如用于自动驾驶的nuScenes和LVIS挑战赛。此外,COCO的标注流程也为生成式人工智能训练数据的收集提供了参考。随着领域向开放词汇检测和基础模型发展,COCO仍然是关键的验证集,尽管研究人员也使用自定义子集来测试零样本泛化能力。COCO对可复现科学的贡献是深远的,为数百万次实验提供了共同的基础。

参见

Category:计算机视觉数据集

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·object-detection·image-segmentation·benchmark-dataset
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴