译自英文

MS COCO是一个大规模的目标检测、分割和图像描述数据集,包含330K张图像,标注了80个类别中的2.5M个实例,广泛用于计算机视觉模型的基准测试。

MS COCO,即微软上下文中的常见对象(Microsoft Common Objects in Context)的缩写,是一个大规模图像数据集,旨在推动目标检测、分割和图像描述领域的研究。该数据集由微软于2014年发布,提供了丰富的图像,描绘了自然环境中包含多个对象的日常场景,解决了早期数据集仅包含单一居中对象的局限性。该数据集已成为评估计算机视觉算法的标准基准,特别是在机器学习深度学习领域。

MS COCO包含超过33万张图像,其中超过20万张已标注,涵盖80个对象类别中的150万个对象实例。每张图像包含详细注释,如边界框、分割掩码和描述,支持实例分割和图像描述等任务。该数据集强调上下文,即对象出现在其典型环境中,使其比之前的ImageNet或PASCAL VOC等数据集更具挑战性和现实性,后者通常以孤立对象为特征。

数据集结构与注释

MS COCO数据集分为三个主要子集:训练集(约11.8万张图像)、验证集(约5000张图像)和测试集(约4.1万张图像)。注释以JSON格式提供,包括类别标签、基于多边形的分割掩码,以及每张图像的五条人工编写描述。80个类别涵盖常见对象,如人、汽车、狗和家具,重点是非典型视角,即从不同角度和尺度拍摄的对象,通常部分被遮挡。

除检测和分割外,MS COCO还包括用于人体姿态估计的关键点检测任务,每个人体有17个标注关节。这一扩展于2017年引入,支持了神经网络架构在姿态估计方面的进展。该数据集还支持密集描述,即用短短语描述区域,以及全景分割,后者结合了语义分割和实例分割。

对计算机视觉研究的影响

MS COCO自推出以来推动了计算机视觉领域的显著进展。2015年至2019年举办的年度COCO检测挑战赛成为比较最先进模型的关键平台。获奖方法通常采用残差网络骨干和特征金字塔网络,导致平均精度(mAP)稳步提升。例如,2015年的获胜者实现了约37%的mAP,而到2019年,顶级模型超过50%的mAP,反映了算法的快速进步。

该数据集在图像描述模型的训练和评估中也发挥了重要作用。早期的描述系统使用带有注意力机制的循环神经网络,而现代方法则利用变换器架构和大语言模型组件。MS COCO描述已成为多模态模型的标准训练语料库,将视觉理解与自然语言生成联系起来。

相关数据集与扩展

多个数据集源自或受MS COCO启发。COCO-Stuff为91个stuff类别(如天空、草地、墙壁)添加了像素级语义标签,补充了原始的thing类别。LVIS(大型词汇实例分割)将COCO的类别扩展到超过1200类,提供了更细粒度的基准。此外,COCO还被用于创建合成数据集,用于全景分割和视频实例分割等任务,其中注释跨帧传播。

生成式人工智能的背景下,MS COCO图像和描述经常用于训练文本到图像模型,例如由OpenAIGoogle DeepMind开发的模型。该数据集的多样场景和描述性文本有助于模型学习语言与视觉内容之间的对应关系,这是DALL-E和Stable Diffusion等系统的基础。

局限性与批评

尽管MS COCO被广泛使用,但它存在局限性。该数据集偏向西方城市场景,对农村或非西方环境的代表性有限,这可能导致模型性能偏差。80个类别是固定的,限制了对预定义对象集的评估。此外,注释过程劳动密集且成本高昂,限制了向更大或更多样化数据集的扩展性。

研究人员还指出,COCO的评估指标,特别是mAP,可能无法完全捕捉模型对域偏移或对抗样本的鲁棒性。因此,出现了Open Images和Objects365等更新的基准,提供更大规模或不同类型的注释。尽管如此,MS COCO仍是一个基础资源,被数千篇论文引用,并用作许多视觉模型的预训练语料库。

遗产与持续相关性

截至2025年,尽管出现了更新的数据集,MS COCO仍是目标检测和分割的主要基准。其注释已集成到许多开源工具包中,如Detectron2和MMDetection,这些工具在学术界和工业界广泛使用。该数据集还作为不同研究团队之间比较模型的共同基础,促进了人工智能研究的可复现性。

COCO格式已成为注释的事实标准,被LabelMe和CVAT等工具采用。这种标准化简化了数据共享和模型评估,有助于该数据集的持久影响力。虽然LAION-5B等大规模数据集在训练生成模型的规模上已超过COCO,但COCO的精选注释和基准地位确保了其在严格评估环境中的持续使用。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·object-detection·image-captioning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史