译自英文

COCO 2017是微软通用对象上下文挑战赛的2017年版,这是一个用于目标检测、分割和图像描述生成的基准测试,包含118k张训练图像和5k张验证图像。

COCO 2017是Common Objects in Context(COCO)挑战赛的年度版本,这是一个用于目标检测、分割和图像描述的大规模基准数据集。该数据集由微软研究团队于2017年发布,成为计算机视觉模型的标准评估数据集,取代了2014年和2015年的早期版本。数据集包含118,000张训练图像、5,000张验证图像和41,000张测试图像,标注覆盖80个对象类别和91个stuff类别。

挑战任务包括边界框目标检测、实例分割、全景分割(后来添加)和图像描述。COCO 2017引入了新的test-dev划分并完善了标注协议,使其比早期版本更加严格。它广泛应用于学术研究和行业竞赛,排行榜跟踪最先进性能。

数据集组成

COCO 2017数据集包含超过200,000张图像,拥有超过150万个标注实例。每张图像都标注了对象边界框、分割掩码和描述。80个对象类别包括常见物品,如人、汽车、狗和椅子,而91个stuff类别涵盖背景,如草地、天空和墙壁。图像来源于Flickr,在场景构成、光照和对象尺度上具有多样性。

标注以JSON格式提供,每张图像有多个标注条目。训练集用于模型训练,验证集用于超参数调整和模型选择。测试集用于最终评估,其标注不公开访问以防止过拟合。

评估指标

COCO 2017使用标准COCO评估指标,主要是平均精度(AP)和平均召回率(AR)。AP在多个Intersection-over-Union(IoU)阈值下计算,从0.5到0.95,步长为0.05,并取平均值。该指标比传统的PASCAL VOC指标更严格,后者使用固定的IoU为0.5。主要指标是AP@[0.5:0.95],通常简称为AP。

对于分割任务,相同的指标应用于掩码预测。对于描述任务,使用BLEU、METEOR和CIDEr等指标。挑战赛还跟踪推理速度,在某些年份设有单独的延迟类别。

对计算机视觉的影响

COCO 2017成为目标检测和分割研究的实际基准。许多有影响力的模型在其上进行了评估,包括基于ResNet的检测器、U-Net变体以及后来的基于Transformer的架构。该数据集推动了多尺度特征学习、无锚点检测和实例分割的进展。

其大规模和多样化的标注促进了数据增强技术和批归一化方法的发展。挑战赛还推动了弱监督学习和半监督学习的研究,因为测试集标注是隐藏的。

挑战赛版本和获胜者

COCO 2017是一系列年度挑战赛的一部分。2017年版吸引了主要科技公司和学术机构的参与。获胜团队通常使用集成模型和先进的训练策略。例如,2017年检测赛的获胜者实现了0.493的AP,比2015年获胜者的0.375有显著提升。

挑战赛格式包括检测、分割和描述三个独立赛道。分割赛道专注于实例级掩码,而描述赛道要求生成自然语言描述。2017年版还引入了stuff分割的新任务,后来在2018年演变为全景分割。

遗产与未来

即使在引入LVIS和Open Images等新数据集之后,COCO 2017仍然被广泛使用。其标注仍然是评估许多深度学习模型的标准。该数据集已集成到Detectron2和MMDetection等流行工具包中,使全球研究人员都能访问。

截至2025年,COCO 2017仍然是模型性能的参考点,尽管Google Cloud的Open Images和AWS的公共数据集等新基准提供了替代挑战。COCO联盟已发布后续版本,但2017版仍是文献中被引用和使用最多的版本。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·benchmark·object-detection
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史