COCO测试集(开发版)

译自英文

COCO test-dev是COCO数据集的盲测分割,用于在挑战中评估目标检测和分割模型,其标注未公开发布。

COCO test-dev是Common Objects in Context(COCO)数据集的一个指定测试子集,专为COCO检测和分割挑战中的模型评估而创建。与标准测试子集不同,test-dev是一个“盲”集:其真实标注不公开。研究人员将模型预测提交至评估服务器,由服务器计算平均精度(mAP)等指标并返回分数。该协议旨在防止对测试集的过拟合,并确保不同方法之间的公平比较。

COCO数据集于2014年由Tsung-Yi Lin、Michael Maire、Serge Belongie、James Hays、Pietro Perona、Deva Ramanan、Piotr Dollár和C. Lawrence Zitnick提出。它包含超过20万张图像,其中标注了超过150万个对象实例,涵盖80个类别。该数据集广泛用于计算机视觉研究,涉及目标检测、实例分割和关键点检测等任务。test-dev子集包含约2万张图像,是完整测试集的一个子集,而完整测试集本身包含约4万张图像。其余测试图像用于“test-challenge”子集,该子集保留用于挑战评估,同样没有公开标注。

评估协议

COCO挑战的参与者,例如自2015年起在计算机视觉与模式识别会议(CVPR)上举办的COCO检测挑战,需提交test-dev子集的结果。评估服务器计算标准指标:在IoU阈值从0.5到0.95(步长0.05)下的平均精度(AP)、IoU 0.5下的AP、IoU 0.75下的AP,以及不同检测数量下的平均召回率(AR)。主要指标是IoU 0.50:0.95下的AP,通常称为COCO AP。该指标比传统的PASCAL VOC指标更为严格,后者使用单一的IoU阈值0.5。

test-dev的盲性意味着研究人员无法直接在测试集上进行迭代。相反,他们通常使用保留的验证集(val2014或val2017)进行开发和超参数调优。test-dev子集仅用于最终报告,这有助于维护基准的完整性。多年来,COCO评估服务器已成为比较机器学习目标检测模型的标准,许多最先进的系统都在test-dev上报告其性能。

历史背景

COCO的创建是为了解决早期数据集(如PASCAL VOC和ImageNet)的局限性,这些数据集要么对象类别较少,要么侧重于分类而非定位。test-dev子集作为数据集设计的一部分被引入,以支持基于挑战的评估。首届COCO挑战于2015年举办,后续版本每年举行一次,直至2020年,最后一次官方挑战在2020年ECCV研讨会上进行。在此期间,test-dev成为比较检测和分割算法的事实标准基准。

该数据集有多个版本:COCO 2014、COCO 2015和COCO 2017。每个版本都有test-dev子集,但2017版本是近期研究中最常用的。2017年的test-dev包含20,288张图像,其标注被保留。COCO 2017的评估服务器仍在运行,允许研究人员提交预测并获得指标。

对研究的影响

COCO test-dev在推动目标检测和实例分割的进展方面发挥了重要作用。许多有影响力的模型在此子集上报告了结果,包括Faster R-CNN、Mask R-CNN和YOLO变体。例如,Kaiming He及其同事于2017年提出的Mask R-CNN在test-dev上达到了37.1的AP,创下了当时的最先进水平。后续模型如EfficientDet和Swin Transformer已将AP推高至50以上。标准化盲测集的可用性促进了公平比较,并加速了特征金字塔网络、无锚检测器和基于Transformer的检测器等技术发展。

除了检测,test-dev还用于评估全景分割,这是一项于2018年引入的任务,结合了语义分割和实例分割。COCO全景挑战使用单独的test-dev子集,包含80个物体类别和91个背景类别。这一扩展拓宽了基准的实用性。

局限性与替代方案

尽管使用广泛,test-dev仍存在局限性。与现代数据集的规模相比,其图像数量较少(约2万张),可能导致指标噪声较大,尤其是对于稀有类别。此外,盲评估协议要求向服务器提交预测,这对于没有互联网接入的研究人员或希望在本地硬件上评估的研究人员可能构成障碍。为解决这些问题,一些研究人员创建了替代基准,例如LVIS(大型词汇实例分割),它拥有更大的类别集和不同的评估协议。然而,COCO test-dev仍然是该领域的标准参考点。

COCO数据集本身由COCO联盟托管,评估服务器由密歇根大学团队及其他贡献者维护。截至2025年,服务器仍然活跃,尽管官方挑战已停止。研究人员继续在论文中使用test-dev报告结果,它仍然是深度学习人工智能研究中的常见基准。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·benchmark·evaluation
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史