COCO检测是计算机视觉中的一项基准任务,用于评估目标检测模型在图像中识别和定位物体的能力。该任务由上下文中的常见物体(COCO)数据集定义,该数据集包含超过20万张图像,其中标注了超过150万个物体实例的边界框和类别标签。检测任务具体要求模型为图像中存在的80个定义类别中的每个物体实例输出一个边界框和一个类别标签。它是衡量目标检测进展最广泛使用的基准之一,与使用相同底层数据集的实例分割和关键点检测等任务并列。
该基准的评估指标是平均精度(mAP),在多个交并比(IoU)阈值下计算。主要指标通常记为mAP@[0.5:0.95],在0.5到0.95的IoU阈值范围内以0.05的步长平均精度。这一严格指标奖励精确的定位,而不仅仅是粗略的检测。自2015年引入以来,COCO检测挑战一直是基于深度学习检测架构创新的核心驱动力,排行榜追踪了从早期卷积模型到现代基于Transformer的检测器的快速改进。
数据集与标注
COCO数据集于2014年由微软研究院的一个团队首次发布,由林宗毅等人领导。它旨在解决早期数据集(如PASCAL VOC)的局限性,通过包含每张图像中更多物体、更小物体以及具有上下文关系的更复杂场景。80个物体类别涵盖日常物品,如人、自行车、汽车、狗和杯子,以及更具体的类别,如交通灯、消防栓和滑雪板。标注以轴对齐边界框形式提供,每个框由其左上角坐标、宽度和高度定义。数据集分为训练集(约118,000张图像)、验证集(5,000张图像)和测试集,其中测试集标注被保留用于挑战评估。
检测模型的演进
COCO检测上的早期最先进方法依赖于两阶段检测器,特别是2015年由任少卿、何恺明及其同事引入的Faster R-CNN系列。这些模型首先使用区域提议网络提出候选区域,然后对每个提议进行分类和细化。2015年ResNet架构的引入提供了一个骨干网络,显著改善了特征提取,将COCO mAP从约21%提升到2017年的超过37%。像YOLO和SSD这样的单阶段检测器提供了速度优势,但最初在准确性上落后。2017年特征金字塔网络(FPN)的采用允许多尺度特征融合,缩小了差距。到2018年,像Mask R-CNN这样的模型,作为Faster R-CNN的扩展,实现了超过39%的mAP,同时执行实例分割。
基于Transformer的检测器
2020年发生了一次重大转变,Meta AI(当时为Facebook AI Research)团队引入了检测Transformer(DETR)。DETR将目标检测重新定义为集合预测问题,使用Transformer编码器-解码器架构和二分匹配损失,直接输出固定数量的预测。这消除了对手工设计组件(如锚框和非极大值抑制)的需求。尽管DETR最初收敛较慢,但后续变体如Deformable DETR(2021年)提高了训练效率和准确性。到2023年,像DINO和RT-DETR这样的基于Transformer的检测器在COCO基准上持续优于卷积对应模型,在测试开发集上实现了超过50%的mAP值。这些模型利用多头注意力机制捕获全局上下文,这对检测小物体和遮挡物体特别有益。
训练与数据增强
在COCO检测上实现高性能需要仔细的训练策略。标准做法包括使用在ImageNet上预训练的权重初始化骨干网络,然后在COCO上进行微调。数据增强起着关键作用;常见技术包括随机水平翻转、随机缩放和颜色抖动。更高级的方法如Mosaic和MixUp,由YOLOv4推广,结合多张图像以提高鲁棒性。训练通常使用Adam或SGD优化器,并采用包含预热和余弦衰减的学习率调度。批量归一化在卷积骨干中是标准的,而层归一化用于基于Transformer的头部。训练过程计算密集,通常需要多个GPU运行数天。例如,一个典型的DETR模型在8个V100 GPU上训练大约需要3天才能收敛。
影响与相关基准
COCO检测已成为评估目标检测研究的事实标准,数千篇论文在其验证集上报告结果。其影响扩展到相关任务:同一数据集支持实例分割(COCO分割)、关键点检测(COCO关键点)和全景分割。该基准还推动了实际应用,如自动驾驶、机器人学和医学成像,这些领域精确的定位至关重要。机器学习社区继续使用COCO作为参考点,尽管更新的数据集如LVIS和Objects365提供了更多类别或更大规模。该挑战仍然活跃,在CVPR和ECCV等主要会议上举办年度研讨会,排行榜是学术和工业研究团队的常见目标。
局限性与批评
尽管COCO检测广受欢迎,但存在已知的局限性。80个类别是固定的,并未涵盖许多现实世界物体,且数据集偏向于居中良好、清晰可见的物体。mAP指标可能对置信度阈值的微小变化敏感,且测试集标注不公开,这可能导致在验证集上过拟合。一些研究人员指出,COCO上的性能并不总是能迁移到其他领域,如航空或水下图像。此外,该基准未明确衡量推理速度或计算成本,尽管许多论文单独报告这些内容。这些问题促使创建了替代基准,如Open Images和更新的EgoObjects,旨在解决其中一些差距。