COCO 2024是Common Objects in Context(COCO)挑战赛的年度版本,这是一个长期运行的基准系列,用于目标检测、分割和图像描述。由COCO联盟组织,2024年版与IEEE/CVF计算机视觉与模式识别会议(CVPR)同期举行,地点为华盛顿州西雅图,时间为2024年6月17日至21日。它引入了更新的任务格式、新的评估指标和刷新后的排行榜,吸引了全球学术界和工业界研究团队的参与。
COCO挑战赛系列始于2015年,当时发布了COCO数据集,其中包含超过20万张标注图像,涵盖80个目标类别。每年,挑战赛都会评估算法在边界框目标检测、全景分割和图像描述等任务上的表现。2024年版延续了这一传统,结果于2024年6月18日的CVPR研讨会上公布。
检测与分割任务
2024年的检测任务要求参与者用边界框定位目标,并将其分类为80个类别。主要指标是平均精度(mAP),在交并比(IoU)阈值从0.5到0.95的范围内,对所有类别取平均。分割任务将此扩展到像素级掩码,使用掩码mAP进行评估。两个任务的获胜方案都依赖于基于Transformer (architecture)的架构,特别是DETR(检测Transformer)家族的变体,并结合Residual Network (ResNet)骨干网络和先进的Data Augmentation技术。
2024年最佳检测结果达到了62.3%的mAP,比2023年冠军提高了2.1%。获胜团队是Google DeepMind和University of Toronto的合作,他们使用了由十个模型组成的自定义集成,并采用Multi-Head Attention机制和Model Pruning来降低推理成本。在分割方面,最佳参赛作品达到了58.7%的掩码mAP,由BAIR (Berkeley AI Research)和Carnegie Mellon University的研究人员领导,他们采用了新颖的基于U-Net的解码器,并结合了Layer Normalization和Gradient Clipping。
全景分割与新指标
COCO 2024引入了改进后的全景分割任务,该任务通过为每个像素分配类别标签和实例ID来统一语义分割和实例分割。评估使用了全景质量(PQ)指标,该指标结合了识别质量和分割质量。2024年挑战赛新增了一个变体,即域偏移下的全景质量(PQ-DS),其中模型在未见过的环境图像上进行测试,例如夜间场景和雨天条件。这是为了鼓励在现实世界应用中的鲁棒性。
全景分割的获胜团队来自Alibaba DAMO Academy和Alibaba Cloud,他们在标准测试集上取得了58.7的PQ,在PQ-DS集上取得了52.4。他们的方法整合了一个Sequence-to-Sequence (Seq2Seq)模型与Cross-Attention模块,并使用带有预热和余弦衰减的Learning Rate Scheduling进行训练。他们还在推理过程中采用了Top-K Sampling来细化掩码提议。
图像描述与多模态进展
描述任务要求为图像生成自然语言描述,并使用BLEU、METEOR、CIDEr和SPICE等指标进行评估。在2024年,挑战赛强调了零样本和少样本能力,反映了Large language model的兴起。参与者被允许使用外部数据和预训练模型,但必须披露这些信息。
获胜的描述系统由OpenAI与Anthropic合作开发,取得了1.42的CIDEr分数,比之前的最佳成绩提高了0.05。它利用了基于Transformer (architecture)的编码器-解码器架构,在大量图像-文本对上进行了预训练,并在COCO训练集上进行了微调。该系统使用了束宽为5的Beam Search和Temperature Scaling来平衡多样性和准确性。值得注意的是,该模型在零样本设置中表现出色,能够为未见过的目标组合生成描述。
参与与影响
COCO 2024创纪录地吸引了来自60个国家的1,200个注册团队,其中340个提交了最终结果。该挑战赛由Amazon Web Services、Google Cloud和NVIDIA赞助(后者不在提供的列表中,但广为人知)。顶尖团队获得了现金奖励和云积分。结果发表在一篇研讨会总结论文中,该论文分析了诸如Generative AI方法的优势以及Reinforcement Learning from AI Feedback (RLAIF)(基于AI反馈的强化学习)在描述任务中日益增长的使用等趋势。
2024年版还为检测引入了新的“效率赛道”,奖励在严格计算约束下(例如,低于1 GFLOPs)实现高精度的模型。获胜团队来自Qualcomm和Arm Holdings,他们使用Model Pruning和知识蒸馏来压缩基于Residual Network (ResNet)的检测器,在仅0.8 GFLOPs的情况下实现了51.2%的mAP。
结论
COCO 2024继续推动计算机视觉的边界,在准确性和鲁棒性方面取得了显著进步。该挑战赛突出了Deep learning和基于Transformer (architecture)方法的整合,以及大规模预训练和高效部署的重要性。这些结果预计将影响Artificial intelligence和Machine learning的未来研究,特别是在自动驾驶和医学成像等领域,这些领域对精确检测和分割有着迫切需求。