MS COCO Captions是一个大规模数据集,包含描述微软通用对象上下文(COCO)集合中图像的人工编写句子。它为超过33万张图像中的每一张提供五个独立的描述,使其成为Artificial intelligence视觉语言理解研究的标准基准。
该数据集旨在支持图像描述任务,即模型必须生成图像的自然语言描述。其规模、多样性和注释质量使其成为Machine learning和Deep learning中的基础资源。
历史与创建
微软COCO数据集于2014年首次发布,作为推进对象识别和场景理解工作的一部分。描述注释通过Amazon Mechanical Turk收集,工作人员被要求描述每张图像中的重要对象、动作和关系。2015年,Xinlei Chen及其同事的配套论文详细介绍了收集方法,并引入了评估服务器。最终数据集包含32.8万张图像,每张有五个描述,总计约150万个句子。
数据集统计与结构
每个描述是一个英文句子,通常长度为10到12个单词,完整词汇量约为1万个单词。图像覆盖80个对象类别,并包含多个交互对象的复杂场景。数据集分为训练集、验证集和测试集,测试描述被保留用于评估。原始2014年划分包括82,783张训练图像、40,504张验证图像和40,775张测试图像。这种结构支持对Neural network模型的可重复基准测试。
评估与基准
MS COCO Captions是图像描述任务的主要基准。自动指标如BLEU、METEOR、ROUGE、CIDEr和SPICE用于将模型输出与五个参考描述进行比较。由COCO项目托管的评估服务器允许研究人员提交保留测试集的结果。早期最先进的系统使用Encoder-Decoder Architecture架构和Sequence-to-Sequence (Seq2Seq)学习。后续进展引入了Transformer (architecture)模型和Multi-Head Attention机制,通常从Large language model初始化。这些模型经常使用Cross-Attention层来对齐视觉特征与文本,解码通常依赖Beam Search生成流畅描述。
影响与应用
该数据集推动了Generative AI在视觉语言任务中的进展。它用于训练自动替代文本生成、图像检索和视觉问答模型。注释也被改编用于其他计算机视觉任务中的Data Augmentation,如对象检测和分割。研究人员使用MS COCO Captions研究组合泛化、跨模态对齐以及深度学习系统的鲁棒性。
局限性与扩展
尽管取得了成功,MS COCO Captions存在已知局限性。图像主要描绘西方背景下的日常场景,描述可能反映文化偏见。词汇量相对较小,句子比典型的人类描述更短。为解决这些问题,研究人员创建了扩展版本,如用于中文描述的COCO-CN和用于开放词汇描述的nocaps数据集。这些努力继续影响人工智能中新基准的设计。