COCO Captions 2015是一个广泛使用的图像描述基准数据集,包含微软COCO(常见物体上下文)2014和2015年集合中每张图像的五条独立人工撰写的描述。该数据集旨在支持人工智能和机器学习领域的研究,特别是需要生成视觉内容自然语言描述的任务。每条描述都是一个完整的句子,描述对应图像中的物体、动作和关系,提供了丰富的视觉-语言对齐数据来源。
这些描述通过Amazon Mechanical Turk收集,工作人员被要求用一句话描述图像中所有重要部分。数据集包含超过330,000张图像,每张图像配有五条描述,总计超过150万条描述-图像对。COCO Captions 2015成为结合计算机视觉和自然语言处理中深度学习技术的模型的标准评估集,通常使用神经网络架构,如编码器-解码器模型。数据集的设计鼓励措辞多样性,因为不同的标注者以不同方式描述同一场景,这考验了模型生成流畅且语义准确文本的能力。
结构和统计
COCO Captions 2015数据集分为训练集、验证集和测试集,其中测试集进一步分为公开测试集和用于官方评估的保留测试集。训练集包含约82,783张图像,验证集包含40,504张图像,测试集包含40,775张图像。每张图像关联五条描述,但测试集的描述不公开发布以防止过拟合;相反,研究人员将预测提交到评估服务器。描述长度各异,通常为8到25个单词,涵盖广泛的日常场景,包括人物、动物、车辆以及室内/室外环境。
评估指标
COCO Captions 2015的标准评估指标包括BLEU、METEOR、ROUGE-L和CIDEr。CIDEr(基于共识的图像描述评估)专为图像描述设计,使用TF-IDF加权的n-gram重叠来衡量生成描述与人工参考集之间的共识。数据集的官方评估脚本在保留测试集上计算这些指标,排行榜跟踪最先进模型的性能。2015年,顶级系统实现了约0.30的BLEU-4分数和约1.0的CIDEr分数,但后续基于变换器架构和大型语言模型预训练的进展显著提高了这些数字。
在模型开发中的作用
COCO Captions 2015在现代图像描述系统的发展中发挥了重要作用。早期方法使用残差网络或U-Net骨干进行视觉特征提取,结合循环神经网络进行文本生成。后来,变换器架构中引入的多头注意力和交叉注意力机制取代了循环组件,实现了更高效的并行训练。该数据集还促进了数据增强和课程学习的研究,以及束搜索和top-p采样解码策略的使用。许多生成式人工智能模型,包括来自OpenAI和Google DeepMind的模型,已将COCO Captions 2015用作预训练或评估基准,尽管像Flickr30k和Visual Genome这样的新数据集已经出现。
局限性和遗产
该数据集存在已知的局限性,包括对常见物体和简单句子结构的偏见,以及来自众包工作人员的潜在标注噪声。它还缺乏较新基准中出现的细粒度空间关系和组合推理挑战。尽管存在这些问题,COCO Captions 2015仍然是比较图像描述方法和研究视觉-语言对齐的基础资源。其每图像五条描述的设计影响了后来的数据集,其评估协议继续用于学术研究。该数据集可免费用于学术用途,其标注在文献中被广泛引用。
相关基准和扩展
COCO Captions 2015的扩展包括COCO-CN(添加了中文描述)和nocaps(专注于新物体描述)。该数据集还与COCO检测和分割任务重叠,支持多任务学习。研究人员经常将COCO Captions 2015与其他数据集结合以提高泛化能力,它仍然是测试视觉-语言任务中序列到序列模型的常见选择。该数据集的影响延伸到Amazon Web Services和Google Cloud产品,这些产品提供预处理版本用于基于云的模型训练。