译自英文

MS COCO Captions是一个大规模数据集,包含描述Microsoft COCO语料库中图像的人工编写句子,每张图像配有五条描述。它作为训练和评估[[image-captioning|图像描述]]模型的标准基准。

MS COCO Captions是一个大规模数据集,包含描述微软通用对象上下文(COCO)集合中图像的人工编写句子。它为超过33万张图像中的每一张提供五个独立的描述,使其成为Artificial intelligence视觉语言理解研究的标准基准。

该数据集旨在支持图像描述任务,即模型必须生成图像的自然语言描述。其规模、多样性和注释质量使其成为Machine learningDeep learning中的基础资源。

历史与创建

微软COCO数据集于2014年首次发布,作为推进对象识别和场景理解工作的一部分。描述注释通过Amazon Mechanical Turk收集,工作人员被要求描述每张图像中的重要对象、动作和关系。2015年,Xinlei Chen及其同事的配套论文详细介绍了收集方法,并引入了评估服务器。最终数据集包含32.8万张图像,每张有五个描述,总计约150万个句子。

数据集统计与结构

每个描述是一个英文句子,通常长度为10到12个单词,完整词汇量约为1万个单词。图像覆盖80个对象类别,并包含多个交互对象的复杂场景。数据集分为训练集、验证集和测试集,测试描述被保留用于评估。原始2014年划分包括82,783张训练图像、40,504张验证图像和40,775张测试图像。这种结构支持对Neural network模型的可重复基准测试。

评估与基准

MS COCO Captions是图像描述任务的主要基准。自动指标如BLEU、METEOR、ROUGE、CIDEr和SPICE用于将模型输出与五个参考描述进行比较。由COCO项目托管的评估服务器允许研究人员提交保留测试集的结果。早期最先进的系统使用Encoder-Decoder Architecture架构和Sequence-to-Sequence (Seq2Seq)学习。后续进展引入了Transformer (architecture)模型和Multi-Head Attention机制,通常从Large language model初始化。这些模型经常使用Cross-Attention层来对齐视觉特征与文本,解码通常依赖Beam Search生成流畅描述。

影响与应用

该数据集推动了Generative AI在视觉语言任务中的进展。它用于训练自动替代文本生成、图像检索和视觉问答模型。注释也被改编用于其他计算机视觉任务中的Data Augmentation,如对象检测和分割。研究人员使用MS COCO Captions研究组合泛化、跨模态对齐以及深度学习系统的鲁棒性。

局限性与扩展

尽管取得了成功,MS COCO Captions存在已知局限性。图像主要描绘西方背景下的日常场景,描述可能反映文化偏见。词汇量相对较小,句子比典型的人类描述更短。为解决这些问题,研究人员创建了扩展版本,如用于中文描述的COCO-CN和用于开放词汇描述的nocaps数据集。这些努力继续影响人工智能中新基准的设计。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·image-captioning·computer-vision·natural-language-processing
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史