译自英文

Flickr30k是一个广泛使用的图像描述基准数据集,包含来自Flickr的超过31,000张图像,每张图像附有五个独立的自然语言描述。它作为机器学习模型生成视觉内容文本描述的标准评估集。

Flickr30k是一个用于图像描述生成的基准数据集,于2014年由伊利诺伊大学厄巴纳-香槟分校及其他机构的研究人员提出。该数据集包含从Flickr照片分享网站获取的31,783张照片,每张照片配有五条不同的人工撰写的描述,总计超过158,000个描述-图像对。它旨在支持开发和评估自动生成图像自然语言描述的人工智能系统,,这一任务处于计算机视觉与自然语言处理的交汇点。

Flickr30k迅速成为机器学习领域的标准参考点,,与早期的Flickr8k数据集以及更大的Microsoft COCO数据集并列。其相对适中的规模,,与COCO的330,000张图像相比,,使其特别适合快速原型开发以及计算资源有限的模型训练。该数据集的描述以其多样性著称,,涵盖日常场景、人物、动物和活动,,这有助于模型学习广泛的视觉概念和语言结构词汇。

构建与标注

Flickr30k中的图像收集自照片分享网站Flickr,,经过策划以包含各种场景和主题;;每张图像由众包工作者(通常通过Amazon Mechanical Turk招募)标注了五条独立的英文句子;;标注过程强调自然、类似人类的描述,,而非基于模板的描述,,这有助于数据集的语言丰富性;;原始发布共包含31,783张图像上的158,915条描述,,标准划分为29,000张图像用于训练,,1,000张用于验证,,以及1,783张用于测试;;

在机器学习研究中的作用

Flickr30k在机器学习深度学习更广泛领域内的图像描述系统开发中发挥了基础性作用;;早期神经方法,,如基于神经网络编码器-解码器架构的方法,,经常使用Flickr30k作为主要评估基准;;该数据集帮助确立了从视觉输入生成流畅、语义准确描述的任务,,补充了更大但多样性较少的Microsoft COCO数据集;;研究人员已使用Flickr30k来比较模型架构,,包括那些结合Transformer (architecture)注意力机制的架构,,并研究图像与文本之间的跨模态对齐;;;

##扩展与变体

该数据集催生了几个显著的扩展;;Flickr30k Entities数据集于2017年发布,,添加了短语级接地标注,,将文本中对人物、物体和动作的提及链接到图像中的特定区域;;这一扩展使得指称表达理解和接地语言生成的研究成为可能;;另一个变体Flickr30k-CNA引入了众包修正,,以解决标注错误和偏差;;这些衍生版本将原始数据集的实用性从基本描述扩展到了更细粒度的视觉-语言任务;;;

##评估指标与基准

Flickr30k通常与标准的自动评估指标一起使用,,包括BLEU、METEOR、ROUGE和CIDEr;;这些指标衡量n-gram重叠、语义相似性以及与人类参考的一致性;;该数据集也被纳入复合基准中,,以评估模型对分布偏移和对抗性扰动的鲁棒性;;尽管更新的数据集(如从网络规模的图像-文本对构建的数据集)在规模上有所增长,,Flickr30k仍然是受控实验的紧凑且理解透彻的测试平台,,特别是在计算资源有限的学术环境中;;;

##局限性与批评

尽管广受欢迎,,Flickr30k存在已知的局限性;;图像主要来自美国与西欧,,导致描述中存在文化和地理偏差;;标注风格虽然自然,,但可能重复,,频繁使用如“a man”或“a woman”的短语而缺乏进一步说明;;数据集的规模与现代网络爬取的语料库相比适中,,这可能限制非常大模型的训练;;研究人员还指出,,五参考标注方案虽然有用,,但未能捕捉人类描述的全部多样性;;这些因素推动了更大、更多样化数据集的创建,,但Flickr30k在文献中继续作为可靠的比较点;;;

##参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·image-captioning·computer-vision·natural-language-processing
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史