NoCaps(大规模新物体描述)是一个基准数据集和评估协议,旨在评估图像描述系统描述包含训练数据中未出现物体的图像的能力。该基准由德克萨斯大学奥斯汀分校等机构的研究人员于2019年提出,解决了标准描述基准中的一个关键局限:模型往往过度拟合训练中见过的有限物体词汇,无法泛化到视觉概念的长尾分布。NoCaps提供了一个受控环境来衡量这种泛化能力,使用来自Open Images数据集的图像,以及一组与广泛使用的COCO数据集中的类别不相交的物体类别。
该基准包含超过15,000张图像,每张图像配有多条人工撰写的参考描述。图像根据包含的新物体数量分为三个评估子集:域内(无新物体)、近域(少量新物体)和开放域(大量新物体)。这种分层结构使研究人员能够分析随着视觉内容的新颖性和复杂性增加而出现的性能下降。主要评估指标是CIDEr,这是一种标准的描述指标,用于衡量生成描述与参考描述之间的一致性,不过BLEU、METEOR和SPICE等其他指标也会被报告。
动机与挑战
像COCO这样的传统描述数据集仅包含80个物体类别,这只是视觉世界的一小部分。在此类数据集上训练的模型倾向于记忆频繁出现的物体共现关系,在遇到不熟悉的组合或全新物体时会失败。NoCaps的创建旨在推动该领域朝着更稳健、更可泛化的描述系统发展。关键挑战在于,模型不仅要识别新物体(这是一个视觉感知问题),还要生成流畅且上下文恰当的语言来描述它们,通常需要使用在训练中从未与这些视觉输入配对过的词汇。
构建与标注
NoCaps中的图像来源于Open Images数据集,该数据集包含数百万张带有多样化物体标注的图像。创建者选择了一部分图像,并对其进行筛选,以确保三个难度层级之间的分布均衡。他们使用了Open Images中的500个物体类别词汇表,其中相对于COCO的80个类别,有200个被视为新类别。Amazon Mechanical Turk上的人工标注者按照鼓励自然、描述性句子的指南,为每张图像撰写了五条参考描述。标注过程包括质量控制措施,以确保描述准确且多样化。
评估协议
要在NoCaps上评估模型,系统需要为测试集中的每张图像生成一条描述。生成的描述使用CIDEr与人工参考进行比较,CIDEr计算候选描述与参考n-gram向量之间的平均余弦相似度,并按词频-逆文档频率加权。该基准提供了一个公开的验证集用于开发,以及一个隐藏的测试集用于最终评估,结果在官方排行榜上报告。这种设置鼓励不同方法之间的公平比较,从经典的序列到序列模型到现代的基于变换器架构。
影响与使用
NoCaps已成为机器学习和计算机视觉社区中的标准基准,特别是在评估图像描述模型的泛化能力方面。它已被用于展示数据增强、课程学习以及整合外部知识源(如大型语言模型)等技术的有效性。例如,一些方法使用预训练的物体检测器来识别新物体,然后根据检测到的标签来条件化语言模型,而其他方法则采用交叉注意力机制来更有效地对齐视觉和文本特征。该基准还强调了扩展训练数据和模型容量的重要性,因为在大型数据集上训练的更大神经网络往往在开放域子集上表现更好。
局限性与批评
尽管具有影响力,NoCaps仍存在一些局限性。该基准依赖于一组固定的新物体,这可能无法完全捕捉现实世界新颖性的开放性。评估指标CIDEr已知对风格和长度敏感,可能无法完全反映语义正确性。此外,人工参考虽然质量高,但数量有限,可能无法覆盖描述图像的所有有效方式。一些研究人员认为,该基准对物体级新颖性的关注掩盖了泛化的其他方面,如新关系或属性。尽管如此,NoCaps仍然是跟踪稳健图像描述进展的宝贵工具。
未来方向
随着该领域向更强大的生成式人工智能系统发展,NoCaps可能会被测试组合泛化、零样本学习以及与用户指令交互的基准所扩展或补充。将大型语言模型作为解码器集成,通常与视觉-语言模型结合,已在利用广泛世界知识处理新物体方面显示出潜力。未来的工作也可能探索动态基准,这些基准会适应模型的训练数据,确保新颖性始终是真正的新颖。NoCaps为严格的泛化评估树立了先例,其原则可能会影响多模态人工智能未来基准的设计。