CLIPScore是一种用于评估图像标题生成质量的指标。

译自英文

CLIPScore是一种无参考的图像描述质量评估指标,通过计算图像及其生成描述的CLIP嵌入之间的余弦相似度来评估,与人类判断具有良好相关性。

CLIPScore是一种用于评估人工智能系统生成的图像描述质量的指标。它是一种无参考指标,意味着它不需要人工撰写的真实描述进行比较。相反,它直接使用一个名为CLIP(对比语言-图像预训练)的预训练神经网络来衡量图像与候选描述之间的语义对齐程度。

该指标于2021年由哥本哈根大学和丹麦技术大学的研究人员引入,由Jack Hessel领导。它在那年的自然语言处理经验方法会议(EMNLP)上提出。其核心思想是利用CLIP学习到的联合嵌入空间,在该空间中,图像及其对应的文本描述被映射到彼此接近的向量。CLIPScore计算图像的CLIP嵌入与描述的CLIP嵌入之间的余弦相似度,并可选地根据过短描述进行惩罚加权。

计算与变体

基础CLIPScore定义为图像和描述归一化嵌入之间的余弦相似度,乘以一个考虑描述长度的因子。具体来说,公式为:CLIPScore(I, c) = w * max(cos(I, c), 0),其中w是一个加权项,如果描述少于一定数量的标记(通常为10),则为2.5,否则为1。这种惩罚机制阻止了可能琐碎匹配图像的过于简短的描述。

一种名为RefCLIPScore的变体通过平均图像与每个参考描述之间的CLIPScore,然后使用调和平均数将其与基础CLIPScore结合,从而纳入参考描述。当有人工参考可用时,会使用此变体,但CLIPScore的主要优势在于它能够在没有参考的情况下工作。

相比传统指标的优势

用于图像描述的传统指标,如BLEU、ROUGE、METEOR和CIDEr,依赖于生成描述与参考描述之间的n-gram重叠。这些指标基于参考,往往无法捕捉语义相似性,会惩罚那些语言上不同但语义等价的改写。CLIPScore通过在一个从大规模图像-文本对语料库中学习到的高维语义空间中操作来解决这一问题。这使它能够识别“一只狗在玩接球”和“一只犬科动物在捡球”描述的是同一场景,即使它们没有共享词汇。

实证研究表明,在多个基准数据集(包括Flickr8k、Flickr30k和MS COCO)上,CLIPScore与人类对描述质量的判断相关性优于传统指标。其无参考特性也使其特别适用于评估新领域中的描述或参考描述不可用的零样本描述模型。

应用与局限性

CLIPScore已被广泛用于生成式AI模型的图像描述和文本到图像生成的评估中。它通常与其他指标一起使用,以提供全面的评估。例如,在文本到图像模型中,使用一种名为CLIPScore的变体来衡量生成图像与文本提示之间的对齐程度,帮助研究人员调整模型参数。

尽管有其优势,CLIPScore也存在已知的局限性。它对CLIP模型检查点的选择敏感,因为不同的检查点可能产生不同的分数。它也可能偏向于提及常见对象或属性的描述,并且可能无法完全捕捉细粒度细节或组合推理。此外,它不直接衡量语法正确性或流畅性,因此通常与基于语言模型的流畅性指标搭配使用。

与其他AI指标的关系

CLIPScore是机器学习评估中从基于n-gram的指标转向基于学习的嵌入指标这一更广泛趋势的一部分。它在概念上与BERTScore等用于文本摘要和翻译的指标相似,后者使用大型语言模型Transformer的嵌入。然而,CLIPScore的独特之处在于它跨模态操作,连接了视觉和语言。

CLIPScore的开发得益于OpenAI在2021年初发布的CLIP模型,该模型本身是一个基于Transformer的神经网络,在4亿个图像-文本对上进行了训练。CLIPScore的成功启发了后续在其他多模态任务(如视频描述和视觉问答)中进行无参考评估的研究。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:image-captioning·evaluation-metrics·multimodal-learning·natural-language-processing
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史