CLIP(对比语言-图像预训练)

译自英文

对比语言-图像预训练,是OpenAI于2021年1月发布的一种神经网络,它学习图像和文本的联合表示,并成为后来许多文本到图像生成系统的基础组件。

CLIP(对比语言-图像预训练)是由OpenAI于2021年1月发布的一种视觉-语言模型。与训练模型将图像分类为固定标签集不同,CLIP通过在大规模互联网收集的图像-标题配对数据集上进行训练,学习将图像与自由形式的文本描述关联起来,据报道该数据集约有4亿对。

方法

CLIP由两个联合训练的编码器组成:一个图像编码器和一个文本编码器,两者都将各自的输入映射到共享的嵌入空间中。训练使用对比目标:给定一批图像-文本对,模型被训练为在该空间中将匹配的图像和标题的嵌入拉近,同时将不匹配的对推开。这种方法借鉴了早期的对比表示学习思想,使CLIP能够直接从网络文本和替代文本中存在的自然语言监督中学习通用视觉概念,而无需依赖像ImageNet这样的手工标注分类数据集。

由此产生的模型能够执行“零样本”图像分类,这是一种零样本学习形式,通过将图像的嵌入与候选文本标签的嵌入进行比较来实现,而无需在这些类别上进行过显式训练。这与前十年占主导地位的基于卷积网络的图像分类器形成显著区别,后者通常需要针对特定任务进行微调。

在图像生成中的作用

CLIP最具影响力的影响并非来自分类,而是作为生成图像模型的引导信号。发布后不久,独立研究人员和爱好者将CLIP与现有的图像生成技术相结合,包括早期的基于GAN的方法以及后来的扩散模型,利用CLIP的文本-图像相似度评分来引导生成过程,使其朝向与给定提示匹配的图像。这种“CLIP引导”方法成为早期开源文本到图像艺术社区的基础,直到专门构建的系统出现。

CLIP的文本编码器随后被直接整合到主要的文本到图像系统中,最显著的是作为Stable Diffusion中的条件组件,其底层架构和训练方法也影响了整个行业的其他多模态模型,包括DALL-E的多个版本以及后续的视觉-语言系统。由于CLIP的嵌入捕捉了图像和文本之间的语义相似性,该模型还被用于基于内容的图像搜索、对图像集合的语义搜索,以及作为评估生成图像与其提示匹配程度的自动化指标。

意义与局限性

CLIP经常被引用为早期且有影响力的示例,展示了在嘈杂的、网络规模的数据上进行对比预训练,而非依赖精心策划的标签,这一策略后来在多模态AI研究中得到广泛呼应。它也被研究为从互联网训练数据中继承偏见的案例,研究人员记录了在种族、性别和其他社会类别上的倾斜关联,这些反映了底层网络抓取标题中存在的偏见。OpenAI公开发布了CLIP的权重,这与该公司后来大多封闭的发布形成对比,这帮助它成为开源生成式AI生态系统中广泛复用的构建模块。

分类:computer-vision·multimodal-ai·openai-models
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史