对比语言-图像预训练

译自英文

对比语言-图像预训练(CLIP)是一种神经网络模型,通过在配对的图像-文本数据上联合训练图像编码器和文本编码器,从自然语言监督中学习视觉概念,从而实现对下游任务的零样本迁移。

对比语言-图像预训练(CLIP)是一种机器学习模型,由OpenAI开发,通过将图像与自然语言描述关联来学习视觉表征。它采用双编码器架构,其中图像编码器和文本编码器联合训练,以在共享向量空间中对齐图像和文本嵌入。这种方法使模型能够执行零样本图像分类和检索,而无需特定任务的训练数据。

CLIP首次在2021年的一篇arXiv论文中提出,作者包括Alec Radford、Jong Wook Kim、Chris Hallacy、Aditya Ramesh、Gabriel Goh、Sandhini Agarwal、Girish Sastry、Amanda Askell、Pamela Mishkin、Jack Clark、Gretchen Krueger和Ilya Sutskever。该项目旨在通过利用互联网上丰富的文本-图像对(特别是来自社交媒体和在线文章的平台)来克服固定标签图像分类数据集的局限性。该名称反映了核心训练方法:对图像及其相关语言描述进行对比预训练。

CLIP的架构由两个神经网络编码器组成,每个编码器基于Transformer框架。图像编码器可以是视觉Transformer(ViT)或残差网络(残差网络),两者均配置为生成低维特征向量。文本编码器使用带有因果注意力掩码的标准Transformer处理分词序列,最终生成一个投影到与图像特征相同维度的特征向量。两个向量通过点积进行比较,并应用对比损失函数,通常是温度缩放的InfoNCE准则。在训练期间,模型看到一批图像-文本对,并优化以最大化匹配对的相似度,同时最小化所有其他组合的相似度。这一过程使用Adam优化器,配合包含预热阶段的学习率调度以及梯度裁剪技术,推动模型学习对齐的嵌入空间。

用于预训练的数据集是WebImageText数据集,其中包含从互联网自动收集的超过4亿个图像-文本对。相比之下,以前流行的数据集(如ImageNet)包含约160万张标记图像。数据集的多样性和规模使CLIP无需手动标注即可获得广泛的视觉知识。然而,作者指出网络收集数据可能存在系统性偏差,包括潜在的别名问题和某些群体的代表性不足,这在后续模型迭代中仍然是一个关注点。

零样本迁移与能力

CLIP无需额外的任务特定微调即可适应广泛的任务。例如,分类任务可以通过让模型对一组文本提示(如“一张狗的照片”)与输入图像进行排序来执行。其在ImageNet(视觉识别的标准基准)上的性能达到了76.2%的top-1准确率,且无需任何像素训练示例,超越了基于固定特征的基线,并匹配了在ResNet-50特征上训练的简单线性分类器的性能。在其他基准(如统一视觉分类任务)上,CLIP相对于SimCLR特征训练的线性分类器平均提升约16%。这些结果表明,在自然发生的文本上进行大规模对比预训练是迁移学习的可行方法。

该模型还支持图像-文本检索,能够从描述中查找图像或将文本匹配到图像。它已用于生成式场景,例如作为文本到图像流水线的组件以及作为生成式AI艺术创作的指导,其嵌入可用于数据增强和图像搜索系统。

影响与作用

CLIP将计算机视觉领域从使用潜在标签集进行分类转向开放词汇理解,为扩展视觉模型开辟了新领域。其零样本迁移概念启发了后续方法(如ALIGN和Florence),而使用自然语言作为灵活预测接口的方法已成为多模态工作的标准。它还影响了在Transformer模型训练中使用对比目标。OpenAI已发布多个参考实现并开源了该模型,促进了学术界和工业界的进一步研究和发展。

后续迭代(如CLIP及其变体OpenCLIP,一个社区重新实现)都扩展了原始概念,在数据收集和训练技术方面进行了改进,同时平衡了能源消耗等实际约束。CLIP仍然是多模态学习实证研究中广泛引用的基线。

批评与局限性

尽管取得了成功,CLIP仍有显著局限性。它在细粒度时序或长尾分类上表现不佳,在仇恨言论检测或医学成像等任务上的准确率低于专用模型。还存在从网络学习社会偏差的风险:在人类属性分类评估中,模型可能表现出训练数据中过度代表的种族或性别特征,并可能误分类某些群体。其空间推理和外观能力较差,无法在没有显式监督的情况下可靠地计数或检测多个实例。大量工程社区也关注零样本鲁棒性,但CLIP对常见变换(如数据增强,例如模糊或旋转)的敏感性降低了其在某些应用中的实用性。

文本编码器在词元级别运行,这限制了对语言的更深层组合理解,且代码无法有效处理大型语法结构。CLIP还依赖于OpenAI实现训练数据集,该数据集未公开,使独立分析复杂化;独立补救措施(如OpenCLIP)解决了适配问题,但未显著解决潜在偏差。

更广泛的生态系统与关联

CLIP的设计影响了视觉之外的领域,包括音频-语言模型,其概念与RLAIF等方法结合用于机器人微调。它与深度学习中对比方法和大规模预训练的广泛趋势相关联,并已由公共云服务(如亚马逊网络服务谷歌云)托管以便使用。许多最近的统一多模态模型(包括Google DeepMind的效率能力)集成了类似CLIP的图像片段。学术和工业中心的研究人员(包括斯坦福AI实验室和UA Ou)构建了扩展,以提供跨模态的多头注意力

此外,CLIP在OpenAI中发挥了重要作用,该组织还与OpenAI成员Ilya Sutskever和OpenAI领导层合作,推动该领域与大规模AI研究保持一致。其复杂演变直接源于先前关于大型语言模型和Transformer的工作,并在近年与其他框架结合考虑。

CLIP的未来涉及扩展:它可以在更多数据和GPU资源上更广泛地训练,但研究人员正在探索更好的架构和极大规模的训练数据,以提高其性能并减轻其偏差。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:multimodal·neural-network·openai·vision-and-language
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史