对比学习是机器学习中的一种范式,模型通过比较数据样本对来学习表征。其核心目标是最小化正样本对之间的距离(即语义相似或同一实例的增强版本),同时最大化负样本对之间的距离(即不相似的样本)。这种方法属于自监督学习的更广泛范畴,后者从数据本身生成监督信号,而非依赖外部提供的标签。通过解决这一对比任务,模型能够捕获数据中的关键特征和关系,通常产生可迁移到下游任务(如图像分类、语音识别和自然语言处理)的表征。
自2010年代中期以来,对比学习随着深度神经网络和大规模无标签数据集的兴起而日益受到重视。它支撑了多个有影响力的模型,包括OpenAI的CLIP(对比语言-图像预训练)以及各种音频和视觉编码器。该技术广泛应用于计算机视觉、音频处理和大型语言模型等领域,帮助模型在没有人工标注的情况下学习有意义的嵌入。
历史发展
对比学习的根源可追溯至神经网络和表征学习的早期工作。最早的一个例子见于2005年Raia Hadsell、Sumit Chopra和Yann LeCun发表的论文,他们使用一对一维卷积神经网络处理两张图像并最大化它们的一致性,从而有效学习相似性度量。这项工作为后来的对比方法奠定了基础。
在2010年代,由Michael Gutmann和Aapo Hyvärinen于2010年提出的噪声对比估计(NCE)概念,提供了一个通过区分目标样本与噪声来学习的统计框架。这直接影响了InfoNCE的发展,后者是由Aaron van den Oord、Yazhe Li和Oriol Vinyals于2018年提出的损失函数,成为现代对比学习的基石。InfoNCE通过最小化一个在负样本集中识别正样本的损失来联合优化两个模型,借鉴了NCE的原理。
核心原理
对比学习基于将正样本对拉近、将负样本对推远的原理。正样本对通常通过对同一输入样本应用不同增强(如裁剪、旋转、颜色抖动或噪声添加)来生成。负样本对则由批次或数据集中的不同样本形成。模型学习一个嵌入空间,其中相似项彼此接近,不相似项彼此远离。
对比学习中的损失函数旨在最小化正样本对之间的距离,同时最大化负样本对之间的距离。常见损失函数包括对比损失、三元组损失和InfoNCE。例如,InfoNCE在给定一组包含一个正样本和N-1个负样本的N个随机样本时,最小化一个鼓励模型相对于负样本赋予正样本高概率的损失。
关键方法与架构
多种有影响力的方法塑造了对比学习。SimCLR由Ting Chen等人于2020年在Google提出,使用一个包含数据增强、基础编码器、投影头和对比损失的简单框架。它证明了强增强和大批量大小对性能至关重要。MoCo(动量对比)由Kaiming He等人在Facebook AI Research开发,引入了一个带有动量更新编码器的动态字典,以保持批次间的一致性。
CLIP由OpenAI于2021年发布,将对比学习扩展到多模态数据。它联合训练一个文本编码器和一个图像编码器,使得匹配的图像-文本对具有高余弦相似度(嵌入向量之间的角度小),而不匹配的对具有低相似度。这实现了对多种视觉任务的零样本迁移。
在音频处理中,对比学习已应用于语音识别,模型从原始波形或频谱图中学习表征。例如,Facebook(现Meta)已使用自监督对比方法进行语音识别,在无标签数据上取得了最先进的结果。
在自监督学习中的应用
对比学习是自监督学习的子集,后者旨在利用数据中的固有结构来创建训练信号。在自监督学习中,模型通过预文本任务(如预测图像的缺失部分或句子中的下一个词)进行训练,使用从数据本身生成的伪标签。对比学习是一种特定类型的预文本任务,其中模型必须区分相似和不相似的样本对。
这种方法密切模仿人类学习,我们通常通过比较对象和事件来学习。例如,一个孩子通过看到许多鸟的例子并注意到它们之间的共同点以及与其他动物的区别来识别鸟。对比学习形式化了这种直觉。
伪标签与自适应学习
在许多自监督流程中,伪标签起着关键作用。伪标签是模型根据自身预测自动分配给无标签数据的标签。它们广泛用于半监督学习以及必须适应概念漂移(数据统计属性随时间变化)的系统中。在这种场景下,模型可能检测到传入实例偏离先前学习的行为,生成分类结果,并使用该预测类别作为更新模型组件的伪标签。这实现了无需人工标注的持续适应。
在对比学习中,伪标签可用于选择正样本对和负样本对。例如,在基于聚类的对比方法中,模型为样本分配聚类归属,同一聚类中的样本被视为正样本。这通过仅使用高置信度预测来降低传播错误的风险。
优势与局限性
对比学习提供了多项优势。它减少了对通常昂贵且稀缺的标签数据的依赖。它学习丰富的表征,可很好地迁移到下游任务,通常在大数据集上优于监督预训练。它还支持多模态学习,如CLIP所示。
然而,对比学习也有局限性。它需要仔细选择增强和负样本;选择不当可能导致平凡解或性能下降。通常需要大批量大小来提供足够的负样本,这可能计算成本高昂。此外,损失函数和超参数的选择显著影响结果。
近期发展与未来方向
近期研究聚焦于提高对比学习的效率和鲁棒性。BYOL(自举潜在表示)和SimSiam等方法表明,对比学习可以在没有负样本对的情况下工作,仅使用正样本对和停止梯度机制。这减少了对大批量的需求。其他工作探索了难负样本挖掘,其中模型专注于具有挑战性的负样本以提高判别能力。
在生成式AI和Transformer的背景下,对比学习用于跨模态对齐表征以及改进文本和图像嵌入。Anthropic和Google DeepMind等公司在其模型中融入了对比目标。截至2025年,对比学习仍是一个活跃的研究领域,在机器人、医疗保健和自动驾驶中均有应用。
结论
对比学习已成为现代机器学习中的一项基础技术,使模型能够从无标签数据中学习强大的表征。通过拉近正样本对并推远负样本对,它捕获了数据中的基本结构,在多个领域取得了最先进的性能。它与自监督学习和伪标签的整合持续推动AI的进步,使其成为研究人员和从业者的关键工具。