译自英文

自监督学习是一种机器学习方法,其中模型从无标签数据中自行生成训练标签,最常见的方式是通过输入的其他部分预测隐藏或缺失的部分。

自监督学习是一种训练方法,模型从没有人工提供标签的数据中学习,通过直接从数据本身的结构构建自身的监督信号。与监督学习中为每个输入告知正确输出不同,模型被设定一个任务,例如从数据的其余部分预测隐藏或缺失的部分,而该任务的“标签”仅仅是隐藏的实际值,该值已存在于原始无标签数据集中,无需额外标注成本。

核心思想与目标

典型的例子是下一个词元预测:给定一段文本并移除最后一个词,模型被训练来预测该词,由于普通文本本身已包含其下一个词,因此无需任何人工标注。这正是用于预训练现代大型语言模型的目标,这些模型通过反复预测序列中的下一个词元,从诸如Common Crawl等来源抓取的海量原始文本中学习。一个相关的目标是掩码词元预测,它隐藏序列中的随机子集词元,并训练模型从周围上下文将其填补回来;这是BERT背后的预训练目标。在计算机视觉和多模态学习中,自监督目标包括预测图像中被掩码的区域,以及对比目标,例如CLIP所使用的,训练模型识别哪些图像和文本对(或同一图像的两个增强视图)属于一起,哪些不匹配。

与监督学习和无监督学习的关系

自监督学习在概念上介于监督学习和无监督学习之间。它像无监督学习一样使用无标签数据,但定义了一个具有明确正确答案的显式预测任务,并使用与普通监督训练相同的损失函数梯度下降反向传播机制进行优化。一些研究者将其视为无监督学习的子类型;另一些则将其视为独立类别,因为其训练机制与监督学习极为相似,仅在标签来源上有所不同。

为何重要

自监督学习解决了限制监督学习的一个根本瓶颈:人工标注数据的稀缺性和成本。由于互联网和其他大型语料库已包含大量无标签的文本、图像、音频和视频,自监督目标使模型能够在标注数据集无法匹敌的规模上进行训练,这一转变直接推动了现代基础模型时代背后的扩展。这也是迁移学习在语言领域变得如此有效的机制:通过自监督目标在广泛文本上预训练的模型,学习到的表示足够通用,能够以相对较少的任务特定微调迁移到广泛的下游任务。

显著里程碑与影响

Word2vec在2013年的词预测目标是自监督学习应用于语言的早期有影响力示例,尽管当时该术语尚未广泛使用。在2018年BERT和GPT系列之后,这种方法成为该领域词汇和策略的核心,到2020年代初,自监督预训练后接监督或基于偏好的微调已成为几乎所有主要大型语言模型的标准配方。同样的范式扩展到文本之外:预测未来帧的自监督视频模型是机器人技术和自主系统世界模型研究的基础组成部分。自监督学习的核心局限性在于,所得表示的质量仍取决于底层无标签数据的质量、规模和多样性,数据中存在的偏差或缺口会被模型吸收,就像在监督训练中一样。

分类:machine-learning·deep-learning·model-training
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史