译自英文

迁移学习是一种机器学习方法,其中在训练模型完成一个任务或数据集时获得的知识,被用作针对不同但相关任务的模型的起点。

迁移学习是一种实践,指复用某个模型或其已学到的表示,从一个任务作为起点,用于另一个不同但相关的任务,而不是从随机初始化的权重开始训练新模型。它基于这样一个观察:一个领域内的许多任务,例如识别图像中的边缘和形状,或理解文本中的语法和词语关系,都共享底层结构,因此已经学习到该结构的模型只需相对较少的新数据即可进一步专业化。

历史与动机

迁移学习的根源可追溯至认知科学和20世纪90年代探索“学会学习”的早期机器学习研究,但它在2012年ImageNet时刻之后成为主导性的实用范式,当时AlexNet证明,在百万张带标签图像上训练的Convolutional neural network学到的视觉特征、边缘、纹理和物体部件,能够以极少的任务特定数据和重训练,出色地迁移到完全不同的图像分类问题上。这使得迁移学习成为计算机视觉领域多年来的默认策略:从业者不再从头训练,而是采用ImageNet预训练网络并对其进行调整。

在自然语言处理领域,类似的转变来得较晚,由Jeremy Howard和Sebastian Ruder的ULMFiT方法推动,随后在2018年由BERT决定性确立,它表明一个在通用语言建模目标上预训练的单一模型,可以通过微调在广泛的NLP任务上达到最先进性能。这确立了“预训练后迁移”作为标准流程,并持续支撑着现代大型语言模型

与预训练和微调的关系

迁移学习是一般性原则;预训练微调是当今深度学习通常实施该原则的具体机制。模型在大型通用数据集上预训练,通常使用自监督学习,因此无需人工标签,然后该预训练模型在目标任务的较小带标签数据集上进行微调。迁移学习的成功取决于源任务和目标任务或领域之间的相关性:从自然图像迁移到医学X光片的效果不如在两个自然图像任务之间迁移,因为数据的低级统计结构差异更大。

技术方法

对于调整预训练模型的多少,存在多种策略。特征提取完全冻结预训练网络,仅在其输出之上训练一个新的最终层,适用于目标数据集非常小的情况。全量微调更新所有参数,在目标域数据充足时通常能达到最佳性能。参数高效方法(如LoRA)介于这两个极端之间,调整少量额外参数,同时保持大部分预训练权重不变,这在基础模型增长到数千亿参数后变得尤为重要。

重要性

迁移学习是深度学习在少数资源充足的实验室之外变得实用的主要原因之一:没有预算从头训练大型模型的研究团队或公司,仍可通过调整现有预训练模型来构建功能强大的专用系统。它还支撑了向基础模型的更广泛转变,即一个大型预训练模型作为许多下游应用的共享基础,而不是每个应用都需要从零开始训练自己的模型。该技术的核心局限,有时称为负迁移,是指将模型调整到与其预训练数据差异过大的领域时,性能可能比从头训练更差,因此选择匹配良好的基础模型是一项重要的实际决策。

分类:machine-learning·deep-learning·model-training
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史