译自英文

正则化是一组技术,包括权重惩罚、丢弃法和提前停止,用于减少过拟合并提升机器学习模型对新数据的泛化能力。

正则化指的是在机器学习中用于减少过拟合的一系列广泛技术,通过阻止模型过于精确地拟合训练数据,使其能更好地泛化到新数据。大多数正则化方法并不改变模型试图学习的内容,而是改变其允许学习的方式,要么直接惩罚复杂性,要么在训练期间注入受控噪声,要么在模型有机会记忆训练集的特殊模式之前停止训练。

基于权重的方法

最古老且最直接的方法是在损失函数中添加一个基于模型权重大小的惩罚项,鼓励优化器偏好更小、更简单的权重值,除非数据强烈支持更大的值。L2正则化,也称为权重衰减或岭正则化,惩罚权重平方和,倾向于将所有权重平滑地缩小到零。L1正则化惩罚绝对权重值之和,倾向于将某些权重精确推至零,从而有效执行特征选择。在现代深度学习中,权重衰减通常直接应用于优化器内部,例如作为Adam的一种修改版本AdamW,而不是作为显式项添加到损失中。

结构性和随机性方法

Dropout由Geoffrey Hinton的团队在2012年左右引入,并在2014年一篇被广泛引用的论文中正式化,它在每次训练步骤中随机禁用神经网络的一部分单元,迫使网络避免过度依赖任何单个单元或固定的单元组合,并有效训练一个共享权重的隐式子网络集成。批归一化及其后续方法,虽然主要引入是为了稳定和加速训练,但也具有正则化的副作用,即在训练期间向每层输入添加噪声。数据增强创建训练示例的修改副本,例如旋转或裁剪的图像,或改写的文本,人为扩展了训练数据的有效多样性,并降低模型抓住表面化、不可泛化模式的机会。

早停和模型选择

早停在验证集上的性能停止改善时停止训练,即使训练损失继续下降,直接针对定义过拟合的训练与验证性能之间的差异。这需要在训练过程中持续监控验证损失,而不仅仅是在结束时,并且是最简单且最广泛使用的正则化技术之一,正因为它不需要改变模型或损失函数本身,只需一个停止规则。

大模型中的正则化

有些反直觉的是,最大的大型语言模型深度学习系统通常使用比小模型更轻的显式正则化,因为在庞大且多样的训练数据上以有限的训练轮次进行训练提供了一种自然的正则化形式:模型很少或从未看到相同的示例两次,几乎没有机会记忆它。Dropout尤其在大规模Transformer预训练中经常被减少或完全移除,但在较小规模的微调阶段仍然常见,因为过拟合到更窄数据集的风险更为现实。

分类:machine-learning·deep-learning·model-training
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史