译自英文

过拟合发生在机器学习模型过于紧密地学习训练数据(包括其噪声)时,导致尽管训练误差很低,但在新的、未见过的数据上表现不佳。

过拟合是机器学习中的一种失败模式,即模型过于紧密地学习训练数据,包括其中的噪声和特有细节,而牺牲了学习能够泛化到新的、未见数据的模式。过拟合的模型通常在其训练数据上表现出极低的误差,但在保留数据上误差显著更高,这与构建一个在未见示例上表现良好的模型的预期目标相反。

成因

当模型具有足够的容量(即足够的参数或有效灵活性)来记忆有限训练集中的特有细节,而非被迫寻找其背后更简单、更通用的模式时,过拟合往往会发生。随着模型容量与训练数据规模之比的增加,过拟合的可能性也随之上升,这就是为什么过拟合在历史上对小型数据集和相对简单的模型更为突出,而对今天训练集规模巨大的大型语言模型来说,情况可能并非如此。过拟合也可能更局部地发生,例如当模型在预训练后针对小型、狭窄的数据集进行微调时,它可能会失去部分更广泛的能力,同时过度适应微调集,这一相关现象有时被称为灾难性遗忘。对同一数据训练过多轮次(即过多epoch)是经典的直接原因,因为具有足够容量的模型在训练时间越长时,会逐渐从学习通用模式转向记忆具体示例。

检测

检测过拟合的标准方法是监控验证集(从训练中保留的一部分数据)上的损失函数,同时关注训练损失。只要两种损失一起下降,模型就在泛化;一旦训练损失持续下降而验证损失停滞或上升,模型就开始过拟合。这一验证曲线是早停法的基础,该技术在验证性能最佳点附近停止训练,也是使用模型从未训练过的验证集来选择竞争性架构或超参数设置的依据。

缓解

用于预防或减少过拟合的通用技术系列被称为正则化,其中包括权重惩罚、丢弃法、数据增强,以及简单地收集更多或更多样化的训练数据,以使可记忆的特有细节相对于真实模式的重要性降低。交叉验证通过反复将数据划分为不同的训练和验证分区,比单一的训练-验证划分能更稳健地估计模型的泛化能力,并且对于单一保留集本身可能带有噪声的小型数据集,这是标准做法。

基准层面的过拟合

同一问题的相关更高层次版本影响着整个领域衡量进展的方式:当研究人员多年来反复针对同一公共基准调整模型时,结果可能在该特定基准上有所改善,但并未带来相应的现实世界增益,而且流行的评估集有泄露到从网络抓取的训练数据中的风险,这一问题被称为基准或数据污染。这使得保留的、抗污染的评估,以及像ARC-AGI这样明确设计为抵抗记忆的基准,对于诚实衡量大型语言模型是否在真正推理方面有所改进,而非过拟合于熟悉的测试分布,变得越来越重要。

分类:machine-learning·model-evaluation·generalization
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史