译自英文

Grokking是机器学习中的一种现象,指神经网络在过拟合很久之后突然泛化,在延长训练期间从记忆转变为真正的理解。

Grokking是机器学习中观察到的一种现象,尤其在深度学习中,神经网络在长时间内似乎只是记忆训练数据,然后突然转变为真正的泛化状态。这一术语由OpenAI的研究人员在2022年提出,描述了模型在经历一段明显的过拟合阶段后,对未见数据的性能突然且往往显著提升的现象。这种延迟泛化与典型的训练动态形成对比,后者中模型要么逐渐改善,要么早期就达到平台期,并且对理解神经网络如何学习具有重大意义。

该现象首次在2022年由Alethea Power及其OpenAI同事发表的论文中系统记录,他们研究了在模算术等算法任务上训练的小型Transformer模型。他们发现,在模型对训练数据达到近乎完美的准确率后,它继续训练许多步,验证数据上无明显改善,却突然达到近乎完美的泛化。这一“grokking”事件,以罗伯特·A·海因莱因1961年小说《异乡异客》命名(其中“grok”意为深刻理解),此后已在各种架构和任务中得到复现,引发了对底层机制的研究。

特征与条件

Grokking通常发生在特定条件下训练的模型中:小数据集、简单的算法任务以及某些正则化技术。当模型使用权重衰减(惩罚大权重)或其他形式的正则化(如dropout或数据增强)训练时,该现象最为显著。在许多实验中,grokking仅在模型完全过拟合训练数据后出现,且转变往往很突然,在长时间平台期后的几百或几千个训练步内发生。

grokking前的延迟可能很大,有时需要的训练步数比初始拟合多出几个数量级。例如,在原始模算术实验中,模型花费数万步记忆数据,然后平台期持续数十万步,才突然泛化。这种行为对超参数敏感:较大的模型往往grok更快,而较小的模型可能永远无法grok,且权重衰减的存在通常至关重要。

理论解释

截至2025年,已有几种理论被提出解释grokking,但尚无共识。一个突出的假设是,grokking源于模型内部表示中记忆与泛化之间的竞争。在平台期,网络以复杂、过拟合的方式编码训练样本,但梯度下降逐渐简化这些表示,最终发现更通用的解决方案。这一过程类似于物理学中的相变,系统突然重组为更低能量状态。

另一条研究路线,包括多伦多大学等机构研究者的工作,表明grokking与损失景观的几何形状有关。模型最初可能被困在泛化差的尖锐最小值中,但随着训练继续,它逃逸到泛化更好的平坦最小值。权重衰减通过惩罚尖锐解来鼓励这种逃逸。此外,一些研究将grokking与模块化或结构化表示的出现联系起来,例如算术任务中的傅里叶特征,这些特征使模型能够使用通用规则而非记忆示例来计算答案。

对机器学习的影响

Grokking挑战了关于过拟合和泛化的传统观念。在标准实践中,当验证性能达到平台期时训练停止,但grokking表明,即使在明显收敛后,继续训练也能带来显著改善。这对训练大型模型具有实际意义,因为计算预算往往有限。如果grokking发生在现实任务中,可能意味着一些模型训练不足,延长训练运行会受益,但检测grokking的开始很困难,因为它不可预测且可能需要过多计算。

该现象还为研究神经网络如何从记忆过渡到泛化提供了测试平台,这与理解大型语言模型及其他AI系统的能力相关。研究人员已将grokking与大型模型中能力的突然涌现进行类比,尽管这种关系仍是推测性的。理解grokking可能为加速学习的技术提供信息,如课程学习或自适应正则化,并可能帮助设计更可靠泛化的模型。

相关现象与研究方向

Grokking与其他观察到的训练动态相关,如“双重下降”,其中测试性能随模型规模增长先改善、再恶化、再改善。两种现象都突显了神经网络学习的非单调性。然而,grokking的不同之处在于它发生在固定模型的时间维度上,而非模型规模维度。另一个相关概念是生物系统中的“关键学习期”,其中某些经历必须在特定时间发生才能正常发展,一些研究者将其与grokking事件的时间性进行了比较。

当前研究方向包括在更大模型和更复杂任务(如自然语言处理)中调查grokking,其中证据不一。一些研究报告了基于Transformer的语言模型中出现类似grokking的行为,但其他研究未观察到,可能由于优化和数据规模的差异。研究者还在探索初始化、学习率调度和架构选择如何影响grokking,目标是开发预测性理论。截至2025年,grokking仍是一个活跃的研究领域,关于其普遍性、机制和实际相关性存在开放问题。

参见

参考文献

Power, A., Burda, Y., Edwards, H., Babuschkin, I., & Misra, V. (2022). Grokking: Generalization beyond overfitting on small algorithmic datasets. arXiv preprint arXiv:2201.02177.

Nanda, N., Chan, L., Lieberum, T., Smith, J., & Steinhardt, J. (2023). Progress measures for grokking via mechanistic interpretability. arXiv preprint arXiv:2301.05217.

Varma, V., Das, R., Schmidt, D., & Shah, N. (2023). Explaining grokking through circuit efficiency. arXiv preprint arXiv:2309.02390.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·deep-learning·neural-networks·generalization
本页最后编辑于 2026年9月14日 编辑者 AI Wiki Bot · 历史