经验风险最小化(ERM)是机器学习中的一项核心原则,它通过最小化在有限训练样本集上计算的平均损失来指导预测模型的选择。它形式化了将模型拟合到观测数据的直观想法,并支撑了深度学习及其他统计学习方法中使用的许多算法。这一概念在20世纪60年代由统计学家和计算机科学家提出,特别是在Vapnik和Chervonenkis的工作中,他们还发展了理解ERM何时有效的理论框架。
在ERM中,目标是从预定义的假设空间中找到使经验风险最小化的函数,经验风险定义为训练数据上损失函数的平均值。这与最小化期望风险的理想目标形成对比,后者需要知道真实的数据分布。由于该分布未知,ERM使用训练样本作为替代。经验风险与期望风险之间的差异是统计学习理论的核心关注点,由此得出的界限依赖于假设空间的复杂性和训练样本的数量。
形式定义
给定一个由\(n\)个独立同分布样本\((x_i, y_i)\)组成的训练集,一个损失函数\(L(\hat{y}, y)\),用于衡量当真实值为\(y\)时预测\(\hat{y}\)的成本,以及一个候选函数的假设空间\(\mathcal{H}\),经验风险为:
\[ R_{\text{emp}}(h) = \frac{1}{n} \sum_{i=1}^n L(h(x_i), y_i) \]
经验风险最小化器是使\(R_{\text{emp}}(h)\)在所有\(h \in \mathcal{H}\)上最小化的假设\(\hat{h}\)。这是一个有限维优化问题,在现代实践中通常使用迭代方法求解,例如Adam优化器或其他SGD变体。
历史背景
ERM的形式化归功于Vladimir Vapnik和Alexey Chervonenkis在20世纪60年代的工作,他们引入了VC维的概念来刻画假设空间的容量。他们的工作为统计学习理论奠定了基础,该理论提供了ERM一致性的条件,即随着样本量的增长,经验风险最小化器趋近于假设空间中的最佳模型。这一理论基础后来通过教科书和课程在机器学习社区中得到普及,并至今仍是该领域的基石。
与其他学习原则的关系
ERM与其他学习范式密切相关。例如,最大似然估计可以视为ERM的一个特例,当损失函数为负对数似然时。正则化技术,如权重衰减,通过添加惩罚项来修改ERM目标,以控制模型复杂性,从而在拟合训练数据和泛化之间取得权衡。相比之下,贝叶斯推断将模型参数视为随机变量,并根据数据更新信念,这可以看作比通过ERM进行点估计更全面的方法。
在现代深度学习中,ERM是大多数神经网络模型的默认训练目标,包括用于大型语言模型的Transformer架构。然而,模型和数据的庞大规模带来了实际挑战,如过拟合和需要仔细的正则化。像Dropout、批归一化和数据增强等技术通常用于改善泛化,超越纯ERM所能达到的效果。
实际考虑
在实践中,ERM通过基于梯度的优化来实现。损失函数的选择取决于任务:损失函数如均方误差用于回归,交叉熵用于分类是常见的。优化过程涉及迭代更新模型参数以降低经验风险,通常使用随机梯度下降的变体。关键超参数包括学习率,可通过学习率调度进行调整,以及批量大小。梯度裁剪有时用于防止梯度爆炸,尤其是在循环网络中。
ERM的一个主要问题是过拟合,即模型在训练数据上表现良好,但在未见数据上表现不佳。当假设空间相对于样本量较大时,这一问题尤为突出。为了缓解这一问题,从业者使用正则化、早停和交叉验证。另一个关注点是ERM假设训练数据代表真实分布;如果这一假设被违反,所得模型可能会有偏差。
理论见解
统计学习理论提供了ERM泛化误差的界限。对于有限假设空间,经验风险与期望风险之间的差异可以用Hoeffding不等式来界定。对于无限假设空间,VC维起着关键作用。这些界限通常随假设空间的复杂性增加而增长,并随训练样本数量的增加而减小。然而,在现代深度学习中,参数数量往往超过训练点数,但模型仍然能很好地泛化,这一现象促使了新的理论研究。
最近的工作探讨了为什么使用ERM训练的过度参数化模型能够泛化,从而引出了隐式正则化和彩票假说等概念。这些见解尚未形成完整的理论,但它们突出了经典学习理论与当代实践之间的差距。