最大似然估计

译自英文

极大似然估计(MLE)是一种统计方法,通过最大化似然函数来估计概率分布的参数,给定观测数据。它在机器学习和计量经济学中被广泛使用。

极大似然估计(MLE)是统计学中估计概率分布未知参数的基本方法。其核心思想是在假设的统计模型下,选择使观测数据出现概率最大的参数值。这通过构建似然函数来实现,该函数表示在给定参数下观测到数据的概率,然后找到使该函数最大化的参数值。由于MLE具有一致性、正则条件下的有效性等优良性质,它被广泛应用于机器学习、计量经济学和人工智能等领域。

这一概念最早由罗纳德·费希尔爵士在20世纪初提出,建立在卡尔·弗里德里希·高斯等人的早期工作之上。费希尔在1912年的一篇论文中正式引入了该方法,并在后续出版物中加以扩展,奠定了其理论基础。该方法在20世纪20年代和30年代作为统计推断的基石而获得 prominence,至今仍是经典和现代数据分析中的标准工具。

数学表述

给定一组独立同分布的观测值 \(x_1, x_2, \ldots, x_n\),它们来自具有概率密度函数(或质量函数)\(f(x; \theta)\) 的概率分布,其中 \(\theta\) 是未知参数向量,似然函数定义为:

\[ L(\theta) = \prod_{i=1}^n f(x_i; \theta) \]

在实践中,通常更方便使用似然函数的自然对数,称为对数似然,因为它将乘积转化为求和并简化了微分:

\[ \ell(\theta) = \log L(\theta) = \sum_{i=1}^n \log f(x_i; \theta) \]

极大似然估计 \(\hat{\theta}\) 是使 \(\ell(\theta)\) 最大化的 \(\theta\) 值,通常通过将对数似然对 \(\theta\) 求导并令其为零,然后求解所得方程来获得。对于许多常见分布,存在闭式解,而其他情况则需要数值优化方法,如梯度上升或牛顿-拉弗森算法。

性质与论证

当满足某些正则条件时,MLE估计量具有若干理想的渐近性质。它们是一致的,意味着随着样本量的增加,估计值在概率上收敛于真实参数值。它们也是渐近正态的,估计量的分布趋近于以真实参数为中心的分布,并且是渐近有效的,达到克拉美-罗下界所描述的最低可能方差。这些性质使MLE在许多统计应用中成为首选。

然而,MLE在有限样本中可能存在偏差,其性能取决于假设模型的正确性。如果模型设定错误,估计可能不一致。此外,对于参数众多的复杂模型,似然面可能存在多个局部极大值,需要谨慎的优化策略。

在机器学习中的应用

机器学习中,MLE是许多监督和无监督学习算法的基础。例如,逻辑回归通过最大化观测到的二元结果的似然来估计其系数。类似地,神经网络训练通常使用极大似然原理,其中损失函数对应于模型输出分布下数据的负对数似然。对于具有softmax输出的分类任务,这等价于最小化交叉熵损失。

深度学习中,MLE支撑了生成模型的训练,包括生成式人工智能系统。变分自编码器和归一化流显式地最大化似然或其下界。大型语言模型,如OpenAIAnthropic开发的模型,通过极大似然估计在下一个词元预测任务上进行训练,其目标是最大化观测到的词元序列的概率。

扩展与变体

MLE的几种扩展解决了其局限性。最大后验(MAP)估计通过最大化后验分布来整合先验信息,后验分布与似然乘以先验成正比。惩罚似然方法,如岭回归或套索回归,在对数似然中添加正则化项以防止过拟合。期望最大化(EM)算法处理具有潜变量的模型,通过两步过程迭代计算期望值并最大化似然。

贝叶斯方法虽然与MLE不同,但通常将似然函数作为组成部分。与提供点估计的MLE相比,贝叶斯推断产生参数上的完整后验分布。尽管存在这种差异,MLE可以被视为具有均匀先验的贝叶斯估计的特例。

历史发展

该方法的起源可追溯到18世纪,丹尼尔·伯努利和后来的高斯在特定问题中使用了类似的思想。然而,是罗纳德·费希尔在1912年的论文《论拟合频率曲线的绝对准则》中形式化了这一通用框架。费希尔在20世纪20年代的后续工作确立了似然原理和极大似然估计的性质。在他1922年具有影响力的论文《论理论统计的数学基础》发表后,该方法被广泛采用。此后,MLE成为统计学课程中的标准主题和科学研究中的实用工具。

计算考量

对于许多实际应用,似然函数过于复杂,无法进行解析最大化。通常采用数值优化技术,如基于梯度的方法。在机器学习框架中,自动微分允许高效计算对数似然对参数的梯度,从而能够对具有数百万参数的模型进行可扩展训练。专用硬件,包括GPUAWS Trainium芯片,加速了这些计算,使基于MLE的训练对大规模模型成为可行。

尽管历史悠久,MLE仍然是一个活跃的研究领域,在稳健估计、高维设置以及与信息论的联系方面持续有工作。其简单性和理论保证确保了它在统计学和现代人工智能中的持续相关性。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:statistics·machine-learning·estimation-theory
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史