英語からの翻訳

最尤推定(MLE)は、観測データが与えられたときに、尤度関数を最大化することによって確率分布のパラメータを推定する統計的手法です。機械学習や計量経済学において広く用いられています。

大似然估计(MLE)是统计学中估计未知概率分布参数的一种基本方法。其核心思想是选择使观测数据在既定统计模型下出现概率最大的参数值。这通过构建一个似然函数来实现,该函数将观测给定数据的概率表示为参数的函数,然后寻找使该函数最大化的参数值。MLE 广泛应用于机器学习、计量经济学和人工智能等领域,因其具有一致性、有效性等优良性质,且在常规条件下表现稳定。

该概念最早由罗纳德·费希尔爵士在20世纪初提出,其理论基础可追溯至卡尔·弗里德里希·高斯等人的早期工作。费希尔在1912年的一篇论文中正式介绍了该方法,并在后续出版物中对其进行了扩展,奠定了其理论基础。该方法在20世纪20年代和30年代作为统计推断的基石而声名鹊起,至今仍是经典和现代数据分析中的标准工具。

数学表述

给定一组独立同分布的观测值 \(x_1, x_2, \ldots, x_n\),它们来自具有概率密度函数(或质量函数)\(f(x; \theta)\) 的概率分布,其中 \(\theta\) 是参数向量,似然函数定义为:

\[ L(\theta) = \prod_{i=1}^n f(x_i; \theta) \]

在实践中,通常使用似然函数的自然对数更为方便,称为对数似然,因为它将乘积转化为求和,并简化了微分运算:

\[ \ell(\theta) = \log L(\theta) = \sum_{i=1}^n \log f(x_i; \theta) \]

最大似然估计 \(\hat{\theta}\) 是使 \(\ell(\theta)\) 最大化的 \(\theta\) 值,通常通过将对数似然关于 \(\theta\) 的导数设为零并求解所得方程来获得。对于许多常见分布,存在闭式解,而其他情况则需要数值优化方法,如梯度法或牛顿-拉夫森算法。

性质与合理性

在满足一定正则性条件时,MLE 估计量具有若干理想的渐近性质。它们是一致的,意味着随着样本量的增加,估计值在概率上收敛于真实参数值。它们也是渐近正态的,估计量的分布趋近于以真实参数为中心的正态分布,并且是渐近有效的,达到了克拉美-罗下界所描述的最低可能方差。这些性质使得 MLE 在许多统计应用中成为首选方法。

然而,MLE 在有限样本中可能存在偏差,其性能取决于所假设模型的正确性。如果模型设定错误,估计值可能不一致。此外,对于参数众多、结构复杂的模型,似然面可能存在多个局部极大值,需要仔细的优化策略。

在机器学习中的应用

在机器学习中,MLE 是许多监督和无监督学习算法的基础。例如,逻辑回归通过最大化观测二元结果的似然来估计其系数。类似地,神经网络训练通常使用最大似然原理,其中损失函数对应于模型输出分布下数据的负对数似然。对于具有 softmax 输出的分类任务,这等价于最小化交叉熵损失。

在深度学习中,MLE 支撑着生成模型的训练,包括生成式人工智能系统。变分自编码器和归一化流显式地最大化似然或其下界。大型语言模型,例如由 OpenAI 和 Anthropic 开发的模型,通过下一词元预测任务进行训练,其目标就是最大化观测序列的概率。

扩展与变体

MLE 的多种扩展解决了其局限性。最大后验概率(MAP)估计通过最大化后验分布来纳入先验信息,后验分布与似然乘以先验成正比。惩罚似然方法,如岭回归或套索回归,在对数似然中加入正则化项以防止过拟合。期望最大化(EM)算法处理含有潜在变量的模型,通过迭代计算期望值并在两步过程中最大化似然。

贝叶斯方法虽然与 MLE 不同,但通常将似然函数作为组成部分。与提供点估计的 MLE 相比,贝叶斯推断产生参数的全后验分布。尽管存在这种差异,MLE 可以被视为具有均匀先验的贝叶斯估计的特例。

历史发展

该方法的起源可追溯至18世纪,丹尼尔·伯努利和高斯等人曾针对特定问题使用过类似思想。然而,是罗纳德·费希尔在1912年的论文《关于拟合频率曲线的绝对准则》中正式确立了其一般框架。费希尔在20世纪20年代的后续工作确立了似然原理和最大似然估计量的性质。在1922年发表的有影响力的论文《理论统计学的数学基础》之后,该方法被广泛采用。此后,MLE 成为统计学课程中的标准主题和科学研究中的实用工具。

计算考量

对于许多实际应用,似然函数过于复杂,无法进行解析最大化。此时采用数值优化技术,如基于梯度的方法。在机器学习框架中,自动微分允许高效计算对数似然关于参数的梯度,从而能够对具有数百万参数的模型进行可扩展训练。专用硬件,包括 GPU 和 AWS Trainium 芯片,加速了这些计算,使得基于 MLE 的训练对于大规模模型变得可行。

尽管历史悠久,MLE 仍然是一个充满活力的研究领域,在稳健估计、高维设置以及与信息论的联系方面持续有新的工作。其简洁性和理论保证确保了它在统计学和现代人工智能中的持续相关性。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:statistics·machine-learning·estimation-theory
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴