隐马尔可夫模型(HMM)是一种统计模型,用于描述依赖于潜在不可观测过程的观测序列。在概率论中,HMM是一种马尔可夫模型,其中观测依赖于潜在(或隐藏)的马尔可夫过程,通常记为X。该模型需要一个可观测过程Y,其结果以已知方式依赖于X的结果。由于X无法直接观测,目标是通过观测Y来了解X的状态。根据马尔可夫模型的定义,HMM还有一个额外要求,即时间t0处Y的结果必须仅受时间t0处X的结果影响,并且给定时间t0处的X,时间t0之前X和Y的结果必须与时间t0处的Y条件独立。HMM中的参数估计可以使用最大似然估计进行;对于线性链HMM,通常使用Baum-Welch算法。
隐马尔可夫模型以其在多个领域的应用而闻名,包括热力学、统计力学、物理学、化学、经济学、金融学、信号处理、信息论和模式识别。具体用途包括语音识别、手写识别、手势识别、词性标注、乐谱跟随、局部放电和生物信息学。
正式定义
设X_n和Y_n为离散时间随机过程,其中n ≥ 1。如果X_n是一个行为无法直接观测的马尔可夫过程(因此称为“隐藏”),并且给定X的整个历史时Y_n的条件概率满足P(Y_n ∈ A | X_1 = x_1, ..., X_n = x_n) = P(Y_n ∈ A | X_n = x_n),对于每个n ≥ 1、每个序列x_1, ..., x_n以及每个Borel集A,则称对(X_n, Y_n)为隐马尔可夫模型。该条件确保时间n处的观测仅依赖于时间n处的隐藏状态,而不依赖于更早的隐藏状态。
对于连续时间过程,如果X_t是一个无法直接观测的马尔可夫过程,并且给定t0之前X的整个路径时Y在t0处的概率等于仅给定X在t0处的概率:P(Y_t0 ∈ A | {X_t ∈ B_t for t ≤ t0}) = P(Y_t0 ∈ A | X_t0),则称对(X_t, Y_t)为隐马尔可夫模型。这将离散时间定义推广到连续时间。
核心组成部分
HMM通常由三组参数表征。第一,初始状态分布,指定隐藏过程从每个可能状态开始的概率。第二,转移概率,描述隐藏状态如何根据马尔可夫性质随时间演化。第三,发射概率,给出在给定当前隐藏状态下观测到每个可能输出的可能性。这些组成部分共同定义了隐藏序列和可观测序列的联合分布。
隐藏状态本身形成一个马尔可夫链,意味着转移到新状态的概率仅依赖于当前状态,而不依赖于更早的状态。可观测过程在给定隐藏状态的条件下是条件独立的,这简化了推断和学习。
推断与学习
HMM中的一个核心问题是推断:给定观测序列,确定最可能的隐藏状态序列。Viterbi算法是一种用于此目的的动态规划方法,用于找到单一最佳状态序列。另一个推断任务是计算给定模型下观测序列的概率,这可以使用前向算法完成。前向-后向算法计算每个时间点处于每个状态的后验概率,适用于平滑等任务。
参数估计通常通过最大似然估计进行。对于线性链HMM,Baum-Welch算法(期望最大化(EM)算法的一个特例)迭代更新模型参数以最大化观测数据的似然。该算法在计算给定当前参数的期望充分统计量和重新估计参数以最大化这些期望之间交替进行。
历史发展
HMM的根源可追溯到Leonard Baum及其同事在1960年代末和1970年代初的工作,他们开发了前向-后向算法和Baum-Welch算法。理论基础随后由Lloyd Welch等研究者进一步完善。在1980年代,HMM在语音识别中获得了 prominence,特别是在Xerox PARC等机构的工作中。这些模型在Deep learning和Neural network方法兴起之前,成为Machine learning中处理序列数据的标准工具。
在1990年代和2000年代,HMM被广泛应用于生物信息学中的基因发现、蛋白质结构预测和序列比对。它们还在自然语言处理中变得重要,用于词性标注和命名实体识别。这些模型后来以各种方式扩展,如分层HMM和耦合HMM,以处理更复杂的依赖关系。
应用
HMM已被应用于广泛的问题。在语音识别中,它们将声学特征序列建模为由隐藏语音状态生成。在手写和手势识别中,它们捕捉笔画或运动的时态动态。在生物信息学中,它们用于基因预测和蛋白质家族建模。在金融学中,它们可以建模经济时间序列中的状态,如牛市和熊市。在信号处理中,它们用于语音增强和活动识别。
尽管基于Transformer (architecture)的模型在现代Artificial intelligence中占主导地位,HMM在可解释性和小数据重要的任务中仍然相关。它们也用作更复杂系统的组成部分,如将HMM与Neural network分类器结合的混合模型。HMM的简单性和数学可处理性使其成为概率建模中的基础工具。
局限性与扩展
HMM假设隐藏过程是马尔可夫的,并且观测在给定隐藏状态的条件下是条件独立的。这些假设对于复杂的现实世界数据可能具有限制性。扩展包括高阶HMM(其中隐藏状态依赖于多个先前状态)和输入-输出HMM(其纳入外生变量)。隐藏半马尔可夫模型允许每个状态具有可变持续时间,解决了标准HMM的一个常见局限性。
在现代Machine learning的背景下,HMM常与递归神经网络和Transformer (architecture)模型进行比较,后者可以捕捉更长范围的依赖关系。然而,HMM在可解释性和处理小数据集能力方面具有优势。它们仍然是一个活跃的研究领域,特别是在计算生物学和语音处理等领域。