概率图模型(PGMs),也称为图模型或结构化概率模型,是一种概率模型,其中图表达了随机变量之间的条件依赖结构。它们广泛应用于概率论、统计学(尤其是贝叶斯统计)和机器学习中。通过将依赖编码为边、将独立编码为图分离,PGMs为复杂的联合分布提供了紧凑的表示,使得在许多应用中进行推断和学习变得可行。
其核心思想是使用图来表示多维空间上的分布,其中节点对应于随机变量,边表示概率依赖。这种基于图的分解捕获了分布中成立的一组条件独立性,从而能够高效计算边际概率和条件概率。图表示的两个主要分支是:贝叶斯网络(有向)和马尔可夫随机场(无向)。两者都具备分解和独立性的性质,但在可编码的独立性类型以及由此产生的分布分解方式上有所不同。
概率图模型的类型
贝叶斯网络
贝叶斯网络,也称为有向图模型或信念网络,使用有向无环图(DAG)来表示联合概率分布。在此类模型中,随机变量\(X_1, \ldots, X_n\)的联合概率分解为条件分布的乘积:
\[ P[X_1, \ldots, X_n] = \prod_{i=1}^n P[X_i \mid \text{pa}(X_i)] \]
其中\(\text{pa}(X_i)\)表示节点\(X_i\)的父节点集合(即存在边指向\(X_i\)的节点)。这种分解意味着任何节点在给定其父节点的条件下,与其非后代节点条件独立。d-分离的概念提供了一种图论判据,用于确定变量集合之间的条件独立性。在贝叶斯网络中,局部独立性(基于父子关系)等价于全局独立性(基于d-分离)。
经典的机器学习模型,如隐马尔可夫模型、神经网络和可变阶马尔可夫模型,可以被视为贝叶斯网络的特例。最简单的贝叶斯网络之一是朴素贝叶斯分类器,它假设在给定类别标签的条件下,特征之间条件独立。
无向图模型
无向图模型,也称为马尔可夫随机场(MRFs),使用无向边来表示依赖关系。在无向图中,边的存在意味着对应随机变量之间存在依赖,而边的缺失则意味着在给定所有其他变量的条件下条件独立。例如,在一个图中,节点B、C和D都仅与节点A相连,则变量B、C和D在给定A的条件下是条件独立的。联合概率分布随后可以分解为图上团(完全连通子集)上的非负函数的乘积。例如,如果图具有边AB、AC和AD,则联合分布可以写为:
\[ P[A,B,C,D] = f_{AB}[A,B] \cdot f_{AC}[A,C] \cdot f_{AD}[A,D] \]
其中\(f_{AB}, f_{AC}, f_{AD}\)为非负函数。这种分解反映了依赖的局部结构。
循环有向图模型
虽然贝叶斯网络通常要求无环图,但某些模型允许存在环。在循环有向图模型中,每个变量可能以可能导致反馈回路的方式依赖于其父节点。例如,具有环的图可能暗示联合密度分解为:
\[ P[A,B,C,D] = P[A] \cdot P[B] \cdot P[C,D \mid A,B] \]
但其他解释也是可能的。由于推断和解释的复杂性,循环模型不太常见。
其他类型
几种其他类型的概率图模型扩展了基本框架:
- 依赖网络:这些网络允许环,并表示为每个变量在给定所有其他变量条件下的条件分布。
- 树增强分类器(TAN):这些是贝叶斯网络,通过在朴素贝叶斯结构上添加特征之间的边来捕获依赖关系。
- 目标贝叶斯网络学习(TBNL):这侧重于学习针对特定目标变量优化的网络。
- 因子图:这些是无向二分图,连接变量和因子,其中每个因子表示其连接的变量上的函数。因子图对于实现信念传播非常有用。
- 团树或联结树:这些是团的树,用于联结树算法中进行精确推断。
- 链图:这些图可能同时具有有向和无向边,但没有有向环,允许混合依赖类型。
应用与意义
概率图模型是Machine learning的基础,它们为在不确定性下进行推理提供了原则性框架。它们被用于Artificial intelligence中的任务,例如Generative AI,其中像Large language model和Transformer (architecture)这样的模型,虽然通常基于Neural network,但可以通过概率视角进行解释。PGMs还应用于计算机视觉、自然语言处理、生物信息学和机器人等领域。它们将领域知识与数据驱动学习相结合的能力,使其成为推理和决策的强大工具。
相关概念
概率图模型与Deep learning和Neural network密切相关,因为许多深度架构可以被视为图模型的特例。例如,隐马尔可夫模型就是一个经典例子。像Michael I. Jordan和Daphne Koller这样的研究者显著推进了PGMs的理论和应用。现代Generative AI和Large language model的发展通常借鉴概率原理,即使它们并未明确地构建为图模型。