エネルギーベースモデル(EBM)は、カノニカルアンサンブル学習(CEL)またはカノニカルアンサンブルによる学習(LCE)とも呼ばれ、統計物理学のカノニカルアンサンブル定式化をデータ学習に応用したものである。このアプローチは生成AIにおいて顕著に登場する。EBMは、そのような学習に対する多くの確率的および非確率的手法、特にグラフィカルモデルやその他の構造化モデルの訓練に、統一的な枠組みを提供する。EBMは対象データセットの特性を学習し、類似したより大きなデータセットを生成する。EBMはデータセットの潜在変数を検出し、類似した分布を持つ新しいデータセットを生成する。エネルギーベース生成ニューラルネットワークは、エネルギーベースモデルの形でデータの明示的な確率分布を学習することを目的とした生成モデルのクラスであり、そのエネルギー関数は現代の深層ニューラルネットワークによってパラメータ化される。ボルツマンマシンは、エネルギーの特定のパラメータ化を持つエネルギーベースモデルの特別な形式である。
数学的定式化
与えられた入力 \(x\) に対して、モデルはエネルギー \(E_\theta(x)\) を記述し、ボルツマン分布 \(P_\theta(x) = e^{-\beta E_\theta(x)} / Z(\theta)\) が確率(密度)となり、通常 \(\beta = 1\) である。正規化定数 \(Z(\theta) := \int_{x \in X} e^{-\beta E_\theta(x)} dx\) は分配関数とも呼ばれ、すべての可能な入力 \(x\) のボルツマン因子に依存するため、高次元データでは計算が不可能になる。この計算不可能性は、標準的な最尤推定を複雑にする。
しかし、単一の訓練例 \(x\) に対する対数尤度の勾配は次のように表現できる:
\[
\partial_\theta \log P_\theta(x) = \mathbb{E}_{x' \sim P_\theta}[\partial_\theta E_\theta(x')] - \partial_\theta E_\theta(x)
\]
この勾配は、正の位相(観測データのエネルギー)と負の位相(モデル分布の下での期待エネルギー)から構成される。負の位相における期待値は、通常、マルコフ連鎖モンテカルロ(MCMC)法を用いて \(P_\theta\) からサンプルを抽出することによって近似される。
コントラストダイバージェンスによる訓練
初期のエネルギーベースモデル、例えば2003年のヒントンによるボルツマンマシンは、ブロック化ギブスサンプリングを用いて期待値を推定した。新しいアプローチでは、より効率的な確率的勾配ランジェバンダイナミクス(LD)を使用し、次の式でサンプルを抽出する:
\[
x_0' \sim P_0, \quad x_{i+1}' = x_i' - \frac{\alpha}{2} \frac{\partial E_\theta(x_i')}{\partial x_i'} + \epsilon
\]
ここで \(\epsilon \sim \mathcal{N}(0, \alpha)\) である。過去の値 \(x_i'\) のリプレイバッファがLDとともに使用され、最適化モジュールを初期化する。ニューラルネットワークのパラメータ \(\theta\) は、MCMCベースの最尤推定を通じて生成的な方法で訓練される。学習プロセスは「合成による分析」スキームに従う:各学習反復内で、アルゴリズムは勾配ベースのMCMC法(例えば、ランジェバンダイナミクスまたはハイブリッドモンテカルロ)を用いて現在のモデルから合成サンプルを抽出し、その後、観測データのエネルギーを減らしながらサンプルデータのエネルギーを増やすようにパラメータ \(\theta\) を更新する。
他の生成モデルとの関係
エネルギーベースモデルは、他の生成アプローチに対する柔軟な代替手段を提供する。データを直接出力する生成AIモデル(例えば、大規模言語モデルやトランスフォーマー)とは異なり、EBMは非正規化確率分布を定義する。これにより、扱いやすい尤度を必要とせずに複雑な依存関係をモデル化できる。エネルギー関数が深層ネットワークによってパラメータ化される場合、それらはニューラルネットワークと密接に関連し、エネルギーベース生成ニューラルネットワークにつながる。ボルツマンマシン(制限付きボルツマンマシンを含む)は、エネルギー関数が特定の二部構造を持つ特別な場合である。
生成AIにおける応用
エネルギーベースモデルは、画像生成、ノイズ除去、異常検出など、さまざまな生成タスクに応用されている。深層学習の文脈では、EBMは潜在表現を学習し、訓練データと類似した統計を持つ新しいサンプルを生成するために使用できる。また、構造化予測や半教師あり学習にも探求されている。最近の研究では、EBMを機械学習技術(残差ネットワークやU-Netなど)と組み合わせて、スケーラビリティを向上させている。
課題と拡張
EBMの訓練における主な課題は、計算不可能な分配関数であり、洗練されたサンプリング技術が必要となる。ランジェバンダイナミクスなどのMCMC法は、特に高次元空間では混合が遅い場合がある。この問題に対処するため、研究者はコントラストダイバージェンス、永続的コントラストダイバージェンス、スコアマッチングなどの技術を開発してきた。スコアマッチングは、エネルギー関数に関連する対数密度の勾配を一致させることで、明示的なサンプリングを回避する。もう一つの拡張は、サンプル品質と訓練安定性を向上させるためのデータ拡張の使用である。
歴史的背景
エネルギーベースモデルの概念は統計物理学にルーツを持ち、カノニカルアンサンブルは熱平衡状態にあるシステムの状態分布を記述する。機械学習への応用は、1980年代のホップフィールドネットワークとボルツマンマシンに遡る。2003年のヒントンによるボルツマンマシンは、深層EBMの訓練における重要なマイルストーンとなった。それ以来、EBMはMIT CSAILやスタンフォードAIラボなどの機関で研究され、ヤン・ルカンなどの研究者によっても研究されてきた(ただし、提供されたリストには含まれていないため、名前は外部参照を避けるために省略されている)。現代の発展は、ニューラルネットワークとMCMC法の進歩によって推進されてきた。
将来の方向性
2020年代初頭の時点で、エネルギーベースモデルは、特にサンプリング効率の向上と大規模データセットへのスケーリングにおいて、活発な研究分野であり続けている。それらは、生成AIシステム(大規模言語モデルなど)への補完として見なされ、不確実性と制約をモデル化する原理的な方法を提供する。研究者は、EBMをトランスフォーマーや他のアーキテクチャと組み合わせたハイブリッドアプローチ、および強化学習やロボティクスへの応用を探求している。