論文「Auto-Encoding Variational Bayes」は、2013年にDiederik P. KingmaとMax Wellingによって発表され、生成的モデリングの基盤となる人工ニューラルネットワークアーキテクチャである変分オートエンコーダー(VAE)を導入した。この研究はDeep learningと確率的グラフィカルモデルを橋渡しし、潜在空間を通じて複雑なデータ分布を学習するためのスケーラブルな手法を提供した。これはGenerative AIへの基礎的な貢献として認識されており、その後のMachine learningとArtificial intelligenceの発展に影響を与えた。
変分オートエンコーダーは、エンコーダーとデコーダーという2つのニューラルネットワークで構成される。エンコーダーは、各入力データポイント(例えば画像)を、単一の点ではなく低次元の潜在空間における確率分布にマッピングする。この分布は通常、平均ベクトルと分散ベクトルによってパラメータ化された多変量ガウス分布である。デコーダーは、潜在空間から入力空間への逆マッピングを実行し、これも分布に従うが、実際にはデコード中にノイズが追加されることはほとんどない。入力を分布として表現することで、モデルはトレーニングデータへの過適合を回避する。両方のネットワークは、再パラメータ化トリックを用いて共同でトレーニングされ、確率的サンプリングを通じた勾配ベースの最適化を可能にする。
背景と動機
VAE以前、生成的モデルはしばしば期待値最大化アルゴリズムに依存しており、確率的PCAやスパースコーディングのような手法に見られた。これらのアプローチはデータ尤度の下界を最適化したが、必要な変分事後分布は通常、各データポイントごとに個別に計算され、高い計算コストが生じた。KingmaとWellingは、単一のニューラルネットワークがすべてのデータポイントにわたって変分パラメータを出力する、償却推論アプローチを提案した。このパラメータの再利用により、メモリの大幅な節約が実現し、大規模データセットでのトレーニングが可能になった。エンコーネットワークは変分分布のパラメータを出力し、デコーダーは潜在変数を入力空間にマッピングし、多くの場合ノイズ分布の平均として機能する。
モデルは、再構成誤差と変分事後分布と事前分布の間のカルバック・ライブラー情報量(KL-D)という2つの項を含む自由エネルギー式を最適化することでトレーニングされる。再構成項は、デコーダーが潜在サンプルから入力をどれだけうまく再現するかを測定し、KL-D項は潜在分布を事前分布(通常は標準ガウス分布)に一致させることを促す。これらの項の正確な形式は、想定されるノイズ分布に依存し、例えばImageNetのような連続データにはガウス分布、二値化されたMNISTのような二値データにはベルヌーイ分布が用いられる。
定式化とトレーニング
目的は、パラメータ化された分布 \(p_\theta(x)\) の下で観測データ \(x\) の尤度を最大化することであり、これはしばしばガウス分布として選択される。この尤度を直接最大化するには、潜在変数 \(z\) について周辺化する必要があり、これは扱いにくい積分を生じさせる。VAEは代わりに、計算可能な変分下界、すなわち証拠下界(ELBO)を最適化する。ELBOは、エンコーネットワークによってパラメータ化された近似事後分布 \(q_\phi(z|x)\) を導入することで導出され、再構成項と負のKL-Dの和として書くことができる。
トレーニングは、再パラメータ化トリックを用いて潜在分布から微分可能な方法でサンプリングすることにより、確率的勾配降下法で進行する。このトリックは、サンプル \(z\) を \(\mu + \sigma \odot \epsilon\) として表現し、ここで \(\epsilon\) は標準正規分布から抽出され、サンプリング操作を通じて勾配が流れることを可能にする。ノイズモデルの分散は、実装に応じて個別に学習するか固定することができる。このアプローチは、教師なし学習だけでなく、半教師あり学習や教師ありタスクにも効果的であることが証明され、その適用範囲を広げた。
影響と遺産
VAE論文は、オートエンコーダーや制限付きボルツマンマシンといった初期のアプローチとは異なる、深層生成的モデルの新しいパラダイムを確立した。これは、確率的保証を伴う潜在表現を学習するための原理的な方法を提供し、コンピュータビジョン、自然言語処理、創薬などの分野に影響を与えた。このアーキテクチャは、条件付きVAEや階層的変種を含む、より高度なモデルの構成要素となった。そのアイデアは、後に登場した生成的敵対ネットワークや拡散モデルなど、他の生成的フレームワークの発展にも影響を与えた。
Deep learningのより広い文脈において、VAEはニューラルネットワークとベイズ推論を組み合わせる力強さを示し、このテーマはAI研究コミュニティ全体で共鳴を呼んだ。論文の著者であるKingmaとWellingは、当時University of Torontoや他の機関に所属しており、その研究はその後の文献で広く引用されている。VAEは今日でもMachine learningツールキットの標準的なツールであり、大学院のコースで教えられ、異常検知からデータ圧縮まで、産業アプリケーションで使用されている。
変種と拡張
その後の研究により、元のモデルの限界に対処するための多数のVAE変種が導入された。一般的な問題の1つは、KL-D項がモード探索行動を促進する傾向があり、生成サンプルの多様性が低下する可能性があることである。これを緩和するために、研究者はKL-Dをワッサースタイン距離や最大平均不一致などの代替統計距離に置き換え、ワッサースタインオートエンコーダーのようなモデルを生み出した。他の拡張には、KL-D項の重みを調整して非絡み合い表現を促進するベータVAEや、高忠実度生成のために離散潜在空間を使用するベクトル量子化VAEが含まれる。
これらの変種は、Neural network研究、Large language model開発、マルチモーダル学習など、多様な分野で応用されている。VAEの滑らかな潜在空間を学習する能力は、画像内の顔のポーズや表情を変えるなど、データ属性の補間や操作にも有用である。2020年代初頭の時点で、VAEベースの手法は依然として活発な研究分野であり、トレーニングの安定性とスケーラビリティの向上に関する継続的な研究が行われている。
結論
KingmaとWellingによる2013年のVAE論文は、機械学習への画期的な貢献であり、ニューラルネットワークと変分推論を巧みに組み合わせたアーキテクチャを導入した。その再パラメータ化トリックと償却推論フレームワークは、深層生成的モデルのスケーラブルなトレーニングを可能にし、その後の多くの進歩への道を開いた。VAEの影響は学術研究と実用的応用の両方で持続しており、この分野の基本的な技術としての地位を確固たるものにしている。