VAE論文(2013年)

英語からの翻訳

変分オートエンコーダー(VAE)は、2013年にDiederik P. KingmaとMax Wellingによって導入された人工ニューラルネットワークアーキテクチャであり、確率的潜在空間と変分ベイズ法を用いた生成的モデリングに使用される。

変分オートエンコーダー(VAE)は、2013年にDiederik P. KingmaとMax Wellingによって導入された人工ニューラルネットワークアーキテクチャである。これは、確率的グラフィカルモデルと変分ベイズ法のファミリーの一部である。オートエンコーダーニューラルネットワークアーキテクチャとして見なされることに加えて、変分オートエンコーダーは変分ベイズ法の数学的定式化の中で研究することもでき、ニューラルエンコーダーネットワークをそのデコーダーに、変分分布のパラメータに対応する確率的潜在空間(例えば、多変量ガウス分布として)を介して接続する。

エンコーダーは、大規模で複雑なデータセットからの各点(画像など)を、潜在空間内の単一の点ではなく、その空間内の分布にマッピングする。デコーダーは逆の機能を持ち、潜在空間から入力空間へ、再び分布に従ってマッピングする(ただし、実際にはデコード段階でノイズが追加されることはほとんどない)。点を単一の点ではなく分布にマッピングすることで、ネットワークはトレーニングデータへの過適合を回避できる。両方のネットワークは通常、再パラメータ化トリックを使用して一緒にトレーニングされるが、ノイズモデルの分散は別々に学習できる。このタイプのモデルは当初教師なし学習用に設計されたが、その有効性は半教師あり学習と教師あり学習で証明されている。

アーキテクチャと動作の概要

変分オートエンコーダーは、それぞれ事前分布とノイズ分布を持つ生成モデルである。通常、このようなモデルは期待値最大化メタアルゴリズム(例えば、確率的主成分分析、スパースコーディング)を使用してトレーニングされる。このようなスキームは、通常計算が困難なデータ尤度の下界を最適化し、その過程でq分布、つまり変分事後分布の発見を必要とする。これらのq分布は通常、個々のデータポイントごとに別々の最適化プロセスでパラメータ化される。しかし、変分オートエンコーダーはニューラルネットワークを償却アプローチとして使用し、データポイント全体にわたって共同で最適化する。このようにして、同じパラメータが複数のデータポイントで再利用され、大幅なメモリ節約につながる可能性がある。最初のニューラルネットワークはデータポイント自体を入力として受け取り、変分分布のパラメータを出力する。既知の入力空間から低次元の潜在空間へのマッピングであるため、エンコーダーと呼ばれる。

デコーダーはこのモデルの2番目のニューラルネットワークである。これは潜在空間から入力空間への関数であり、例えばノイズ分布の平均として機能する。分散にマッピングする別のニューラルネットワークを使用することも可能だが、簡略化のために省略できる。その場合、分散は勾配降下法で最適化できる。

このモデルを最適化するには、「再構成誤差」とカルバック・ライブラー発散(KL-D)という2つの項を知る必要がある。両方の項は確率モデルの自由エネルギー式から導出されるため、ノイズ分布とデータの想定される事前分布(ここではp分布と呼ぶ)に応じて異なる。例えば、IMAGENETのような標準的なVAEタスクは通常、ガウス分布のノイズを持つと想定されるが、二値化されたMNISTのようなタスクはベルヌーイノイズを必要とする。自由エネルギー式からのKL-Dは、p分布と重なるq分布の確率質量を最大化するが、残念ながらモード探索的な挙動につながる可能性がある。「再構成」項は自由エネルギー式の残りであり、その期待値を計算するにはサンプリング近似が必要である。

より最近のアプローチでは、カルバック・ライブラー発散(KL-D)を様々な統計的距離に置き換えている。以下の「統計的距離VAE変種」を参照。

定式化

確率モデリングの観点から、選択したパラメータ化された確率分布 \(p_\theta(x)=p(x|\theta)\) によってデータ \(x\) の尤度を最大化したい。この分布は通常、\(\mu\) と \(\sigma\) によってそれぞれパラメータ化されるガウス分布 \(N(x|\mu,\sigma)\) が選ばれ、指数分布族のメンバーとしてノイズ分布として扱いやすい。単純な分布は最大化が容易であるが、潜在変数 \(z\) に事前分布が想定される分布は、扱いにくい積分をもたらす。\(z\) について周辺化して \(p_\theta(x)\) を見つけよう。

\(p_\theta(x) = \int_z p_\theta({x,z}) \, dz,\)

ここで \(p_\theta({x,z})\) は、\(p_\theta\) の下での観測データ \(x\) とその潜在表現またはエンコーディング \(z\) の同時分布を表す。連鎖律によれば、方程式は次のように書き直すことができる。

\(p_\theta(x) = \int_z p_\theta({x|z}) p_\theta(z) \, dz.\)

実際には、潜在空間が高次元であり、真の事後分布 \(p_\theta(z|x)\) が未知であるため、\(z\) に関する積分は扱いにくい。VAEは、真の事後分布を近似するエンコーダーネットワーク \(q_\phi(z|x)\) と、データを再構成するデコーダーネットワーク \(p_\theta(x|z)\) を導入する。トレーニング目的は、再構成項とKL発散項の合計である証拠下界(ELBO)である。再パラメータ化トリックにより、\(z\) を \(z = \mu + \sigma \odot \epsilon\) と表現することで、サンプリングプロセスを通じた誤差逆伝播が可能になる。ここで \(\epsilon\) は標準正規分布からサンプリングされる。

トレーニングと最適化

VAEは、パラメータ \(\theta\) と \(\phi\) に関してELBOを最大化することでトレーニングされる。再構成項はデコーダーが入力データを正確に再構成することを促し、KL発散項は潜在空間が事前分布(通常は標準正規分布)に近くなるように正則化する。このバランスは過適合を防ぎ、事前分布からサンプリングしてデコードすることで新しいデータポイントの生成を可能にする。

再パラメータ化トリックは、確率的勾配降下法を使用した効率的なトレーニングに不可欠である。確率性をノイズ変数 \(\epsilon\) に移すことで、勾配はネットワークの決定論的部分を通じて流れることができる。ノイズモデルの分散は別々に学習でき、再構成誤差は連続データには平均二乗誤差、バイナリデータにはバイナリ交差エントロピーを使用して計算されることが多い。

アプリケーションと影響

VAEはGenerative AIの基礎モデルとなり、画像生成、異常検知、表現学習などのタスクを可能にした。これはDeep learningMachine learningを含む様々な領域に拡張され、Large language modelのような他の生成モデルの開発に影響を与えたが、これらは通常異なるアーキテクチャを使用する。VAEは半教師あり学習や教師あり学習の設定でも使用され、教師なし学習を超えたその汎用性を示している。

KingmaとWellingによる元の論文は非常に影響力が大きく、VAEフレームワークは、モード崩壊に対処するためにKL発散の代わりに異なる統計的距離を使用するなど、様々な方法で適応されてきた。モデルが滑らかな潜在空間を学習する能力は、データ属性の補間や操作に有用である。

変種と拡張

VAEのいくつかの変種が、その性能を向上させるために提案されている。例えば、ベータVAEは、より解きほぐれた表現を促進するためにKL発散項に重み係数を導入する。他の変種は、ガウス混合モデルなどの異なる事前分布を使用したり、生成サンプルの現実性を向上させるために敵対的トレーニングを採用したりする。再パラメータ化トリックは、ガンベル・ソフトマックス近似を使用して、カテゴリ変数などの他の分布にも一般化されている。

Artificial intelligenceの文脈では、VAEはしばしば生成的敵対ネットワーク(GAN)と比較される。GANは別のクラスの生成モデルである。GANはよりシャープな画像を生成できるが、VAEはトレーニングがより安定している傾向があり、不確実性推定に役立つ確率的フレームワークを提供する。2020年代初頭の時点で、VAEは依然として活発な研究分野であり、Neural network設計などを超えたアプリケーションがある。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:variational-autoencoder·generative-model·machine-learning·deep-learning
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴