変分オートエンコーダー(VAE)は、2013年にDiederik P. KingmaとMax Wellingによって導入された人工ニューラルネットワークアーキテクチャである。これは、確率的グラフィカルモデルと変分ベイズ法のファミリーに属する。VAEは生成モデルであり、入力データを確率的潜在空間にエンコードし、その空間からサンプルを元のデータ領域にデコードすることを学習し、データ生成、ノイズ除去、表現学習などのタスクを可能にする。
このアーキテクチャは、エンコーダーとデコーダーの2つのニューラルネットワークで構成される。エンコーダーは、大きな複雑なデータセットからの各データポイント(画像など)を、単一のポイントではなく、潜在空間内の分布にマッピングする。この分布は通常、平均と分散によってパラメータ化された多変量ガウス分布である。デコーダーは逆の機能を実行し、潜在空間から入力空間へ、再び分布に従ってマッピングするが、実際にはデコード中にノイズが追加されることはほとんどない。単一のポイントではなく分布にマッピングすることで、ネットワークはトレーニングデータの過学習を回避する。両方のネットワークは通常、再パラメータ化トリックを使用して一緒にトレーニングされるが、ノイズモデルの分散は別々に学習できる。
アーキテクチャと動作の概要
変分オートエンコーダーは、事前分布とノイズ分布を持つ生成モデルである。このタイプの伝統的なモデルは、確率的PCAやスパースコーディングなどの期待値最大化メタアルゴリズムを使用してトレーニングされる。これらのスキームは、通常計算上扱いにくいデータ尤度の下界を最適化し、q分布、すなわち変分事後分布を発見する必要がある。これらのq分布は通常、個々のデータポイントごとに別々の最適化プロセスでパラメータ化される。
VAEは代わりに、ニューラルネットワークを償却アプローチとして使用し、データポイント全体で共同で最適化する。同じパラメータが複数のデータポイントで再利用され、大幅なメモリ節約を実現する。最初のニューラルネットワークはデータポイントを入力として受け取り、変分分布のパラメータを出力する。既知の入力空間から低次元の潜在空間へのマッピングであるため、エンコーダーと呼ばれる。デコーダーは2番目のニューラルネットワークであり、潜在空間から入力空間へのマッピング、例えばノイズ分布の平均として機能する。別のニューラルネットワークを使用して分散にマッピングすることも可能だが、簡略化のために省略でき、分散は勾配降下法で最適化される。
モデルを最適化するには、再構成誤差とカルバック・ライブラー発散(KL-D)の2つの項が必要である。両方とも確率モデルの自由エネルギー式から導出され、ノイズ分布とデータの想定される事前分布によって異なる。例えば、IMAGENETなどの標準的なVAEタスクは通常ガウスノイズを想定し、二値化されたMNISTなどのタスクはベルヌーイノイズを必要とする。KL-D項は、p分布と重なるq分布の確率質量を最大化し、モード探索行動をもたらす可能性がある。再構成項は自由エネルギー式の残りであり、その期待値を計算するにはサンプリング近似が必要である。より最近のアプローチでは、KL-Dをさまざまな統計的距離に置き換えている。
定式化
確率モデリングの観点から、目標は、選択されたパラメータ化された確率分布p_θ(x) = p(x|θ)の下でデータxの尤度を最大化することである。この分布は通常、μとσによってパラメータ化されたガウス分布N(x|μ, σ)として選択され、指数族のメンバーとして扱いやすい。単純な分布は最大化が容易だが、潜在変数zに対する事前分布を持つ分布は扱いにくい積分をもたらす。尤度p_θ(x)は、zについて周辺化することで見つかる:
p_θ(x) = ∫ p_θ(x, z) dz,
ここで、p_θ(x, z)は観測データxと潜在エンコーディングzの同時分布である。連鎖律により、これは次のようになる:
p_θ(x) = ∫ p_θ(x|z) p_θ(z) dz.
この積分は一般に扱いにくいため、変分推論が使用される。エンコーダーネットワークは、真の事後分布p_θ(z|x)を変分分布q_φ(z|x)(通常はガウス分布)で近似する。デコーダーはp_θ(x|z)をモデル化する。トレーニングは証拠下界(ELBO)を最適化し、再構成精度と事前分布への正則化のバランスを取る。
再パラメータ化トリック
再パラメータ化トリックは、バックプロパゲーションでVAEをトレーニングするための重要な技術である。エンコーダーの出力分布q_φ(z|x)からのサンプリングは微分可能ではなく、勾配の流れを妨げる。このトリックは、潜在変数をz = μ + σ ⊙ εとして表現し、ここでεは標準正規分布N(0, I)からサンプリングされる。これにより、確率的部分(ε)と決定論的パラメータ(μとσ)が分離され、勾配がネットワークを通じて流れることが可能になる。このトリックは2013年にVAEとともに導入され、変分深層学習の標準となっている。
ELBOと損失関数
トレーニング目的は、自由エネルギー式から導出された証拠下界(ELBO)である。ELBOは2つの項で構成される:再構成項とKL発散項。再構成項E_{q_φ(z|x)}[log p_θ(x|z)]は、デコーダーが潜在サンプルから入力をどれだけうまく再構成するかを測定する。KL項D_KL(q_φ(z|x) || p(z))は、事前分布p(z)(通常は標準ガウス分布)からの逸脱を罰することによりエンコーダーを正則化する。総損失は負のELBOであり、勾配降下法で最小化される。KL項は潜在空間が滑らかで連続的であることを奨励し、再構成項はデータへの忠実性を保証する。
応用と拡張
当初は教師なし学習用に設計されたが、VAEは半教師あり学習および教師あり学習にも効果的であることが証明されている。画像生成、異常検知、創薬、表現学習に使用される。変種には、追加の入力に条件付けする条件付きVAE(CVAE)や、非絡み合い表現のためにKL項に重みを付けるベータVAEがある。最近の研究では、モード崩壊に対処しサンプル品質を向上させるために、KL-Dを他の統計的距離に置き換えている。VAEはまた、Generative AIの基礎であり、Large language modelなどの他のモデルと並んで、アーキテクチャと応用が異なる。
他のモデルとの関係
VAEはより広いDeep learningの景観の一部であり、Neural networkアーキテクチャ(Residual Network (ResNet)やU-Netなど)に関連している。Encoder-Decoder ArchitectureモデルやSequence-to-Sequence (Seq2Seq)フレームワークと概念的なつながりを共有するが、VAEは確率的潜在空間に焦点を当てている。Artificial intelligenceシステム(OpenAIのGPTシリーズなど)で使用されるTransformer (architecture)ベースのモデルとは異なり、VAEは通常より小さく、連続データに使用される。MIT CSAILやStanford AI Labなどの機関での研究がVAE理論を進展させ、Google DeepMindやAmazon Web Servicesなどの企業が生産システムでそれらを適用している。
制限と将来の方向性
VAEは、ガウスノイズの仮定とKL正則化により、生成的敵対ネットワーク(GAN)と比較してぼやけたサンプルを生成することが多い。モデルがデータ分布の少数のモードに焦点を当てると、モード崩壊が発生する可能性がある。最近の進歩は、階層的VAE、正規化フロー、代替発散測度を通じてこれらの問題に対処している。2020年代半ばの時点で、VAEは活発な研究分野であり、Machine learningとGenerative AIにおけるサンプル品質とスケーラビリティの向上に関する継続的な作業がある。