2014年6月にIan Goodfellowらによって発表されたGAN論文は、生成的敵対ネットワーク(GAN)の概念を導入した。これは、Generative AIの中心となるMachine learningフレームワークの一種である。この論文は、2つのニューラルネットワークがゼロサムゲームに従事し、一方のネットワークが合成データを生成し、他方がその真偽を評価するという新しいアーキテクチャを提案した。この競争により、システムはトレーニングデータセットの基礎となる分布を学習し、それに似た新しいサンプル(人間の観察者に現実的に見える写真など)を生成できるようになる。当初は教師なし学習の一形態として位置づけられたが、このフレームワークは後に半教師あり、完全教師あり、およびReinforcement learningタスクにも適応可能であることが証明された。
GAN論文の核心的な革新は、その間接的なトレーニングメカニズムにある。生成ネットワークは特定の例への直接的な距離を最小化するのではなく、識別ネットワーク(実入力と合成入力を区別する能力を動的に更新する2番目のネットワーク)を欺くことを学習する。この敵対的プロセスにより、モデルは明示的な尤度モデリングなしで複雑な統計的パターンを捕捉できる。この論文は進化生物学における擬態に類似性を見出し、各ネットワークが他方に応じて継続的に改善する軍拡競争を描写した。
数学的定式化
元のGANは、確率空間上のゲームとして形式化される。空間Ω上の参照分布μ_refが与えられたとき、生成器はΩ上のすべての確率測度の集合から確率測度μ_Gを選択し、識別器は各点を[0,1]上の確率分布に写像するマルコフ核μ_Dを選択する。目的関数は、実サンプルに対する識別器の出力の期待対数尤度と、生成サンプルに対する1からその出力を引いた値の期待対数尤度の和として定義される。生成器はこの目的関数を最小化し、識別器はそれを最大化するため、ミニマックスゲームが形成される。生成器の目標はμ_Gをμ_refに近似させることであり、識別器は参照データには1に近い値、生成データには0に近い値を出力することを目指す。
実践的なトレーニングプロセス
実際には、生成器は潜在空間から候補サンプルを生成し、通常は多変量正規分布からのランダムノイズでシードされる。識別器はこれらの候補を既知のトレーニングデータセットと照合し、最初は実サンプルで許容可能な精度に達するまでトレーニングされる。両方のネットワークは独立したバックプロパゲーション手順を通じて更新される。生成器は説得力のあるサンプルを生成する能力を向上させ、識別器は合成サンプルを検出する能力を高める。画像生成タスクでは、生成器はしばしば逆畳み込みアーキテクチャを使用し、識別器は畳み込み構造を採用して、Deep learningの進歩を活用する。
他の手法との比較
GANは暗黙的生成モデルのクラスに属し、フローベースの生成モデルとは異なり、尤度関数を明示的にモデル化せず、サンプルから潜在変数への直接的な写像も提供しない。WaveNetやPixelRNNなどの自己回帰モデルと比較して、GANは複数の逐次パスを必要とせず、単一パスで完全なサンプルを生成できる。また、ボルツマンマシンや線形ICAとは異なり、ネットワークの関数形式に制限を課さない。ニューラルネットワークは普遍近似器であるため、GANは漸近的に一貫性があるが、この特性は他の生成アプローチと共有される。
影響と遺産
GAN論文は、その後のArtificial intelligence研究に影響を与えた基礎的なフレームワークを確立した。その敵対的トレーニングパラダイムは、画像合成からデータ拡張まで、多くの変種と応用を生み出した。この概念はまた、後にTransformer (architecture)ベースのアーキテクチャなどのモデルで拡張されたGenerative AIのより広い分野にも貢献した。ネットワーク間の競争に焦点を当てたこの論文は、教師なし学習に新しい視点を提供し、その進化的類推は適応システムを研究する研究者に共鳴した。2026年現在、GANは広く研究されているアプローチであり続けているが、急速に進化する生成的モデリングの状況では新しい手法が登場している。