生成モデルは、Machine learningの一種であり、与えられたデータセットの確率分布を学習し、その学習した分布を用いて新たな、もっともらしいデータ点を生成する。クラス間の境界を描くことに焦点を当てる識別モデルとは異なり、生成モデルはデータ自体の背後にある構造と統計的パターンを捉えることを目的とする。この能力はGenerative AIの多くを支え、システムがトレーニングデータに似た新規のテキスト、画像、音声、その他のコンテンツを作り出すことを可能にする。生成モデルは、Large language modelや画像合成ツールを含む現代のDeep learningアプリケーションの基盤となっている。
この概念は古典的な統計学にルーツを持ち、ガウス混合モデルや隠れマルコフモデルなどのモデルが系列を生成するために使われていた。しかし、現代の生成モデリングの時代はNeural networkの台頭とともに始まり、モデルが複雑で高次元の分布を学習できるようになった。重要なマイルストーンには、2013年の変分オートエンコーダー(VAE)と2014年の生成的敵対ネットワーク(GAN)の導入があり、どちらも生成の実用的な範囲を広げた。より最近では、Transformer (architecture)アーキテクチャと拡散モデルの開発がテキストと画像生成の飛躍的進歩を促し、産業全体での広範な採用につながっている。
基本原則と種類
生成モデルは、確率分布を表現しサンプリングする方法によって大まかに分類できる。一般的なアプローチの1つは尤度ベースであり、モデルがデータ上の確率分布を明示的に定義し、観測されたサンプルの尤度を最大化することでトレーニングする。例としては、前の要素を条件として次の要素を予測することでデータを逐次的に生成する自己回帰モデルや、可逆変換を用いて単純な分布を複雑な分布に写像する正規化フローがある。
もう1つの主要なファミリーは暗黙的生成モデルであり、尤度を明示的に定義せず、敵対的トレーニングを通じてサンプルを生成することを学習する。イアン・グッドフェローらによって導入されたGANは、サンプルを生成する生成器ネットワークと、本物と偽物を識別する識別器ネットワークで構成され、両者は競争的なプロセスでトレーニングされる。2020年代に注目を集めた拡散モデルは、データに徐々にノイズを加え、その後このプロセスを逆転させることを学習することで、高忠実度の生成を可能にする。各タイプには、トレーニングの安定性、サンプル品質、計算コストの面でトレードオフがある。
ドメインを超えた応用
生成モデルは自然言語処理で広く利用されている。OpenAI、Anthropic、Google DeepMindなどによって開発された大規模言語モデルは、膨大なテキストコーパスでトレーニングされた自己回帰生成モデルである。これらはチャットボット、コンテンツ作成、コード生成などのアプリケーションを支えている。これらのモデルは、Multi-Head AttentionやPositional Encodingなどのメカニズムを使用して系列を効果的に処理するTransformer (architecture)アーキテクチャに依存している。
コンピュータビジョンでは、生成モデルは画像超解像、インペインティング、スタイル転送などのタスクを可能にする。もともと生体医用画像のセグメンテーション用に設計されたU-Netアーキテクチャは、拡散ベースの画像生成に適応されている。生成モデルはまた、他の機械学習システムの堅牢性を向上させるために合成サンプルを作成するデータ拡張もサポートする。音声ドメインでは、音声と音楽を合成し、仮想アシスタントやエンターテインメントでの応用がある。
トレーニングと課題
生成モデルのトレーニングは計算集約的であり、専用ハードウェアを必要とすることが多い。NVIDIAやAMDなどの企業は、Deep learningの中心となる行列演算を高速化するGPUを生産している。Amazon Web Services、Microsoft Azure、Google Cloudなどのクラウドプロバイダーは、大規模モデルのトレーニングのためのスケーラブルなインフラを提供している。Batch Normalization、Layer Normalization、Dropoutなどの技術はトレーニングの安定化に役立ち、Adam (Optimizer)やStochastic Gradient Descent Variantsなどの最適化アルゴリズムが一般的に使用される。
重要な課題はモード崩壊であり、モデルが限られた種類の出力しか生成せず、データの完全な分布を捉えられないことである。これは特にGANで顕著である。もう1つの問題は生成品質の評価であり、損失関数などの従来の指標は人間の知覚と常に相関するとは限らない。研究者は画像にはFréchet Inception Distance(FID)、テキストにはパープレキシティなどの指標を使用するが、これらには限界がある。多様性と忠実度を同時に確保することは、依然として活発な研究分野である。
最近の進展と将来の方向性
最近の進歩は、モデルのスケーリングと効率の改善に焦点を当てている。拡散モデルは画像生成の最先端となり、Stable DiffusionやDALL-Eなどのシステムが顕著な能力を示している。テキストでは、Transformer (architecture)アーキテクチャがCross-AttentionやEncoder-Decoder Architecture設計などの革新とともに進化し、入力と出力の間のより良い整合を可能にしている。Top-K Sampling、Top-P (Nucleus) Sampling、Temperature Scalingなどの技術は、生成テキストのランダム性を制御し、創造性と一貫性のバランスを取る。
MIT CSAIL、Stanford AI Lab、BAIR (Berkeley AI Research)などの研究機関は、理論的基盤と新しいアーキテクチャの探求を続けている。生成モデルをより解釈可能で制御可能にすることへの関心が高まっており、Reinforcement Learning from AI Feedback (RLAIF)(AIフィードバックからの強化学習)などの方法が出力を人間の好みに合わせるために使用されている。Model PruningやData Augmentationなどの効率改善は、トレーニングの環境的および金銭的コストを削減することを目的としている。生成モデルがより強力になるにつれて、日常のツールへの統合は拡大する可能性が高く、信頼性、バイアス、倫理的使用に関する重要な疑問を提起している。