拡散モデル(Diffusion Models)は、拡散ベース生成モデルまたはスコアベース生成モデルとも呼ばれ、機械学習における潜在変数生成モデルの一種である。これらは、データに徐々にノイズを加える前方拡散過程と、ノイズを除去することを学習する逆サンプリング過程という、二つの主要な構成要素から成る。目標は、与えられたデータセットに対して拡散過程を学習し、元のデータと同様の分布を持つ新しい要素を生成できるようにすることである。訓練された拡散モデルは、効率と品質のトレードオフを伴う様々な方法でサンプリングすることができる。
拡散モデルは2015年に導入され、非平衡熱力学の手法を応用したものである。核心となる考え方は、データの分布を高次元空間における「雲」としてモデル化することである。ノイズを繰り返し加えることで、この雲は拡散し、最終的にはガウス分布とほぼ区別がつかなくなる。この拡散を近似的に逆転させるように訓練されたモデルは、ランダムなノイズから出発し、反復的にノイズを除去することで、元の分布から新しいサンプルを生成することができる。
定式化と訓練
拡散モデルには、マルコフ連鎖、デノイジング拡散確率モデル(DDPM)、ノイズ条件付きスコアネットワーク、確率微分方程式など、いくつかの等価な定式化が存在する。これらは通常、変分推論を用いて訓練される。ノイズ除去を担うモデルは「バックボーン」と呼ばれ、任意のアーキテクチャを使用できるが、一般的にはU-Netまたはトランスフォーマーが用いられる。2020年のDDPMに関する論文は、変分推論を拡散過程に適用することで、それ以前の手法を改善した。
コンピュータビジョンへの応用
2024年現在、拡散モデルは主にコンピュータビジョンのタスクに使用されており、画像のノイズ除去、インペインティング(修復)、超解像、画像生成、動画生成などが含まれる。これらのタスクでは通常、ガウスノイズでぼかされた画像を順次ノイズ除去するようにニューラルネットワークを訓練する。訓練が収束した後、モデルはランダムなノイズから始めて、ネットワークを反復的に適用してノイズを除去することで画像を生成できる。拡散モデルを用いた画像生成器は広く商業的な関心を集めており、代表的な例としてStable DiffusionやDALL-Eが挙げられる。これらのシステムは、拡散モデルとテキストエンコーダー、クロスアテンションモジュールを組み合わせることで、テキスト条件付き生成を可能にしている。
その他の領域
コンピュータビジョン以外にも、拡散モデルは自然言語処理、例えばテキスト生成や要約、さらには音声生成や強化学習にも応用されている。その多様性により、生成AIにおける重要な研究分野となっている。
他の生成モデルとの関係
拡散モデルは、大規模言語モデルやその他のアプローチを含む、より広範な生成モデルの一部である。大規模言語モデルが通常、自己回帰的またはトランスフォーマーベースのアーキテクチャに依存するのに対し、拡散モデルは、画像や音声のような連続データに対して特に効果的な代替パラダイムを提供する。バックボーンの選択(U-Netかトランスフォーマーか)により、拡散モデルは深層学習およびニューラルネットワーク研究の進歩を活用することができる。
今後の方向性
研究は、拡散モデルの効率と品質の向上を目指して続けられており、新しいサンプリング手法、バックボーンアーキテクチャ、応用分野が探求されている。OpenAI、Google DeepMind、Anthropicなどの組織によって開発された他のAIシステムとの統合は、人工知能分野におけるさらなる革新を促進する可能性が高い。