拡散モデルは、データ、最も一般的には画像、動画、または音声を生成することを学習する生成的モデルであり、徐々にノイズを加えるプロセスを逆転させることでデータを創り出す。つまり、破損したサンプルからノイズを段階的に除去するように訓練され、訓練後は純粋なランダムノイズから始めて、それを反復的にノイズ除去して一貫性のある出力へと変換することで、新しいデータを生成できる。拡散モデルは、2020年代半ば時点で主要なText-to-image generationおよびText-to-video generationシステムの背後にある技術であり、高忠実度の画像合成における支配的なアプローチとしてGenerative adversarial networkを置き換えた。
歴史
理論的基盤は、2015年にJascha Sohl-Dicksteinらによる論文で築かれ、非平衡熱力学との類推を用いて、データの構造をノイズで徐々に破壊し、その逆転を学習するプロセスを記述した。このアプローチは研究上の好奇心の対象に留まっていたが、2020年にJonathan Ho、Ajay Jain、Pieter AbbeelがDenoising Diffusion Probabilistic Models(DDPM)を発表し、比較的単純な訓練目的でGANに匹敵する画像品質を生み出せることを示した。この技術は、2022年4月のOpenAIのDALL-E 2を通じて主流の注目を集め、その数ヶ月後には、2022年にRobin Rombachらが導入した潜在拡散技術に基づくStable Diffusionの2022年8月のオープンソース公開により広く利用可能となった。潜在拡散は、圧縮されたLatent spaceでノイズ除去プロセスを実行し、生のピクセルに直接作用するのではなく、拡散モデルの訓練と実行に必要な計算量を大幅に削減した。
仕組み
拡散モデルの訓練には、実データサンプルに多数のステップで小さなガウスノイズを加え、純粋なノイズと区別がつかなくなるまで進める前方プロセスと、各ステップで加えられたノイズを予測して除去するように訓練されたニューラルネットワーク(典型的にはU-Net、またはますますTransformer (architecture)ベースのアーキテクチャ)が関与し、実質的に逆転プロセスを学習する。生成はこの逆転プロセスをゼロから実行する。つまり、ランダムノイズから始めて、モデルが多数のステップでノイズを繰り返し予測して除去し、徐々に一貫性のある画像や動画を明らかにする。条件付けメカニズム、最も一般的にはテキストPromptをエンコードしてクロスアテンションを介してノイズ除去ネットワークに供給することで、ユーザーがモデルの生成内容を導くことができ、classifier-free guidanceなどの技術は出力がその条件付け信号にどれだけ密接に従うかを強化する。
応用とエコシステム
拡散モデルは、Stable Diffusion、DALL-E、Midjourney、Fluxなど、広く使用されている主要な画像生成器のほぼすべてを支えており、Sora、GoogleのVeo、KlingやSeedanceなどの中国のシステムを含む主要な動画生成器の基盤となっている。2023年に導入されたControlNetなどの拡張機能は構造的条件付けを追加し、ユーザーがスケッチ、ポーズ、深度マップで生成を導くことを可能にし、オープンチェックポイントを中心に構築されたエコシステムは、コミュニティが訓練したLoRAアダプターなどの技術を通じて広範なカスタマイズをサポートする。拡散技術はメディア生成以外にも応用されており、タンパク質構造予測や分子設計を含み、研究者はほとんどのLarge language modelで使用されるトークン単位の自己回帰アプローチの代替として、テキスト生成への拡散ベースのアプローチも探求しているが、2025年時点でテキスト生成では自己回帰生成が依然として支配的である。
制限
GANと比較して、拡散モデルは推論時に計算コストが高い。なぜなら、単一のサンプルを生成するには数十から数百の連続的なノイズ除去ステップが必要となる場合があるからだ。ただし、数ステップモデルへの蒸留や改善されたサンプラーなどの技術により、2022年以降このコストは大幅に削減されている。大規模でキュレーションされていないウェブスクレイピングデータセットで訓練された拡散モデルは、Training data内のアーティストのスタイルや類似の画像を生成することが侵害に当たるかどうかについてAI and copyright紛争に直面しており、特定の条件下で記憶された訓練画像を逐語的に再現する能力についても scrutinized されている。