Denoising Diffusion Probabilistic Models(DDPM)は、生成モデルの一種であり、機械学習において、徐々にノイズを加える過程を逆転させることを学習することでデータを生成する。これらはより広い拡散モデルのファミリーに属し、データが高次元空間をランダムウォークとドリフトを伴って遷移するものとしてモデル化する。DDPMは2020年の論文で導入され、変分推論を用いた初期の拡散ベースのアプローチを改良し、現代の多くの画像生成システムの基盤となった。
DDPMでは、順方向プロセスが一連のタイムステップにわたって画像にガウスノイズを加え、徐々に純粋なノイズへと変換する。モデルはこのプロセスを逆転させるように訓練され、ランダムノイズから始めて反復的にノイズ除去を行い、現実的な画像を生成する。このアプローチは、画像生成、インペインティング、超解像などのタスクで非常に効果的であることが証明されており、Stable DiffusionやDALL-Eなどの商用システムを支えている。
コアメカニズム
DDPMフレームワークは、固定されたノイズレベルのスケジュールを持つ順方向拡散プロセスを定義する。与えられた画像に対して、各タイムステップで分散スケジュールに従ってノイズが加えられ、ますますノイズの多いバージョンのシーケンスが生成される。逆方向プロセスは、ニューラルネットワーク(通常はU-Netまたはトランスフォーマー)によって学習され、各ステップでノイズ成分を予測する。訓練は、予測されたノイズと実際のノイズの間の単純な平均二乗誤差を最小化し、これは変分推論の一形態と等価である。
数学的には、順方向プロセスは(0,1)の定数 \(\beta_1, \dots, \beta_T\) を使用し、\(\alpha_t = 1 - \beta_t\) および \(\bar{\alpha}_t = \prod_{s=1}^t \alpha_s\) とする。タイムステップ \(t\) でのノイズの多い画像は、元の画像とガウスノイズの線形結合であり、分散は \(\sigma_t^2 = 1 - \bar{\alpha}_t\) である。逆方向プロセスは、ノイズ除去分布の平均を出力するニューラルネットワークによってパラメータ化される。
訓練とサンプリング
DDPMの訓練には、ランダムなタイムステップをサンプリングし、対応するノイズを画像に加え、そのノイズを予測するようにネットワークを訓練することが含まれる。損失関数は \(\mathbb{E}_{t, \mathbf{x}_0, \epsilon}[\|\epsilon - \epsilon_\theta(\mathbf{x}_t, t)\|^2]\) であり、ここで \(\epsilon\) はノイズ、\(\epsilon_\theta\) はネットワークの予測である。この目的関数は、対数尤度の変分下界から導出される。
サンプリング時には、モデルは純粋なガウスノイズから始め、逆方向プロセスを \(T\) ステップ反復的に適用し、各ステップでノイズの一部を除去する。ステップ数は、denoising diffusion implicit models(DDIM)などの技術やノイズスケジュールの学習によって削減でき、より高速な生成が可能になる。
歴史的背景
拡散モデルは2015年に、Jascha Sohl-Dicksteinらを含む研究者によって、非平衡熱力学の原理を用いて初めて提案された。彼らは、複雑なデータ分布が徐々に単純なガウス分布に拡散されること、そしてこのプロセスを逆転させることを学習することで新しいサンプルを生成できることを示した。しかし、初期の方法は計算コストが高く、当時のGANほど効果的ではなかった。
2020年のDDPM論文は、Jonathan Ho、Ajay Jain、Pieter Abbeelによって執筆され、注意深く選択されたノイズスケジュールとU-Netバックボーンを用いることで、拡散モデルが最先端の画像生成品質を達成できることを実証した。これにより、研究と応用の急速な拡大が促進された。
応用と影響
2024年現在、DDPMとその変種は、画像ノイズ除去、インペインティング、超解像、テキストから画像への生成などのタスクでコンピュータビジョンにおいて広く使用されている。また、自然言語処理におけるテキスト生成や要約、音声生成にも応用されている。Stable DiffusionやDALL-Eなどの商用製品は、DDPMをテキストエンコーダーとクロスアテンションモジュールと組み合わせて、テキスト条件付き生成を可能にし、幅広いユーザーが利用できるようにしている。
DDPMはまた、強化学習や科学シミュレーションなどの他の分野にも影響を与えており、複雑な分布のモデル化に使用されている。高品質なサンプルを生成する能力により、現代の人工知能研究の基礎となっている。
限界と将来の方向性
その成功にもかかわらず、DDPMには限界がある。サンプリングは、反復的なノイズ除去プロセスのため、通常GANよりも遅いが、高速化手法が開発されている。また、訓練にはかなりの計算リソースが必要であり、これが効率的なアーキテクチャやAWS TrainiumやGoogle Cloud TPUなどのハードウェアへの関心を駆り立てている。進行中の研究は、サンプル品質の向上、推論時間の短縮、DDPMの新しいモダリティへの拡張に焦点を当てている。
2025年現在、拡散モデルは活発な研究分野であり、バックボーンアーキテクチャ、ノイズスケジュール、条件付けメカニズムの革新が、生成的モデリングの可能性の限界を押し広げ続けている。