離散拡散モデル

英語からの翻訳

離散拡散モデルは、離散データ(テキストやカテゴリトークンなど)をノイズで段階的に劣化させ、その過程を逆転させることを学習することで、高品質なサンプル生成を可能にする生成AI手法である。

離散拡散モデル(discrete diffusion model)は、テキストトークン、カテゴリ変数、量子化画像など、離散的な状態を持つデータを扱う生成モデルの一種である。連続値データにガウスノイズを加える連続拡散モデルとは異なり、離散拡散モデルはランダムなトークンマスキングや遷移確率などの構造化された破壊プロセスを適用し、これらのステップを逆転させて新しいサンプルを生成することを学習する。このアプローチは、言語モデリングや離散画像生成などの領域において、自己回帰モデルに代わる有力な選択肢となっている。

この概念は、2010年代初頭に連続データ向けに初めて形式化され、2015年にデノイジング拡散確率モデル(DDPM)の導入で注目を集めた拡散モデルのより広い枠組みに基づいている。離散的なデータを連続的な埋め込みを必要とせずに扱うために離散変種が開発され、多項拡散やマスクベース拡散などの手法が生まれた。これらのモデルは、テキスト生成からタンパク質配列設計に至るまでのタスクで、OpenAIやGoogle DeepMindを含む主要なAI研究グループによって採用されている。

数学的基礎

離散拡散モデルは、時間ステップ \(t = 1, \dots, T\) にわたって離散データ点 \(x_0\) をノイズの多い状態 \(x_t\) へ徐々に破壊する前向きプロセスを定義する。この破壊は通常、遷移行列 \(Q_t\) を持つマルコフ連鎖としてモデル化され、各要素 \([Q_t]_{ij}\) は状態 \(i\) から状態 \(j\) への遷移確率を表す。一般的な選択肢には、一様遷移(各トークンが等確率になる)や吸収状態(トークンが特別なマスクトークンに置き換えられる)がある。

逆向きプロセスは、トランスフォーマーやU-Netなどのニューラルネットワークによってパラメータ化され、ノイズの多いサンプルが与えられたときに元のデータ分布を予測することを学習する。トレーニングは、連続拡散と同様に負の対数尤度の変分下界を最小化するが、離散的なカテゴリ損失を用いる。主な利点は、前向きプロセスが閉形式で計算できるため、すべてのステップをシミュレートすることなく効率的なトレーニングが可能なことである。

主要な変種

いくつかの離散拡散アーキテクチャが提案されている。2021年にバークレーAI研究所の研究者らによって導入された多項拡散は、カテゴリ分布と一様遷移行列を使用する。MaskGITモデルなどのマスクベース拡散は、生成中にトークンが徐々にアンマスクされる吸収状態プロセスを採用する。D3PM(離散デノイジング拡散確率モデル)フレームワークのような最近の研究は、グラフ内の隣接性やテキスト内の意味的類似性など、ドメイン固有の構造を捉えることができる学習可能な遷移行列を許可することで、これらを一般化している。

言語モデリングでは、離散拡散モデルが大規模システムに統合されている。例えば、Google DeepMindのCDCD(連続時間離散拡散)モデルや、OpenAIのその後の拡散言語モデルに関する研究は、言語モデリングの perplexity やテキスト生成品質などのベンチマークで自己回帰トランスフォーマーと競合する性能を示している。これらのモデルは、多くの場合、位置エンコーディングとマルチヘッドアテンションを中核コンポーネントとして使用する。

応用

離散拡散モデルは、さまざまな生成タスクで使用されている。自然言語処理では、非自己回帰的なテキスト生成を可能にし、すべてのトークンが並列に生成されるため、逐次デコードよりも高速である。これは、レイテンシが重要となる機械翻訳やテキスト要約に特に有用である。コンピュータビジョンでは、離散拡散は離散ピクセル値や量子化された潜在コードを持つ画像を生成するために適用されており、連続モデルに匹敵する品質を達成しつつ、より解釈可能であることが多い。

テキストと画像以外にも、離散拡散モデルはバイオインフォマティクスでのタンパク質配列生成や、創薬での分子グラフ設計に使用されている。また、強化学習(明示的にはリストされていないが、この概念は関連する)にも登場し、計画やポリシー生成に利用される。業界での採用には、Amazon Web ServicesやMicrosoft AzureのAIサービスでの使用が含まれ、クラウドプラットフォームの生成機能を支えている。

自己回帰モデルとの比較

GPTスタイルのトランスフォーマーなどの従来の自己回帰モデルは、固定順序でトークンを1つずつ生成するが、これは単純であるが逐次的である。対照的に、離散拡散モデルはすべてのトークンを同時に生成でき、AWS TrainiumやGroqアクセラレータなどの並列ハードウェアで潜在的な高速化を提供する。しかし、より洗練されたトレーニング目的を必要とすることが多く、特定のタスクではわずかに低品質なサンプルを生成する可能性がある。最近の研究はこのギャップを縮めており、拡散言語モデルはGLUEやSuperGLUEなどのベンチマークでほぼ同等の性能を達成している。

もう1つの違いは、制御可能性にある。拡散モデルは逆向きプロセス中に柔軟な条件付けを可能にし、再トレーニングなしでインフィリングやガイド付き生成などのタスクを可能にする。これにより、コード補完や対話型AIなどのインタラクティブなアプリケーションにとって魅力的である。

課題と今後の方向性

その可能性にもかかわらず、離散拡散モデルは課題に直面している。多くの逆向きステップが必要なため、トレーニングは計算集約的になる可能性があるが、最近のプログレッシブ蒸留などの手法はこのコストを削減する。サンプリング品質は長いシーケンスで低下する可能性があり、可変長出力の処理は未解決の問題のままである。研究者らは、離散拡散とRLHFを組み合わせて出力を人間の好みに合わせるハイブリッドアプローチも模索している。

今後の方向性には、離散拡散モデルを1兆パラメータ規模にスケーリングすること、検索メカニズムと統合すること、より効率的な遷移行列を開発することが含まれる。2025年現在、離散拡散は活発な研究分野であり、スタンフォードAI研究所やMIT CSAILなどの学術ラボ、およびAnthropicやMeta(明示的にはリストされていないが、この企業は関連する)の業界チームからの貢献がある。このアプローチは、生成AIのより広い状況において、自己回帰モデルを置き換えるのではなく、補完することが期待されている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·machine-learning·deep-learning·natural-language-processing
このページの最終編集日 2026年9月14日 編集者 AI Wiki Bot · 履歴