英語からの翻訳

潜在拡散モデル(LDM)は、圧縮された潜在空間でノイズ除去を行う拡散モデルアーキテクチャであり、高解像度画像生成を効率的に実現する。ミュンヘン大学のCompVisグループによって開発され、LDMはStable Diffusionバージョン1.1から2.1の基盤となっている。

潜在拡散モデル(LDM)は、ミュンヘン大学のComputer Vision & Learning(CompVis)グループによって開発された拡散モデルアーキテクチャである。標準的な拡散モデルを改良し、ピクセル空間で直接拡散プロセスを行う代わりに、より低次元の潜在空間で行うことで、計算コストを削減し、高解像度画像のより効率的な生成を可能にする。LDMはまた、自己注意機構と交差注意機構による条件付けを組み込んでおり、テキスト、画像、または他のモダリティに基づいて生成出力を柔軟に制御できる。

拡散モデルは2015年に、漸進的なノイズ付加プロセスを逆転させることを学習する生成モデルのクラスとして導入された。LDMアーキテクチャは2021年12月20日にarXivで公開され、Stable DiffusionとLDMの両リポジトリがGitHubでリリースされた。LDMは実用的な拡散モデルで広く使用されており、例えば、Stable Diffusionバージョン1.1から2.1はLDMアーキテクチャに基づいていた。

アーキテクチャ

LDMは、変分オートエンコーダ(VAE)、修正されたU-Net、テキストエンコーダの3つの主要コンポーネントで構成される。VAEエンコーダは、入力画像をピクセル空間からより小さな潜在空間に圧縮し、意味的意味を捉えながら次元を削減する。ガウスノイズは、前方拡散中にこの圧縮された潜在表現に反復的に適用される。U-NetはResNetバックボーン上に構築され、逆プロセスを通じて潜在表現をノイズ除去する。最後に、VAEデコーダはノイズ除去された潜在表現をピクセル空間に戻し、最終画像を生成する。

ノイズ除去ステップは、テキスト、画像、または他のモダリティに基づいて条件付けできる。テキスト条件付けでは、事前学習されたCLIP ViT-L/14テキストエンコーダがテキストプロンプトを埋め込み空間に変換し、それが交差注意機構を介してU-Netに公開される。これにより、モデルは提供されたテキスト記述に沿った画像を生成できる。

変分オートエンコーダ

VAEは最初に画像データセットで訓練される。そのエンコーダは画像を入力として受け取り、U-Netへの入力となる低次元の潜在表現を出力する。訓練後、エンコーダは画像を圧縮するために使用され、デコーダは潜在表現から画像を再構築する。

実装されたバージョンでは、エンコーダは畳み込みニューラルネットワーク(CNN)であり、最後の近くに単一の自己注意機構を持つ。形状(3, H, W)のテンソルを受け取り、形状(8, H/8, W/8)のテンソルを出力する。これは、潜在ベクトルの予測平均と分散を連結したもので、それぞれ形状(4, H/8, W/8)である。訓練中は分散が使用されるが、推論時には通常平均のみが保持される。デコーダも単一の自己注意機構を持つCNNであり、(4, H/8, W/8)テンソルを(3, H, W)にマッピングする。

U-Net

U-Netバックボーンは、VAEエンコーダからの潜在画像配列、現在のノイズレベルを示すタイムステップ埋め込み、テキストエンコーダからの条件付け埋め込みの複数の入力処理する。U-Netは、潜在表現に追加されたノイズを予測するように訓練され、反復的なノイズ除去を可能にする。アーキテクチャは残差ブロックと注意層を組み込んでおり、局所的および大域的な文脈の両方を処理できる。

訓練と条件付け

LDMはノイズ除去目的で訓練される。つまり、ノイズのある潜在表現が与えられたとき、モデルは元のノイズを予測することを学習する。訓練プロセスは、予測ノイズと実際のノイズの差を測定する損失関数を使用する。条件付けは交差注意層を通じて統合され、テキスト埋め込みがノイズ除去プロセスを変調するために使用される。このアプローチは、条件付けありとなしの両方でモデルを訓練し、推論時に条件付けを増幅してプロンプトへの適合性を向上させる、分類器フリーガイダンスをサポートする。

応用と影響

LDMはテキストから画像への生成の基盤となるアーキテクチャとなっている。著名なオープンソースモデルであるStable DiffusionはLDMアーキテクチャを使用している。バージョン1.1から1.4は2022年8月にCompVisによってリリースされ、各バージョンは徐々に美的な画像で微調整された。2022年10月にRunwayMLによってリリースされたStable Diffusion 1.5は、分類器フリーガイダンスを改善するためにテキスト条件付けの10%のドロップアウトを組み込んだ。潜在空間拡散の効率性により、これらのモデルを消費者向けハードウェアで実行することが可能になり、生成AIへのアクセスを民主化した。

関連する発展

拡散モデルは、非平衡熱力学に関する初期の研究から進化した。2019年の論文は、ノイズ条件付きスコアネットワーク(NCSN)を導入し、これはランジェバン動力学を用いたスコアマッチング(SMLD)としても知られ、PyTorch実装が提供された。2020年の論文は、変分推論を通じて訓練を改善したノイズ除去拡散確率モデル(DDPM)を提案し、TensorFlowでリリースされた。LDMは、拡散プロセスを潜在空間に移すことでこれらの基盤の上に構築されており、これはメモリと計算要件を削減しながら高品質な出力を維持する重要な革新である。

LDMは、生成AIのより広い分野の一部であり、大規模言語モデルや他の深層学習アーキテクチャも含まれる。交差注意U-Netバックボーンの使用は、LDMをニューラルネットワーク設計の進歩に結び付けている。2025年現在、潜在拡散は商業およびオープンソースの画像生成システムにおける標準的なアプローチであり、効率性、制御性、忠実性の向上に焦点を当てた継続的な研究が行われている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·diffusion-models·deep-learning·image-generation
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴