Stable Diffusion 2022年8月

英語からの翻訳

Stable Diffusionは、2022年8月にStability AIによって公開された、深層学習に基づくテキストから画像を生成するモデルであり、潜在拡散技術に基づいている。テキストプロンプトから詳細な画像を生成し、オープンソースとして公開されたことで注目され、一般消費者向けハードウェアでの広範な採用を可能にした。

Stable Diffusionは、2022年8月に公開された深層学習によるテキストから画像を生成するモデルであり、ミュンヘン大学(LMU Munich)のCompVisグループとRunwayの研究者らによって開発され、Stability AIから計算支援を受け、非営利団体から訓練データの提供を受けた。これは潜在拡散モデル(latent diffusion model)であり、深層生成人工ニューラルネットワークの一種で、Stability AIの主要製品と見なされ、進行中のAIブームに貢献している。モデルのコードと重みは公開され、2.4 GB VRAM程度の控えめなGPUを備えた消費者向けハードウェアで動作可能であり、クラウドサービス経由でのみアクセス可能だったDALL-EやMidjourneyのようなプロプライエタリなモデルとは一線を画している。

主な用途は、テキスト記述に基づいて詳細な画像を生成することだが、インペインティング(inpainting)、アウトペインティング(outpainting)、テキストプロンプトによる画像間変換(image-to-image translation)などのタスクもサポートしている。そのオープンソース性と効率性により、デジタルアートから研究まで、さまざまなアプリケーションで急速に採用された。

開発

Stable Diffusionは、ドイツのミュンヘン大学とハイデルベルク大学の研究者らによって開発された「潜在拡散」(latent diffusion)と呼ばれるプロジェクトに由来する。元の5人の著者のうち4人(Robin Rombach、Andreas Blattmann、Patrick Esser、Dominik Lorenz)は後にStability AIに加わり、後続バージョンをリリースした。技術ライセンスはミュンヘン大学のCompVisグループによって公開された。開発は、潜在拡散アーキテクチャの発明者の一人であるRunwayのPatrick EsserとCompVisのRobin Rombachが主導した。Stability AIはまた、訓練データセットを構築したドイツの非営利団体であるEleutherAIとLAIONを支援者として挙げている。

技術

アーキテクチャ

2015年に導入された拡散モデルは、訓練画像にガウスノイズを連続的に適用することを除去するように訓練されており、一連のノイズ除去オートエンコーダーとして機能する。その名称は熱力学的拡散に由来し、熱力学に触発されたものである。Stable Diffusionは、2021年にCompVisグループによって開発された「潜在拡散モデル」(LDM)と呼ばれる変種を使用している。

このモデルは、変分オートエンコーダー(VAE)、U-Net、およびオプションのテキストエンコーダーの3つの部分で構成される。VAEエンコーダーは、画像をピクセル空間からより小さな潜在空間に圧縮し、意味論的な意味を捉える。前方拡散中に、圧縮された潜在表現にガウスノイズが反復的に適用される。ResNetバックボーンで構成されるU-Netは、出力をノイズ除去して潜在表現を得る。最後に、VAEデコーダーが表現をピクセル空間に変換して最終画像を生成する。

ノイズ除去ステップは、クロスアテンション機構を介して、テキスト、画像、または他のモダリティによって条件付けできる。テキスト条件付けの場合、固定された事前訓練済みのCLIP ViT-L/14テキストエンコーダーがプロンプトを埋め込み空間に変換する。LDMは、訓練と生成のための計算効率の向上を提供する。U-Netに8億6000万パラメータ、テキストエンコーダーに1億2300万パラメータを持つStable Diffusionは、2022年の基準では比較的軽量であり、消費者向けGPUや、OpenVINOバージョンではCPUのみでも動作可能である。

SD XL

XLバージョンは同じLDMアーキテクチャを使用するが、より大きなUNetバックボーン、より大きなクロスアテンションコンテキスト、1つではなく2つのテキストエンコーダー、および複数のアスペクト比での訓練を備えている。同時にリリースされたSD XL Refinerは同じアーキテクチャを持つが、テキスト条件付きimg2imgを介して既存画像に微細なディテールを追加するために訓練された。

SD 3.0

3.0バージョンはバックボーンを完全に変更し、UNetの代わりにRectified Flow Transformerを使用している。Transformerアーキテクチャには、元のテキストエンコーディング、変換されたテキストエンコーディング、および(潜在空間での)画像エンコーディングの3つのトラックがある。変換されたテキストエンコーディングと画像エンコーディングは、各Transformerブロック中に混合される。このアーキテクチャは「マルチモーダル拡散トランスフォーマー(MMDiT)」と呼ばれ、「マルチモーダル」は、その操作内でテキストと画像のエンコーディングを混合することを意味し、テキストエンコーディングが画像エンコーディングにのみ影響を与えた以前のDiTバージョンとは異なる。

訓練データ

Stable Diffusionは、Common Crawlデータから派生した公開データセットであるLAION-5Bの画像キャプションペアで訓練され、言語、解像度、透かしの可能性、予測される美的スコアによってフィルタリングされた50億の画像テキストペアを含む。このデータセットは、Stability AIから資金提供を受けたドイツの非営利団体LAIONによって作成された。モデルは、laion2B-en、laion-high-resolution、laion-aesthetics v2 5+の3つのサブセットで訓練された。1200万画像のより小さなサブセットの第三者分析では、約47%が100の異なるドメインからのものであり、Pinterestが8.5%を占め、次いでWordPress、Blogspot、Flickr、DeviantArt、Wikimedia Commonsが続いた。バイエルン放送(Bayerischer Rundfunk)の調査により、Hugging FaceでホストされているLAIONのデータセットには、大量のプライベートで機密性の高いデータが含まれていることが明らかになった。

訓練手順

モデルは最初にlaion2B-enとlaion-high-resolutionで訓練され、最終ラウンドでは、美的品質で5/10以上のスコアを獲得すると予測された6億のキャプション付き画像のサブセットであるLAION-Aesthetics v2 5+で訓練された。このサブセットは、低解像度の画像と透かしの可能性が80%を超える画像を除外した。最終訓練ラウンドでは、Classifier-Free Diffusion Guidanceを改善するためにテキスト条件付けの10%を削除した。モデルは、Amazon Web Services上の256基のNvidia A100 GPUを使用して、合計15万GPU時間、コスト60万ドルで訓練された。

制限事項

Stable Diffusionには既知の制限があり、複雑なシーンの処理の難しさ、解剖学的な不正確さ(例えば手)、訓練データのバイアスなどが含まれる。また、データセットに存在する社会的バイアスを反映した画像を生成することもある。モデルはテキストレンダリングや細部の描写に苦労する場合があり、その性能はプロンプトによって異なる。2024年現在、進行中の研究が、微調整とアーキテクチャの改善を通じてこれらの問題に対処している。

影響と採用

2022年8月のStable Diffusionの公開リリースは、生成AIにおける重要な転換点を示し、高品質なテキストから画像への生成を幅広いユーザーに利用可能にした。そのオープンソースライセンスにより、開発者はアートツールから教育プラットフォームまで、さまざまなアプリケーションに統合できるようになった。モデルの効率性により、消費者向けハードウェアで動作し、趣味人や研究者のコミュニティを育成した。このリリースはまた、著作権、倫理、AI生成コンテンツの悪用の可能性に関する議論を引き起こした。Stability AIは、SD XLやSD 3.0などの改良版をリリースし続け、急速に進化する人工知能の分野での地位を維持している。

今後の方向性

Stable Diffusionの後続バージョンでは、SD 3.0のRectified Flow Transformerなど、品質と効率の向上を目指して異なるアーキテクチャが探求されている。バイアスの低減、制御性の向上、他のモダリティとの統合に関する研究が続けられている。モデルの成功は、他の機械学習プロジェクトに影響を与え、より広範なAIブームに貢献し、深層学習ニューラルネットワークに影響を与えている。2025年現在、Stable Diffusionはテキストから画像への生成におけるベンチマークであり続け、コミュニティと企業による継続的な開発が行われている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·text-to-image·open-source·deep-learning
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴