Stable Diffusionは、2022年にStability AIが公開した、拡散技術に基づく深層学習のテキストから画像へのモデルである。主にテキスト記述に基づいて詳細な画像を生成するために使用されるが、インペインティング、アウトペインティング、テキストプロンプトに導かれた画像から画像への変換などのタスクにも適用できる。このモデルは進行中の生成AIブームの一部と見なされ、クラウドサービス経由でのみアクセス可能だったDALL-EやMidjourneyなどの従来のプロプライエタリなテキストから画像へのモデルからの転換点となった。
Stable Diffusionは、深層生成人工ニューラルネットワークの一種である潜在拡散モデルである。そのコードとモデルの重みは公開され、最適化版は2.4 GB VRAMというわずかな容量の控えめなGPUを備えたほとんどのコンシューマーハードウェアで実行できる。このアクセシビリティは、以前のモデルとは一線を画し、広範な採用に貢献した。
開発
Stable Diffusionは、ドイツのLMUミュンヘン大学とハイデルベルク大学の研究者によって開発された、潜在拡散と呼ばれるプロジェクトに由来する。元の5人の著者のうち4人、ロビン・ロンバッハ、アンドレアス・ブラットマン、パトリック・エッサー、ドミニク・ローレンツは、後にStability AIに加わり、モデルの後続バージョンをリリースした。技術ライセンスはLMUミュンヘン大学のCompVisグループによってリリースされ、開発はRunwayのパトリック・エッサーと、以前に潜在拡散アーキテクチャを発明したCompVisのロビン・ロンバッハが主導した。Stability AIはまた、トレーニングデータセットを構築したドイツの非営利団体であるEleutherAIとLAIONを支援者として挙げている。
技術
アーキテクチャ
2015年に導入された拡散モデルは、トレーニング画像にガウスノイズを連続的に適用して除去するようにトレーニングされており、これは一連のノイズ除去オートエンコーダに似ている。この名前は熱力学的拡散に由来し、初期の開発は熱力学に触発された。SD 3以前のStable Diffusionシリーズのモデルは、2021年にLMUミュンヘン大学のCompVisグループによって開発された潜在拡散モデル(LDM)と呼ばれる変種を使用していた。
Stable Diffusionは、変分オートエンコーダ(VAE)、U-Net、オプションのテキストエンコーダの3つの部分で構成される。VAEエンコーダは、画像をピクセル空間からより小さな潜在空間に圧縮し、基本的な意味論的意味を捉える。ガウスノイズは、前方拡散中に圧縮された潜在表現に反復的に適用される。ResNetバックボーンで構成されるU-Netブロックは、出力をノイズ除去して潜在表現を取得し、VAEデコーダは表現をピクセル空間に戻すことで最終画像を生成する。
ノイズ除去ステップは、クロスアテンション機構を介して、テキスト、画像、または他のモダリティに条件付けることができる。テキスト条件付けの場合、固定された事前トレーニング済みのCLIP ViT-L/14テキストエンコーダが、プロンプトを埋め込み空間に変換する。研究者は、トレーニングと生成のための計算効率の向上をLDMの利点として指摘している。U-Netに8億6000万パラメータ、テキストエンコーダに1億2300万パラメータを持つStable Diffusionは、2022年の基準では比較的軽量であり、コンシューマーGPU、またはOpenVINOバージョンではCPUのみでも実行できる。
#### SD XL
XLバージョンは同じLDMアーキテクチャを使用するが、より大きい、より大きなUNetバックボーン、より大きなクロスアテンションコンテキスト、1つではなく2つのテキストエンコーダ、および複数のアスペクト比でのトレーニングを備えている。同時にリリースされたSD XL Refinerは同じアーキテクチャを持つが、テキスト条件付きimg2imgを介して既存画像に細部を追加するためにトレーニングされた。
#### SD 3.0
3.0バージョンはバックボーンを完全に変更し、UNetではなくRectified Flow Transformerを使用する。アーキテクチャには、元のテキストエンコーディング、変換されたテキストエンコーディング、潜在空間での画像エンコーディングの3つのトラックがあり、後者の2つは各トランスフォーマーブロック中に混合される。これは「マルチモーダル拡散トランスフォーマー」(MMDiT)と名付けられ、以前のDiTバージョンではテキストが画像に影響を与えるがその逆はないのに対し、内部でテキストと画像のエンコーディングを混合することを反映している。
トレーニングデータ
Stable Diffusionは、Common Crawlのウェブデータから派生した公開データセットであるLAION-5Bの画像とキャプションのペアでトレーニングされた。LAION-5Bには、言語別に分類され、解像度、透かしの可能性、予測される美的スコアでフィルタリングされた50億の画像とテキストのペアが含まれる。このデータセットは、Stability AIから資金提供を受けたドイツの非営利団体であるLAIONによって作成された。モデルは、laion2B-en、laion-high-resolution、laion-aesthetics v2 5+の3つのサブセットでトレーニングされた。1200万画像の小さなサブセットの第三者分析では、約47%が100のドメインから来ており、Pinterestが8.5%を占め、以下WordPress、Blogspot、Flickr、DeviantArt、Wikimedia Commonsが続いた。Bayerischer Rundfunkによる調査では、Hugging FaceでホストされているLAIONのデータセットには、大量のプライベートで機密性の高いデータが含まれていることが示された。
トレーニング手順
モデルは最初にlaion2B-enとlaion-high-resolutionでトレーニングされ、最終ラウンドでは、人間の評価者から5/10以上のスコアを獲得すると予測された6億のキャプション付き画像のサブセットであるLAION-Aesthetics v2 5+でトレーニングされた。このサブセットは、低解像度の画像と、予測される透かし確率が80%を超える画像を除外した。最終トレーニングラウンドでは、Classifier-Free Diffusion Guidanceを改善するために、テキスト条件付けの10%を削除した。モデルは、Amazon Web Services上で256基のNvidia A100 GPUを使用して15万GPU時間でトレーニングされ、コストは60万ドルだった。
制限
Stable Diffusionには、手やテキストのレンダリングが難しいなどの劣化に関する既知の問題があり、トレーニングデータのために偏ったまたは有害なコンテンツを生成する可能性がある。公開リリースは、ディープフェイクや著作権侵害などの悪用に関する懸念を引き起こし、機械学習コミュニティでの規制と倫理的使用に関する進行中の議論につながった。
影響
2022年のStable Diffusionのリリースは、深層学習アート運動を大幅に加速させ、趣味人やアーティストが個人のハードウェアで高品質の画像を生成できるようにした。これはその後のテキストから画像へのモデルに影響を与え、アート、デザイン、コンテンツ作成のアプリケーションを備えたより広範なAIブームに貢献した。このモデルのオープンソースの性質は、コミュニティツールと微調整されたバリアントの大規模なエコシステムを育成したが、知的財産と創造的作業の未来に関する議論も引き起こした。
評価と遺産
このモデルは、技術的な成果とアクセシビリティで広く注目を集めた。効率性と品質で賞賛されたが、潜在的な悪用についても批判された。2025年の時点で、Stable Diffusionは生成AIの基礎的なリファレンスであり続け、Stability AIとオープンソースコミュニティによる継続的な開発が行われている。そのアーキテクチャとトレーニングアプローチは、その後の多くのモデルで採用され、この分野での遺産を確固たるものにしている。