Stable Diffusionは、2022年8月にリリースされた拡散技術に基づく深層学習のテキストから画像へのモデルである。これはStability AIの主力製品であり、進行中のAIブームの一部と見なされている。このモデルは、テキスト記述に条件付けられた詳細な画像を生成し、インペインティング、アウトペインティング、テキストプロンプトによる画像から画像への変換などのタスクもサポートする。その開発には、LMUミュンヘンのCompVisグループとRunwayの研究者が関与し、Stability AIからの計算リソースの提供と、非営利団体からのトレーニングデータが使用された。
Stable Diffusionは、潜在拡散モデルであり、深層生成人工ニューラルネットワークの一種である。そのコードとモデル重みは公開され、最適化されたバージョンは、わずか2.4 GBのVRAMを備えた控えめなGPUを搭載したほとんどの消費者向けハードウェアで動作する。これは、クラウドサービス経由でのみアクセス可能だったDALL-EやMidjourneyのような独自のテキストから画像へのモデルからの脱却であり、Stable Diffusionを個人ユーザーや研究者に広く利用可能にした。
開発
Stable Diffusionは、ドイツのLMUミュンヘンとハイデルベルク大学の研究者によって開発された「潜在拡散」と呼ばれるプロジェクトに由来する。元の5人の著者のうち4人(ロビン・ロンバッハ、アンドレアス・ブラットマン、パトリック・エッサー、ドミニク・ロレンツ)は、後にStability AIに加わり、その後のバージョンをリリースした。技術ライセンスは、LMUミュンヘンのCompVisグループによってリリースされた。開発は、Runwayのパトリック・エッサーとCompVisのロビン・ロンバッハが主導し、彼らは以前に潜在拡散アーキテクチャを発明していた。Stability AIはまた、トレーニングデータセットを構築したドイツの非営利団体であるEleutherAIとLAIONをプロジェクト支援者として挙げている。
技術
アーキテクチャ
2015年に導入された拡散モデルは、トレーニング画像にガウスノイズを連続的に適用することを除去するように訓練されており、一連のデノイジングオートエンコーダーとして機能する。この名前は熱力学的拡散に由来し、その技術は熱力学に触発されたものである。SD 3より前のStable Diffusionシリーズのモデルは、2021年にLMUミュンヘンのCompVisグループによって開発された潜在拡散モデル(LDM)と呼ばれる変種を使用していた。
Stable Diffusionは、変分オートエンコーダー(VAE)、U-Net、およびオプションのテキストエンコーダーの3つの部分で構成される。VAEエンコーダーは、画像をピクセル空間からより小さな次元の潜在空間に圧縮し、意味論的な意味を捉える。ガウスノイズは、前方拡散中に圧縮された潜在表現に反復的に適用される。ResNetバックボーンで構成されるU-Netブロックは、出力を後方にデノイズして潜在表現を得る。最後に、VAEデコーダーは、表現をピクセル空間に変換して最終画像を生成する。
デノイジングステップは、テキスト、画像、または他のモダリティに条件付けることができる。エンコードされた条件付けデータは、Cross-Attentionメカニズムを介してデノイジングU-Netに公開される。テキスト条件付けの場合、固定された事前トレーニング済みのCLIP ViT-L/14テキストエンコーダーがプロンプトを埋め込み空間に変換する。研究者は、トレーニングと生成のための計算効率の向上をLDMの利点として挙げている。
U-Netに8億6000万パラメータ、テキストエンコーダーに1億2300万パラメータを持つStable Diffusionは、2022年の基準では比較的軽量である。他の拡散モデルとは異なり、消費者向けGPUで動作し、OpenVINOバージョンではCPUのみでも動作する。
#### SD XL
XLバージョンは同じLDMアーキテクチャを使用するが、より大きい:より大きなUNetバックボーン、より大きなクロスアテンションコンテキスト、1つではなく2つのテキストエンコーダー、そして正方形のみではなく複数のアスペクト比でのトレーニング。同時にリリースされたSD XL Refinerは同じアーキテクチャを持つが、テキスト条件付きimg2imgを介して既存の画像に細部を追加するために訓練された。
#### SD 3.0
3.0バージョンはバックボーンを完全に変更する。これは、Transformer (architecture)アーキテクチャで整流フロー法を実装したRectified Flow Transformerを使用する。アーキテクチャには3つのトラックがある:元のテキストエンコーディング、変換されたテキストエンコーディング、および潜在空間での画像エンコーディング。変換されたテキストエンコーディングと画像エンコーディングは、各トランスフォーマーブロック中に混合される。これは「マルチモーダル拡散トランスフォーマー(MMDiT)」と呼ばれ、マルチモーダルとは、以前のDiTバージョン(テキストエンコーディングが画像エンコーディングに影響を与えたが、その逆はなかった)とは異なり、その操作内でテキストと画像のエンコーディングを混合することを意味する。
トレーニングデータ
Stable Diffusionは、Common Crawlのウェブスクレイピングから派生した公開データセットであるLAION-5Bからの画像キャプションペアで訓練された。50億の画像テキストペアは、言語ごとに分類され、解像度、予測される透かしの可能性、および予測される「美的」スコアによってデータセットにフィルタリングされた。Stability AIから資金提供を受けたドイツの非営利団体LAIONがデータセットを作成した。モデルは、laion2B-en、laion-high-resolution、およびlaion-aesthetics v2 5+の3つのサブセットで訓練された。
1200万画像の小さなサブセットの第三者分析では、約47%が100のドメインから来ており、Pinterestが8.5%を占め、次いでWordPress、Blogspot、Flickr、DeviantArt、Wikimedia Commonsが続いた。Bayerischer Rundfunkによる調査では、Hugging FaceでホストされているLAIONのデータセットには、大量のプライベートおよび機密データが含まれていることが示された。
トレーニング手順
モデルは最初にlaion2B-enとlaion-high-resolutionで訓練され、最終ラウンドはLAION-Aesthetics v2 5+(人間の美的評価で少なくとも5/10を受けると予測された6億のキャプション付き画像のサブセット)で行われた。このサブセットは、低解像度の画像と透かし検出確率が80%を超える画像を除外した。最終トレーニングラウンドでは、Classifier-Free Diffusion Guidanceを改善するためにテキスト条件付けの10%を削除した。トレーニングには、Amazon Web Services上の256個のNvidia A100 GPUが使用され、15万GPU時間、コストは60万ドルだった。
制限事項
Stable Diffusionには、特に複雑なシーン、人体解剖学、テキストレンダリングにおいて、劣化やアーティファクトの問題がある。トレーニングデータからのバイアス(ステレオタイプや有害なコンテンツを含む)を再現する可能性がある。このモデルは、手や顔などの細部に苦労し、しばしば歪んだ結果を生成する。また、複数のオブジェクトや特定の空間関係を含む構成的なプロンプトにも困難がある。2024年現在、新しいバージョンはいくつかの制限に対処しているが、これらの分野では依然として課題に直面している。
影響と評価
2022年8月のStable Diffusionの公開リリースは、生成AIの倫理、著作権、芸術的労働に関する広範な議論を引き起こした。そのオープンソースの性質により、開発者は機械学習実験、データ拡張、クリエイティブワークフローのためのツールを作成できた。消費者向けハードウェアでのモデルのアクセシビリティは、AIアートコミュニティと商業アプリケーションの急増に貢献した。Stability AIは、2023年のSD XLや2024年のSD 3.0を含むその後のバージョンをリリースし、それぞれ品質と機能を向上させた。このモデルはまた、政策議論に影響を与え、AI規制とコンテンツの出所に関する議論につながった。