Stable Diffusion リリース

英語からの翻訳

Stable Diffusionは、2022年にStability AIによって公開されたオープンソースの深層学習テキスト・トゥ・イメージモデルであり、消費者向けハードウェア上で動作することで生成アートを普及させた。潜在拡散を用いて、テキストプロンプトから詳細な画像を生成する。

Stable Diffusionは、2022年に公開された拡散技術に基づく深層学習のテキストから画像への変換モデルである。この生成AI技術はStability AIの主力製品であり、進行中のAIブームの一部と見なされている。主にテキスト記述に基づいて詳細な画像を生成するために使用されるが、インペインティング、アウトペインティング、テキストプロンプトに導かれた画像間変換の生成などの他のタスクにも適用できる。その開発には、ミュンヘン大学(LMU)のCompVisグループとRunwayの研究者が関与し、Stabilityからの計算リソースの提供と非営利団体からのトレーニングデータを受けた。

Stable Diffusionは潜在拡散モデルであり、深層生成人工ニューラルネットワークの一種である。そのコードとモデル重みは公開されており、最適化版は2.4 GB VRAMというわずかな容量の控えめなGPUを備えたほとんどの消費者向けハードウェアで実行できる。これは、クラウドサービス経由でのみアクセス可能だったDALL-EやMidjourneyなどの以前の独自テキストから画像への変換モデルからの脱却を示した。

開発

Stable Diffusionは、ドイツのミュンヘン大学とハイデルベルク大学の研究者によって開発された「潜在拡散」と呼ばれるプロジェクトに由来する。当初の5人の著者のうち4人(ロビン・ロンバッハ、アンドレアス・ブラットマン、パトリック・エッサー、ドミニク・ローレンツ)は後にStability AIに加わり、Stable Diffusionの後続バージョンをリリースした。モデルの技術ライセンスはミュンヘン大学のCompVisグループによって公開された。開発はRunwayのパトリック・エッサーとCompVisのロビン・ロンバッハが主導し、彼らはStable Diffusionで使用される潜在拡散モデルアーキテクチャを以前に発明した研究者の一部でもあった。Stability AIはまた、Stable Diffusionのトレーニングに使用されたデータセットを構築したドイツの非営利団体であるEleutherAIとLAIONをプロジェクトの支援者として挙げている。

2022年のStable Diffusionのリリースは、Generative AIツールのアクセシビリティにおける重要な転換を示した。クラウドアクセスを必要とした初期のモデルとは異なり、Stable Diffusionはローカルで実行でき、より広範なアーティストや開発者のコミュニティがテキストから画像への生成を実験できるようにした。これは急速な採用と、さまざまなオンラインプラットフォームでのAI生成アートの普及に貢献した。

技術

アーキテクチャ

2015年に導入された拡散モデルは、トレーニング画像へのガウスノイズの連続的な適用を除去する目的でトレーニングされ、これは一連のノイズ除去オートエンコーダーと考えることができる。「拡散」という名前は熱力学的拡散に由来し、最初は熱力学からの着想で開発されたためである。SD 3以前のStable Diffusionシリーズのモデルはすべて、2021年にミュンヘン大学のCompVis(コンピュータビジョンおよび学習)グループによって開発された潜在拡散モデル(LDM)と呼ばれる拡散モデルの変種を使用していた。

Stable Diffusionは3つの部分で構成される:変分オートエンコーダー(VAE)、U-Net、およびオプションのテキストエンコーダーである。VAEエンコーダーは画像をピクセル空間からより小さな次元の潜在空間に圧縮し、画像のより基本的な意味的意味を捉える。ガウスノイズは、前方拡散中に圧縮された潜在表現に反復的に適用される。ResNetバックボーンで構成されるU-Netブロックは、前方拡散の出力を逆方向にノイズ除去して潜在表現を取得する。最後に、VAEデコーダーは表現をピクセル空間に変換して最終画像を生成する。

ノイズ除去ステップは、テキスト文字列、画像、または他のモダリティに柔軟に条件付けできる。エンコードされた条件付けデータは、クロスアテンションメカニズムを介してノイズ除去U-Netに公開される。テキストへの条件付けには、固定された事前トレーニング済みのCLIP ViT-L/14テキストエンコーダーを使用して、テキストプロンプトを埋め込み空間に変換する。研究者は、トレーニングと生成の計算効率の向上をLDMの利点として挙げている。U-Netに8億6000万パラメータ、テキストエンコーダーに1億2300万パラメータを持つStable Diffusionは、2022年の基準では比較的軽量と見なされ、他の拡散モデルとは異なり、消費者向けGPUで実行でき、OpenVINOバージョンのStable Diffusionを使用すればCPUのみでも実行できる。

#### SD XL

XLバージョンは以前のバージョンと同じLDMアーキテクチャを使用しているが、より大きい:より大きなUNetバックボーン、より大きなクロスアテンションコンテキスト、1つではなく2つのテキストエンコーダー、および複数のアスペクト比(以前のバージョンのような正方形のアスペクト比だけでなく)でトレーニングされている。同時にリリースされたSD XL RefinerはSD XLと同じアーキテクチャを持つが、テキスト条件付きimg2imgを介して既存画像に細部を追加するためにトレーニングされた。

#### SD 3.0

3.0バージョンはバックボーンを完全に変更する。UNetではなく、Transformer (architecture)で整流フロー法を実装したRectified Flow Transformerである。SD 3.0に使用されるTransformerアーキテクチャには、元のテキストエンコーディング、変換されたテキストエンコーディング、および画像エンコーディング(潜在空間内)の3つの「トラック」がある。変換されたテキストエンコーディングと画像エンコーディングは、各トランスフォーマーブロック中に混合される。このアーキテクチャは「マルチモーダル拡散トランスフォーマー(MMDiT)」と呼ばれ、「マルチモーダル」はその操作内でテキストと画像のエンコーディングを混合することを意味する。これは、テキストエンコーディングが画像エンコーディングに影響を与えるが、その逆はない以前のDiTバージョンとは異なる。

トレーニングデータ

Stable Diffusionは、ウェブからスクレイピングされたCommon Crawlデータから派生した公開データセットであるLAION-5Bから取得した画像とキャプションのペアでトレーニングされた。そこでは50億の画像テキストペアが言語に基づいて分類され、解像度、透かしを含む予測確率、および予測された「美的」スコア(例:主観的な視覚品質)によって別々のデータセットにフィルタリングされた。このデータセットは、Stability AIから資金提供を受けるドイツの非営利団体であるLAIONによって作成された。Stable Diffusionモデルは、LAION-5Bの3つのサブセット(laion2B-en、laion-high-resolution、およびlaion-aesthetics v2 5+)でトレーニングされた。モデルのトレーニングデータの第三者分析により、元のより広いデータセットから取得した1200万画像の小さなサブセットのうち、サンプルサイズの約47%が100の異なるドメインから来ており、Pinterestがサブセットの8.5%を占め、次いでWordPress、Blogspot、Flickr、DeviantArt、Wikimedia Commonsなどのウェブサイトが続くことが特定された。バイエルン放送による調査では、Hugging FaceでホストされているLAIONのデータセットには、大量のプライベートおよび機密データが含まれていることが示された。

トレーニング手順

モデルは最初にlaion2B-enおよびlaion-high-resolutionサブセットでトレーニングされ、最後の数ラウンドのトレーニングはLAION-Aesthetics v2 5+で行われた。これは、LAION-Aesthetics Predictor V2が、人間が平均して5/10以上のスコアを与えると予測した6億のキャプション付き画像のサブセットである。LAION-Aesthetics v2 5+サブセットはまた、低解像度の画像と、LAION-5B-WatermarkDetectionが80%以上の確率で透かしを運ぶと特定した画像を除外した。最終ラウンドのトレーニングでは、Classifier-Free Diffusion Guidanceを改善するためにテキスト条件付けの10%をさらに削除した。モデルは、256台のNvidia A100 GPUを使用してAmazon Web Services上で合計15万GPU時間、コスト60万ドルでトレーニングされた。

影響と遺産

Stable Diffusionのコードと重みの公開リリースは、Artificial intelligenceとデジタルアートの分野に深遠な影響を与えた。強力なテキストから画像への生成へのアクセスを民主化し、個人や小規模チームが高価なクラウドインフラストラクチャなしで高品質の画像を作成できるようにした。これは、コンセプトアートやイラストから広告やゲームデザインに至るまで、クリエイティブアプリケーションの急増につながった。モデルはまた、開発者がますます控えめなハードウェアでモデルを実行しようとしたため、モデル圧縮や効率的な推論などの分野でMachine learningのさらなる研究を促進した。

Stable Diffusionはまた、著作権、データプライバシー、および悪用の可能性に関する重要な倫理的および法的問題を提起した。トレーニングのためのスクレイピングされたウェブデータの使用(著作権で保護された画像や個人情報を含む)は、議論と訴訟の対象となった。これらの懸念は、生成モデルの開発におけるより透明で責任あるデータプラクティスの必要性についての議論を促し、その後の分野での作業に影響を与えた。

制限事項

Stable Diffusionには、特に複雑なシーンやテキストを生成する際に、劣化やアーティファクトの問題がある。解剖学的正確さに苦労し、歪んだ手や顔を持つ画像を生成することがあり、画像内のテキストを正確にレンダリングできない場合がある。モデルのパフォーマンスはトレーニングデータの品質と多様性にも依存しており、生成された画像にバイアスをもたらす可能性がある。さらに、SD 3.0のような大規模モデルのトレーニングと微調整の計算コストは依然として大きく、一部の研究者や開発者の実験を制限している。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·text-to-image·deep-learning·open-source
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴