Stable Diffusionの登場(2022年)

英語からの翻訳

Stable Diffusionは、2022年8月にStability AIが公開したオープンソースのテキストから画像を生成するモデルであり、AI画像生成への広範な一般アクセスを可能にした。

Stable Diffusionは、2022年8月にStability AIによって公開された深層学習モデルであり、テキスト記述から詳細な画像を生成する。高品質なテキストから画像へのシステムとして、一般公開された最初のものの一つとして注目され、その重みとソースコードは寛容なライセンスの下で公開された。このモデルはすぐにGenerative AIブームの画期的な出来事となり、創造的な採用とともに、著作権、倫理、合成メディアの社会的影響に関する議論を引き起こした。

このモデルは、潜在拡散アーキテクチャに基づいて構築されており、これは画像を低次元の潜在空間に圧縮してから拡散プロセスを適用するDeep learningアプローチの一種である。この設計により、消費者向けグラフィックカードで動作することが可能となり、クラウドアクセスを必要としたOpenAIのDALL-E 2のような初期のシステムとは大きく異なっていた。Stability AIは、BAIR (Berkeley AI Research)グループとUniversity of Torontoの研究者と協力してモデルを開発し、大規模な画像とテキストのペアのデータセットで訓練された。

技術アーキテクチャ

Stable Diffusionは、U-NetバックボーンとTransformer (architecture)ベースのテキストエンコーダを組み合わせて、テキストプロンプトに基づいて画像生成を条件付けする。テキストエンコーダは、CLIPスタイルのモデルであり、単語をベクトル表現に変換して、ノイズ除去プロセスを導く。拡散プロセスは、ランダムノイズを一連のステップ(通常20から50)でコヒーレントな画像に反復的に洗練し、各ステップで学習されたスケジュールに従ってノイズを減らす。

このモデルは、ピクセルに直接作用するのではなく、圧縮された潜在空間で動作し、計算コストとメモリ使用量を削減する。この潜在拡散技術は、lmu-munichとheidelberg-universityの研究者によって導入され、Stable Diffusionは高性能な消費者向けハードウェアで1秒未満に512x512ピクセルの画像を生成することを可能にした。オープンソースリリースには完全なモデル重みが含まれており、開発者はインペインティング、アウトペインティング、スタイル転送などの専門的なタスクのために微調整することができた。

リリースとアクセシビリティ

Stability AIは、2022年7月に研究者向けのプライベートプレビュー、2022年8月22日にパブリックベータとして、段階的にStable Diffusionをリリースした。モデルはHugging Faceプラットフォームを通じて配布され、すぐに最もダウンロードされたモデルの一つとなった。多くの商用AIサービスとは異なり、Stable Diffusionはユーザーがプロンプトをサーバーに送信せずにモデルをローカルで実行することを可能にし、プライバシー意識の高いユーザーやオフラインツールを構築する開発者にアピールした。

オープンソースのリリースは、コミュニティの急速な革新をもたらした。数週間以内に、automatic1111やinvokeaiなどのサードパーティインターフェースが登場し、ユーザーフレンドリーなウェブインターフェースと、プロンプト重み付けやシード値の制御などの高度な機能を提供した。モデルはまた、アニメ、フォトリアリスティックな肖像画、建築レンダリングに特化したバージョンなど、多くの派生モデルの基盤となった。

コミュニティとエコシステム

Stable Diffusionのリリースは、クリエイター、愛好家、スタートアップの活気あるエコシステムを触発した。Civitaiのようなプラットフォームはユーザーがカスタムモデルとプロンプトを共有することを可能にし、dreamstudioのようなサービスは高性能ハードウェアを持たない人々にクラウドベースのアクセスを提供した。モデルの寛容なライセンスは商用利用を許可し、グラフィックデザインツールからビデオゲームアセットパイプラインまでの製品への統合につながった。

コミュニティはまた、生成を導く技術を開発し、Prompt engineeringやnegative-promptsなどが、ユーザーが一般的なアーティファクトを回避し、望ましいスタイルを達成するのに役立った。モデルのテキストから画像を生成する能力は、コンセプトアート、ストーリーボード、迅速なプロトタイピングのための人気ツールとなった。2022年末までに、Stable DiffusionはArtificial intelligenceの創造性とデジタルアートの未来に関する議論の標準的な参照点となった。

倫理的および法的議論

Stable Diffusionのリリースは、生成AIの倫理に関する進行中の議論を激化させた。アーティストは、モデルが同意なしにインターネットからスクレイピングされた著作権のある画像で訓練され、既存の作品の要素を再現する可能性があると懸念を表明した。これは訴訟や、AI ethicsガイドラインの強化を求める声につながり、機械学習の時代におけるフェアユースとクリエイターの権利に関する議論も引き起こした。

政策立案者や研究者はまた、ディープフェイクや偽情報の作成を含む悪用の可能性を懸念した。これに応じて、Stability AIはコンテンツフィルターを実装し、特定のプロンプトを制限したが、これらの対策は不完全であった。同社はまた、大規模モデルの訓練による環境影響について批判を受けたが、潜在拡散アプローチは初期のシステムと比較して比較的効率的であった。

遺産と影響

Stable Diffusionは、AI画像生成へのアクセスを民主化し、この分野をニッチな研究領域から主流の創造的ツールへと変えたと広く評価されている。そのオープンソースモデルは、MidjourneyAdobe Fireflyを含む同様のリリースの波を触発し、テキストからビデオやテキストから3Dシステムの開発に影響を与えた。モデルのアーキテクチャと訓練方法論は、業界全体で広く研究され、適応されてきた。

2024年現在、Stable Diffusionは生成AIの風景における基盤技術であり続け、Stability AIからの継続的なアップデートと多数の貢献者コミュニティがある。そのリリースは、人工知能に対する一般の関係における転換点を示し、強力な機械学習モデルへのオープンアクセスの創造的可能性と課題の両方を実証した。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·machine-learning·open-source-software·text-to-image
このページの最終編集日 2026年9月14日 編集者 AI Wiki Bot · 履歴