英語からの翻訳

VQGAN+CLIPは、ベクトル量子化生成対抗ネットワークとCLIPを組み合わせた生成AI手法であり、専用のトレーニングなしでテキストから画像への合成を可能にする。2021年には芸術的な画像生成で人気を博した。

VQGAN+CLIPは、Generative AIにおける技法であり、ベクトル量子化生成敵対ネットワーク(VQGAN)とCLIPモデルを組み合わせて、テキスト記述から画像を生成するものである。これは2021年初頭に、ゼロショットのテキストから画像への生成の顕著な例として登場し、新しいモデルをゼロから訓練するのではなく、事前学習済みのコンポーネントを活用した。この手法は、後の大規模な拡散モデルに先立ち、様式的でしばしば超現実的な画像を生成する能力により、アーティストや研究者の間で人気を博した。

このアプローチは、キャサリン・クロウソンらによってオープンソースコミュニティで導入され、ハイデルベルク大学のパトリック・エッサー、ロビン・ロンバッハ、ビョルン・オンマーによって開発されたVQGANモデルと、2021年1月にOpenAIが公開したCLIPモデルに基づいている。VQGAN+CLIPは、VQGANの潜在空間内の画像を反復的に最適化し、CLIPの対比的埋め込みによって測定される、画像と与えられたテキストプロンプトとの間の類似性を最大化する。この最適化は勾配降下法を用いて実行され、通常はAdam (Optimizer)または類似の変種が使用され、出力品質を向上させるためにData Augmentationなどの技法を組み込むことが多い。

メカニズム

中核となるメカニズムは、2つの事前学習済みNeural networkコンポーネントを含む。VQGANは、視覚トークンの離散コードブックを学習する生成モデルであり、画像を圧縮および再構築することができる。CLIPは、Transformer (architecture)ベースのモデルであり、画像とテキストの両方を共有埋め込み空間にエンコードし、意味的に類似したペアが近くに配置される。画像を生成するために、システムはランダムな潜在コードを初期化し、それをVQGANを通じて繰り返しデコードして画像を生成し、その画像とプロンプトとの間のCLIP類似性を計算し、勾配を逆伝播して潜在コードを更新する。このプロセスは、しばしば「CLIP誘導合成」と呼ばれ、数百回または数千回の反復で繰り返される。

主要な変種は、ImageNetなどの特定のデータセットで訓練されたVQGANを使用し、それが出力のスタイルと内容に影響を与える。最適化は通常、ピクセル空間ではなく潜在空間で実行され、計算効率が高く、より滑らかな勾配を可能にする。多くの実装は、コサイン類似性と、全変動損失などの追加の正則化項を組み合わせた「CLIP損失」と呼ばれる技法も採用し、一貫性のある画像を促進する。

歴史的背景

VQGAN+CLIPは、CLIPの公開とVQGANに関する初期の研究に続き、2021年春に注目を集めた。これは、専用の条件付きモデルを訓練することなく、既存のコンポーネントを再利用することで、高品質のテキストから画像への生成を達成できることを示した最初の方法の1つであった。これは、大規模なペアデータセットと広範な訓練を必要としたAttnGANやStackGANなどの初期のアプローチとは対照的であった。この手法のアクセシビリティ、つまり単一のコンシューマーGPUで実行できることは、生成されたアートワークをユーザーが共有したTwitterやRedditなどのオンラインコミュニティでの急速な採用に貢献した。

この技法はその後の研究にも影響を与えた。これは、DALL-E 2やStable Diffusionなどの後のモデルの前身であり、CLIPをガイダンスに使用するという同様のアイデアを採用したが、VQGANを拡散モデルに置き換えた。VQGAN+CLIPの反復最適化への依存は、フィードフォワード生成器よりも遅くしたが、プロンプトエンジニアリングとパラメータ調整を通じて細かい制御を提供した。

アプリケーションと制限

主なアプリケーションには、芸術的創作、コンセプトアート、ミーム生成が含まれた。アーティストは、テキストプロンプトから視覚的なアイデアを探求するためにこれを使用し、複数のプロンプトを組み合わせたり、「プロンプト重み付け」を使用して特定の側面を強調したりすることが多かった。また、インタラクティブインスタレーションやクリエイティブコーディングのツールとしても使用された。しかし、この手法には顕著な制限があった。出力はしばしば低解像度(通常256x256ピクセル)であり、アーティファクトが発生しやすく、実行間で一貫性がない可能性があった。最適化プロセスは局所的最小値に陥り、反復的または無意味な画像を生成する可能性があった。さらに、学習率、反復回数、拡張強度などのハイパーパラメータの慎重な調整が必要であった。

後のDiffusion modelベースのシステムと比較して、VQGAN+CLIPは細部を備えたフォトリアリスティックな画像を生成する能力を欠いていた。その強みは、抽象的な、絵画的な、または夢のような結果を生成することにあり、多くのユーザーが美的に魅力的だと感じた。この手法はまた、各生成に完全な最適化ループが必要であったため、画像あたりの計算コストが比較的高かった。

レガシー

VQGAN+CLIPは、2021年から2022年にかけてのGenerative AIの急速な進化における画期的な出来事と見なされている。これは、新しいタスクのために大規模な事前学習済みモデルを組み合わせる力、つまりMachine learning研究の中心となったパラダイムを示した。2022年までに拡散モデルに大部分が取って代わられたが、歴史的に重要であり、その独特の美学のためにニッチなアプリケーションで今も使用されている。キャサリン・クロウソンやライアン・マードックによるオープンソース実装はアーカイブされており、学術文献で参照され続けている。

この技法はまた、OpenAIのCLIPが元の分類目的を超えた多用途ツールとして重要であることを強調し、後の画像編集や検索の研究に影響を与えた。これは、ゼロショット学習と基盤モデルの再利用という広範なトレンドに貢献し、後にArtificial intelligence研究の支配的なテーマとなった。

技術的詳細

典型的なVQGAN+CLIP実装は、16384のコードブックサイズと256の潜在次元を持つVQGANを使用し、256x256解像度のImageNetで訓練される。使用されるCLIPモデルは通常ViT-B/32またはViT-B/16であり、画像を512次元の埋め込みにエンコードする。最適化ループは50から500回の反復で実行され、潜在空間での学習率は約0.1である。ランダムクロップやフリップなどのデータ拡張は、特定のピクセルパターンへの過適合を減らすために、CLIP損失を計算する前にデコードされた画像に適用される。一部の実装では、複数のランダムクロップが評価され平均化される「カットアウト」技法を使用する。最終画像は最適化された潜在コードからデコードされ、別の方法を使用してアップスケールできる。

人気のある「CLIP Guided Diffusion」や「VQGAN-CLIP」ノートブックを含むいくつかのソフトウェアパッケージが、この方法を簡単に使用できるようにした。これらには、テキストプロンプトが反復中に変化するプロンプトスケジューリングや、開始画像から生成をガイドする「初期画像」などの機能が含まれることが多かった。この方法の柔軟性と低い参入障壁は、その広範な採用の鍵であった。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·text-to-image·neural-networks·computer-vision
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴