Imagenは、Google DeepMindによって開発された一連のテキストから画像を生成するモデルであり、自然言語のテキストプロンプトから高忠実度の画像を生成するように設計されている。これらのモデルは、Transformer (architecture)ベースの言語理解と拡散モデルによる画像生成の組み合わせを使用しており、DALL-EやStable Diffusionなどの著名な生成AIツールの中に位置づけられる。Imagenは、GeminiやVertex AIを含むさまざまなGoogleサービスを通じて利用可能であり、導入以来、いくつかの主要なバージョンリリースを経ている。
元のImagenモデルは、2022年5月に発表された研究論文で初めて提示され、2023年4月にDeepMindと合併する前のGoogle Brainチームによって開発された。その後のバージョンであるImagen 2とImagen 3は、それぞれ2023年12月と2024年8月にリリースされ、各イテレーションで画像品質、テキストレンダリング、ユーザー制御が改善された。2025年5月、Googleは年次のGoogle I/OカンファレンスでImagen 4を発表し、モデルの機能をさらに進化させた。
技術
Imagenのアーキテクチャは、2つの主要な技術に依存している。テキストエンコーディングのための凍結された大規模言語モデル(LLM)と、画像生成のためのカスケード型拡散モデルである。T5トランスフォーマーファミリーに基づくテキストエンコーダーは、入力プロンプトを画像合成プロセスを導く意味的埋め込みに変換する。拡散モデルはその後、一連の段階で動作し、低解像度の画像(64×64ピクセル)から始めて、段階的に高解像度にアップサンプリングし、最終的には初期バージョンで1024×1024ピクセルに達する。Imagen 4はこの機能を拡張し、最大2K解像度の画像を生成して、詳細と視覚的忠実度を向上させる。
カスケード設計により、モデルは画像を段階的に洗練し、テキストプロンプトとの整合性と一貫性を向上させることができる。このアプローチは単一段階モデルとは対照的であり、より効率的なトレーニングと高品質な出力を可能にする。凍結されたLLMの使用はまた、自然言語処理の進歩を活用し、Imagenが抽象的な概念やスタイル指示を含む複雑なプロンプトを理解することを可能にする。
機能
Imagenは、テキスト記述からフォトリアリスティックな画像を生成することに優れているが、シネマティック、35mmフィルム、イラスト、シュールレアリスムの美学など、幅広い芸術的スタイルもサポートしている。この多様性により、デジタルアート、広告、コンセプトデザインなどの創造的な用途に適している。モデルは、9:16、3:4、1:1、4:3、16:9を含む複数のアスペクト比で画像を生成でき、さまざまな表示形式やユースケースに対応する。
初期生成に加えて、Imagenは編集機能を提供し、ユーザーが新しいテキストプロンプトを提供することで既存の画像を洗練できるようにする。この機能により、ユーザーが画像全体を再生成することなく、構図、スタイル、または特定の要素を調整できる反復的な創造的ワークフローが可能になる。ただし、他のテキストから画像へのモデルと同様に、Imagenには人間の指、テキスト、アンビグラム、その他の複雑なタイポグラフィを正確にレンダリングするのが難しいという制限がある。これらの課題はこの分野で一般的であり、進行中の研究領域である。
関連項目
- 人工知能アート
- コンピュータアート
- ジェネレーティブアート
- DALL-E
- Midjourney
- Recraft
- Stable Diffusion