英語からの翻訳

Museは、Googleが開発したテキストから画像を生成する生成AIモデルで、2023年に発表されました。マスク付き生成トランスフォーマーを使用し、テキストプロンプトから高忠実度かつ高速に画像の生成と編集を行います。

Museは、Googleによって開発されたテキストから画像を生成する生成モデルであり、2023年1月の研究論文で初めて発表された。これはTransformerベースのモデルのファミリーに属し、テキスト記述から高解像度の画像を生成するように設計されている。Stable DiffusionDALL-Eのような拡散ベースのモデルとは異なり、Museは圧縮された画像空間内の離散トークン上で動作し、大規模言語モデルにおけるマスク言語モデリングに触発されたマスク生成アプローチを使用する。

このモデルは、GoogleとGoogle DeepMindの研究者によって開発され、ベクトル量子化とTransformerアーキテクチャにおける以前の研究に基づいている。これは「Muse: Text-To-Image Generation via Masked Generative Transformers」という論文で公開詳細が示され、MS-COCOのようなベンチマークでの最先端のパフォーマンスとゼロショット生成能力を実証した。GoogleはMuseを拡散モデルよりも効率的な代替手段として位置づけ、競争力のある画像品質を維持しながらより高速な推論時間を主張した。

アーキテクチャ

Museは2段階のパイプラインを使用する。まず、事前学習された変分オートエンコーダ(VAE)が画像を離散トークングリッドに圧縮する。これはVQGANやVQ-VAEで使用されるアプローチに類似している。次に、Transformerモデルがこのグリッド内のマスクされたトークンを予測するように訓練され、凍結された大規模言語モデル(具体的にはT5)によって生成されたテキスト埋め込みに条件付けられる。生成中、モデルはすべてのトークンがマスクされた状態から開始し、最も確信度の高いトークンを反復的に予測し、残りを数ステップで埋めていく。このマスクモデリング技術により並列デコードが可能となり、自己回帰モデルと比較して生成が高速化される。

テキストエンコーダは凍結されたT5-XXLモデルであり、豊かな意味表現を提供する。画像トークナイザーは大規模な画像データセットで訓練されたVAEであり、構成に応じて256x256または512x512のトークングリッドを生成する。Transformer自体は標準的なエンコーダ-デコーダアーキテクチャであり、テキスト埋め込みがエンコーダ入力、マスクされた画像トークンがデコーダ入力となる。

訓練とデータ

Museは、公開されているLAION-5BデータセットとGoogle内部データセットを含む大規模な画像テキストペアのコーパスで訓練された。訓練プロセスは2つの段階を含む。まず、VAEが画像のみで別途訓練され、次にTransformerがテキストとマスクされていないコンテキストが与えられたマスクされたトークンを予測するように訓練された。モデルはTPU v4ポッドで訓練され、最大のバリアントは30億パラメータを持つ。論文では、MuseがMS-COCOでゼロショットFIDスコア7.9を達成し、当時のGLIDEやDALL-E 2のような初期の拡散モデルを上回ったと報告された。

機能

このモデルは、テキストから画像への生成以外にもいくつかのタスクをサポートする。入力画像を部分的にマスクし、テキストプロンプトを提供することで局所的な変更を可能にする画像編集を実行できる。また、アウトペインティング(画像の境界を越えて拡張する)とインペインティング(欠落領域を埋める)もサポートする。さらに、Museは可変アスペクト比で画像を生成でき、特定のスタイルやドメインに合わせて微調整できる。論文では、Museが単一のTPU上で約1.5秒で高品質の512x512画像を生成できることを実証し、これは多くのノイズ除去ステップを必要とする拡散モデルよりも大幅に高速である。

他のモデルとの比較

MuseはしばしばDALL-E 2やImagenと比較されるが、これらは両方とも拡散プロセスを使用する。拡散モデルは徐々にノイズを追加および除去し、数百のステップを必要とする。対照的に、Museは反復的なマスク解除を伴う離散トークンアプローチを使用し、通常はわずか10〜20ステップしか必要としない。これにより、推論中により計算効率が高くなる。しかし、拡散モデルはその単純さと堅牢性のために、本番システムでより広く採用されている。Museの離散トークン空間への依存は、特に複雑なテクスチャや細かいディテールで、時折アーティファクトを引き起こすことがある。

評価と影響

Museは、画像領域でのマスクモデリングの革新的な使用に対して、研究コミュニティで好評を得た。これは、その後の離散拡散やトークンベース生成に関する研究に影響を与えた。しかし、Googleは後のモデルであるImagenGeminiとは異なり、Museを公開製品やAPIとしてリリースしなかった。コードと重みはオープンソース化されておらず、再現性が制限された。それにもかかわらず、Museからのアイデアは後のGoogleモデルに組み込まれ、PartiやMuseGANのようなオープンソースの取り組みに影響を与えた。

関連項目

参考文献

  • Chang, H., et al. (2023). "Muse: Text-To-Image Generation via Masked Generative Transformers." arXiv:2301.00704.
  • Google AI Blog. (2023). "Muse: A New Text-to-Image Model."
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·generative-ai·google-deepmind·transformer
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴