Parti-20Bは、テキストから画像を生成するための200億パラメータのAIモデルであり、Google Researchによって開発された。これはPartiファミリーに属し、画像生成をシーケンス間問題として扱い、Transformer (architecture)エンコーダがテキストを処理し、デコーダが視覚トークンを予測する。Parti-20Bはこのシリーズで最大のバリアントであり、複雑なプロンプトから高精細で意味的に整合性のある画像を生成するように設計されている。
このモデルはSequence-to-Sequence (Seq2Seq)学習の概念に基づいており、テキスト入力を画像トークンのグリッドにマッピングするニューラルネットワークアーキテクチャを活用している。拡散ベースのアプローチとは異なり、Parti-20Bは自己回帰デコーダを使用し、画像パッチを順次生成する。この設計により、モデルサイズに応じて効果的にスケールし、忠実度と構成的理解を向上させることができる。
アーキテクチャとトレーニング
Parti-20BはEncoder-Decoder Architectureトランスフォーマーを採用しており、エンコーダはMulti-Head AttentionとPositional Encodingを使用してテキストプロンプトを処理する。デコーダはその後、学習されたコードブックを介してピクセルにマッピングされる離散的な視覚トークンのシーケンスを予測する。トレーニングには大規模な画像テキストペアのデータセットが使用され、Adam (Optimizer)とLearning Rate Schedulingを用いた最適化が行われる。モデルは安定性のためにLayer NormalizationとDropoutを使用し、大規模トレーニングを処理するためにGradient Clippingを採用している。
自己回帰生成プロセスはBeam SearchやTop-K Sampling、Top-P (Nucleus) Samplingなどのサンプリング戦略に依存し、Temperature Scalingを使用して多様性を制御する。Parti-20Bの規模により、テクスチャや空間関係などの細かい詳細を捉えることができ、これは小さなモデルでは見逃されることがある。
能力とパフォーマンス
Parti-20Bは、複数のオブジェクト、属性、空間的制約を含む複雑なプロンプトに従うことに優れている。写実的な画像、芸術的なスタイル、斬新な構図を生成できる。以前のモデルと比較して、ゼロショット汎化において顕著な改善を示しており、微調整なしで未見のプロンプトを処理できる。モデルはまた、堅牢性を高めるためにトレーニング中にData Augmentationをサポートしている。
ベンチマーク評価では、Parti-20Bはテキストから画像へのタスクで最先端の結果を達成し、FID(Fréchet Inception Distance)と人間の好みスコアの点で多くの同時代のモデルを上回った。その200億パラメータにより、より広範な視覚概念を表現できるが、推論にはかなりの計算リソースが必要である。
他のモデルとの関係
Parti-20Bは、DALL-EやStable Diffusionなどのモデルと並ぶGenerative AIの広範なトレンドの一部である。拡散モデルとは異なり、自己回帰アプローチを使用しており、一部の研究者はこれがより良い制御性を提供すると主張している。このモデルはLarge language model技術に関連しており、トランスフォーマーのバックボーンと画像に適応されたトレーニング目的を共有している。また、より大きなモデルが一貫してパフォーマンスを向上させるスケーリング則に関するMachine learning研究にも関連している。
GoogleはParti-20Bを公開しておらず、内部研究と選ばれたパートナーにアクセスを制限している。これはオープンソースの取り組みとは対照的であるが、独自のAIシステムを開発する同社の戦略と一致している。このモデルのアーキテクチャは、トークン化とデコード効率の改善を含む、その後のテキストから画像への生成研究に影響を与えた。
制限と倫理的考慮事項
多くのテキストから画像へのモデルと同様に、Parti-20Bはフィルタリングされていないインターネットデータでトレーニングされた場合、偏ったまたは有害な出力を生成する可能性がある。また、まれな概念や曖昧なプロンプトに苦労することがあり、時には無意味な結果を生成することもある。200億パラメータモデルを実行する計算コストは高く、Google Cloud TPUやGPUなどの専門的なハードウェアが必要であり、アクセシビリティが制限される。
研究者は、プロンプトフィルタリングや出力モデレーションなどの安全対策の必要性を強調している。Parti-20Bの開発はまた、著作権や欺瞞的な画像作成における悪用の可能性についての疑問を提起している。2023年現在、これらの懸念はAIコミュニティで活発であり、責任ある展開を求める声が上がっている。
遺産と影響
Parti-20Bは、自己回帰モデルを数百億パラメータにスケールすることが画像生成に viable であることを実証し、ImagenやGeminiなどの後のモデルへの道を開いた。その成功は、Deep learningにおけるモデル規模の重要性を強化し、効率的なトランスフォーマーへのさらなる研究を促した。公開されていないが、その技術的貢献は研究論文で文書化されており、学術的および産業的な取り組みに影響を与えている。
画像をシーケンスとして扱うこのモデルのアプローチは、ビデオ生成や3Dシーン合成などの他の領域にも適用されている。Parti-20Bは、自己回帰と拡散ベースの生成モデルの間のトレードオフを理解するための参照点であり続け、その発見は次世代システムの設計に引き続き情報を提供している。