GPT 2.5 imageは、OpenAIが開発した、テキストから画像を合成するための生成人工知能モデルである。2025年にリリースされ、同社のLarge language model技術をマルチモーダル出力へ拡張するGPT-2.5シリーズの一部である。このモデルは、自然言語の記述からラスター画像を生成し、空間関係、タイポグラフィ、スタイルの一貫性を含む複雑なプロンプトを処理するように設計されている。
このモデルは、OpenAIの初期の画像生成システムに対する段階的なアップデートとして導入され、Transformer (architecture)アーキテクチャとNeural networkトレーニングの進歩を組み込んでいる。OpenAIのAPIおよび消費者向け製品を通じて利用可能であるが、具体的なパラメータ数やトレーニングデータセットの規模は公式には公開されていない。公開デモでは、歴史的に生成モデルにとって課題であった、画像内の判読可能なテキストをレンダリングする能力が強調された。
アーキテクチャとトレーニング
GPT 2.5 imageは、テキスト生成用のGPT-2.5モデルから適応された、Transformer (architecture)ベースのEncoder-Decoder Architectureフレームワークを使用している。画像生成プロセスは離散潜在表現を採用し、連続的な視覚特徴を有限の語彙にトークン化することで、モデルが画像トークンを順次予測できるようにしている。このアプローチはSequence-to-Sequence (Seq2Seq)学習で使用される技術と一致し、Multi-Head Attentionメカニズムにより、モデルがテキストと画像の両方のトークンに注意を向けることを可能にしている。
トレーニングデータは、公開されているウェブコンテンツとライセンスされた画像コレクションから取得された、ペアの画像テキストデータセットで構成されていた。OpenAIは、これらのデータセットの正確な量や構成を開示していない。モデルはAdam (Optimizer)を使用してトレーニングされ、ウォームアップとコサイン減衰を含むLearning Rate Schedulingが適用された。トレーニングを安定させるためにGradient ClippingとLayer Normalizationが適用され、正則化にはDropoutが使用された。
能力とベンチマーク
内部評価では、GPT 2.5 imageは、MS-COCOなどのデータセットにおけるFID(Fréchet Inception Distance)スコアを含む、標準的な画像生成ベンチマークで改善されたパフォーマンスを示した。ただし、OpenAIはこの特定のモデルに関する公式のベンチマーク数値を公開していない。独立した評価では、写実的なシーンの生成、複数のオブジェクトを含む複雑な構図の処理、正確なテキストオーバーレイの生成における強みが指摘された。
このモデルはプロンプトベースの編集をサポートしており、ユーザーが自然言語の指示を通じて画像の特定の領域を変更できる。また、ネガティブプロンプトへの遵守も改善されており、不要な要素の除外が可能である。これらの能力により、Google DeepMindやAnthropicの他の生成モデルとの競争相手として位置づけられているが、公開ベンチマークの欠如により直接比較は限られている。
リリースと利用可能性
GPT 2.5 imageは、OpenAIの反復的なモデル更新パターンに従い、2025年にリリースされた。OpenAI APIを通じて利用可能になり、ChatGPTのPlusおよびEnterpriseサブスクライバーにも統合された。価格は画像ごとのトークンベースのモデルに従い、コストは解像度と生成の複雑さによって異なる。このモデルは最大2048x2048ピクセルの出力解像度をサポートし、計算コストを削減するための低解像度オプションも提供している。
OpenAIはまた、消費者向けハードウェアでの高速推論のための、より小型の蒸留バリアントもリリースしたが、このバージョンは公に詳細化されていない。フルモデルはかなりの計算リソースを必要とし、通常はMicrosoft AzureやAmazon Web Servicesなどのクラウドインフラストラクチャ上で実行される。
受容と影響
GPT 2.5 imageのリリースは、テキストレンダリングの正確さとプロンプト忠実度により、Generative AIコミュニティ内で注目を集めた。批評家は、他のモデルと同様に、複雑なシーンでアーティファクトを生成したり、まれなオブジェクトの組み合わせで失敗することがあると指摘した。このモデルはまた、著作権と倫理的使用に関する議論を引き起こし、著作権で保護されたキャラクターや芸術スタイルに似た画像を生成できるため、OpenAIはコンテンツフィルターと使用ポリシーを実装した。
Artificial intelligence開発のより広い文脈では、GPT 2.5 imageは、テキストと画像の生成を単一のアーキテクチャ内で統合するトレンドに貢献した。これは、特にCross-AttentionとPositional Encodingの分野における、マルチモーダルモデルに関するその後の研究に影響を与えた。このモデルのリリースはまた、クラウドプロバイダー間の競争を促進し、Google CloudとOracle Cloud Infrastructureが同様のワークロード向けに最適化された推論ソリューションを提供した。
関連研究と将来の方向性
GPT 2.5 imageは、生成モデリングとコンピュータビジョンにおけるMIT CSAIL、Stanford AI Lab、BAIR (Berkeley AI Research)の基礎研究に基づいている。高解像度合成のためにResidual Network (ResNet)とU-Netアーキテクチャのアイデアを組み込んでいるが、正確な実装詳細は独自のものとなっている。OpenAIは、将来のイテレーションがビデオ生成のための時間的一貫性の改善と推論コストの削減に焦点を当てると示している。
このモデルの開発チームには、以前にDavid LuanとJakob Uszkoreitのトランスフォーマー革新に取り組んだ研究者が含まれていたが、具体的な人員配置は確認されていない。2025年現在、GPT 2.5 imageはアクティブな製品であり、安全性フィルターとパフォーマンス最適化の定期的な更新が行われている。