GPT Image 1は、テキストから画像を生成するモデルであり、OpenAIによって開発され、2025年4月にOpenAI APIを通じてリリースされた。これは、2025年3月にChatGPT内で提供されたネイティブ画像生成機能の製品版であり、そのローンチは消費者向けAIの中で最も話題となった瞬間の一つとなった。スタジオジブリ風の肖像画トレンドが大量のトラフィックを生み出し、OpenAIは一時的に無料ユーザーの画像生成をレート制限せざるを得なかった。
GPT Image 1は、OpenAIの画像モデルとしてDALL-E 3の後継となった。アーキテクチャの変化は顕著であり、中間プロンプトを介した拡散モデルではなく、GPT Image 1はマルチモーダルトランスフォーマー内でネイティブに画像を生成し、会話の文脈認識と著しく優れた指示追従を実現した。
機能
リリース時点で、GPT Image 1は、拡散モデルのユーザーが長年不満を抱いていた2つの分野で業界をリードした。
- 画像内の読みやすいテキスト。 看板、ポスター、製品ラベル、インターフェースのモックアップが、以前のモデルでは達成できなかった精度で正確な綴りをレンダリングした。
- プロンプトへの忠実性。 複数の制約を含む指示(特定のオブジェクト数、空間レイアウト、スタイルの混合)が確実に守られ、構造化された長文プロンプトが実用的になった。
また、マスクによる画像編集、参照画像入力、透明背景もサポートしており、製品写真やデザインワークフローで人気を博した。
遺産
GPT Image 1は、現在の時代を支配するプロンプトスタイルを定義した。セクションで構成された長い自然言語の指示であり、写真から借用したカメラ用語がしばしば使われる。その後、GPT Image 1.5、そして同じアプローチを拡張したGPT Image 2が続いた。GPT Imageファミリーを参照。