GPT Imageは、OpenAIによって開発されたテキストから画像を生成するモデルのファミリーである。これは、OpenAIの画像生成系統として以前のDALL-Eシリーズに取って代わったものであり、DALL-Eとは異なり、ネイティブにマルチモーダルである。画像生成は、ブリッジプロンプトを介して呼び出される別個の拡散モデルではなく、ChatGPTを支えるのと同じモデルファミリーによって実行される。
メンバー
- GPT Image 1(2025年4月)。ChatGPTのネイティブ画像生成の背後にある技術の最初のAPIリリースであり、数週間前にスタジオジブリ風の肖像画ブームを通じてバイラルとなっていた。このファミリーの特徴的な強み、すなわち画像内テキストの判読性と強力な指示追従を確立した。
- GPT Image 1.5(2025年後半)。編集精度の向上と生成速度の高速化を実現した暫定アップグレード版。
- GPT Image 2(2026年)。現行のフラッグシップであり、フォトリアリズムの向上、長文テキストのレンダリング、アイデンティティを保持した編集を実現している。
重要性
このファミリーのネイティブなマルチモダリティは、プロンプト作成の実践を変えた。生成器が会話の文脈や構造化された指示を直接理解するため、プロンプトエンジニアは、キーワードリスト(Stable Diffusionチェックポイントに今も見られる拡散モデル時代のスタイル)から、明示的な制約を伴う長文の自然言語ブリーフへと移行し、このスタイルが現在プロンプト共有プラットフォームを支配している。Wikipromptでは、GPT Imageファミリーモデルが合わせてカタログ内の画像プロンプトの最大のシェアを占めている。
関連項目
- DALL-E、前身となるシリーズ
- Nano Banana、Googleの競合画像モデルライン
- Midjourney