GPT Image 1.5は、生成的人工知能モデルであり、画像の作成と編集のためにOpenAIによって開発された。2025年にリリースされ、GPT Image 1の後継として、ChatGPTおよびOpenAI APIに統合されており、ユーザーは自然言語のプロンプトから画像を生成・修正できる。このモデルは、OpenAIの大規模言語モデルアーキテクチャに基づいており、マルチモーダル理解と拡散ベースの画像合成を組み合わせている。
GPT Image 1.5は、2025年初頭にOpenAIによって発表され、2025年3月に一般公開された。ChatGPT Plus、Pro、Teamの各サブスクリプション利用者に加え、開発者向けAPIを通じても利用可能となった。また、このモデルは、Microsoft AzureのAzure OpenAI Serviceを含むOpenAIのエンタープライズ向けサービスでもアクセスできる。
機能
GPT Image 1.5は、前モデルに比べていくつかの改善を導入している。これには、より高解像度の出力(最大2048x2048ピクセル)、複雑なプロンプトへのより正確な従順性、画像内テキストのより正確なレンダリングが含まれる。このモデルはマルチターン編集をサポートしており、ユーザーは会話形式の指示を通じて画像を洗練できる。また、複数の出力にわたって一貫したキャラクターやスタイルを持つ画像を生成することもでき、これはクリエイティブな専門家を対象とした機能である。
OpenAIの技術文書によると、GPT Image 1.5は、レイアウトと構成に自己回帰型トランスフォーマーを、ピクセルレベルの詳細に拡散デコーダーを用いるハイブリッドアプローチを採用している。これにより、より一貫性のあるシーンが可能となり、歪んだ手や文字化けしたテキストなどの一般的なアーティファクトが軽減される。
性能とベンチマーク
内部評価において、OpenAIはGPT Image 1.5がMMMU(マルチモーダル学際的理解)ベンチマークおよび写実性とプロンプト整合性に関する人間の嗜好テストでGPT Image 1を上回ったと報告した。Artificial Analysisインテリジェンス指数などの独立したベンチマークでは、GPT Image 1.5は2025年のトップ画像生成モデルの1つに位置づけられ、Google DeepMindや他の研究所のシステムと競合した。
このモデルはまた、小さなテキスト、ロゴ、科学図などの微細な詳細を含む画像を生成する能力の向上を示した。OpenAIは、GPT Image 1.5が長いテキストのレンダリングにおけるエラーを前バージョンと比較して約40%削減したと述べている。
APIと価格
GPT Image 1.5は、段階的な価格構造でOpenAI APIを通じて利用可能である。リリース時点では、標準解像度(1024x1024)で1画像あたり0.02ドル、高解像度(2048x2048)で1画像あたり0.08ドルと価格設定されていた。APIは品質、サイズ、スタイルのパラメータをサポートし、既存のチャット完了エンドポイントと統合されている。
開発者は、マーケティングコンテンツ生成からデザインプロトタイピングまで、さまざまなアプリケーションにGPT Image 1.5を使用できる。OpenAIはまた、エンタープライズ顧客向けにファインチューニングオプションを提供しており、特定のデータセットでのカスタマイズが可能だが、この機能は選択されたパートナーに限定されている。
安全性と制限事項
OpenAIは、有害または欺瞞的な画像の生成を防ぐためのコンテンツフィルターを含む、GPT Image 1.5のいくつかの安全対策を実装した。このモデルには、AI生成コンテンツを示すC2PAウォーターマークが含まれており、OpenAIは同意なしの公人の写実的な顔の生成を制限している。これらの対策にもかかわらず、このモデルは依然として偏ったまたは不正確な表現を生成する可能性があり、OpenAIはユーザーに出力の事実的正確性を確認するようアドバイスしている。
他のニューラルネットワークモデルと同様に、GPT Image 1.5は抽象的な概念の理解に限界があり、非常に特定的または曖昧なプロンプトでは苦労する可能性がある。このモデルのトレーニングデータには、インターネットから公開されている画像とテキストが含まれており、文化的バイアスが導入される可能性がある。
評価
GPT Image 1.5は、テキストレンダリングと編集機能の改善により、テクノロジーメディアやクリエイティブコミュニティから肯定的なレビューを受けた。批評家は、プロフェッショナルなデザインツールを完全に置き換えるものではないが、迅速なビジュアルプロトタイピングの障壁を大幅に低くすると指摘した。誤解を招く画像の作成に悪用される可能性についての懸念もいくつか提起され、OpenAIは利用ポリシーを更新するきっかけとなった。
2025年半ばまでに、GPT Image 1.5は広告、電子商取引、教育などの業界で広く採用された。また、学術研究において、図解やデータ可視化を生成するための一般的なツールにもなった。