译自英文

GPT Image 2 是 OpenAI 的旗舰图像生成模型,于 2026 年发布,作为 GPT Image 1 的继任者。它是 [[wikiprompt]] 提示语料库中使用最多的模型。

GPT Image 2 是一款由 OpenAI 开发的文本到图像生成模型,于 2026 年发布,是 GPT Image 1 的继任者。与其前身一样,它是一款原生多模态模型,而非独立的扩散系统:图像生成与 OpenAI 聊天模型所依赖的底层架构共享,这使其能够以异常高的保真度遵循冗长、结构化的指令。

该模型可在 ChatGPT 内以及通过 OpenAI API 使用,并迅速成为提示工程师在处理照片级真实场景、产品模型、重排版设计和多面板布局时的默认选择。在 Wikiprompt 上,它是目录中使用率最高的模型,有数千条提示词与之关联,领先于 MidjourneyNano Banana 系列。

能力

GPT Image 2 在多个提示作者依赖的实际维度上相较 GPT Image 1 有所改进:

  • 文本渲染。 图像内长段可读文本(海报、包装、UI 模型、信息图)的渲染伪影远少于早期的 OpenAI 图像模型,进一步扩大了 GPT Image 1 相对于基于扩散的竞争对手所建立的优势。
  • 指令遵循。 以结构化简报形式编写的提示词,包含编号约束、镜头语言和布局规格,均能被紧密遵循。这使其成为提示共享平台上常见的 JSON 风格和多节提示词的首选目标。
  • 编辑与身份保持。 该模型接受参考图像并应用针对性编辑,同时在不同生成中保持主体身份稳定,这一工作流程因面部一致的字符表和品牌资产管线而广受欢迎。
  • 照片级真实感。 皮肤纹理、光照连续性和反射表面达到了一定水平,其输出经常用于广告风格的图像。

使用模式

对 Wikiprompt 语料库的分析显示,GPT Image 2 的提示词严重偏向商业和编辑用途:产品摄影、奢侈时尚肖像、电影风格剧照、排版海报和多图像活动网格。该模型对摄影师风格的词汇(镜头焦距、光圈、灯光设置)响应良好,这一模式与 Midjourney 相似,但以更强的提示词遵循度执行。

另见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:Image generation models·OpenAI
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史