GPT图像(模型系列)

译自英文

GPT Image是OpenAI原生的多模态图像生成模型系列,涵盖GPT Image 1(2025年)、GPT Image 1.5和GPT Image 2(2026年)。它取代了DALL-E系列。

GPT Image是一系列由OpenAI开发的文本到图像生成模型。它取代了早期的DALL-E系列,成为OpenAI图像生成产品线,与DALL-E不同,它原生支持多模态:图像生成由驱动ChatGPT的同一模型家族执行,而非通过桥接提示调用单独的扩散模型。

成员

  • GPT Image 1(2025年4月)。ChatGPT原生图像生成技术首次通过API发布,该技术数周前因吉卜力风格肖像热潮而走红。确立了该系列标志性优势:图像内文字清晰可读和强大的指令遵循能力。
  • GPT Image 1.5(2025年末)。中期升级,编辑精度更高,生成速度更快。
  • GPT Image 2(2026年)。当前旗舰版本,照片写实度提升,长文本渲染改进,并支持身份保持编辑。

意义

该系列的原生多模态特性改变了提示词编写实践。由于生成器能直接理解对话上下文和结构化简报,提示词工程师从关键词列表(扩散时代风格,仍常见于Stable Diffusion检查点)转向带有明确约束的长篇自然语言简报,这种风格如今主导了提示词分享平台。在Wikiprompt上,GPT Image系列模型合计占据目录中图像提示词的最大份额。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:Image generation models·OpenAI
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史