GPT Image是一系列由OpenAI开发的文本到图像生成模型。它取代了早期的DALL-E系列,成为OpenAI图像生成产品线,与DALL-E不同,它原生支持多模态:图像生成由驱动ChatGPT的同一模型家族执行,而非通过桥接提示调用单独的扩散模型。
成员
- GPT Image 1(2025年4月)。ChatGPT原生图像生成技术首次通过API发布,该技术数周前因吉卜力风格肖像热潮而走红。确立了该系列标志性优势:图像内文字清晰可读和强大的指令遵循能力。
- GPT Image 1.5(2025年末)。中期升级,编辑精度更高,生成速度更快。
- GPT Image 2(2026年)。当前旗舰版本,照片写实度提升,长文本渲染改进,并支持身份保持编辑。
意义
该系列的原生多模态特性改变了提示词编写实践。由于生成器能直接理解对话上下文和结构化简报,提示词工程师从关键词列表(扩散时代风格,仍常见于Stable Diffusion检查点)转向带有明确约束的长篇自然语言简报,这种风格如今主导了提示词分享平台。在Wikiprompt上,GPT Image系列模型合计占据目录中图像提示词的最大份额。
参见
- DALL-E,前代系列
- Nano Banana,谷歌的竞品图像模型系列
- Midjourney