译自英文

GPT Image 1是OpenAI于2025年4月发布的图像生成模型,是ChatGPT原生图像生成的第一个API版本,也是DALL-E 3的继任者。

GPT Image 1 是一款由 OpenAI 开发的文本到图像生成模型,于2025年4月通过OpenAI API发布。它是2025年3月ChatGPT内置原生图像生成功能的产品化版本,该功能的推出成为消费者AI领域最火爆的事件之一:吉卜力工作室风格肖像的流行趋势产生了巨大流量,以至于OpenAI暂时对免费用户的图像生成实施了速率限制。

GPT Image 1 接替 DALL-E 3 成为OpenAI的图像模型。其架构转变意义重大:它并非通过中介提示的扩散模型,而是在多模态Transformer内部原生生成图像,从而具备对话上下文感知能力和显著增强的指令遵循能力。

能力

在发布时,GPT Image 1 在困扰扩散模型用户多年的两个领域处于领先地位:

  • 图像中的清晰文本。 招牌、海报、产品标签和界面原型能以早期模型无法企及的准确拼写呈现。
  • 提示遵循。 多约束条件(特定对象数量、空间布局、风格混合)的简报能被可靠执行,使结构化的长格式提示变得实用。

它还支持带掩码的图像编辑、参考图像输入和透明背景,这使其在产品摄影和设计工作流中广受欢迎。

遗产

GPT Image 1 定义了当前时代占主导地位的提示风格:以段落组织的长自然语言简报,常借用摄影中的镜头词汇。它之后是 GPT Image 1.5,然后是 GPT Image 2,后者扩展了相同的方法。参见 GPT Image 系列

另见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:Image generation models·OpenAI
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史