译自英文

GPT Image 1.5 是OpenAI开发的一款AI图像生成模型,于2025年作为GPT Image 1的更新版本发布。它通过ChatGPT界面和API提供了增强的逼真度、文本渲染和编辑能力。

GPT Image 1.5 是一款由生成式人工智能模型,由OpenAI开发,用于图像创建和编辑。该模型于2025年发布,是GPT Image 1的继任者,并已集成到ChatGPT和OpenAI API中,允许用户通过自然语言提示生成和修改图像。该模型基于OpenAI的大语言模型架构,将多模态理解与基于扩散的图像合成相结合。

GPT Image 1.5由OpenAI于2025年初宣布,并于2025年3月公开发布。它面向ChatGPT Plus、Pro和Team订阅用户开放,同时也可通过API供开发者使用。该模型还可通过OpenAI的企业产品访问,包括Microsoft Azure的Azure OpenAI服务

能力

GPT Image 1.5在其前代产品的基础上引入了多项改进,包括更高分辨率的输出(最高可达2048x2048像素)、对复杂提示的更好遵循,以及图像内文本渲染的更高准确性。该模型支持多轮编辑,允许用户通过对话式指令优化图像。它还可以在多个输出中生成具有一致角色和风格的图像,这一功能面向创意专业人士。

根据OpenAI的技术文档,GPT Image 1.5采用了一种混合方法,将用于布局和构图的自回归变换器与用于像素级细节的扩散解码器相结合。这使得场景更加连贯,并减少了诸如扭曲的手部或乱码文本等常见伪影。

性能与基准测试

在内部评估中,OpenAI报告称,GPT Image 1.5在MMMU(多模态多学科理解)基准测试以及照片真实感和提示对齐的人类偏好测试中均优于GPT Image 1。独立基准测试,例如Artificial Analysis智能指数中的测试,将GPT Image 1.5列为2025年顶级图像生成模型之一,与Google DeepMind及其他实验室的系统相抗衡。

该模型在生成具有精细细节的图像方面也表现出更强的能力,例如小文本、标志和科学图表。OpenAI指出,与前代版本相比,GPT Image 1.5在渲染长文本段落时的错误率降低了约40%。

API与定价

GPT Image 1.5可通过OpenAI API使用,并采用分级定价结构。截至发布时,该模型的标准分辨率(1024x1024)定价为每张图像0.02美元,高分辨率(2048x2048)定价为每张图像0.08美元。该API支持质量、尺寸和风格参数,并与现有的聊天补全端点集成。

开发者可将GPT Image 1.5用于从营销内容生成到设计原型制作等各种应用。OpenAI还为企业客户提供微调选项,允许在特定数据集上进行定制,但该功能仅限于部分合作伙伴使用。

安全性与局限性

OpenAI为GPT Image 1.5实施了多项安全措施,包括内容过滤器,以防止生成有害或欺骗性图像。该模型包含C2PA水印以标识AI生成的内容,并且OpenAI已限制在未经同意的情况下生成公众人物的逼真面部图像。尽管采取了这些措施,该模型仍可能产生有偏见或不准确的表述,OpenAI建议用户对输出结果进行事实核查。

与其他神经网络模型一样,GPT Image 1.5在理解抽象概念方面存在局限性,可能难以处理高度具体或模糊的提示。该模型的训练数据包括来自互联网的公开图像和文本,这可能会引入文化偏见。

评价

GPT Image 1.5因其改进的文本渲染和编辑能力而获得科技媒体和创意社区的积极评价。评论者指出,虽然它不能完全取代专业设计工具,但显著降低了快速视觉原型制作的门槛。也有人对滥用该模型创建误导性图像的潜在风险表示担忧,促使OpenAI更新了其使用政策。

到2025年中期,GPT Image 1.5已被广告、电子商务和教育等行业广泛采用。它也成为学术研究中生成插图和数据可视化的常用工具。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·image-generation·openai·machine-learning
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史