OpenAI DALL-E 3发布

译自英文

DALL-E 3,由OpenAI于2023年10月发布,是一款集成到ChatGPT中的文本到图像模型,面向Plus和企业用户,提供先进的提示词遵循和图像生成能力。

DALL-E 3是由OpenAI开发的文本到图像模型,于2023年10月发布,是DALL-E系列的第三代迭代。它原生集成于ChatGPT中,面向ChatGPT Plus和ChatGPT Enterprise客户提供,并于2023年11月初通过OpenAI的API和Labs平台实现更广泛的访问。该模型在其前身DALL-E和DALL-E 2的基础上,利用深度学习从自然语言提示生成数字图像。

名称DALL-E是皮克斯机器人角色WALL-E与西班牙超现实主义艺术家萨尔瓦多·达利的合成词。第一版于2021年1月发布,随后DALL-E 2于2022年4月推出。DALL-E 3在理解提示的细微差别和细节方面取得了显著进步,并已集成到微软的Bing图像创建工具中,微软Copilot也运行在该模型上。

历史与背景

OpenAI于2021年1月5日首次在博客文章中披露DALL-E,使用GPT-3的修改版本生成图像。DALL-E 2于2022年4月6日发布,旨在以更高分辨率生成更逼真的图像,并能够组合概念、属性和风格。它于2022年7月20日进入测试阶段,向100万等待名单中的个人发送邀请,并于2022年9月28日向所有人开放。

2023年9月,OpenAI宣布推出DALL-E 3,能够理解比以往迭代显著更多的细微差别和细节。该模型于2023年10月原生发布到ChatGPT中,面向Plus和Enterprise客户。2023年11月初,通过OpenAI API和Labs平台提供访问。微软将该模型应用于Bing的图像创建工具,并计划集成到其Designer应用中。

2024年2月,OpenAI开始为DALL-E生成的图像添加水印,其中包含C2PA(内容来源与真实性联盟)标准的元数据,该标准由内容真实性倡议推广。2025年3月,DALL-E 3在ChatGPT中被GPT Image的原生图像生成功能所取代。

技术

首个生成式预训练Transformer(GPT)模型由OpenAI于2018年开发,采用Transformer架构。GPT-1在2019年扩展为GPT-2,2020年推出具有1750亿参数的GPT-3。DALL-E 3使用深度学习方法,但OpenAI关于DALL-E 3的技术报告未包含训练或实现细节,而是侧重于改进的提示跟随能力。

DALL-E架构

原始DALL-E包含三个组件:一个离散VAE、一个具有120亿参数的自回归解码器专用Transformer模型(类似于GPT-3),以及一对CLIP图像编码器和文本编码器。离散VAE将图像转换为标记序列并转换回来,这是因为Transformer不直接处理图像数据。

Transformer输入是标记化的图像标题序列,后跟标记化的图像块。标题为英文,通过字节对编码进行标记化,词汇表大小为16384,最长256个标记。每张图像为256×256 RGB,分为32×32个4×4的块,每个块由离散变分自编码器转换为词汇表大小为8192的标记。

CLIP(对比语言-图像预训练)与DALL-E同时开发,训练于4亿对图像和文本标题。它通过预测图像最合适的标题(从32,768个随机选择的标题列表中)来对DALL-E的输出进行排序,过滤较大的初始列表以选择最接近的匹配。

DALL-E 2和DALL-E 3架构

DALL-E 2使用35亿参数,少于其前身,并采用基于CLIP图像嵌入条件的扩散模型,推理时由先验模型从CLIP文本嵌入生成这些嵌入。该架构类似于几个月后发布的Stable Diffusion。

DALL-E 3延续了这种基于扩散的方法,但增强了提示跟随能力。虽然没有公开的技术细节,但该模型在遵循复杂提示和生成图像内连贯文本方面表现出更高的准确性。

能力

DALL-E可以生成多种风格的图像,包括照片级逼真图像、绘画和表情符号。它可以操纵和重新排列对象,并在没有明确指令的情况下,在新颖构图中正确放置设计元素。例如,当被要求画一个擤鼻涕、喝拿铁或骑独轮车的萝卜时,DALL-E通常会将手帕、手和脚画在合理的位置。

该模型可以填补空白,在没有特定提示的情况下推断适当的细节,例如为通常与庆祝活动相关的提示添加圣诞图像,并在未提及阴影的图像中适当放置阴影。DALL-E展现出对视觉和设计趋势的广泛理解,并能以各种视角为各种任意描述生成图像,仅偶有失败。

佐治亚理工学院交互计算学院副教授Mark Riedl发现,DALL-E能够融合概念,这被认为是人类创造力的关键要素。其视觉推理能力足以解决Raven's Matrices,这是一种常用于测试人类智力的视觉测试。

DALL-E 3比其前身更准确、更详细地遵循复杂提示,并能生成更连贯和准确的图像内文本。它集成于ChatGPT Plus中,允许用户通过对话式提示生成图像。

图像修改

给定现有图像,DALL-E 2和DALL-E 3可以基于原始图像生成变体作为单独输出,并可以编辑图像以修改或扩展它。内绘和外绘能力利用图像上下文,根据给定提示,使用与原始图像一致的媒介填充缺失区域。

例如,这可用于将新主体插入图像,或将图像扩展到原始边界之外。据OpenAI称,外绘会考虑图像现有的视觉元素,包括阴影、反射和纹理,以保持一致性。

集成与可用性

DALL-E 3于2023年10月原生发布到ChatGPT中,面向ChatGPT Plus和ChatGPT Enterprise客户。2023年11月初,通过OpenAI API和Labs平台提供访问。微软将该模型应用于Bing的图像创建工具,微软Copilot运行在DALL-E 3上,并计划集成到其Designer应用中。

API按图像数量计费,价格因图像分辨率而异。与OpenAI企业团队合作的公司可获得批量折扣。2025年3月,DALL-E 3在ChatGPT中被GPT Image的原生图像生成功能所取代。

安全性与来源

OpenAI已解决DALL-E模型的安全问题,包括限制有害内容和添加水印。2024年2月,OpenAI开始为DALL-E生成的图像添加水印,其中包含C2PA标准的元数据,该标准由内容真实性倡议推广。这有助于验证AI生成图像的来源。

遗产

DALL-E 3代表了Generative AIText-to-image generation技术的里程碑,建立在早期Deep learningNeural network模型的工作基础上。它与Large language model系统(如ChatGPT)的集成展示了语言和图像生成的融合。该模型的能力影响了该领域的后续发展,包括GPT Image和其他图像生成系统。

DALL-E 3于2023年10月的发布标志着向更易访问和更细致的AI图像生成的转变,对创意产业、内容创作和数字艺术产生了影响。它在微软Copilot和Bing图像创建工具中的使用扩大了其覆盖范围,惠及更广泛的受众。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:openai·text-to-image·generative-ai·deep-learning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史