译自英文

DALL-E 3 是OpenAI于2023年10月发布的文本到图像模型,以其增强的提示遵循能力和与ChatGPT的集成而闻名。它利用深度学习从自然语言描述中生成图像。

DALL-E 3 是由OpenAI开发的一种文本到图像模型,于2023年10月发布。它是DALL-E系列中的第三代,继DALL-E和DALL-E 2之后。DALL-E 3利用深度学习方法从自然语言描述(称为提示)生成数字图像,重点在于理解比其前代“显著更多的细微差别和细节”。该模型原生集成到ChatGPT中,供ChatGPT Plus和ChatGPT Enterprise客户使用,后来通过OpenAI的API和Labs平台提供。2025年3月,DALL-E 3在ChatGPT中被GPT Image的原生图像生成功能所取代。

历史与背景

DALL-E最初由OpenAI于2021年1月5日宣布,使用GPT-3的修改版本生成图像。DALL-E 2紧随其后,于2022年4月6日推出,提供更高分辨率以及组合概念、属性和风格的能力。经过2022年7月的测试阶段和2022年9月的公开发布,DALL-E 2于2022年11月通过API提供。2023年9月,OpenAI宣布了DALL-E 3,并于2023年10月发布。微软在Bing的图像创建工具中实现了DALL-E 3,Microsoft Copilot也基于DALL-E 3运行。“DALL-E”这个名字是皮克斯机器人WALL-E和西班牙超现实主义艺术家萨尔瓦多·达利的组合词。2024年2月,OpenAI开始为DALL-E生成的图像添加水印,使用C2PA标准中的元数据。

技术

DALL-E 3建立在OpenAI的GPT模型中使用的Transformer架构之上。虽然为DALL-E 3编写了技术报告,但该报告不包括训练或实现细节,而是侧重于改进的提示遵循能力。该模型旨在以更高的准确性和细节解释复杂提示,并能生成比早期版本更连贯、更准确的图像内文本。

DALL-E和DALL-E 2

最初的DALL-E使用离散VAE、具有120亿参数的自回归解码器专用Transformer,以及用于对输出进行排名的CLIP模型。DALL-E 2拥有35亿参数,转向了以CLIP图像嵌入为条件的扩散模型,类似于后来在Stable Diffusion中使用的架构。

能力

DALL-E 3可以生成多种风格的图像,包括逼真照片、绘画和表情符号。它可以操纵和重新排列对象,并将设计元素置于新颖的构图中。它比其前代更准确、更详细地遵循复杂提示,并能生成图像内连贯的文本。DALL-E 3集成到ChatGPT Plus中,允许用户直接在对话中生成图像。

图像修改

DALL-E 2和DALL-E 3可以生成现有图像的变体并进行编辑,包括内绘和外绘。这些功能利用原始图像的上下文来填充缺失区域或扩展边界之外,保持阴影、反射和纹理的一致性。

接受度与影响

DALL-E 3因其增强的提示遵循能力和与ChatGPT的集成而受到关注,使其更易于广大受众使用。它在微软的Bing图像创建工具和Copilot中的使用扩大了其影响力。该模型从复杂提示生成详细准确图像的能力影响了生成式AI领域,尽管也引发了关于伦理和安全的担忧,导致采取了水印等措施。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:text-to-image·openai·generative-ai·deep-learning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史