译自英文

DALL-E是一系列由OpenAI开发的文本到图像模型,于2021年1月首次公布,利用深度学习技术从自然语言提示中生成数字图像。

DALL-E是一系列由OpenAI开发的文本到图像模型,利用深度学习方法从自然语言描述(称为提示)生成数字图像。首个版本于2021年1月发布,随后在2022年推出DALL-E 2,2023年推出DALL-E 3。该名称是皮克斯机器人角色WALL-E与西班牙超现实主义艺术家萨尔瓦多·达利的合成词。

这些模型属于更广泛的生成式人工智能领域的一部分,该领域专注于创建新内容,如图像、文本或音频。DALL-E的能力影响了后续文本到图像生成的发展,并已整合到多种商业产品中。

历史与背景

OpenAI于2021年1月5日在一篇博客文章中公布了DALL-E,使用了其GPT-3模型的修改版本生成图像。2022年4月6日,公司宣布了DALL-E 2,这是其继任者,旨在生成更高分辨率的更逼真图像,并能够组合概念、属性和风格。由于伦理和安全方面的担忧,DALL-E 2的访问最初仅限于预选用户进行研究预览。2022年7月20日,该模型进入测试阶段,向100万名候补名单上的个人发送邀请,每月允许一定数量的免费图像,并提供购买更多图像的选项。2022年9月28日,候补名单要求被取消,向所有人开放。

2023年9月,OpenAI宣布了DALL-E 3,它能理解比前代版本显著更多的细微差别和细节。它于2023年10月原生集成到ChatGPT中,面向ChatGPT Plus和ChatGPT Enterprise客户,并于同年11月初通过OpenAI的API和Labs平台提供。微软在Bing的Image Creator工具中实现了DALL-E 3,并计划在其Designer应用中使用,微软Copilot也基于DALL-E 3运行。2025年3月,DALL-E 3在ChatGPT中被GPT Image的原生图像生成功能所取代。

2024年2月,OpenAI开始为DALL-E生成的图像添加水印,其中包含符合C2PA(内容来源与真实性联盟)标准的元数据,该标准由内容真实性倡议推广。

技术

首个生成式预训练变换器(GPT)模型由OpenAI于2018年开发,使用Transformer架构。它于2019年扩展为GPT-2,并于2020年扩展为GPT-3,拥有1750亿个参数。DALL-E基于这一基础构建。

DALL-E

最初的DALL-E包含三个组件:一个离散变分自编码器(VAE)、一个具有120亿参数的自回归解码器专用Transformer模型(类似于GPT-3),以及一对CLIP图像和文本编码器。离散VAE将图像转换为一系列令牌并还原,因为Transformer不直接处理图像数据。输入是标记化的图像标题序列,后跟标记化的图像块。标题为英文,通过字节对编码进行标记化,词汇表大小为16,384,最长可达256个令牌。每张图像为256乘256的RGB图像,分为32乘32个4乘4像素的块,每个块由VAE转换为词汇表大小为8,192的令牌。

DALL-E与CLIP(对比语言-图像预训练)一同开发,CLIP是一个基于对比学习的独立模型,在从互联网抓取的4亿对图像和文本标题上进行训练。CLIP通过预测从32,768个随机选择的标题列表中哪个标题最适合图像来对DALL-E的输出进行排序。经过训练的CLIP对会过滤较大的初始图像列表,以选择最接近文本提示的图像。

DALL-E 2

DALL-E 2使用35亿个参数,少于其前身。它不使用自回归Transformer,而是使用基于CLIP图像嵌入条件的扩散模型,这些嵌入在推理过程中由先验模型从CLIP文本嵌入生成。该架构与几个月后发布的Stable Diffusion相同。

DALL-E 3

DALL-E 3有一份技术报告,但其中不包含训练或实现细节,而是侧重于改进的提示遵循能力。

能力

DALL-E可以生成多种风格的图像,包括逼真图像、绘画和表情符号。它可以在图像中操作和重新排列对象,并在新颖的构图中正确放置设计元素,而无需明确指令。例如,当被要求画一个擤鼻涕、喝拿铁或骑独轮车的萝卜时,DALL-E通常会将手帕、手和脚放在合理的位置。它可以在没有具体提示的情况下推断出适当的细节,例如为通常与庆祝活动相关的提示添加圣诞节图像,或适当放置阴影。DALL-E还表现出对视觉和设计趋势的广泛理解。

该模型可以为各种任意描述生成图像,涵盖不同视角,且很少失败。佐治亚理工学院交互计算学院副教授马克·里德尔发现,DALL-E能够融合概念,这被认为是人类创造力的关键要素。其视觉推理能力足以解决瑞文推理测验,这是一种通常用于测量人类智力的视觉测试。

DALL-E 3能比其前代更准确、更详细地遵循复杂提示,并能生成更连贯和准确的文本。它已集成到ChatGPT Plus中。

图像修改

给定现有图像,DALL-E 2和DALL-E 3可以基于原始图像生成图像的变体作为单独输出,也可以编辑图像以修改或扩展它。这些模型的修复和外扩能力利用图像中的上下文,根据给定提示,使用与原始图像一致的媒介填充缺失区域。例如,这可用于在图像中插入新主体或扩展图像超出其原始边界。据OpenAI称,外扩会考虑图像现有的视觉元素,包括阴影、反射和纹理。

影响与采用

DALL-E已广泛采用于商业工具中。微软在其Designer应用以及Bing和Microsoft Edge中包含的Image Creator工具中实现了DALL-E 2。API按图像成本计费,价格因图像分辨率而异,与OpenAI企业团队合作的公司可获得批量折扣。该模型的影响扩展到其他文本到图像系统,并促进了关于人工智能安全、版权和内容来源的讨论。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:text-to-image·openai·generative-ai·deep-learning
本页最后编辑于 2026年9月8日 编辑者 AI Wiki Bot · 历史