DALL-E、DALL-E 2 和 DALL-E 3(风格化为 DALL·E)是由 OpenAI 使用深度学习方法开发的文本到图像模型,能够根据称为提示(prompts)的自然语言描述生成数字图像。第一个版本于 2021 年 1 月发布,后续版本在真实感、提示遵循能力等方面不断扩展。该名称是皮克斯机器人角色 WALL-E 与西班牙超现实主义艺术家萨尔瓦多·达利的组合词。
历史与背景
OpenAI 于 2021 年 1 月 5 日在一篇博客文章中公布了 DALL-E,它使用GPT-3的修改版本来生成图像。2022 年 4 月 6 日,公司发布了 DALL-E 2,这是其继任者,旨在生成更逼真、分辨率更高的图像,并且能够“组合概念、属性和风格”。由于伦理和安全方面的考虑,DALL-E 2 最初仅向预先选定的用户开放,用于研究预览。2022 年 7 月 20 日,该模型进入测试阶段,向 100 万名排队用户发出邀请,每月提供一定数量的免费生成次数,并允许用户购买更多额度。2022 年 9 月 28 日,排队要求被取消,该工具向所有人开放。
2023 年 9 月,OpenAI 发布了 DALL-E 3,它能够理解比前几代“更丰富的细节和含义”。该模型于 2023 年 10 月原生集成到 ChatGPT 中,供 Plus 和企业版用户使用,并于 11 月通过 API 和“实验室”平台提供。微软将该模型集成到必应图像创建器和 Designer 应用中,Microsoft Copilot 也运行在 DALL-E 3 上。2025 年 3 月,DALL-E 3 在 ChatGPT 中被 GPT Image 的原生图像生成功能所取代。2024 年 2 月,OpenAI 开始为 DALL-E 生成的图像添加水印,其中包含符合 C2PA(内容来源与真实性联盟)标准的元数据。
技术
第一个生成式预训练变换器(GPT)模型由 OpenAI 于 2018 年开发,采用Transformer架构。通过规模扩展,相继产生了 GPT-2(2019 年)和 GPT-3(2020 年),后者拥有 1750 亿个参数。DALL-E 在此基础上构建,但不同版本采用了不同的架构。
DALL-E
最初的 DALL-E 由三个组件构成:一个离散变分自编码器(VAE)、一个类似 GPT-3 的具有 120 亿参数的自回归解码器 Transformer 模型,以及一对 CLIP 图像和文本编码器。离散 VAE 将图像转换为 token 序列,反之亦然,这是因为 Transformer 不能直接处理图像数据。输入由一段经过 token 化的英文描述(最多 256 个 token,词汇表大小为 16,384)以及随后经过 token 化的图像块组成。每张 256×256 的 RGB 图像被划分为 32×32 的图像块,每个图像块使用大小为 8,192 的词汇表转换为一个 token。
CLIP(对比语言-图像预训练)是与 DALL-E 一同开发和发布的独立模型,基于对比学习,在从互联网抓取的 4 亿个图像-文本对上进行了训练。它通过预测哪条描述(从 32,768 条随机选择的描述中)最适合某张图像来对 DALL-E 的输出进行排序,从而从更大的候选列表中筛选出与提示最匹配的结果。
DALL-E 2
DALL-E 2 使用了 35 亿个参数,少于其前身,并用一个以 CLIP 图像嵌入为条件的扩散模型取代了自回归 Transformer。在推理过程中,这些嵌入由一个先验模型根据 CLIP 文本嵌入生成。该架构与几个月后发布的 Stable Diffusion 相同。
DALL-E 3
OpenAI 为 DALL-E 3 发布了一份技术报告,但省略了训练和实现细节,重点强调了改进后的提示遵循能力。该模型被集成到 ChatGPT Plus 中,使用户能够通过对话方式对生成的图像进行迭代优化。
能力
DALL-E 能够生成多种风格的图像,包括照片级真实感图像、绘画和表情符号。它能够“操控和重新排列”物体,并在没有明确指令的情况下将设计元素置于新颖的构图中。BoingBoing 的 Thom Dunn 指出,当被要求画一个“打喷嚏的萝卜、喝着拿铁的萝卜或骑着独轮车的萝卜”时,DALL-E 常常会在合理的位置画出纸巾、手和脚。该模型能够“填补空白”,根据相关提示推断出诸如圣诞节之类的细节,或补充文本中未提及的阴影,展现出对视觉和设计趋势的广泛理解。
DALL-E 能够为各种任意描述生成图像,涵盖多种视角,且失败情况很少。佐治亚理工学院交互计算学院的副教授 Mark Riedl 发现,DALL-E 能够融合概念,这是人类创造力的一个关键要素。其视觉推理能力足以解决 Raven 矩阵测试,这是一种常用于衡量人类智力的视觉测试。
DALL-E 2 和 DALL-E 3 在遵循复杂提示方面比前代更加准确和细致,并且能够在图像中生成更连贯、更准确的文字。
图像修改
DALL-E 2 和 DALL-E 3 能够基于现有图像生成“变体”,即根据原图生成多个独立输出,也可以对图像进行编辑以修改或扩展内容。“内绘”(inpainting)和“外绘”(outpainting)功能利用图像上下文来填充缺失区域,并保持与原始图像一致的媒介风格,同时遵循给定的提示。例如,这允许在图像中插入新主体,或将图像扩展到原始边界之外。据 OpenAI 称,“外绘会考虑图像的现有视觉元素,,包括阴影、反射和纹理,,以”生成无缝的延伸。