译自英文

DALL-E 1 是由 OpenAI 开发的一种文本到图像模型,利用深度学习根据自然语言提示生成数字图像。它于 2021 年 1 月发布,采用了修改后的 GPT-3 架构,是生成式人工智能领域的一个里程碑。

DALL-E 1,风格化为DALL·E,是由OpenAI使用深度学习方法开发的文本到图像模型。它根据自然语言描述(称为提示)生成数字图像。DALL-E的第一个版本于2021年1月发布,使其成为首批将大型语言模型与图像生成相结合的重要模型之一。该软件的名称是动画机器人WALL-E和西班牙超现实主义艺术家萨尔瓦多·达利名字的混合词。

其继任者DALL-E 2于2022年4月发布,并于2022年7月推出公开测试版。DALL-E 3于2023年10月发布,原生集成到ChatGPT中,供Plus和企业客户使用。DALL-E 3后来于2025年3月在ChatGPT中被GPT Image的原生图像生成功能所取代。

历史与背景

DALL-E由OpenAI于2021年1月5日在一篇博客文章中公布。该模型使用了gpt-partnr?的一个版本,但针对图像进行了调整,采用了适用于图像生成的Transformer (architecture)架构。当时,OpenAI以GPT-3等大型语言模型而闻名,但DALL-E标志着其向多模态人工智能的转变,即同时处理文本和图像领域。该模型的命名延续了OpenAI命名中常见的俏皮缩写和谐音梗。

2024年2月,OpenAI开始为DALL-E生成的图像添加水印,其中包含符合C2PA(内容来源与真实性联盟)标准的元数据,该标准由内容真实性倡议推广,以帮助追踪图像来源。

技术

首个生成式预训练变换器(GPT)模型最初由OpenAI于2018年开发,采用Transformer (architecture)架构。第一代GPT-1经过扩展于2019年产生GPT-2;2020年再次扩展产生GPT-3,拥有1750亿个参数。DALL-E是GPT-3的一个独特变体,经过修改以生成图像。

DALL-E 1

DALL-E包含三个组件:一个离散变分编码器、一个自回归解码器-only的Transformer (architecture)模型(120亿个参数),类似于GPT-3,以及一对CLIP图像编码器和文本编码器。

离散变分自编码器(VAE)将图像转换为一系列标记,反之亦然,将一系列标记转换回图像。这是必要的,因为变换器模型不直接处理图像数据。变换器的输入是标记化的图像标题序列,后跟标记化的图像块。标题为英文,通过字节对编码(词汇表大小为16384)进行标记化,最长可达256个标记。每张图像为256x256 RGB图像,分为32x32个块,每个块为4x4。然后,每个块由离散VAE转换为一个标记(词汇表大小为8192)。

DALL-E与CLIP(对比语言-图像预训练)联合开发和发布。CLIP是一个基于对比学习的独立模型,在从互联网抓取的4亿对图像和文本标题上进行训练。其作用是理解和排序DALL-E的输出,通过预测从32,768个随机选择的标题列表(其中一个是正确的)中哪个标题最适合图像。经过训练的CLIP对会过滤DALL-E生成的较大初始图像列表,以选择最接近文本提示的图像。

继任者

DALL-E 2使用35亿个参数,比其前身更少。它不使用自回归变换器,而是采用基于CLIP图像嵌入的扩散模型,在推理过程中,这些嵌入由先验模型从CLIP文本嵌入生成。这与几个月后发布的Stable-Diffusion架构相同。

DALL-E 3于2023年9月发布,比之前的版本更准确地遵循复杂提示,并生成更连贯的文本。虽然为其撰写了技术报告,但该报告不包含训练或实现细节,而是侧重于改进的提示遵循能力。

能力

DALL-E可以生成多种风格的图像,包括逼真图像、绘画和表情符号。它可以操纵和重新排列图像中的对象,并能在没有明确指令的情况下,在新颖构图中正确放置设计元素。它展示了创造性推理能力,例如为提示填充合理的细节,比如为与庆祝活动相关的提示添加圣诞图像,或即使未提及也能适当放置阴影。DALL-E对视觉设计趋势有广泛的理解。

DALL-E可以为各种任意描述生成图像,涵盖不同视角,且很少失败。佐治亚理工学院交互计算学院副教授Mark Riedl发现,DALL-E能够融合概念,这是人类创造力的关键要素。其视觉推理能力足以解决Raven's Matrices,这是一种常用于衡量智力的视觉测试。

图像修改

给定现有图像,DALL-E 2和DALL-E 3可以生成图像的变体,并编辑以修改或扩展场景。这些模型的修补和外扩能力利用图像上下文,以与原始图像一致的风格填充缺失区域,并遵循给定提示。这可用于插入新主体或将图像扩展到其边界之外。根据OpenAI的说法,外扩会考虑图像现有的视觉元素,包括阴影、反射和纹理。

应用与影响

DALL-E 1开启了生成式AI图像创作的新时代,并影响了后来的模型和应用。其继任者DALL-E 2于2022年11月通过API提供,允许开发人员将该模型集成到应用程序中,并按图像定价。微软将DALL-E 2整合到其Designer应用以及Bing和Edge中的Image Creator工具中。DALL-E 3于2023年10月集成到ChatGPT中,供Plus和企业客户使用,并于11月提供API和Labs可用性。2024年2月,OpenAI按照C2PA标准为DALL-E图像添加了水印。

参考文献

本文基于公开报告和OpenAI自身出版物的信息。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-art·openai·text-to-image·deep-learning
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史