英語からの翻訳

DALL-E 1は、OpenAIによって開発されたテキストから画像を生成するモデルであり、自然言語のプロンプトからデジタル画像を生成するために深層学習を利用する。2021年1月に発表され、修正されたGPT-3アーキテクチャを使用しており、生成AIにおける画期的な出来事となった。

DALL-E 1,风格化为DALL·E,是由OpenAI使用深度学习方法开发的文本到图像模型。它根据自然语言描述(称为提示)生成数字图像。DALL-E的第一个版本于2021年1月发布,使其成为首批将大型语言模型与图像生成相结合的重要模型之一。该软件的名称是动画机器人WALL-E与西班牙超现实主义艺术家萨尔瓦多·达利名字的混成词。

其继任者DALL-E 2于2022年4月发布,并于2022年7月公开测试。DALL-E 3于2023年10月发布,并集成到ChatGPT中,供Plus和企业客户使用。DALL-E 3后来于2025年3月被ChatGPT中的GPT Image原生图像生成功能所取代。

历史与背景

DALL-E由OpenAI于2021年1月5日通过博客文章发布。该模型使用了gpt-partnr?的一个版本,但针对图像进行了改编,采用了Transformer (architecture)架构。当时,OpenAI以大型语言模型如GPT-3而闻名,但DALL-E标志着其向多模态人工智能的转变、、同时处理文本和图像领域。该模型的名称延续了OpenAI命名中常见的俏皮缩写和双关语风格。

2024年2月,OpenAI开始为DALL-E生成的图像添加水印,包含符合C2PA(内容来源与真实性联盟)标准的元数据,该标准由内容真实性倡议推广,以帮助追踪图像来源。

技术

第一个生成式预训练变换器(GPT)模型最初由OpenAI于2018年开发,采用Transformer (architecture)架构。第一个迭代版本GPT-1于2019年扩展为GPT-2;2020年再次扩展为GPT-3,拥有1750亿参数。DALL-E是GPT-3的一个独特变体,经过修改以生成图像。

DALL-E 1

DALL-E由三个组件组成:一个离散变分自编码器、一个类似于GPT-3的自回归解码器Transformer (architecture)模型(120亿参数),以及一个CLIP图像编码器和文本编码器对。

离散变分自编码器(VAE)将图像转换为一系列标记,反之亦然,将一系列标记转换回图像。这是必要的,因为transformer模型不直接处理图像数据。transformer的输入是一系列标记化的图像标题,后跟标记化的图像块。标题为英文,通过字节对编码进行标记化(词汇表大小为16384),最长可达256个标记。每张图像为256x256 RGB图像,分为32x32个4x4块。每个块随后由离散VAE转换为一个标记(词汇表大小为8192)。

DALL-E与CLIP(对比语言-图像预训练)一同开发和发布。CLIP是一个基于对比学习的独立模型,在从互联网抓取的4亿对图像和文本标题上进行训练。其作用是理解和排序DALL-E的输出,通过预测从32768个随机选择的标题中哪个最匹配图像。经过训练的CLIP对会过滤DALL-E生成的较大初始图像列表,以选择最接近文本提示的图像。

继任者

DALL-E 2使用35亿参数,比其前身更少。它不再使用自回归transformer,而是采用扩散模型,以CLIP图像嵌入为条件,在推理过程中,这些嵌入由先验模型从CLIP文本嵌入生成。这与几个月后发布的Stable-Diffusion架构相同。

DALL-E 3于2023年9月发布,在遵循复杂提示方面比先前版本更准确、更详细,并能生成更连贯的文本。虽然为其撰写了技术报告,但该报告未包含训练或实现细节,而是侧重于改进的提示遵循能力。

能力

DALL-E可以生成多种风格的图像,包括逼真图像、绘画和表情符号。它能够操作和重新排列图像中的对象,并能在没有明确指令的情况下,将设计元素正确放置在新颖的构图中。它展示了创造性推理能力,例如为提示补充合理的细节、、比如为与庆祝活动相关的提示添加圣诞节意象,或即使未提及也能正确放置阴影。DALL-E表现出对视觉设计趋势的广泛理解。

DALL-E可以为各种任意描述生成图像,从不同视角呈现,且失败情况极少。佐治亚理工学院交互计算学院副教授马克·里德尔发现,DALL-E能够融合概念,这是人类创造力的关键要素。其视觉推理能力足以解决雷文矩阵测试,这是一种常用于测量智力的视觉测试。

图像修改

DALL-E 2和DALL-E 3可以生成现有图像的变体,并编辑图像以修改或扩展场景。这些模型的修复和扩展能力利用图像上下文,以与原始图像一致的风格填充缺失区域。这可用于插入新主体或将图像扩展到其原始边界之外。据OpenAI称,扩展会考虑图像的现有视觉元素,包括阴影、反射和纹理。

应用与影响

DALL-E开启了生成式AI图像创作的新时代,并影响了后续模型和应用。其继任者DALL-E 2通过API提供,允许开发人员将该模型集成到应用中,并按图像计费。微软将DALL-E 2整合到其Designer应用以及Bing和Edge中的图像创建工具中。DALL-E 3于2023年10月集成到ChatGPT中,供Plus和企业客户使用,并于11月通过API和Labs提供。2024年2月,OpenAI按照C2PA标准为DALL-E图像添加了水印。

参考文献

本文基于公开报告和OpenAI自身出版物的信息。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-art·openai·text-to-image·deep-learning
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴