译自英文

DALL-E是由OpenAI开发的一系列文本到图像模型,于2021年1月首次公布,利用深度学习从自然语言提示中生成数字图像。

DALL-E是一系列由OpenAI开发的文本到图像模型,能够根据自然语言描述(即提示词)生成数字图像。首个版本于2021年1月发布,随后在2022年推出DALL-E 2,2023年推出DALL-E 3。其名称是动画机器人WALL-E与超现实主义艺术家萨尔瓦多·达利的合成词。

历史与背景

OpenAI于2021年1月5日在一篇博客文章中公布了DALL-E,使用了其GPT-3模型的修改版本来生成图像。2022年4月6日,公司宣布推出DALL-E 2,这是旨在以更高分辨率生成更逼真图像,并能够组合概念、属性和风格的后续版本。由于伦理和安全方面的考虑,访问最初仅限于预选用户进行研究预览。2022年7月20日,DALL-E 2进入测试阶段,向一百万名候补名单用户发送了邀请;用户每月可以免费生成有限数量的图像,并可购买更多。2022年9月28日,候补名单被取消,该模型向所有人开放。

2023年9月,OpenAI宣布推出DALL-E 3,它比之前的版本能理解更多的细微差别和细节。2023年10月,它原生集成到ChatGPT中,供Plus和企业客户使用,并于11月初在API和Labs中提供。微软将DALL-E 3集成到Bing的图像创建器和Designer应用中,Microsoft Copilot也基于DALL-E 3运行。2025年3月,DALL-E 3在ChatGPT中被GPT Image的原生图像生成能力所取代。

2024年2月,OpenAI开始为DALL-E生成的图像添加水印,将元数据嵌入到由内容真实性倡议推广的C2PA(内容来源与真实性联盟)标准中。

技术

第一个生成式预训练变换器(GPT)模型由OpenAI于2018年开发,使用Transformer (architecture)架构。2019年扩展到GPT-2,2020年扩展到GPT-3,拥有1750亿个参数。

DALL-E

DALL-E由三个组件组成:一个离散变分自编码器(VAE),一个具有120亿参数、类似GPT-3的自回归解码器专用变换器模型,以及一对CLIP(对比语言-图像预训练)图像和文本编码器。离散VAE将图像转换为一系列标记并再转换回来,使变换器能够处理图像数据。变换器接收一系列标记化的图像标题,后跟标记化的图像块。标题为英文,通过字节对编码进行标记化,词汇量为16,384,最长可达256个标记。每张图像为256×256 RGB,分为32×32个4×4像素的块,每个块由VAE转换为词汇量为8,192的标记。

CLIP与DALL-E同时开发,是一个基于对比学习的独立模型,训练于从互联网抓取的4亿个图像-文本对。它通过预测从32,768个随机选择的标题列表中哪个标题最适合某张图像来对DALL-E的输出进行排序。一个训练好的CLIP对会过滤一个较大的初始生成图像列表,以选择最接近提示词的图像。

DALL-E 2

DALL-E 2使用35亿个参数,比其前身更少。它不使用自回归变换器,而是使用以CLIP图像嵌入为条件的扩散模型,这些嵌入在推理过程中由先验模型从CLIP文本嵌入生成。该架构与几个月后发布的Stable Diffusion类似。

DALL-E 3

OpenAI为DALL-E 3发布了一份技术报告,但未包含训练或实现细节,而是侧重于改进的提示词遵循能力。

能力

DALL-E可以生成多种风格的图像,包括照片级逼真图像、绘画和表情符号。它可以操作和重新排列图像中的物体,并在没有明确指令的情况下正确地将设计元素放置在新颖的构图中。例如,当被要求画一个擤鼻涕、喝拿铁或骑独轮车的萝卜时,DALL-E通常会在合理的位置画出纸巾、手和脚。它可以推断出提示词中未提及的适当细节,例如为与节日相关的提示词添加圣诞图像,或适当地放置阴影。DALL-E还表现出对视觉和设计趋势的广泛理解。

DALL-E可以为各种任意描述生成不同视角的图像,只有极少数失败情况。佐治亚理工学院交互计算学院的副教授马克·里德尔发现,DALL-E能够融合概念,他认为这是人类创造力的关键要素。其视觉推理能力足以解决瑞文推理测验,这是一种常用于衡量人类智力的视觉测试。

DALL-E 3比其前身更准确、更详细地遵循复杂提示词,并能生成更连贯、更准确的文本。它已集成到ChatGPT Plus中。

图像修改

DALL-E 2和DALL-E 3可以生成现有图像的变体,并对其进行编辑以修改或扩展。修复和扩展能力利用图像的上下文,以与原始图像一致的风格填充缺失区域,并遵循给定的提示词。这可以将新主体插入图像中,或将其扩展到原始边界之外。据OpenAI称,扩展会考虑图像现有的视觉元素,包括阴影、反射和纹理。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:text-to-image·openai·generative-ai·deep-learning
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史