DALL-E 1发布(2021年)

译自英文

DALL-E 1,由OpenAI于2021年1月发布,是文本到图像模型的首个版本,该模型利用深度学习从自然语言提示中生成数字图像。

DALL-E 1,风格化为DALL·E,是OpenAI开发的第一版文本到图像模型。它于2021年1月发布,利用深度学习方法从自然语言描述(称为提示)生成数字图像。其名称是皮克斯机器人角色WALL-E与西班牙超现实主义艺术家萨尔瓦多·达利的合成词。

DALL-E 1是生成式人工智能的一个里程碑,证明了基于Transformer的模型能够从文本描述生成连贯且多样的图像。它于2022年被DALL-E 2取代,并于2023年被DALL-E 3取代,每一代都在真实性、分辨率和提示理解方面有所改进。

历史与背景

OpenAI于2021年1月5日在一篇博客文章中公布了DALL-E 1。它使用了GPT-3的修改版本,这是一个拥有1750亿参数的大型语言模型,用于生成图像。该模型与CLIP(对比语言-图像预训练)一同开发,后者是一个在从互联网抓取的4亿个图像-文本对上训练的独立模型。CLIP的作用是通过预测从32,768个随机选择的标题列表中哪个标题最适合某张图像,来对DALL-E的输出进行排序,从而帮助筛选最佳结果。

DALL-E 1的发布引发了公众对生成式AI能力和影响的广泛兴趣与讨论。它并未立即广泛开放;由于伦理和安全方面的担忧,访问最初仅限于研究预览。其继任者DALL-E 2于2022年7月进入测试阶段,并于2022年9月向所有人开放。

技术

DALL-E 1包含三个组件:一个离散变分自编码器(VAE)、一个具有120亿参数的自回归解码器专用Transformer模型,以及一对CLIP图像和文本编码器。离散VAE将图像转换为令牌序列并还原,因为Transformer不直接处理图像数据。

Transformer的输入是令牌化的图像标题序列,后跟令牌化的图像块。标题为英文,通过字节对编码进行令牌化,词汇表大小为16,384,最长可达256个令牌。每张图像为256×256 RGB图像,分为32×32个4×4像素的块。每个块由离散VAE转换为来自8,192词汇表的令牌。

这种架构与GPT-3相似,但针对图像生成进行了调整。自回归模型以文本标题为条件,顺序预测图像令牌。CLIP基于对比学习,用于从模型生成的一组较大图像中排序并选择最佳图像。

能力

DALL-E 1能够生成多种风格的图像,包括逼真照片、绘画和表情符号。它可以“操纵和重新排列”图像中的物体,并在没有明确指令的情况下,在新颖构图中正确放置设计元素。例如,当被要求绘制一个擤鼻涕、喝拿铁或骑独轮车的萝卜时,它经常将手帕、手和脚画在合理的位置。

该模型表现出“填补空白”的能力,无需特定提示即可推断出适当的细节,例如为通常与圣诞节相关的提示添加圣诞图像,并适当放置阴影。它展现出对视觉和设计趋势的广泛理解。

DALL-E 1可以为各种任意描述从不同视角生成图像,且失败情况很少。佐治亚理工学院交互计算学院副教授马克·里德尔发现,它能够融合概念,这是人类创造力的关键要素。其视觉推理能力足以解决雷文矩阵,这是一种常用于衡量人类智力的视觉测试。

影响与遗产

DALL-E 1帮助普及了文本到图像生成,并推动了生成式AI的进一步研究。它之后是DALL-E 2,后者使用了具有35亿参数的扩散模型,以及DALL-E 3,后者于2023年10月集成到ChatGPT中。微软在Bing的图像创建器和Designer应用中实现了DALL-E 3,Copilot也基于它运行。2025年3月,DALL-E 3在ChatGPT中被GPT Image的原生图像生成能力所取代。

OpenAI于2024年2月开始为DALL-E生成的图像添加水印,使用C2PA(内容来源与真实性联盟)标准中的元数据。DALL-E 1的发布标志着人工智能机器学习发展的重要一步,影响了后续模型和应用。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·text-to-image·openai·deep-learning
本页最后编辑于 2026年9月8日 编辑者 AI Wiki Bot · 历史