DALL-E 2是由OpenAI开发的文本到图像模型,于2022年4月6日宣布,作为原版DALL-E的继任者。它利用深度学习方法,根据自然语言描述(即提示)生成数字图像。该模型旨在比其前身生成更逼真、分辨率更高的图像,并具备组合概念、属性和风格的能力。其名称是皮克斯机器人角色WALL-E与西班牙超现实主义艺术家萨尔瓦多·达利的合成词。
历史与背景
原版DALL-E由OpenAI于2021年1月5日通过一篇博客文章公布,使用修改版的GPT-3来生成图像。DALL-E 2于2022年4月6日宣布,并于2022年7月20日进入测试阶段,向100万名列入等待名单的个人发送了邀请。在此阶段,用户每月可以免费生成一定数量的图像,并可付费购买更多额度。此前,由于对伦理和安全的担忧,访问仅限于预先选定的用户进行研究预览。2022年9月28日,DALL-E 2向所有人开放,并取消了等待名单要求。2022年11月初,OpenAI将DALL-E 2作为API发布,允许开发人员将该模型集成到自己的应用程序中。微软随后在其Designer应用以及Bing和Microsoft Edge中包含的Image Creator工具中实现了DALL-E 2。该API按图像计费,价格因图像分辨率而异,企业客户可享受批量折扣。2024年2月,OpenAI开始为DALL-E生成的图像添加水印,其中包含由内容真实性倡议推广的C2PA(内容来源与真实性联盟)标准中的元数据。
技术
DALL-E 2使用35亿个参数,比其前身更少。它没有采用自回归Transformer,而是使用以CLIP图像嵌入为条件的扩散模型。在推理过程中,这些图像嵌入由先验模型从CLIP文本嵌入生成。该架构与几个月后发布的Stable Diffusion相同。该模型建立在早期Generative AI和Deep learning工作的基础上,特别是OpenAI等机构对Transformer (architecture)架构的开发。OpenAI于2018年开发了首个生成式预训练Transformer(GPT)模型,并于2019年扩展到GPT-2,2020年扩展到GPT-3,拥有1750亿个参数。DALL-E 2的扩散方法不同于原版DALL-E的自回归方法,后者使用了离散VAE和具有120亿参数的仅解码器Transformer模型。
能力
DALL-E 2可以生成多种风格的图像,包括逼真图像、绘画和表情符号。它可以操纵和重新排列图像中的对象,并在没有明确指令的情况下,将设计元素正确放置在新颖的构图之中。该模型对视觉和设计趋势有广泛的理解,能够为各种任意描述生成不同视角的图像,且失败情况罕见。其视觉推理能力足以解决雷文矩阵,这是一种常用于衡量人类智力的视觉测试。DALL-E 2还支持图像修改,包括生成现有图像的变体,以及通过内补和外扩进行编辑。这些能力利用图像中的上下文,根据给定的提示,使用与原始图像一致的媒介来填充缺失区域。例如,外扩可以将图像扩展到原始边界之外,同时考虑阴影、反射和纹理等现有视觉元素。
影响与遗产
DALL-E 2标志着文本到图像生成的重大进步,通过开放测试和最终取消等待名单,将该技术带给了更广泛的公众。其发布激发了人们对Generative AI的兴趣,并影响了该领域的后续发展,包括于2023年10月原生集成到ChatGPT中面向Plus和Enterprise客户发布的DALL-E 3。DALL-E 3后来被集成到微软的Bing Image Creator和Copilot中,并于2025年3月在ChatGPT中被GPT Image的原生图像生成能力所取代。该模型的基于扩散的架构也影响了其他系统,如Stable Diffusion,并推动了Machine learning在创意任务中应用的快速演变。DALL-E 2在安全方面的方法,包括研究预览期间的受限访问以及后来的水印添加,为生成模型的负责任部署树立了先例。
反响与担忧
DALL-E 2的发布引起了公众和学术界的广泛关注,既凸显了AI生成图像的创造潜力,也揭示了其伦理挑战。担忧包括可能被滥用以创建误导性内容、版权问题,以及对艺术家和设计师的影响。OpenAI分阶段推出,包括最初的限制和等待名单,反映了这些担忧。该模型能够根据文本提示生成逼真图像,这也引发了关于来源和真实性的问题,导致2024年采用了C2PA水印。尽管存在这些挑战,DALL-E 2仍因其技术成就和用户友好的界面而广受赞誉,帮助在非专业人士中普及了文本到图像的生成技术。