译自英文

DALL-E 2 是由OpenAI开发的一种文本到图像模型,于2022年发布,它利用扩散和CLIP嵌入从自然语言提示生成逼真的图像。

DALL-E 2是一个由OpenAI开发的文本到图像模型,于2022年发布。它使用深度学习方法,从自然语言描述(称为提示)生成数字图像。该模型是原始DALL-E的继任者,旨在以更高分辨率生成更逼真的图像,并能够组合概念、属性和风格。

DALL-E 2属于生成式人工智能这一更广泛领域的一部分,该领域专注于创造新内容。它采用基于扩散的架构,这与前身的自回归方法有所不同。其名称是皮克斯机器人WALL-E和西班牙超现实主义艺术家萨尔瓦多·达利的合成词。

历史与背景

原始DALL-E由OpenAI在2021年1月5日的博客文章中宣布,使用修改版的GPT-3来生成图像。2022年4月6日,OpenAI宣布DALL-E 2作为继任者,强调其生成更逼真图像和组合概念的能力。最初,由于伦理和安全方面的担忧,访问仅限于预先选定的用户进行研究预览。2022年7月20日,DALL-E 2进入测试阶段,邀请了100万名排队用户;用户每月可以免费生成有限数量的图像,并可购买额外积分。2022年9月28日,排队要求被取消,该模型向公众开放。

2022年11月初,OpenAI将DALL-E 2作为API发布,允许开发者将模型集成到应用程序中。该API按图像计费,价格因分辨率而异,企业客户可享受批量折扣。微软将DALL-E 2集成到其Designer应用以及Bing和Microsoft Edge中的Image Creator工具中。2024年2月,OpenAI开始为DALL-E生成的图像添加水印,使用C2PA(内容来源与真实性联盟)标准嵌入元数据。

技术

DALL-E 2使用35亿个参数,少于其前身的120亿个。它没有采用自回归变换器,而是使用基于CLIP图像嵌入条件的扩散模型。在推理过程中,先验模型从CLIP文本嵌入生成这些图像嵌入。该架构与几个月后发布的Stable Diffusion类似。该模型利用神经网络机器学习技术,建立在人工智能研究的进步之上。

CLIP(对比语言-图像预训练)是一个单独的模型,在来自互联网的4亿个图像-文本对上训练。它在理解和排序DALL-E 2的输出中起着关键作用,选择与提示最匹配的图像。扩散过程在CLIP嵌入的引导下,将随机噪声迭代细化成连贯图像。

能力

DALL-E 2可以生成多种风格的图像,包括逼真照片、绘画和表情符号。它可以操纵和重新排列对象,并在没有明确指令的情况下,将设计元素正确放置在新颖的构图中。例如,当被要求画一个擤鼻涕、喝拿铁或骑独轮车的萝卜时,模型通常会将手帕、手和脚放在合理的位置。它还可以推断适当的细节,例如为与节日相关的提示添加圣诞图像,或渲染未提及的阴影。

该模型对视觉和设计趋势有广泛的理解,可以为各种任意描述从不同视角生成图像,且很少失败。其视觉推理能力足以解决Raven's Matrices,这是一种常用于衡量人类智力的测试。

图像修改

DALL-E 2可以生成现有图像的变体,也可以编辑图像以修改或扩展它们。内绘和外绘功能使用原始图像的上下文,以一致的媒介填充缺失区域,并遵循给定的提示。例如,用户可以将新主题插入图像中,或将其扩展到原始边界之外。据OpenAI称,外绘会考虑现有的视觉元素,如阴影、反射和纹理。

影响与遗产

DALL-E 2影响了后续文本到图像生成的发展,包括2023年10月发布的DALL-E 3,后者被集成到ChatGPT中,并于2025年3月被GPT Image取代。该模型还促进了关于生成式AI能力和伦理影响的更广泛讨论,包括对滥用的担忧以及对水印等来源验证措施的需求。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:text-to-image·generative-ai·openai·diffusion-models
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史