译自英文

DALL-E 2是OpenAI开发的一种文本到图像模型,于2022年4月发布,利用扩散和CLIP嵌入从自然语言提示生成逼真图像。它继承了最初的DALL-E,并随后被DALL-E 3所取代。

DALL-E 2是一种由OpenAI开发的文本到图像模型,能够根据自然语言描述(即提示)生成数字图像。该模型于2022年4月6日宣布,继承了最初的DALL-E模型,旨在以更高分辨率生成更逼真的图像,并具备组合概念、属性和风格的能力。该模型采用深度学习方法,特别是基于CLIP图像嵌入条件的扩散模型,并于2022年分阶段向公众发布。

名称DALL-E是动画机器人角色WALL-E与西班牙超现实主义艺术家萨尔瓦多·达利的合成词。该模型的开发标志着生成式人工智能的重要一步,建立在早期机器学习神经网络进展的基础上。

历史与背景

DALL-E的第一个版本由OpenAI于2021年1月宣布,使用GPT-3的修改版生成图像。2022年4月6日,OpenAI宣布DALL-E 2作为其继任者,强调改进的逼真度和分辨率。出于伦理和安全考虑,初始访问仅限于预选用户进行研究预览。2022年7月20日,该模型进入测试阶段,向100万名候补名单中的个人发送邀请,他们每月可免费生成一定数量的图像,并可购买额外积分。2022年9月28日,候补名单要求被取消,DALL-E 2向所有人开放。

2022年11月初,OpenAI将DALL-E 2作为API发布,允许开发者将该模型集成到其应用程序中。该API按图像计费,价格因分辨率而异,企业客户可享受批量折扣。微软后来在其Designer应用以及Bing和Microsoft Edge中的Image Creator工具中实现了DALL-E 2。2023年9月,OpenAI宣布DALL-E 3,并于2023年10月集成到ChatGPT中供Plus和企业客户使用,后于2025年3月被GPT Image取代。

技术

DALL-E 2使用35亿个参数,少于其前身的120亿个参数。它不再采用自回归Transformer模型,而是使用基于CLIP图像嵌入条件的扩散模型。在推理过程中,先验模型从CLIP文本嵌入生成这些图像嵌入。该架构与几个月后发布的Stable Diffusion类似。最初的DALL-E使用离散变分自动编码器将图像转换为令牌,由自回归解码器专用Transformer处理,并配有一对CLIP图像和文本编码器来对输出进行排序。

DALL-E 2的扩散过程通过文本派生的嵌入引导,将噪声迭代细化为图像,从而实现高分辨率输出和连贯的对象放置。该模型的训练涉及大量图像-文本对数据集,但具体细节未完全公开。

能力

DALL-E 2可以生成多种风格的图像,包括逼真照片、绘画和表情符号。它可以操纵和重新排列对象,并在无需明确指令的情况下在新颖构图中正确放置设计元素。例如,当被要求绘制一个擤鼻涕、喝拿铁或骑独轮车的萝卜时,该模型通常会在合理位置绘制手帕、手和脚。它还可以填补空白,例如为与庆祝活动相关的提示添加圣诞图像,或为未提及阴影的图像添加适当的阴影。

该模型对视觉和设计趋势有广泛理解,并能融合概念,这是人类创造力的关键要素。其视觉推理能力足以解决瑞文推理测验,这是一种常用于测量人类智力的视觉测试。DALL-E 2可以为各种任意描述从不同视角生成图像,仅偶有失败。

图像修改

给定现有图像,DALL-E 2可以根据原图生成各种变体作为单独输出,还可以编辑图像以修改或扩展它。修复和外扩功能利用图像上下文来填充缺失区域,遵循给定提示。例如,这可以将新主体插入图像或将其扩展到原始边界之外。OpenAI指出,外扩会考虑图像现有的视觉元素,包括阴影、反射和纹理。

安全与伦理

在研究预览期间,OpenAI限制了对DALL-E 2的访问,原因是担心滥用,例如生成误导性或有害内容。该公司实施了过滤器以阻止暴力、成人或政治内容,并于2024年2月在生成的图像中添加了水印,其中包含内容真实性倡议推广的C2PA标准中的元数据。这些措施旨在解决围绕深度伪造和错误信息的伦理问题。

遗产与影响

DALL-E 2影响了后续的文本到图像模型以及更广泛的人工智能研究。其基于扩散的方法被其他系统采用,其集成到Bing Image Creator等产品中扩大了公众对生成图像的访问。该模型的成功促进了OpenAI在该领域的突出地位,同时推动了深度学习注意力机制的发展。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:text-to-image·openai·generative-ai·diffusion-model
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史