DALL-E是一系列由OpenAI开发的文本到图像生成模型,其名称是艺术家萨尔瓦多·达利和皮克斯机器人角色WALL-E的合成词。最初的DALL-E于2021年1月发布,是一个拥有120亿参数的变换器模型,基于与GPT-3相同的架构家族,通过将图像生成视为离散图像标记上的序列预测问题来训练从文本描述生成图像,而非使用后来主导该领域的扩散技术。
各版本演变
DALL-E 2于2022年4月发布,用基于CLIP引导的扩散架构取代了原始的离散标记方法,CLIP是OpenAI的联合图像-文本嵌入模型,从而生成分辨率更高、更逼真的图像,并引入了“修复”功能,可根据文本描述编辑现有图像的部分区域。DALL-E 2的公开测试版及其后于2022年晚些时候的全面开放,引起了主流媒体的广泛关注,并普遍被认为与Midjourney和Stable Diffusion等同期发布的产品一道,首次将AI生成图像带入主流公众视野。DALL-E 3于2023年发布,并直接集成到面向订阅用户的ChatGPT中,改进了提示遵循和图像内文本渲染,并利用ChatGPT本身在将简短用户提示传递给图像模型之前对其进行扩展和细化。
反响与影响
DALL-E的发布引发了关于视觉创意工作未来的广泛公众辩论,既激发了用户对AI辅助艺术和设计的热情,也引起了专业插画师和摄影师对职业替代以及未经同意在训练数据中使用受版权保护图像的担忧,这一争议进一步波及整个生成式AI行业的AI版权诉讼。该系统还因其可能生成虚假信息和非自愿图像而受到审查,促使OpenAI实施内容过滤器,并在一定时期内限制生成公众人物的可识别面孔。
遗产
DALL-E普遍被认为,连同早期关于GAN的学术工作和后来的开放竞争对手,是将文本到图像生成确立为主流消费和商业技术而非研究好奇心的模型之一。其成功直接促进了OpenAI更广泛的多模态战略,为后来集成到GPT-4及后续模型中的图像理解和图像生成能力奠定了基础,并帮助普及了提示写作作为一项与视觉(而非仅文本)生成式AI系统相关的技能。