文生图生成是指人工智能系统接收自然语言描述(即提示词),并生成相应图像的过程。该任务结合了自然语言处理以解读文本,以及计算机视觉和生成建模以渲染像素,并成为生成对抗网络及后来的扩散模型最引人注目的应用之一。
历史
2010年代的早期尝试使用基于文本嵌入条件化的生成对抗网络,生成小而模糊的图像,且仅限于鸟类或花卉等狭窄领域。2021年1月,OpenAI的DALL-E改变了这一领域,它应用了一个在图像标记上自回归训练的Transformer,同年晚些时候,CLIP为研究人员提供了一种评分图像与标题匹配程度并引导生成朝向该匹配的方法。真正的突破在于向扩散模型的转变:DALL-E 2(2022年)、谷歌的Imagen,尤其是2022年8月稳定扩散的开源发布,使高质量生成变得快速,并且在稳定扩散的情况下,可在消费级GPU上运行。Midjourney通过Discord访问,围绕相同的核心技术构建了独特的审美优先产品,而黑森林实验室于2024年发布的FLUX则成为新的开放权重标准。
工作原理
大多数现代系统基于潜在扩散模型构建:图像通过自编码器压缩为紧凑的潜在空间,文本编码器将提示词转换为嵌入,去噪网络在该嵌入的引导下逐步将随机噪声转化为潜在图像,随后解码为像素。诸如无分类器引导等技术允许用户在提示词保真度与图像多样性之间进行权衡。2023年推出的ControlNet增加了在文本之外基于草图、姿态或深度图进行条件生成的能力,从而对构图提供更精细的控制。
提示词文化与工具
由于输出质量对措辞敏感,围绕编写有效提示词形成了一套非正式技艺,涵盖主题描述、艺术风格、相机和光照术语,以及用于排除不需要元素的负向提示,这是后来被称为提示工程的早期实例。Discord和Reddit上的社区分享了提示词公式,并出现了用于放大、修复和组合输出的辅助工具。LoRA适配器使得在少量示例图像和适度计算资源下,针对特定角色、风格或对象微调基础模型变得切实可行。
接受度与批评
文生图工具在广告、概念艺术和游戏设计中迅速获得商业采用,同时也引发了持续的争议。艺术家们反对模型在未经同意或补偿的情况下使用抓取的图像进行训练,这助长了更广泛的AI版权争议以及对多家图像生成公司的诉讼。批评者还提出了关于深度伪造、未经同意的图像以及低质量合成输出淹没图库和社交平台(这一现象后来被称为“AI垃圾内容”)的担忧。实验室通过内容过滤器、来源元数据以及在某些情况下使用AI水印系统作出回应,但整个生态系统的执行情况仍不一致。
后续发展
到2025年,领先模型能够遵循更长、更具组合性的提示词,在图像内渲染可读文本,并通过自然语言指令编辑现有照片,从而缩小了文生图生成与通用图像编辑之间的差距。