Stable Diffusion 发布

译自英文

Stable Diffusion是一个开源深度学习文本到图像模型,由Stability AI于2022年发布,通过在消费级硬件上运行而普及了生成艺术。它利用潜在扩散技术,从文本提示生成详细图像。

Stable Diffusion是一个基于扩散技术的深度学习文本到图像模型,于2022年发布。该生成式AI技术是Stability AI的主要产品,被视为持续进行的AI热潮的一部分。它主要用于根据文本描述生成详细图像,但也可应用于其他任务,如修复、扩展以及根据文本提示引导的图像到图像转换。其开发涉及慕尼黑大学CompVis小组和Runway的研究人员,Stability提供了计算捐赠,非营利组织提供了训练数据。

Stable Diffusion是一种潜在扩散模型,属于深度生成式人工神经网络。其代码和模型权重已公开发布,优化版本可在配备适度GPU且显存低至2.4 GB的大多数消费级硬件上运行。这标志着与先前专有文本到图像模型(如DALL-E和Midjourney)的显著不同,后者仅能通过云服务访问。

开发

Stable Diffusion源于一个名为潜在扩散的项目,由德国慕尼黑大学和海德堡大学的研究人员在慕尼黑开发。最初五位作者中的四位(Robin Rombach、Andreas Blattmann、Patrick Esser和Dominik Lorenz)后来加入了Stability AI,并发布了Stable Diffusion的后续版本。该模型的技术许可是由慕尼黑大学CompVis小组发布的。开发由Runway的Patrick Esser和CompVis的Robin Rombach领导,他们也是早期发明Stable Diffusion所用潜在扩散模型架构的研究人员。Stability AI还将EleutherAI和LAION(一个组装了Stable Diffusion训练数据集的德国非营利组织)列为项目的支持者。

2022年Stable Diffusion的发布标志着Generative AI工具可访问性的重大转变。与需要云访问的早期模型不同,Stable Diffusion可以在本地运行,使更广泛的艺术家和开发者社区能够实验文本到图像生成。这促进了其快速采用以及AI生成艺术在各种在线平台上的普及。

技术

架构

扩散模型于2015年引入,其训练目标是从训练图像中去除逐步施加的高斯噪声,可以视为一系列去噪自编码器。名称“扩散”来源于热力学扩散,因为其最初是受热力学启发而开发的。SD 3之前的Stable Diffusion系列模型均使用扩散模型的一种变体,称为潜在扩散模型(LDM),由慕尼黑大学CompVis(计算机视觉与学习)小组于2021年开发。

Stable Diffusion由三个部分组成:变分自编码器(VAE)、U-Net和可选的文本编码器。VAE编码器将图像从像素空间压缩到较小维度的潜在空间,捕捉图像更基本的语义含义。在前向扩散过程中,高斯噪声被迭代应用于压缩后的潜在表示。U-Net块由ResNet骨干组成,通过反向去噪前向扩散的输出以获得潜在表示。最后,VAE解码器通过将表示转换回像素空间来生成最终图像。

去噪步骤可以灵活地以文本字符串、图像或其他模态为条件。编码后的条件数据通过交叉注意力机制暴露给去噪U-Net。对于文本条件,使用固定的预训练CLIP ViT-L/14文本编码器将文本提示转换到嵌入空间。研究人员指出,LDM在训练和生成方面的计算效率提高是一个优势。U-Net中有8.6亿个参数,文本编码器中有1.23亿个参数,按2022年的标准,Stable Diffusion被认为相对轻量,且与其他扩散模型不同,它可以在消费级GPU上运行,甚至如果使用OpenVINO版本的Stable Diffusion,也可以在仅CPU环境下运行。

#### SD XL

XL版本使用与先前版本相同的LDM架构,但规模更大:更大的UNet骨干、更大的交叉注意力上下文、两个文本编码器而非一个,并在多种宽高比上训练(而不仅仅是先前版本的方形宽高比)。同时发布的SD XL Refiner具有与SD XL相同的架构,但其训练目的是通过文本条件的img2img为已有图像添加细节。

#### SD 3.0

3.0版本完全改变了骨干架构。不再是UNet,而是Rectified Flow Transformer,它使用Transformer (architecture)实现整流流方法。用于SD 3.0的Transformer架构具有三个“轨道”,分别用于原始文本编码、转换后的文本编码和图像编码(在潜在空间中)。转换后的文本编码和图像编码在每个Transformer块中混合。该架构被称为“多模态扩散Transformer(MMDiT)”,其中“多模态”意味着其操作内部混合了文本和图像编码。这与先前版本的DiT不同,在DiT中,文本编码影响图像编码,但反之则不成立。

训练数据

Stable Diffusion是在取自LAION-5B的图像和标题对上训练的,LAION-5B是一个公开可用的数据集,源自从网络抓取的Common Crawl数据,其中50亿个图像-文本对根据语言分类,并按分辨率、预测包含水印的可能性以及预测的“美学”评分(例如主观视觉质量)过滤到不同数据集。该数据集由LAION创建,这是一个接受Stability AI资助的德国非营利组织。Stable Diffusion模型在LAION-5B的三个子集上训练:laion2B-en、laion-high-resolution和laion-aesthetics v2 5+。对模型训练数据的第三方分析发现,在从原始更广泛数据集取出的较小1200万图像子集中,约47%的图像样本来自100个不同域,其中Pinterest占子集的8.5%,其次是WordPress、Blogspot、Flickr、DeviantArt和Wikimedia Commons等网站。Bayerischer Rundfunk的一项调查显示,托管在Hugging Face上的LAION数据集包含大量私人和敏感数据。

训练程序

该模型最初在laion2B-en和laion-high-resolution子集上训练,最后几轮训练在LAION-Aesthetics v2 5+上进行,这是一个包含6亿个带标题图像的子集,LAION-Aesthetics Predictor V2预测人类平均会给出至少5分(满分10分)的评分,当被问及他们有多喜欢这些图像时。LAION-Aesthetics v2 5+子集还排除了低分辨率图像以及LAION-5B-WatermarkDetection识别为携带水印概率大于80%的图像。最后几轮训练还放弃了10%的文本条件以改进无分类器扩散引导。该模型使用256个Nvidia A100 GPU在Amazon Web Services上训练,总计150,000个GPU小时,成本为600,000美元。

影响与遗产

Stable Diffusion代码和权重的公开发布对Artificial intelligence和数字艺术领域产生了深远影响。它使强大的文本到图像生成民主化,使个人和小团队无需昂贵的云基础设施即可创建高质量图像。这导致了创意应用的激增,从概念艺术和插图到广告和游戏设计。该模型还促进了Machine learning领域的进一步研究,特别是在模型压缩和高效推理方面,因为开发者寻求在越来越有限的硬件上运行该模型。

Stable Diffusion还引发了关于版权、数据隐私和潜在滥用的重要伦理和法律问题。使用抓取的网络数据进行训练(包括受版权保护的图像和个人信息)成为争论和诉讼的主题。这些担忧促使人们讨论在生成模型开发中需要更透明和负责任的数据实践,影响了该领域的后续工作。

局限性

Stable Diffusion在生成复杂场景或文本时存在退化伪影问题。它可能在解剖学正确性方面遇到困难,产生手部或面部扭曲的图像,并且可能无法准确渲染图像中的文本。模型的性能还依赖于其训练数据的质量和多样性,这可能导致生成图像中的偏见。此外,训练和微调像SD 3.0这样的大型模型的计算成本仍然很高,限制了一些研究人员和开发者的实验。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·text-to-image·deep-learning·open-source
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史