Stability AI 稳定扩散模型 2022

译自英文

Stable Diffusion是一种深度学习文本到图像模型,由Stability AI于2022年发布,基于潜在扩散技术。它能根据文本提示生成细节丰富的图像,并因其公开发布及能在消费级硬件上运行而著称。

Stable Diffusion 是一个深度学习、文本到图像模型,由Stability AI于2022年发布,基于扩散技术。它主要用于根据文本描述生成详细图像,但也可应用于诸如修复、扩展和由文本提示引导的图像到图像转换等任务。该模型被视为持续进行的生成式AI热潮的一部分,并标志着与之前专有的文本到图像模型(如DALL-E和Midjourney)的背离,后者仅能通过云服务访问。

Stable Diffusion是一个潜在扩散模型,一种深度生成人工神经网络。其代码和模型权重已公开发布,优化版本可在配备适度GPU且仅有2.4 GB VRAM的大多数消费级硬件上运行。这种可访问性使其与早期模型区分开来,并促进了其广泛采用。

开发

Stable Diffusion起源于一个名为潜在扩散的项目,由德国慕尼黑大学和海德堡大学的研究人员开发。五位原始作者中的四位,,Robin Rombach、Andreas Blattmann、Patrick Esser和Dominik Lorenz,,后来加入了Stability AI并发布了该模型的后续版本。技术许可证由慕尼黑大学的CompVis小组发布,开发由Runway的Patrick Esser和CompVis的Robin Rombach领导,他们早先发明了潜在扩散架构。Stability AI还感谢EleutherAI和LAION(一个组装训练数据集的德国非营利组织)作为支持者。

技术

架构

扩散模型于2015年引入,训练目标是移除训练图像上连续施加的高斯噪声,类似于一系列去噪自编码器。名称源于热力学扩散,因为最初开发受到热力学启发。SD 3之前的Stable Diffusion系列模型使用了一种称为潜在扩散模型(LDM)的变体,由慕尼黑大学CompVis小组于2021年开发。

Stable Diffusion由三部分组成:变分自编码器(VAE)、U-Net和可选文本编码器。VAE编码器将图像从像素空间压缩到较小的潜在空间,捕获基本语义含义。在前向扩散过程中,高斯噪声被迭代应用于压缩后的潜在表示。U-Net块由ResNet骨干组成,对输出进行去噪以获得潜在表示,VAE解码器通过将表示转换回像素空间生成最终图像。

去噪步骤可以通过交叉注意力机制以文本、图像或其他模态为条件。对于文本条件,固定的预训练CLIP ViT-L/14文本编码器将提示转换为嵌入空间。研究人员指出,LDM在训练和生成方面具有更高的计算效率优势。U-Net中有8.6亿参数,文本编码器中有1.23亿参数,按2022年标准,Stable Diffusion相对轻量,可在消费级GPU上运行,甚至可通过OpenVINO版本仅使用CPU运行。

#### SD XL

XL版本使用相同的LDM架构但更大:更大的UNet骨干、更大的交叉注意力上下文、两个文本编码器而非一个,并在多种宽高比上进行训练。同时发布的SD XL Refiner具有相同架构,但训练用于通过文本条件img2img为现有图像添加细节。

#### SD 3.0

3.0版本完全改变了骨干,使用Rectified Flow Transformer而非UNet。该架构具有三条轨道:原始文本编码、转换后文本编码和潜在空间中的图像编码,其中后两者在每个Transformer块中混合。它被称为“多模态扩散Transformer”(MMDiT),反映其内部混合文本和图像编码,不同于之前的DiT版本,其中文本影响图像但反之不然。

训练数据

Stable Diffusion在来自LAION-5B的图像-标题对上训练,这是一个从Common Crawl网络数据派生的公开数据集。LAION-5B包含50亿个图像-文本对,按语言分类,并根据分辨率、水印可能性和预测美学评分进行过滤。该数据集由LAION创建,这是一个由Stability AI资助的德国非营利组织。模型在三个子集上训练:laion2B-en、laion-high-resolution和laion-aesthetics v2 5+。对1200万图像较小子集的第三方分析发现,约47%来自100个域名,其中Pinterest占8.5%,其次是WordPress、Blogspot、Flickr、DeviantArt和Wikimedia Commons。Bayerischer Rundfunk的一项调查显示,托管在Hugging Face上的LAION数据集包含大量私人和敏感数据。

训练过程

模型最初在laion2B-en和laion-high-resolution上训练,最终轮次在LAION-Aesthetics v2 5+上进行,这是一个包含6亿个带标题图像的子集,预测人类评分者会给出至少5分(满分10分)。该子集排除了低分辨率图像和预测水印概率大于80%的图像。最终训练轮次丢弃了10%的文本条件以改进Classifier-Free Diffusion Guidance。模型使用256个Nvidia A100 GPU在亚马逊网络服务上训练了150,000 GPU小时,成本为60万美元。

局限性

Stable Diffusion存在已知的退化问题,例如难以渲染手部和文本,并且由于训练数据可能产生有偏见或有害的内容。公开发布引发了对滥用的担忧,包括深度伪造和版权侵权,导致在机器学习社区中关于监管和伦理使用的持续辩论。

影响

Stable Diffusion于2022年的发布显著加速了深度学习艺术运动,使爱好者和艺术家能够在个人硬件上生成高质量图像。它影响了后续的文本到图像模型,并为更广泛的AI热潮做出了贡献,应用领域包括艺术、设计和内容创作。该模型的开源性质培育了一个庞大的社区工具和微调变体生态系统,尽管它也引发了关于知识产权和创意工作未来的讨论。

接受与遗产

该模型因其技术成就和可访问性而受到广泛关注。它因效率和高质量而受到赞扬,但也因潜在滥用而受到批评。截至2025年,Stable Diffusion仍然是生成式AI中的基础参考,Stability AI和开源社区正在进行持续开发。其架构和训练方法已被众多后续模型采用,巩固了其在该领域的遗产。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·text-to-image·deep-learning·open-source-software
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史