Stable Diffusion

译自英文

Stable Diffusion 是一个开源文本到图像模型,由 Stability AI 于 2022 年 8 月发布,基于潜在扩散技术。它能根据文本提示生成详细图像,并可在消费级硬件上运行,标志着从专有云端模型向本地化生成的转变。

Stable Diffusion是一个于2022年8月发布的深度学习文本到图像模型,基于扩散技术。它是Stability AI的首要产品,被视为正在进行的AI热潮的一部分。该模型根据文本描述生成详细图像,并支持诸如修复、扩展和由文本提示引导的图像到图像转换等任务。其开发涉及慕尼黑大学CompVis小组和Runway的研究人员,Stability AI提供了计算捐赠,非营利组织提供了训练数据。

Stable Diffusion是一个潜在扩散模型,一种深度生成人工神经网络。其代码和模型权重公开发布,优化版本可在大多数消费级硬件上运行,仅需少量GPU和低至2.4 GB的显存。这与DALL-E和Midjourney等专有文本到图像模型不同,后者仅通过云服务访问,这使得Stable Diffusion广泛可供个人用户和研究人员使用。

开发

Stable Diffusion源于一个名为潜在扩散的项目,由德国慕尼黑大学和海德堡大学的研究人员开发。五位原始作者中的四位,,Robin Rombach、Andreas Blattmann、Patrick Esser和Dominik Lorenz,,后来加入Stability AI并发布了后续版本。技术许可由慕尼黑大学CompVis小组发布。开发由Runway的Patrick Esser和CompVis的Robin Rombach领导,他们早先发明了潜在扩散架构。Stability AI还感谢EleutherAI和LAION(一个组装训练数据集的德国非营利组织)作为项目支持者。

技术

架构

扩散模型于2015年引入,训练用于去除训练图像上连续应用的高斯噪声,充当一系列去噪自编码器。名称来源于热力学扩散,因为该技术受热力学启发。SD 3之前的Stable Diffusion系列模型使用了一种称为潜在扩散模型(LDM)的变体,由慕尼黑大学CompVis小组于2021年开发。

Stable Diffusion由三部分组成:变分自编码器(VAE)、U-Net和可选文本编码器。VAE编码器将图像从像素空间压缩到较小维度的潜在空间,捕获语义含义。在前向扩散过程中,高斯噪声迭代应用于压缩的潜在表示。U-Net块由ResNet骨干组成,向后去噪输出以获得潜在表示。最后,VAE解码器通过将表示转换回像素空间生成最终图像。

去噪步骤可以以文本、图像或其他模态为条件。编码的条件数据通过Cross-Attention机制暴露给去噪U-Net。对于文本条件,固定的预训练CLIP ViT-L/14文本编码器将提示转换为嵌入空间。研究人员引用LDM在训练和生成方面提高计算效率作为优势。

U-Net中有8.6亿参数,文本编码器中有1.23亿参数,按2022年标准,Stable Diffusion相对轻量。与其他扩散模型不同,它可在消费级GPU上运行,甚至可通过OpenVINO版本在仅CPU环境下运行。

#### SD XL

XL版本使用相同的LDM架构但更大:更大的UNet骨干、更大的交叉注意力上下文、两个文本编码器而非一个,并在多个宽高比而非仅正方形上训练。同时发布的SD XL Refiner具有相同架构,但训练用于通过文本条件img2img为现有图像添加精细细节。

#### SD 3.0

3.0版本完全改变了骨干。它使用Rectified Flow Transformer,实现整流流方法,采用Transformer (architecture)架构。该架构有三个轨道:原始文本编码、转换文本编码和潜在空间中的图像编码。在每个transformer块中混合转换文本编码和图像编码。这被称为“多模态扩散transformer(MMDiT)”,其中多模态意味着它在操作内部混合文本和图像编码,与之前的DiT版本不同,后者文本编码影响图像编码但反之不然。

训练数据

Stable Diffusion在来自LAION-5B的图像-标题对上训练,这是一个从Common Crawl网络抓取中衍生的公开数据集。50亿图像-文本对按语言分类,并按分辨率、预测水印可能性和预测“美学”分数过滤成数据集。LAION是一个接受Stability AI资助的德国非营利组织,创建了该数据集。模型在三个子集上训练:laion2B-en、laion-high-resolution和laion-aesthetics v2 5+。

对1200万图像较小子集的第三方分析发现,约47%来自100个域,Pinterest占8.5%,其次是WordPress、Blogspot、Flickr、DeviantArt和Wikimedia Commons。Bayerischer Rundfunk的一项调查显示,托管在Hugging Face上的LAION数据集包含大量私人和敏感数据。

训练程序

模型最初在laion2B-en和laion-high-resolution上训练,最后几轮在LAION-Aesthetics v2 5+上训练,这是一个包含6亿张带标题图像的子集,预计人类美学评分至少为5分(满分10分)。此子集排除了低分辨率图像和水印检测概率高于80%的图像。最终训练轮次丢弃了10%的文本条件以改进无分类器扩散引导。训练使用256个Nvidia A100 GPU在Amazon Web Services上进行,共150,000 GPU小时,成本为60万美元。

局限性

Stable Diffusion在复杂场景、人体解剖和文本渲染方面存在退化问题。它可以再现训练数据中的偏见,包括刻板印象和有害内容。模型在处理手和脸等精细细节时遇到困难,经常产生扭曲结果。它也难以处理涉及多个对象或特定空间关系的组合提示。截至2024年,较新版本解决了一些局限性,但仍面临这些领域的挑战。

影响与反响

2022年8月Stable Diffusion的公开发布引发了关于生成式AI伦理、版权和艺术劳动的广泛讨论。其开源性质允许开发人员创建用于机器学习实验、数据增强和创意工作流程的工具。模型在消费级硬件上的可访问性促进了AI艺术社区和商业应用的激增。Stability AI发布了后续版本,包括2023年的SD XL和2024年的SD 3.0,每个版本都提高了质量和能力。该模型还影响了政策辩论,导致关于AI监管和内容来源的讨论。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·text-to-image·open-source-software·diffusion-models
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史