Stable Diffusion 2022年8月版本

译自英文

Stable Diffusion是一个深度学习文本到图像模型,于2022年8月由Stability AI发布,基于潜在扩散技术。它从文本提示生成详细图像,并以其开源发布而著称,使得在消费级硬件上广泛采用成为可能。

Stable Diffusion是一个深度学习文本到图像模型,于2022年8月发布,由慕尼黑大学LMU CompVis小组和Runway的研究人员开发,Stability AI提供计算支持,非营利组织提供训练数据。它是一个潜在扩散模型,一种深度生成人工神经网络,被视为Stability AI的旗舰产品,推动了持续的AI热潮。该模型的代码和权重公开发布,使其能够在配备适度GPU(最低2.4 GB VRAM)的消费级硬件上运行,这与仅可通过云服务访问的专有模型(如DALL-E和Midjourney)形成鲜明对比。

其主要用途是根据文本描述生成详细图像,但也支持诸如修复、扩展和基于文本提示的图像到图像转换等任务。其开源特性和高效性使其在从数字艺术到研究等各个应用领域迅速普及。

开发

Stable Diffusion源于一个名为潜在扩散的项目,由德国慕尼黑大学和海德堡大学的研究人员开发。五位原始作者中的四位(Robin Rombach、Andreas Blattmann、Patrick Esser和Dominik Lorenz)后来加入了Stability AI并发布了后续版本。技术许可证由慕尼黑大学LMU的CompVis小组发布。开发由Runway的Patrick Esser和CompVis的Robin Rombach领导,他们是潜在扩散架构的发明者之一。Stability AI还将EleutherAI和LAION(一个组装训练数据集的德国非营利组织)列为支持者。

技术

架构

扩散模型于2015年引入,通过训练去除训练图像上连续施加的高斯噪声,作为一系列去噪自编码器运行。其名称源于热力学扩散,因为它们受热力学启发。Stable Diffusion使用一种称为潜在扩散模型(LDM)的变体,由CompVis小组于2021年开发。

该模型由三部分组成:变分自编码器(VAE)、U-Net和可选文本编码器。VAE编码器将图像从像素空间压缩到较小的潜在空间,捕获语义含义。在前向扩散过程中,高斯噪声迭代应用于压缩后的潜在表示。U-Net由ResNet骨干组成,对输出进行去噪以获得潜在表示。最后,VAE解码器通过将表示转换回像素空间来生成最终图像。

去噪步骤可以通过交叉注意力机制以文本、图像或其他模态为条件。对于文本条件,一个固定的、预训练的CLIP ViT-L/14文本编码器将提示转换为嵌入空间。LDM在训练和生成方面提供了更高的计算效率。U-Net中有8.6亿个参数,文本编码器中有1.23亿个参数,Stable Diffusion按2022年标准相对轻量,能够在消费级GPU上运行,甚至可通过OpenVINO版本在仅CPU环境下运行。

SD XL

XL版本使用相同的LDM架构,但规模更大:更大的UNet骨干、更大的交叉注意力上下文、两个文本编码器(而非一个),并在多个宽高比上进行训练。同时发布的SD XL Refiner具有相同架构,但训练用于通过文本条件img2img为现有图像添加细节。

SD 3.0

3.0版本完全改变了骨干,使用Rectified Flow Transformer而非UNet。Transformer架构有三个轨道:原始文本编码、转换文本编码和图像编码(在潜在空间中)。转换文本编码和图像编码在每个Transformer块中混合。该架构被称为“多模态扩散Transformer(MMDiT)”,其中“多模态”意味着在其操作内部混合文本和图像编码,这与之前的DiT版本(文本编码仅影响图像编码)不同。

训练数据

Stable Diffusion在LAION-5B的图像-标题对上进行训练,这是一个从Common Crawl数据派生的公开数据集,包含50亿个图像-文本对,按语言、分辨率、水印可能性和预测美学分数进行过滤。该数据集由LAION创建,这是一个由Stability AI资助的德国非营利组织。模型在三个子集上训练:laion2B-en、laion-high-resolution和laion-aesthetics v2 5+。对1200万张图像较小子集的第三方分析发现,约47%来自100个不同域,其中Pinterest占8.5%,其次是WordPress、Blogspot、Flickr、DeviantArt和Wikimedia Commons。Bayerischer Rundfunk的一项调查显示,托管在Hugging Face上的LAION数据集包含大量私人和敏感数据。

训练过程

模型最初在laion2B-en和laion-high-resolution上训练,最终轮次在LAION-Aesthetics v2 5+上进行,这是一个包含6亿个带标题图像的子集,预测美学得分至少为5分(满分10分)。该子集排除了低分辨率图像和那些水印概率大于80%的图像。最终训练轮次丢弃了10%的文本条件以改进Classifier-Free Diffusion Guidance。模型使用256个Nvidia A100 GPU在Amazon Web Services上训练,总计150,000 GPU小时,成本为60万美元。

局限性

Stable Diffusion存在已知局限性,包括处理复杂场景困难、解剖学不准确(例如手部)以及训练数据中的偏见。它还可能生成反映数据集中社会偏见的图像。模型在文本渲染和细节处理方面可能存在问题,其性能因提示而异。截至2024年,持续研究通过微调和架构改进来解决这些问题。

影响与采用

Stable Diffusion于2022年8月公开发布标志着生成式AI的重大转变,使高质量文本到图像生成普及到广泛受众。其开源许可证使开发者能够将其集成到各种应用中,从艺术工具到教育平台。模型的高效性使其能够在消费级硬件上运行,促进了爱好者社区和研究人员的参与。此次发布还引发了关于版权、伦理以及AI生成内容潜在滥用的讨论。Stability AI继续发布改进版本,如SD XL和SD 3.0,在快速发展的人工智能领域保持其地位。

未来方向

Stable Diffusion的后续版本探索了不同架构,如SD 3.0中的Rectified Flow Transformer,旨在提高质量和效率。研究继续关注减少偏见、增强可控性以及与其他模态的集成。该模型的成功影响了其他机器学习项目,并为更广泛的AI热潮做出了贡献,对深度学习神经网络具有启示意义。截至2025年,Stable Diffusion仍是文本到图像生成的基准,社区和企业持续开发。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·text-to-image·open-source·deep-learning
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史