## 稳定扩散 **稳定扩散**(Stable Diffusion)是一种基于[[deep-learning|深度学习]]的[[text-to-image|文本到图像]]生成模型,主要用于根据文本描述生成高质量图像。它由Stability AI与[[runway-ml|Runway ML]]等机构合作开发,于2022年发布。该模型采用[[latent-diffusion|潜在扩散]]架构,通过逐

译自英文

一个开源潜在扩散模型,用于文本到图像生成,于2022年8月由Stability AI与学术合作者公开发布,其开放性催生了大量社区微调版本和创意工具生态系统。

Stable Diffusion是一个文本到图像生成模型,于2022年8月22日公开发布,由慕尼黑路德维希·马克西米利安大学CompVis小组的研究人员与Stability AI和Runway合作开发,基于先前关于潜在扩散模型的学术工作。与封闭的竞争对手不同,其作为开放权重模型的发布,使其成为主流生成式图像AI早期历史中最具影响力的发布之一。

技术方法

Stable Diffusion基于扩散模型技术,该技术学习逆转逐步加噪的过程,但其独特之处在于,该过程在压缩的潜在空间中执行,而非直接在像素上进行,这一方法在由Robin Rombach合著的“高分辨率图像合成与潜在扩散模型”论文中有所描述。在潜在空间中操作大幅降低了训练和运行模型的计算成本,相比像素空间扩散,使其能够在单个消费级GPU上运行,这是其迅速被采用的关键因素。文本条件由源自CLIP的文本编码器提供,使模型能够生成与自然语言提示匹配的图像。

发布与开放性

Stability AI,当时由Emad Mostaque领导,资助了训练所需的计算资源,并在宽松许可证(CreativeML Open RAIL-M)下公开发布了模型权重,同时提供了任何人都可以在本地运行的代码。这与OpenAIDALL-E以及后来的Midjourney所采用的封闭API方法形成了刻意对比。训练数据主要来自非营利组织LAION整理的LAION-5B数据集,这是一个从网络抓取的大规模图像-文本对集合,后来因包含受版权保护的内容以及一小部分非法内容而引发争议,LAION已努力识别并移除这些内容。

生态系统

Stable Diffusion的开放发布催生了异常庞大且快速发展的社区生态系统。在数月内,开发者构建了自定义用户界面、扩展和训练流程,开放许可证使得一波社区训练的检查点和风格特定微调模型得以在Hugging Face和Civitai等平台上分发。诸如LoRA适配器和ControlNet等技术,允许对姿态、边缘和深度图进行精确条件控制,由社区开发并迅速融入主流工作流程,将模型的实际能力扩展至远超其原始发布范围。后续官方版本(SD 2.0、SDXL、SD3)提升了图像质量和提示遵循度,但某些更新,特别是SD 2.0更严格的训练数据过滤,因削弱某些能力而遭到社区抵制。

反响与影响

Stable Diffusion被广泛认为使高质量图像生成得以普及,并加速了关于AI与版权的公众辩论,因为其本地运行能力使其远比API受限的竞争对手更难监管。它还加强了对训练数据同意的审查,促成了艺术家和库存图像公司(包括Getty Images)提起的诉讼。Stability AI自身的商业命运则动荡不安,Mostaque于2024年因资金压力辞去CEO职务,尽管底层模型及其开放衍生品仍被广泛使用,并相对于后来的开放进入者(如Flux)保持影响力。

分类:generative-ai·image-generation·open-weights
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史