Stable Diffusion是一个由Stability AI于2022年8月发布的深度学习模型,能够根据文本描述生成详细图像。它因成为首批向公众开放的高质量文本到图像系统之一而闻名,其权重和源代码在宽松许可下发布。该模型迅速成为Generative AI热潮中的里程碑,既引发了创造性采用,也引发了关于版权、伦理以及合成媒体对社会影响的辩论。
该模型基于潜在扩散架构构建,这是一种Deep learning方法,在应用扩散过程之前将图像压缩到低维潜在空间。这种设计使其能够在消费级显卡上运行,与早期系统如OpenAI的DALL-E 2(需要云访问)相比,这是一个显著进步。Stability AI与BAIR (Berkeley AI Research)小组和University of Toronto的研究人员合作开发了该模型,该模型在大型图像-文本对数据集上进行了训练。
技术架构
Stable Diffusion使用U-Net骨干网络,结合基于Transformer (architecture)的文本编码器,以根据文本提示条件化图像生成。文本编码器是一种CLIP风格的模型,将单词转换为向量表示,指导去噪过程。扩散过程通过一系列步骤(通常为20到50步)迭代地将随机噪声细化为连贯图像,每一步根据学习到的调度减少噪声。
该模型在压缩的潜在空间中运行,而不是直接在像素上运行,这降低了计算成本和内存使用。这种潜在扩散技术由lmu-munich和heidelberg-university的研究人员引入,使Stable Diffusion能够在高端消费硬件上不到一秒内生成512x512像素的图像。开源发布包括完整的模型权重,允许开发者针对修复、扩展和风格迁移等专门任务进行微调。
发布与可访问性
Stability AI分阶段发布了Stable Diffusion,先是于2022年7月为研究人员提供私人预览,随后于2022年8月22日公开测试。该模型通过Hugging Face平台分发,迅速成为下载量最大的模型之一。与许多商业AI服务不同,Stable Diffusion允许用户本地运行模型,而无需将提示发送到服务器,这吸引了注重隐私的用户和开发离线工具的开发人员。
开源性质导致了社区的快速创新。数周内,出现了automatic1111和invokeai等第三方界面,提供用户友好的网页界面和高级功能,如提示加权和种子值控制。该模型也成为许多衍生模型的基础,包括针对动漫、逼真人像和建筑渲染训练的专门版本。
社区与生态系统
Stable Diffusion的发布催生了一个由创作者、爱好者和初创公司组成的活跃生态系统。像Civitai这样的平台允许用户分享自定义模型和提示,而dreamstudio等服务为没有强大硬件的人提供基于云的访问。该模型的宽松许可允许商业使用,导致其被整合到从图形设计工具到视频游戏资产管线的各种产品中。
社区还开发了引导生成的技术,如Prompt engineering和负面提示,帮助用户避免常见伪影并实现所需风格。该模型从文本生成图像的能力使其成为概念艺术、故事板和快速原型制作的流行工具。到2022年底,Stable Diffusion已成为关于Artificial intelligence创造力和数字艺术未来讨论的标准参考点。
伦理与法律辩论
Stable Diffusion的发布加剧了关于生成式AI伦理的持续辩论。艺术家们担心该模型是在未经同意的情况下从互联网抓取的受版权保护图像上训练的,可能复制现有作品中的元素。这导致了诉讼和对更强AI ethics指南的呼吁,以及关于合理使用和创作者在机器学习时代权利的讨论。
政策制定者和研究人员也担心滥用的可能性,包括深度伪造和虚假信息的创建。作为回应,Stability AI实施了内容过滤器并限制了某些提示,尽管这些措施并不完美。该公司还因训练大型模型的环境影响而受到批评,尽管与其他早期系统相比,潜在扩散方法相对高效。
遗产与影响
Stable Diffusion被广泛认为使AI图像生成民主化,将该领域从一个小众研究领域转变为主流创意工具。其开源模型启发了类似发布的热潮,包括Midjourney和Adobe Firefly,并影响了文本到视频和文本到3D系统的发展。该模型的架构和训练方法已在行业内得到广泛研究和改编。
截至2024年,Stable Diffusion仍然是生成式AI领域的基础技术,Stability AI持续更新,并拥有庞大的贡献者社区。其发布标志着公众与人工智能关系的转折点,展示了开放获取强大机器学习模型的创造潜力与挑战。