译自英文

一种神经网络架构,于2023年提出,为预训练的文生图扩散模型增加了细粒度的条件控制,使用户能够通过姿态、边缘图、深度图或草图来引导生成过程。

ControlNet是一种神经网络架构,它为预训练的文本到图像扩散模型(如稳定扩散)增加了空间条件控制。该架构由斯坦福大学的Lvmin Zhang、Anyi Rao和Maneesh Agrawala在2023年2月的一篇论文中提出,它允许用户通过提供辅助输入(如人体姿态骨架、Canny边缘图、深度图或粗略草图)以及文本提示,来控制生成图像的结构,而不仅仅是其内容。在ControlNet出现之前,扩散模型只能通过提示措辞和种子选择来间接控制构图;ControlNet使结构控制变得直接且可靠。

架构

ControlNet的工作原理是将预训练扩散模型编码层的权重克隆到一个可训练副本中,同时保持原始模型的权重冻结。可训练副本接收条件图像,并通过“零卷积”层连接回冻结网络,这些卷积层初始化为零权重,因此在训练开始时,新增分支对基础模型的输出没有影响。随后,训练逐步教会网络尊重条件信号,而不会灾难性地遗忘基础模型从其更大的预训练数据集中已学到的内容。由于基础模型保持冻结,单个ControlNet模块可以在相对较小的、任务特定的数据集上训练,同时继承底层扩散模型的全部生成能力。多个ControlNet模块(每个专门针对不同类型的条件)也可以组合使用,以实现复合结构控制。

条件类型

ControlNet发布时支持多种条件模式,每种模式都需要其专用的训练模块:用于人体姿态控制的OpenPose骨架、用于基于轮廓控制的Canny边缘检测、用于控制空间布局的深度图、用于建筑和室内场景的Hough线检测、语义分割图、法线图,以及用于粗略构图指导的涂鸦或草图输入。这种多样性使ControlNet在多种工作流程中都很实用,从在一系列插图中保持一致的角色姿态,到将粗略涂鸦转换为成品图像同时保留艺术家的预期布局。

采用与影响

ControlNet以开源代码形式发布,并附带与Stable Diffusion 1.5兼容的预训练权重,迅速被Hugging Face相关的开源图像生成社区采用,成为Automatic1111的Stable Diffusion WebUI和ComfyUI等界面的标准组件。它的出现常被视为扩散模型实用化、面向生产用途的转折点,因为它解决了核心痛点,即仅靠文本提示给艺术家和设计师提供的构图控制太少。ControlNet风格的条件控制随后被重新实现并扩展到更新的基础模型(包括Stable Diffusion XL),并影响了后来的商业系统(如MidjourneyFlux)处理结构引导的方式,即使这些系统使用了不同的底层机制。

评价

ControlNet在计算机视觉和生成式AI研究社区中被广泛认为是一种重要且低成本的扩展现有基础模型能力的方法,无需完全重新训练,其零卷积技术也影响了后来关于高效条件控制适配器方法的更广泛研究。它在后续关于可控生成的研究中被广泛引用,既涉及图像,也涉及后来的文本到视频系统,这些系统面临着类似的需求,即需要超越文本提示所能指定的结构和时间控制。

分类:generative-ai·image-generation·computer-vision
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史