译自英文

VQGAN(向量量化生成对抗网络)是一种生成模型,它将向量量化与对抗训练相结合,用于高分辨率图像合成,由海德堡大学和IWR的研究人员于2021年提出。

VQGAN(向量量化生成对抗网络)是一类用于高分辨率图像合成的生成式神经网络架构。它将向量量化(VQ)的离散潜在表示学习与生成对抗网络(GAN)的感知质量提升相结合。该模型由Patrick Esser、Robin Rombach和Björn Ommer于2021年在海德堡大学和IWR发表的论文中提出,成为后续文本到图像模型的基础组件,包括Stable Diffusion中使用的潜在扩散模型。

VQGAN的核心思想是从训练图像中学习一个压缩的、离散的视觉特征码本。编码器网络将输入图像映射为码本中的索引序列,解码器则从这些索引重建图像。一个GAN判别器与编码器和解码器同时训练,以确保重建图像在感知上与真实图像难以区分,同时基于预训练网络(如VGG)的感知损失进一步提高了保真度。这种方法使VQGAN能够生成分辨率达到1024x1024像素及以上的图像,而这对于早期的模型如VQ-VAE来说颇具挑战性。

架构与训练

VQGAN架构由三个主要组件组成:编码器、解码器和一个可学习向量的码本。编码器将输入图像下采样为潜在代码的空间网格,每个代码被量化到最近的码本条目。解码器将这些代码上采样回图像空间。训练过程最小化重建损失(L2)、感知损失和鼓励编码器输出接近码本条目的承诺损失。GAN判别器(通常是PatchGAN)以对抗方式训练,用于区分真实图像和重建图像,推动解码器生成更清晰的细节。

一个关键的创新是使用Transformer等变换器模型来建模量化代码的序列。通过将离散代码视为标记,变换器可以学习全局依赖关系并自回归地生成新颖图像,从而实现连贯的大尺度结构。这种混合方法(卷积编码器/解码器与变换器先验相结合)使VQGAN能够同时捕捉局部纹理和全局上下文。

在潜在扩散中的应用

VQGAN最具影响力的应用是通过其集成到潜在扩散模型中实现的。在2022年的论文《高分辨率图像合成与潜在扩散模型》中,Rombach及其同事使用VQGAN风格的自动编码器将图像压缩到较低维度的潜在空间。扩散模型随后在这些潜在表示上操作,而非原始像素,从而大幅降低计算成本,同时保持图像质量。这一架构成为Stable Diffusion(一种广泛使用的开源文本到图像系统)的基础。在这些模型中,VQGAN组件通常被称为“VAE”(变分自动编码器),尽管它保留了向量量化的设计。

与其他生成模型的比较

与纯GAN(如StyleGAN)直接从噪声向量生成图像不同,VQGAN生成一个可操作和编辑的离散潜在表示。这一特性使其适用于图像修复、超分辨率和语义合成等任务。与VQ-VAE相比,VQGAN增加了对抗性和感知损失,显著提高了输出的清晰度和真实感。然而,VQGAN对码本和变换器先验的依赖使其训练比简单的自动编码器更复杂且计算密集。

遗产与影响

VQGAN影响了后续在深度学习人工智能领域的研究,特别是在生成建模方面。其离散潜在空间概念被多种多模态模型采用,并促进了包含视觉标记的大型语言模型的发展。代码和预训练模型已公开发布,促进了广泛的实验。截至2025年,VQGAN仍然是理解图像生成中离散与连续潜在表示权衡的参考点,其原理继续为更广泛的机器学习社区中的新架构提供启示。

局限性

尽管有其优势,VQGAN也存在已知的局限性。码本的大小和维度需要仔细调整;码本过小会导致细节丢失,而过大会增加内存使用。变换器先验在采样时可能较慢,尤其是对于高分辨率图像。此外,模型可能表现出伪影,如均匀区域模糊或重复模式,特别是在码本表达力不足时。这些问题促使后来的方法转向连续潜在表示,如在某些扩散模型中所见。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·computer-vision·deep-learning·image-synthesis
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史