向量量化变分自编码器(VQ-VAE)是一种AI模型,学习将数据压缩为一组离散的、有限的码本向量。与使用连续潜在变量的标准变分自编码器(VAE)不同,VQ-VAE对潜在空间进行量化,这使得它们在需要离散表示的任务中特别有效,例如图像生成、音频合成和视频预测。该模型由DeepMind的研究人员于2017年提出,此后已成为许多生成式AI系统的基础组成部分。
VQ-VAE的工作原理是将输入编码为连续潜在向量,然后将该向量映射到学习到的码本中最近的条目。这个离散码随后被解码回原始数据空间。训练过程涉及三个损失项:重建损失、用于使码本条目与编码器输出对齐的码本损失,以及用于防止编码器无界增长的承诺损失。这种架构使模型能够避免VAE中常见的“后验坍缩”问题,即潜在变量变得无信息量。
架构与机制
VQ-VAE由编码器、解码器和码本组成。编码器将输入数据(例如图像或音频波形)处理为一系列潜在向量。每个向量随后被其在码本中的最近邻替换,这一过程称为向量量化。解码器随后从这些量化向量重建输入。码本与编码器和解码器通过梯度下降联合学习,并使用直通估计器来处理不可微的量化步骤。
一个关键特征是使用指数移动平均(EMA)更新码本,这能稳定训练并提高码本利用率。这种方法在2017年Aaron van den Oord、Oriol Vinyals和Koray Kavukcuoglu的论文《神经离散表示学习》中详细阐述,证明了VQ-VAE无需自回归先验即可学习有意义的离散表示。
在生成模型中的应用
VQ-VAE已被广泛采用于生成模型中。最显著的应用是在图像和音频的生成式AI中。例如,2019年推出的VQ-VAE-2采用分层多尺度方法,通过结合全局码本和局部细节生成高分辨率图像(例如1024x1024)。该模型在当时ImageNet上取得了最先进的结果。
在音频方面,VQ-VAE已被用于语音合成和音乐生成。该模型的离散潜在空间特别适合文本到语音等任务,可以学习类似音素的表示。此外,VQ-VAE是许多处理非文本模态的大型语言模型的核心组件,例如VQ-GAN和DALL-E模型,它们使用VQ-VAE将图像转换为可由Transformer处理的离散令牌。
与其他模型的关系
VQ-VAE与神经网络和深度学习技术密切相关。它们常与GAN(生成对抗网络)和标准VAE进行比较。虽然GAN能生成清晰的图像,但可能遭受模式坍缩,而VQ-VAE提供稳定的训练和结构化的潜在空间。与假设连续高斯潜在分布的标准VAE不同,VQ-VAE使用分类分布,使其与PixelCNN或Transformer等自回归模型更兼容。
VQ-VAE潜在变量的离散性质还支持使用无损压缩技术,并便于与需要符号或离散输入的机器学习流水线集成。这导致它们被用于结合文本、图像和音频数据的多模态模型中。
近期发展与变体
自原始论文以来,已开发出多种变体。VQ-VAE-2通过使用分层码本提高了图像质量。其他工作引入了残差VQ-VAE,使用多个码本来捕捉更精细的细节,以及向量量化Transformer(VQ-GAN),将VQ-VAE与Transformer结合用于自回归生成。这些模型已被OpenAI等公司在DALL-E的早期版本中采用,也被DeepMind用于音频生成模型。
2023年,基于VQ-VAE的视频令牌化器(如VideoPoet)的推出证明了这些模型在高维数据上的可扩展性。该方法也已应用于AWS和其他云平台,以实现高效的模型服务,因为离散表示减少了计算开销。
局限性与未来方向
尽管取得了成功,VQ-VAE仍面临挑战。码本大小必须仔细选择;太小会导致重建质量差,太大会导致利用率不足。训练可能不稳定,尤其是使用大型码本时,尽管EMA更新缓解了这一问题。此外,离散瓶颈可能丢失细粒度细节,这就是为什么常采用分层或残差方法的原因。
未来研究正在探索动态学习码本的方法,以及将VQ-VAE与基于Transformer的大型语言模型集成,以实现统一的多模态理解。截至2024年,VQ-VAE仍是生成式AI工具包中的关键工具,并在效率和保真度方面持续改进。