论文《生成对抗网络》于2014年6月由伊恩·古德费洛及其同事发表。该论文引入了一类新的机器学习框架,称为生成对抗网络(GAN),此后该框架已成为生成式人工智能的一种重要方法。其核心思想涉及两个神经网络,即生成器和判别器,它们在零和博弈中相互竞争,其中一方的收益即为另一方的损失。给定一个训练集,GAN能够学习生成与训练集具有相同统计特性的新数据。例如,在照片上训练的GAN可以生成对人类观察者而言看似真实的新照片。尽管最初是作为一种用于无监督学习的生成模型提出的,但GAN也被证明在半监督学习、全监督学习和强化学习中十分有用。
这一概念借鉴了进化生物学中的拟态现象,描述了两个网络之间的进化军备竞赛。生成器的任务是产生与真实数据无法区分的样本,而判别器的任务是区分真实样本与生成样本。这种动态机制使模型能够以无监督的方式进行学习,因为生成器并非被训练为最小化与特定图像的固定距离,而是旨在欺骗判别器。
数学框架
最初的GAN被定义为两个玩家之间的博弈。每个概率空间(Ω, μ_ref)定义一个GAN博弈。生成器的策略集是Ω上所有概率测度μ_G的集合,而判别器的策略集是马尔可夫核μ_D: Ω → P[0,1]的集合,其中P[0,1]是[0,1]上概率测度的集合。GAN博弈是零和的,其目标函数为L(μ_G, μ_D) = E_{x∼μ_ref, y∼μ_D(x)}[ln y] + E_{x∼μ_G, y∼μ_D(x)}[ln(1-y)]。生成器旨在最小化该目标函数,而判别器旨在最大化它。生成器的目标是逼近μ_ref,使其输出分布与参考分布相匹配。判别器对来自参考分布的输入输出接近1的值,对来自生成器的输入输出接近0的值。
训练过程
在实践中,生成网络生成候选样本,而判别网络对其进行评估。这创建了一个基于数据分布的竞赛。生成器学习从潜在空间映射到真实数据分布,旨在产生判别器无法与真实数据区分的候选样本。判别器的目标是正确识别这些候选样本,但随着生成器的改进,判别器的任务变得更加困难,其错误率也随之增加。
一个已知的数据集作为判别器的初始训练数据。训练过程包括向判别器展示训练数据集中的样本,直到其达到可接受的准确率。生成器则根据其是否成功欺骗判别器来进行训练。通常,生成器以从预定义潜在空间(如多元正态分布)中采样的随机输入作为种子。此后,生成器合成的候选样本由判别器进行评估。对两个网络分别应用独立的反向传播过程,因此生成器能够生成更好的样本,而判别器则更擅长标记合成样本。当用于图像生成时,生成器通常是反卷积神经网络,而判别器是卷积神经网络。
与其他方法的关系
GAN是隐式生成模型,这意味着它们不显式建模似然函数,也不提供找到给定样本对应潜在变量的方法,这与流式生成模型等替代方法不同。与全可见信念网络(如WaveNet和PixelRNN)以及一般的自回归模型相比,GAN可以在单次前向传播中生成一个完整的样本,而无需多次通过网络。与玻尔兹曼机和线性ICA相比,GAN对网络使用的函数类型没有限制。由于神经网络是通用逼近器,GAN是渐近一致的。截至2026年,变分自编码器已被证明是通用逼近器,但GAN仍然是一个独特且有影响力的框架。
影响与遗产
2014年的论文为深度学习和机器学习领域的大量研究和应用奠定了基础。GAN已被用于图像生成、风格迁移、数据增强等。对抗训练范式也影响了其他领域,包括对抗鲁棒性和基于AI反馈的强化学习。该论文的作者,包括伊恩·古德费洛、约书亚·本吉奥和亚伦·库维尔,当时隶属于多伦多大学。这项工作已被引用数万次,被认为是人工智能领域的开创性贡献。
挑战与发展
早期的GAN面临着训练不稳定和模式崩溃等挑战,即生成器产生的样本多样性有限。后续研究引入了批归一化、丢弃法和改进的损失函数等技术来缓解这些问题。DCGAN、StyleGAN和CycleGAN等变体推动了该领域的发展。对抗原理也已应用于图像生成之外的领域,包括大型语言模型和其他神经网络架构。该论文的影响延伸至工业界,像OpenAI和Google DeepMind这样的公司在其生成式AI研究中借鉴了GAN相关的思想。