生成对抗网络(GAN)是一类机器学习框架,也是生成式人工智能的一种重要方法。该概念最初由伊恩·古德费洛及其同事于2014年6月提出。在GAN中,两个神经网络在零和博弈中竞争,其中一方的收益即为另一方的损失。给定一个训练集,该技术学习生成与训练集具有相同统计特性的新数据。例如,在照片上训练的GAN可以生成新照片,这些照片至少在外观上对人类观察者来说看似真实。尽管最初被提议作为无监督学习的一种生成模型形式,GAN也被证明在半监督学习、全监督学习和强化学习中很有用。
GAN的核心思想基于通过判别器进行的间接训练,判别器是另一个神经网络,用于评估输入看起来有多真实,并且其自身也会动态更新。生成器不是被训练来最小化与特定图像的距离,而是为了欺骗判别器,从而使模型能够以无监督的方式学习。GAN类似于进化生物学中的拟态,两个网络之间存在进化军备竞赛。
定义
最初的GAN被定义为两个玩家之间的博弈:生成器和判别器。生成器的策略集是给定空间上所有概率测度的集合,而判别器的策略集是将输入映射到概率的马尔可夫核的集合。目标函数是一个零和博弈:生成器旨在最小化它,而判别器旨在最大化它。生成器的任务是使其输出分布尽可能接近参考分布,而判别器的任务是对真实数据输出接近1的值,对生成数据输出接近0的值。
在实践中,生成网络生成候选样本,而判别网络对其进行评估。这创建了一个基于数据分布的竞赛。生成器学习从潜在空间映射到真实数据分布,旨在产生判别器无法与真实数据区分的候选样本。判别器的目标是正确识别这些候选样本,但随着生成器的改进,判别器的任务变得更加困难,其错误率也随之增加。
一个已知的数据集作为判别器的初始训练数据。训练涉及从训练数据集中呈现样本,直到判别器达到可接受的准确度。生成器根据其是否成功欺骗判别器来进行训练。通常,生成器以从预定义潜在空间(如多元正态分布)中采样的随机输入作为种子。此后,由生成器合成的候选样本由判别器评估。对两个网络分别应用独立的反向传播过程,使生成器产生更好的样本,同时判别器在标记合成样本方面变得更加熟练。当用于图像生成时,生成器通常是反卷积神经网络,而判别器是卷积神经网络。
与其他统计机器学习方法的关系
GAN是隐式生成模型,这意味着它们不显式建模似然函数,也不提供找到给定样本对应潜在变量的方法,这与流式生成模型等替代方法不同。与完全可见的信念网络(如WaveNet和PixelRNN)以及一般的自回归模型相比,GAN可以在一次通过中生成一个完整样本,而不是多次通过网络。与玻尔兹曼机和线性ICA相比,网络使用的函数类型没有限制。由于神经网络是通用逼近器,GAN是渐近一致的。截至2026年,变分自编码器也被证明是通用逼近器,但GAN在其对抗训练范式上仍然独树一帜。
训练动态与挑战
训练GAN涉及微妙的平衡。生成器和判别器交替训练,常常导致模式崩溃等问题,即生成器产生有限种类的输出,或非收敛,即两个网络振荡而不达到均衡。已经开发了各种技术来稳定训练,包括修改目标函数、架构更改和正则化方法。GAN的对抗性质使其对超参数敏感,训练需要仔细调整。
应用
GAN已广泛应用于图像生成、风格迁移、数据增强和超分辨率。它们还用于生成逼真的合成数据以训练其他模型,在医学成像中,以及在艺术和音乐生成等创意领域。GAN已被用于Deep learning研究中,其原理也影响了Generative AI的其他领域。
影响与未来方向
GAN的引入对Machine learning和Artificial intelligence产生了深远影响。它们启发了许多变体和改进,如条件GAN、循环一致GAN和渐进式GAN。研究继续解决训练稳定性和评估指标等挑战。GAN仍然是生成式AI工具包中的基础工具,与Large language model和Transformer (architecture)等其他模型并列,尽管它们在对抗框架上有所不同。