生成对抗网络(GAN)是一类机器学习框架,也是实现生成式人工智能的重要框架。这一概念最初由伊恩·古德费洛及其同事于2014年6月提出。在GAN中,两个神经网络以零和博弈的形式相互竞争,其中一方的收益即为另一方的损失。
给定一个训练集,该技术能够学习生成与训练集具有相同统计特征的新数据。例如,在照片上训练的GAN可以生成新照片,这些照片至少在外观上对人类观察者显得真实,并具有许多逼真的特征。尽管最初是作为无监督学习的生成模型提出的,但GAN已被证明在半监督学习、全监督学习和强化学习中也很有用。
GAN的核心思想基于通过判别器进行的“间接”训练,判别器是另一个能够判断输入“真实”程度的神经网络,其本身也在动态更新。这意味着生成器不是被训练来最小化与特定图像的距离,而是为了欺骗判别器。这使得模型能够以无监督方式学习。GAN类似于进化生物学中的拟态现象,两个网络之间存在着进化军备竞赛。
架构与训练
GAN由两个主要组件组成:生成器和判别器。生成器是一个神经网络,它从潜在空间(通常是多元正态分布)中获取随机噪声,并将其映射到数据样本(如图像)。判别器是另一个神经网络,它接收来自训练数据集的真实样本和来自生成器的合成样本,并输出给定输入是真实而非生成的概率。
训练以迭代博弈的方式进行。首先在已知数据集上训练判别器,使其能够以可接受的准确度区分真实与虚假。然后,根据生成器是否成功欺骗判别器来训练生成器。两个网络分别应用独立的反向传播过程:生成器调整其权重以生成更令人信服的样本,而判别器则提高其标记合成输入的能力。当用于图像生成时,生成器通常是反卷积神经网络,判别器是卷积神经网络。
原始GAN博弈的目标函数定义在参考分布(真实数据)和生成器分布之上。判别器旨在最大化正确分类真实和虚假输入的对数概率,而生成器旨在最小化同一目标,实际上试图使判别器对生成样本输出1。这种零和公式驱动两个网络不断改进,直到生成器的分布与参考分布紧密匹配。
数学表述
形式上,GAN博弈定义在概率空间(Ω, μ_ref)上。生成器的策略集是Ω上所有概率测度μ_G的集合,而判别器的策略集由从Ω到[0,1]上概率测度的马尔可夫核组成。目标函数为:
L(μ_G, μ_D) = E_{x~μ_ref, y~μ_D(x)}[ln y] + E_{x~μ_G, y~μ_D(x)}[ln(1-y)]
生成器旨在最小化该目标,使μ_G接近μ_ref,而判别器旨在最大化该目标,对真实数据输出接近1的值,对生成数据输出接近0的值。这个极小极大博弈具有理论均衡,其中生成器完美复制参考分布,判别器无法优于随机猜测。
与其他生成模型的关系
GAN是隐式生成模型,这意味着它们不显式建模似然函数,也不提供找到给定样本对应潜变量的方法,这与基于流的生成模型等替代方案不同。与WaveNet和PixelRNN等完全可见信念网络以及一般的自回归模型相比,GAN可以在单次传递中生成一个完整样本,而无需多次通过网络。
与玻尔兹曼机和线性ICA不同,GAN对网络使用的函数类型没有限制。由于神经网络是通用逼近器,GAN是渐近一致的。截至2026年,变分自编码器也已被证明是通用逼近器,但GAN在其对抗训练范式上仍然独特。这种方法使GAN在图像合成、风格迁移和数据增强等任务中特别有效,这些任务中生成真实的高维样本至关重要。
应用与影响
GAN推动了深度学习和机器学习应用的重大进展。它们被广泛用于生成逼真的图像,包括人脸、风景和医学图像。在人工智能研究中,GAN促进了半监督学习(其中标记数据稀缺)和强化学习(其中它们可以建模环境或生成训练经验)的进展。
对抗训练的概念也影响了其他领域,如变换器和大型语言模型,尽管这些架构使用不同的训练目标。GAN仍然是生成建模中的基础框架,持续的研究正在解决训练不稳定和模式崩溃(生成器产生有限多样性)等挑战。它们的进化军备竞赛类比继续激发学术界和工业界的新方法。
局限性与挑战
尽管GAN功能强大,但它们面临若干已知困难。训练可能不稳定,因为两个网络必须保持平衡;如果判别器变得过强,生成器会收到消失梯度,如果判别器过弱,生成器可能无法有效学习。模式崩溃是另一个常见问题,生成器只产生可能输出的一小部分子集,无法捕捉训练数据的全部多样性。
评估GAN性能也非易事,因为没有显式似然可供测量。研究人员通常使用Inception Score或Fréchet Inception Distance等指标,但这些指标存在局限性。截至2020年代中期,包括扩散模型在内的新型生成模型在某些任务中已获得普及,但GAN仍然是一个活跃的研究领域,特别是在实时应用和单次生成具有优势的设置中。