GAN论文(2014年)

译自英文

生成对抗网络(GAN)是一种机器学习框架,其中两个神经网络在零和博弈中相互竞争,以生成与训练集具有相同统计特征的新数据,由Ian Goodfellow及其同事于2014年6月提出。

生成对抗网络(GAN)是一类机器学习框架,也是实现生成式人工智能的重要框架。这一概念最初由伊恩·古德费洛及其同事于2014年6月提出。在GAN中,两个神经网络以零和博弈的形式相互竞争,其中一方的收益即为另一方的损失。

给定一个训练集,该技术能够学习生成与训练集具有相同统计特征的新数据。例如,在照片上训练的GAN可以生成新的照片,这些照片对人类观察者而言至少表面上看起来真实,具有许多逼真的特征。尽管最初是作为无监督学习的生成模型提出的,但GAN在半监督学习、全监督学习和强化学习中也已被证明是有用的。

GAN的核心思想基于通过判别器进行的“间接”训练,判别器是另一个神经网络,能够判断输入看起来有多“真实”,而该网络本身也在动态更新。这意味着生成器并非被训练为最小化与特定图像的距离,而是旨在欺骗判别器。这使得模型能够以无监督的方式学习。

GAN类似于进化生物学中的拟态现象,两个网络之间存在着进化式的军备竞赛。

数学定义

最初的GAN被定义为一个博弈。每个概率空间\((\Omega, \mu_{\text{ref}})\)定义一个GAN博弈。有两个参与者:生成器和判别器。生成器的策略集是\(\mathcal{P}(\Omega)\),即\(\Omega\)上所有概率测度\(\mu_G\)的集合。判别器的策略集是马尔可夫核\(\mu_D: \Omega \to \mathcal{P}[0,1]\)的集合,其中\(\mathcal{P}[0,1]\)是\([0,1]\)上概率测度的集合。

GAN博弈是一个零和博弈,其目标函数为:

\[ L(\mu_G, \mu_D) := \mathbb{E}_{x \sim \mu_{\text{ref}}, y \sim \mu_D(x)}[\ln y] + \mathbb{E}_{x \sim \mu_G, y \sim \mu_D(x)}[\ln(1-y)]. \]

生成器的目标是最小化该目标函数,而判别器的目标是最大化该目标函数。生成器的任务是使\(\mu_G \approx \mu_{\text{ref}}\),即尽可能使其输出分布接近参考分布。判别器的任务是当输入看起来来自参考分布时输出接近1的值,而当输入看起来来自生成器分布时输出接近0的值。

实际应用

生成网络生成候选样本,而判别网络对其进行评估。这创建了一种基于数据分布的竞赛,其中生成器学习从潜在空间映射到真实数据分布,旨在产生判别器无法与真实数据区分的候选样本。判别器的目标是正确识别这些候选样本,但随着生成器的改进,其任务变得更加困难,判别器的错误率也随之增加。

一个已知的数据集用作判别器的初始训练数据。训练过程包括向判别器呈现训练数据集中的样本,直到其达到可接受的准确度。生成器则根据其是否成功欺骗判别器来进行训练。通常,生成器以从预定义潜在空间(例如多元正态分布)中采样的随机输入作为种子。此后,生成器合成的候选样本由判别器进行评估。对两个网络分别应用独立的反向传播过程,使得生成器产生更好的样本,而判别器则更擅长标记合成样本。当用于图像生成时,生成器通常是反卷积神经网络,而判别器是卷积神经网络。

与其他统计机器学习方法的关系

GAN是隐式生成模型,这意味着它们不显式建模似然函数,也不提供找到给定样本对应潜在变量的方法,这与基于流的生成模型等替代方法不同。

与诸如WaveNet和PixelRNN等完全可见信念网络以及一般的自回归模型相比,GAN可以一次生成一个完整的样本,而无需多次通过网络。与玻尔兹曼机和线性ICA相比,GAN对网络使用的函数类型没有限制。

由于神经网络是通用逼近器,GAN在渐近意义上是一致的。截至2026年,变分自编码器已被证明是通用逼近器,但GAN仍然是机器学习深度学习领域中一种独特且有影响力的方法。该框架启发了众多变体和应用,为人工智能神经网络研究的更广泛发展做出了贡献。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·deep-learning·generative-ai·neural-networks
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史