生成对抗网络

译自英文

生成对抗网络(GAN)是一种机器学习框架,其中两个神经网络在零和博弈中竞争,以生成与训练集具有相同统计特性的新数据。该框架由伊恩·古德费洛于2014年6月提出,是生成式AI的一种重要方法。

生成对抗网络(GAN)是一类机器学习框架,也是实现生成式人工智能的重要框架。这一概念最初由伊恩·古德费洛及其同事于2014年6月提出。在GAN中,两个神经网络以零和博弈的形式相互竞争,其中一方的收益即为另一方的损失。

给定一个训练集,该技术能够学习生成与训练集具有相同统计特征的新数据。例如,在照片上训练的GAN可以生成新照片,这些照片至少在外观上对人类观察者显得真实,并具有许多逼真的特征。尽管最初是作为无监督学习的生成模型提出的,但GAN已被证明在半监督学习、全监督学习和强化学习中也很有用。

GAN的核心思想基于通过判别器进行的“间接”训练,判别器是另一个能够判断输入“真实”程度的神经网络,其本身也在动态更新。这意味着生成器不是被训练来最小化与特定图像的距离,而是为了欺骗判别器。这使得模型能够以无监督方式学习。GAN类似于进化生物学中的拟态现象,两个网络之间存在着进化军备竞赛。

架构与训练

GAN由两个主要组件组成:生成器和判别器。生成器是一个神经网络,它从潜在空间(通常是多元正态分布)中获取随机噪声,并将其映射到数据样本(如图像)。判别器是另一个神经网络,它接收来自训练数据集的真实样本和来自生成器的合成样本,并输出给定输入是真实而非生成的概率。

训练以迭代博弈的方式进行。首先在已知数据集上训练判别器,使其能够以可接受的准确度区分真实与虚假。然后,根据生成器是否成功欺骗判别器来训练生成器。两个网络分别应用独立的反向传播过程:生成器调整其权重以生成更令人信服的样本,而判别器则提高其标记合成输入的能力。当用于图像生成时,生成器通常是反卷积神经网络,判别器是卷积神经网络。

原始GAN博弈的目标函数定义在参考分布(真实数据)和生成器分布之上。判别器旨在最大化正确分类真实和虚假输入的对数概率,而生成器旨在最小化同一目标,实际上试图使判别器对生成样本输出1。这种零和公式驱动两个网络不断改进,直到生成器的分布与参考分布紧密匹配。

数学表述

形式上,GAN博弈定义在概率空间(Ω, μ_ref)上。生成器的策略集是Ω上所有概率测度μ_G的集合,而判别器的策略集由从Ω到[0,1]上概率测度的马尔可夫核组成。目标函数为:

L(μ_G, μ_D) = E_{x~μ_ref, y~μ_D(x)}[ln y] + E_{x~μ_G, y~μ_D(x)}[ln(1-y)]

生成器旨在最小化该目标,使μ_G接近μ_ref,而判别器旨在最大化该目标,对真实数据输出接近1的值,对生成数据输出接近0的值。这个极小极大博弈具有理论均衡,其中生成器完美复制参考分布,判别器无法优于随机猜测。

与其他生成模型的关系

GAN是隐式生成模型,这意味着它们不显式建模似然函数,也不提供找到给定样本对应潜变量的方法,这与基于流的生成模型等替代方案不同。与WaveNet和PixelRNN等完全可见信念网络以及一般的自回归模型相比,GAN可以在单次传递中生成一个完整样本,而无需多次通过网络。

与玻尔兹曼机和线性ICA不同,GAN对网络使用的函数类型没有限制。由于神经网络是通用逼近器,GAN是渐近一致的。截至2026年,变分自编码器也已被证明是通用逼近器,但GAN在其对抗训练范式上仍然独特。这种方法使GAN在图像合成、风格迁移和数据增强等任务中特别有效,这些任务中生成真实的高维样本至关重要。

应用与影响

GAN推动了深度学习机器学习应用的重大进展。它们被广泛用于生成逼真的图像,包括人脸、风景和医学图像。在人工智能研究中,GAN促进了半监督学习(其中标记数据稀缺)和强化学习(其中它们可以建模环境或生成训练经验)的进展。

对抗训练的概念也影响了其他领域,如变换器大型语言模型,尽管这些架构使用不同的训练目标。GAN仍然是生成建模中的基础框架,持续的研究正在解决训练不稳定和模式崩溃(生成器产生有限多样性)等挑战。它们的进化军备竞赛类比继续激发学术界和工业界的新方法。

局限性与挑战

尽管GAN功能强大,但它们面临若干已知困难。训练可能不稳定,因为两个网络必须保持平衡;如果判别器变得过强,生成器会收到消失梯度,如果判别器过弱,生成器可能无法有效学习。模式崩溃是另一个常见问题,生成器只产生可能输出的一小部分子集,无法捕捉训练数据的全部多样性。

评估GAN性能也非易事,因为没有显式似然可供测量。研究人员通常使用Inception Score或Fréchet Inception Distance等指标,但这些指标存在局限性。截至2020年代中期,包括扩散模型在内的新型生成模型在某些任务中已获得普及,但GAN仍然是一个活跃的研究领域,特别是在实时应用和单次生成具有优势的设置中。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·machine-learning·neural-networks·deep-learning
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史