敵対的生成ネットワーク

英語からの翻訳

生成的敵対ネットワーク(GAN)は、2つのニューラルネットワークがゼロサムゲームで競い合い、トレーニングセットと同じ統計を持つ新しいデータを生成する機械学習フレームワークである。2014年6月にイアン・グッドフェローによって導入され、生成AIの顕著なアプローチである。

生成对抗网络(GAN)是一类机器学习框架,也是处理生成式AI的一种重要框架。该概念最初由伊恩·古德费洛及其同事于2014年6月提出。在GAN中,两个神经网络以零和博弈的形式相互竞争,其中一方的收益即为另一方的损失。

给定训练集,该技术学习生成与训练集具有相同统计特性的新数据。例如,在照片上训练的GAN可以生成新照片,这些照片至少在表面上对人类观察者而言是真实的,并具有许多逼真的特征。尽管最初是作为无监督学习的生成模型提出的,GAN也被证明在半监督学习、全监督学习和强化学习中很有用。

GAN的核心思想基于通过判别器进行的“间接”训练,判别器是另一个神经网络,能够判断输入看起来有多“真实”,而该网络本身也在动态更新。这意味着生成器并非被训练为最小化与特定图像的差异,而是被训练为欺骗判别器。这使得模型能够以无监督的方式进行学习。GAN类似于进化生物学中的拟态现象,两者之间存在一种进化式的军备竞赛。

架构

GAN由两个主要部分组成:生成器和判别器。生成器是一个神经网络,它从潜在空间(通常是多元正态分布)中获取随机噪声,并将其映射为数据样本,例如图像。判别器是另一个神经网络,它接收来自训练集的真实样本和来自生成器的合成样本,并输出给定输入是真实的而非生成的概率。

训练过程是一个迭代博弈。首先在已知数据集上训练判别器,使其能够以可接受的准确率区分真实与伪造。然后,根据生成器是否成功欺骗判别器来训练生成器。两个网络都应用独立的反向传播过程:生成器调整其权重以生成更有说服力的样本,而判别器则提高其识别伪造输入的能力。在用于图像生成时,生成器通常是反卷积神经网络,而判别器是卷积神经网络。

数学表述

形式上,GAN博弈定义在概率空间(Ω,μ_ref)上。生成器的策略集是Ω上所有概率测度μ_G的集合,而判别器的策略集由从Ω到[0,1]上概率测度的马尔可夫核组成。目标函数为:

L(μ_G, μ_D) = E_{x~μ_ref, y~μ_D(x)}[ln y] + E_{x~μ_G, y~μ_D(x)}[ln(1-y)]

生成器旨在最小化该目标,使μ_G接近μ_ref,而判别器旨在最大化该目标,对真实数据输出接近1的值,对生成数据输出接近0的值。该极小极大博弈存在一个理论均衡,其中生成器完美复制参考分布,而判别器只能随机猜测。

与其他生成模型的关系

GAN是隐式生成模型,这意味着它们不显式建模似然函数,也不提供找到给定样本对应潜在变量的方法,这与基于流的生成模型等替代方案不同。与WaveNet和PixelRNN等全可见信念网络以及一般的自回归模型相比,GAN可以在单次前向传播中生成一个完整样本,而无需多次传播。

与玻尔兹曼机和线性ICA不同,GAN对网络使用的函数类型没有限制。由于神经网络是通用逼近器,GAN是渐近一致的。截至2026年,变分自编码器也已被证明是通用逼近器,但GAN因其对抗性训练范式而与众不同。这种方法使GAN在图像合成、风格迁移和数据增强等任务中特别有效,这些任务需要生成高维、逼真的样本。

应用与影响

GAN推动了深度学习机器学习应用的重大进展。它们被广泛用于生成逼真的图像,包括人脸、风景和医学图像。在人工智能研究中,GAN促进了半监督学习的发展,在标注数据稀缺的情况下尤为有用,也推动了强化学习的发展,其中GAN可以建模环境或生成训练经验。

对抗性训练的概念也影响了其他领域,例如Transformer大语言模型,尽管这些架构使用不同的训练目标。GAN仍然是生成建模的基础框架,持续的研究正在解决训练不稳定和模式崩溃等挑战,其中生成器只产生有限的多样性。其进化式军备竞赛的类比继续激发学术界和工业界的新方法。

局限性与挑战

尽管GAN功能强大,但它们面临若干已知困难。训练可能不稳定,因为两个网络必须保持平衡;如果判别器变得过强,生成器会收到梯度消失,而如果判别器过弱,生成器可能无法有效学习。模式崩溃是另一个常见问题,即生成器只产生少量可能的输出,无法捕捉训练数据的全部多样性。

评估GAN性能也并非易事,因为没有显式的似然函数可供衡量。研究人员通常使用Inception Score或Fréchet Inception Distance等指标,但这些指标存在局限性。截至2020年代中期,包括扩散模型在内的更新型生成模型在某些任务上已获得青睐,但GAN仍然是一个活跃的研究领域,特别是在实时应用和单次生成具有优势的场景中。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-ai·machine-learning·neural-networks·deep-learning
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴