生成对抗网络

译自英文

生成对抗网络(GAN)将生成器与判别器神经网络配对,在对抗训练中使生成器能够创造出如图像般逼真的合成数据。

生成对抗网络(GAN)是一类机器学习模型,其中两个神经网络,,生成器和判别器,,以对抗方式共同训练:生成器试图生成足够逼真的合成数据以欺骗判别器,而判别器则试图正确区分生成器的伪造输出与真实样本。训练过程表现为一场对抗博弈,其中一方的改进推动另一方相应提升,理想情况下收敛于一个能够生成高度逼真合成数据的生成器。

历史

GAN由伊恩·古德费洛及其蒙特利尔大学的同事在2014年的一篇论文中提出,据称源于一场深夜关于生成建模的争论。最初的公式在简单图像数据集上训练相对较小的网络,但架构迅速改进:2015年的DCGAN确立了用于图像生成的稳定卷积架构,2017年的渐进式GAN以及NVIDIA研究人员于2018年发布并通过StyleGAN2和StyleGAN3精炼的StyleGAN,生成了足以驱动公开“此人不存在”演示以及后来用于深度伪造媒体的大部分技术的逼真人脸。

训练方式

生成器将随机噪声作为输入,并将其转换为合成样本,而判别器(一个标准分类器)接收真实和生成样本的混合,并训练以正确标记每个样本。生成器的损失函数奖励其输出被判别器误判为真实的样本,两个网络通过梯度下降在交替步骤中更新。原则上,这一对抗过程推动生成器的输出分布趋向匹配真实数据分布,但在实践中,GAN训练以不稳定和容易发生模式崩溃而闻名,即生成器只学习产生狭窄范围的逼真输出,而非真实数据的全部多样性,这一问题推动了多年的架构和损失函数研究。

应用

除了逼真的人脸和图像合成外,GAN还被用于图像到图像的转换,例如将草图转为照片或将白天照片转为夜间照片、超分辨率放大、训练其他模型的数据增强以及语音转换。它们也是实用文本到图像系统的早期架构,之后在很大程度上被扩散模型取代。基于GAN的合成是深度伪造媒体关注的核心,因为生成逼真合成人脸的同一生成器技术可用于在照片和视频中冒充真实人物,促使了对GAN输出检测和AI水印的研究。

相对扩散模型的衰退

自大约2021年以来,扩散模型已取代GAN成为高质量图像和视频生成的主导方法,包括在DALL-E稳定扩散Midjourney等系统中,因为扩散训练通常更稳定,避免模式崩溃,并产生更大的输出多样性,尽管GAN通常通过单次快速前向传播生成样本,而扩散模型需要多次迭代去噪步骤。GAN在推理速度优势重要的场景中仍被积极使用,其核心对抗训练原则继续影响超越纯图像生成的损失函数设计。

分类:deep-learning·generative-ai·computer-vision
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史