译自英文

StyleGAN是一种由NVIDIA于2018年12月推出的生成对抗网络架构,用于高质量合成图像生成,尤其是逼真的人脸图像。它通过渐进式增长和基于风格的控制扩展了早期的GAN。

StyleGAN(风格生成对抗网络)是一种由生成模型架构,由NVIDIA研究人员于2018年12月提出。它是GAN框架的扩展,旨在生成高分辨率、逼真的图像,尤其是人脸。该架构通过基于风格的机制实现对图像特征的精细控制,其源代码于2019年2月公开发布。

StyleGAN建立在渐进式GAN方法的基础上,该方法在训练过程中让生成器和判别器从低分辨率逐步增长到高分辨率。其关键创新在于在多个尺度上注入风格向量,使模型能够独立控制粗粒度和细粒度细节。原始实现依赖于TensorFlow和NVIDIA的CUDA软件,但后续版本采用PyTorch作为官方库。

历史

StyleGAN的直接前身是2017年发表的渐进式GAN。2018年12月,NVIDIA研究人员发布了StyleGAN的预印本及配套软件,能够在普通GPU上生成无限逼真的虚构人脸肖像。2019年2月,Uber工程师Phillip Wang利用该软件创建了网站“此人不存在”,每次刷新页面都会显示一张新的人脸。Wang表示惊讶,尽管人类进化出理解人脸的能力,StyleGAN仍能提取相关面部特征并连贯地重新组合它们。

2019年9月,网站Generated Photos发布了一组使用StyleGAN创建的100,000张库存图片,这些图片基于在受控环境中拍摄的私有数据集,具有一致的照明和角度。大约同一时间,华盛顿大学信息学院的两位教员创建了“哪张脸是真的?”,这是一个互动工具,挑战访问者区分真假人脸。他们的目标是教育公众了解该技术的存在,以便人们对其保持警惕,类似于对Photoshop篡改的广泛认知。

StyleGAN2于2020年2月5日发布,消除了特征性伪影并提高了图像质量。StyleGAN3被描述为“无别名”版本,于2021年6月23日推出,源代码于2021年10月12日发布。它改善了细粒度与粗粒度细节之间的一致性,并使用PyTorch实现。

架构

渐进式GAN

渐进式GAN是一种用于稳定大规模图像生成的训练方法。它将生成器分解为\(G = G_1 \circ G_2 \circ \cdots \circ G_N\),将判别器分解为\(D = D_N \circ D_{N-1} \circ \cdots \circ D_1\)。最初,仅使用\(G_N\)和\(D_N\)生成4x4图像。然后添加\(G_{N-1}\)和\(D_{N-1}\),允许8x8生成,依此类推直到1024x1024。为避免不连续性,新层通过alpha因子“混合”进来,该因子从0平滑过渡到1,并配合上采样和下采样函数。

StyleGAN

StyleGAN将渐进式GAN与神经风格迁移相结合。每个生成的图像从恒定的4x4x512数组开始,并通过风格块。每个风格块通过仿射变换(自适应实例归一化)应用风格潜向量,类似于神经风格迁移使用格拉姆矩阵的方式。然后添加噪声,并通过减去均值并除以方差进行归一化。在训练期间,通常每个图像使用一个风格潜向量,但偶尔使用两个(混合正则化)以鼓励每个风格块独立操作。

应用与影响

StyleGAN已被广泛用于AI研究和创意应用。它实现了逼真的人脸生成,用于艺术、设计和合成数据。在不同级别控制风格的能力启发了后续的生成式AI模型。然而,它也引发了对滥用的担忧,例如创建虚假个人资料或欺骗性内容。

非法使用

2019年12月,Facebook(未在提供的slug中,故省略)撤下了一批使用虚假身份的账户,并指出其中一些使用了通过机器学习技术创建的简介图片。这凸显了StyleGAN可能被用于虚假信息或身份欺诈,引发了关于检测和伦理保障的讨论。

遗产

StyleGAN的影响超越了人脸生成。其架构原则,如渐进式增长和风格调制,已被各种深度学习模型采用。源代码的发布以及后续版本(StyleGAN2和StyleGAN3)使其成为机器学习研究中的标准基准,并在主要框架(如PyTorchTensorFlow)中提供了实现。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:generative-ai·neural-network·computer-vision·nvidia
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史