StyleGAN(风格生成对抗网络)是一种生成模型架构,由NVIDIA研究人员于2018年12月提出。它是GAN框架的扩展,旨在生成高分辨率、逼真的图像,尤其是人脸图像。该架构通过基于风格的机制实现对图像特征的精细控制,其源代码于2019年2月公开发布。
StyleGAN建立在渐进式GAN方法之上,该方法在训练过程中从低分辨率到高分辨率逐步增长生成器和判别器。关键创新在于在多个尺度上注入风格向量,使模型能够独立控制粗粒度和细粒度细节。最初的实现依赖于TensorFlow和NVIDIA的CUDA软件,但后续版本采用PyTorch作为官方库。
历史
StyleGAN的直接前身是渐进式GAN,于2017年发布。2018年12月,NVIDIA研究人员发布了StyleGAN的预印本及配套软件,能够在普通GPU上生成无限数量的逼真假人脸肖像。2019年2月,Uber工程师Phillip Wang利用该软件创建了网站“此人不存在”(This Person Does Not Exist),每次刷新页面都会显示一张新面孔。Wang表示,尽管人类天生擅长识别人脸,但StyleGAN仍能精准地拆解并重组相关面部特征,这令他感到惊叹。
2019年9月,网站Generated Photos发布了由StyleGAN生成的10万张库存图片,这些图片使用了在受控环境(具有一致光照和角度)下拍摄的私有数据集。大约同一时期,华盛顿大学信息学院的两位教师创建了“哪张脸是真的?”(Which Face is Real?)互动工具,挑战访客区分真假人脸。他们的目标是教育公众认识这项技术的存在,使人们对其保持警惕,类似于对Photoshop操纵的广泛认知。
StyleGAN2于2020年2月5日发布,消除了特征伪影并提升了图像质量。StyleGAN3被描述为“无混叠”版本,于2021年6月23日推出,其源代码于2021年10月12日公开。该版本改善了细粒度与粗粒度细节之间的一致性,并采用PyTorch实现。
架构
渐进式GAN
渐进式GAN是一种用于稳定大规模图像生成的训练方法。它将生成器分解为\(G = G_1 \circ G_2 \circ \cdots \circ G_N\),将判别器分解为\(D = D_N \circ D_{N-1} \circ \cdots \circ D_1\)。最初仅使用\(G_N\)和\(D_N\)生成4x4图像,随后加入\(G_{N-1}\)和\(D_{N-1}\)以支持8x8生成,依此类推直至1024x1024。为避免不连续性,新层通过alpha因子平滑过渡(从0到1),并配合上采样和下采样函数。
StyleGAN
StyleGAN将渐进式GAN与神经风格迁移相结合。每张生成的图像从一个4x4x512的常量数组开始,并经过多个风格块处理。每个风格块通过仿射变换(自适应实例归一化)应用风格潜向量,类似于神经风格迁移使用格拉姆矩阵的方式。随后添加噪声,并通过减去均值、除以方差进行归一化。训练过程中,通常每张图像使用一个风格潜向量,但偶尔使用两个(混合正则化),以鼓励每个风格块独立运作。
应用与影响
StyleGAN已被广泛应用于AI研究和创意领域。它实现了用于艺术、设计和合成数据的逼真人脸生成。在不同层次上控制风格的能力启发了生成式AI领域的后续模型。然而,它也引发了关于滥用的担忧,例如创建虚假个人资料或欺骗性内容。
非法使用
2019年12月,Facebook(未提供相关slug,故省略)下架了一批使用虚假身份的网络账号,并指出其中一些头像使用了机器学习技术生成的图片。这凸显了StyleGAN可能被用于虚假信息或身份欺诈的风险,促使人们讨论检测手段和伦理保障措施。
遗产
StyleGAN的影响超越了人脸生成领域。其架构原则(如渐进式增长和风格调制)已被各种深度学习模型采用。源代码的发布以及后续版本(StyleGAN2和StyleGAN3)使其成为机器学习研究中的标准基准,并在主要框架(如PyTorch和TensorFlow)中均有实现。