StyleGAN(Style Generative Adversarial Network)은 2018년 12월 NVIDIA 연구진이 소개한 생성 모델 아키텍처이다. 이는 GAN 프레임워크의 확장으로, 고해상도의 사실적인 이미지, 특히 인간의 얼굴을 생성하도록 설계되었다. 이 아키텍처는 스타일 기반 메커니즘을 통해 이미지 특징을 세밀하게 제어할 수 있으며, 소스 코드는 2019년 2월에 공개되었다.
StyleGAN은 훈련 중 생성기와 판별기를 저해상도에서 고해상도로 성장시키는 Progressive GAN 접근 방식을 기반으로 한다. 핵심 혁신은 여러 스케일에서 스타일 벡터를 주입하여 모델이 거친 세부 사항과 미세한 세부 사항을 독립적으로 제어할 수 있게 하는 것이다. 원래 구현은 TensorFlow와 NVIDIA의 CUDA 소프트웨어에 의존했지만, 이후 버전에서는 PyTorch를 공식 라이브러리로 채택했다.
역사
StyleGAN의 직접적인 전신은 2017년에 발표된 Progressive GAN이다. 2018년 12월, NVIDIA 연구진은 StyleGAN에 대한 사전 인쇄본과 소프트웨어를 공개했으며, 이는 일반 GPU에서 무한한 수의 설득력 있는 가짜 인간 얼굴 초상화를 생성할 수 있었다. 2019년 2월, 우버 엔지니어 필립 왕은 이 소프트웨어를 사용하여 페이지를 새로 고칠 때마다 새로운 얼굴을 표시하는 웹사이트 This Person Does Not Exist를 만들었다. 왕은 인간이 얼굴을 이해하도록 진화했음에도 불구하고 StyleGAN이 관련 얼굴 특징을 분리하고 일관되게 재구성할 수 있다는 점에 놀라움을 표현했다.
2019년 9월, 웹사이트 Generated Photos는 통제된 환경에서 일관된 조명과 각도로 촬영된 개인 데이터셋을 사용하여 StyleGAN으로 생성된 100,000개의 스톡 이미지 컬렉션을 공개했다. 같은 시기에 워싱턴 대학교 정보대학의 두 교수는 Which Face is Real?이라는 대화형 도구를 만들어 방문자가 가짜 얼굴과 진짜 얼굴을 구별하도록 도전하게 했다. 그들의 목표는 기술의 존재에 대해 대중을 교육하여 Photoshop 조작에 대한 광범위한 인식과 유사하게 사람들이 이를 경계하도록 하는 것이었다.
StyleGAN2는 2020년 2월 5일에 발표되어 특징적인 아티팩트를 제거하고 이미지 품질을 개선했다. StyleGAN3는 "앨리어스 없는" 버전으로 설명되며 2021년 6월 23일에 소개되었고, 소스 코드는 2021년 10월 12일에 공개되었다. 이는 미세한 세부 사항과 거친 세부 사항 간의 일관성을 개선했으며 PyTorch를 사용하여 구현되었다.
아키텍처
Progressive GAN
Progressive GAN은 안정적인 대규모 이미지 생성을 위한 훈련 방법이다. 생성기를 \(G = G_1 \circ G_2 \circ \cdots \circ G_N\)으로, 판별기를 \(D = D_N \circ D_{N-1} \circ \cdots \circ D_1\)로 분해한다. 처음에는 \(G_N\)과 \(D_N\)만 사용하여 4x4 이미지를 생성한다. 그런 다음 \(G_{N-1}\)과 \(D_{N-1}\)을 추가하여 8x8 생성을 허용하고, 1024x1024까지 계속한다. 불연속성을 피하기 위해 새 레이어는 0에서 1로 부드럽게 전환되는 알파 계수를 사용하여 "혼합"되며, 업샘플링 및 다운샘플링 함수가 사용된다.
StyleGAN
StyleGAN은 Progressive GAN과 신경 스타일 전이를 결합한다. 각 생성된 이미지는 상수 4x4x512 배열로 시작하여 스타일 블록을 통과한다. 각 스타일 블록은 신경 스타일 전이가 그라미안 행렬을 사용하는 방식과 유사하게 아핀 변환(적응형 인스턴스 정규화)을 통해 스타일 잠재 벡터를 적용한다. 그런 다음 노이즈를 추가하고 평균을 빼고 분산으로 나누어 정규화한다. 훈련 중에는 일반적으로 이미지당 하나의 스타일 잠재 벡터가 사용되지만, 각 스타일 블록이 독립적으로 작동하도록 장려하기 위해 때때로 두 개(혼합 정규화)가 사용된다.
응용 및 영향
StyleGAN은 AI 연구와 창의적 응용 분야에서 널리 사용되었다. 이는 예술, 디자인 및 합성 데이터를 위한 사실적인 얼굴 생성을 가능하게 했다. 다양한 수준에서 스타일을 제어하는 능력은 이후 생성 AI 모델에 영감을 주었다. 그러나 가짜 프로필이나 기만적인 콘텐츠 생성과 같은 오용에 대한 우려도 제기했다.
불법 사용
2019년 12월, 페이스북은 기계 학습 기술로 생성된 프로필 사진을 사용한 일부 계정을 포함하여 가짜 신원을 가진 계정 네트워크를 삭제했다. 이는 StyleGAN이 허위 정보나 신원 사기에 사용될 가능성을 강조하며, 탐지 및 윤리적 보호 장치에 대한 논의를 촉발했다.
유산
StyleGAN의 영향은 얼굴 생성 이상으로 확장된다. 점진적 성장과 스타일 변조와 같은 아키텍처 원칙은 다양한 딥 러닝 모델에서 채택되었다. 소스 코드와 후속 버전(StyleGAN2 및 StyleGAN3)의 공개는 이를 머신 러닝 연구의 표준 벤치마크로 만들었으며, PyTorch 및 TensorFlow와 같은 주요 프레임워크에서 구현이 제공된다.