StyleGAN2는 2019년 12월 NVIDIA 연구진이 발표한 생성 모델로, 이미지 합성을 위해 설계되었다. 이는 StyleGAN 아키텍처의 두 번째 버전으로, 특히 인간의 얼굴을 비롯한 고해상도 사실적 이미지를 생성하는 데 있어 전례 없는 시각적 속성 제어 기능을 제공한다. 이 모델은 신경망 프레임워크와 딥러닝 기술을 기반으로 하며, 이전 버전의 기법을 개선하여 일반적인 결함을 제거하고 이미지 품질을 향상시켰다.
StyleGAN2의 주요 혁신은 재설계된 정규화 및 점진적 훈련 방법에 있다. 2019년에 출시된 원래 StyleGAN은 각 레이어의 스타일을 제어하기 위해 적응형 인스턴스 정규화(AdaIN)를 사용했지만, 생성된 이미지에 '물방울' 모양의 특징적인 결함이 자주 나타나는 문제가 있었다. StyleGAN2는 AdaIN을 가중치 복조(weight demodulation) 기법으로 대체하여 합성곱 레이어의 가중치를 직접 정규화함으로써 더 깨끗한 출력과 안정적인 훈련을 가능하게 했다. 또한 저해상도에서 시작하여 1024x1024 픽셀까지 점진적으로 해상도를 높이는 훈련 방식을 도입하여, 모델이 세부적인 특징을 단계적으로 학습할 수 있게 했다.
아키텍처 및 훈련
StyleGAN2는 머신러닝 적대적 생성 네트워크(GAN) 구조에서 생성자(generator)와 판별자(discriminator)로 구성된다. 생성자는 잠재 코드(latent code)라고 불리는 무작위 숫자 벡터를 입력받아 매핑 네트워크를 통해 중간 잠재 공간으로 변환한 후, 각 합성곱 레이어에서 이 중간 표현을 사용하여 스타일을 조절한다. 이러한 매핑과 합성의 분리는 포즈, 정체성, 조명과 같은 다양한 속성을 세밀하게 제어할 수 있게 해준다. 판별자는 생성된 이미지와 실제 이미지를 구별하도록 훈련되며, 이를 통해 생성자는 점점 더 사실적인 출력을 만들어내도록 유도된다.
훈련은 70,000장의 고품질 얼굴 이미지로 구성된 Flickr-Faces-HQ(FFHQ) 데이터셋과 고양이, 자동차 등 다양한 범주를 포함하는 LSUN 데이터셋을 사용하여 수행되었다. 가장 높은 해상도의 모델은 8개의 NVIDIA V100 GPU에서 약 1주일간 훈련되었다. 공식 구현은 NVIDIA 소스 코드 라이선스 하에 오픈소스로 공개되었으며, 코드는 GitHub에서 제공된다.
StyleGAN과의 차이점
StyleGAN2는 원래 StyleGAN의 여러 단점을 해결하는 데 중점을 두었다. 가중치 복조 기법은 AdaIN으로 인해 발생하던 물방울 모양의 결함을 제거했으며, 특히 배경과 피부 질감에서 두드러졌던 이러한 문제를 해결했다. 또한 경로 길이 정규화(path length regularization)라는 새로운 정규화 항을 도입하여 잠재 공간에서의 보간이 더 부드럽고 일관되게 이루어지도록 했다. 이를 통해 속성 변경 시 갑작스러운 변화 없이 자연스러운 전환이 가능해졌다.
또 다른 중요한 변화는 점진적 성장(growing) 방식의 제거이다. 원래 StyleGAN은 저해상도에서 고해상도로 점진적으로 레이어를 추가하며 훈련했지만, StyleGAN2는 건너뛰기 연결(skip connection) 구조를 사용하여 여러 해상도의 특징을 동시에 학습한다. 이는 훈련 시간을 단축하고 안정성을 높였으며, 해상도 간 전환 과정에서 발생할 수 있는 불안정성을 제거했다.
응용 및 영향
StyleGAN2는 인공지능 연구와 창의적 응용 분야에서 표준 도구가 되었다. 합성 데이터셋을 생성하여 다른 모델의 훈련에 활용하거나, 디지털 아트 제작, 얼굴 교체 및 편집 도구 등에 널리 사용된다. 모델의 스타일과 구조 분리 능력은 특정 잠재 코드를 조작함으로써 나이, 안경, 표정 등의 속성을 변경하는 응용을 가능하게 했다. 또한 StyleGAN3를 포함한 후속 모델 개발에 큰 영향을 미쳤으며, 이 후속 모델은 번역 등변성(translation equivariance)을 더욱 개선했다.
한계 및 윤리적 고려 사항
StyleGAN2는 뛰어난 성능에도 불구하고 몇 가지 한계를 가진다. 고해상도 모델을 훈련하려면 상당한 계산 자원이 필요하지만, 사전 훈련된 모델은 일반 소비자 하드웨어에서도 추론에 사용할 수 있다. 복잡한 장면이나 얼굴 이외의 객체를 생성할 때는 여전히 결함이 나타날 수 있으며, 훈련 데이터에 내재된 편향(예: 특정 인구 집단의 과소 대표)이 생성 결과에 반영될 수 있다.
윤리적 측면에서, 사실적인 가짜 얼굴을 생성할 수 있는 능력은 딥페이크(deepfake), 잘못된 정보 유포, 개인 정보 침해 등의 악용 가능성을 제기한다. 연구자들은 이러한 이미지를 탐지하는 방법을 개발해 왔지만, 생성 기술과 탐지 기술 간의 경쟁은 계속되고 있다. OpenAI를 비롯한 여러 기관은 책임 있는 사용을 위한 지침을 발표했지만, 이 기술은 여전히 광범위하게 접근 가능한 상태로 남아 있다.
영향
StyleGAN2는 생성형 AI 분야의 이정표로 평가받으며, GAN이 제어 가능하고 고품질의 사실적 이미지를 생성할 수 있음을 입증했다. 그 기술은 이후 많은 연구 작업에 채택되었으며, 이미지 합성 분야의 벤치마크로 자리 잡았다. 코드와 사전 훈련된 모델이 공개적으로 제공되면서 학계와 산업계 전반에 걸쳐 널리 활용되었고, 논문은 수천 회 인용되며 딥러닝 분야에 지속적인 영향을 미치고 있다.