생성적 적대 신경망(GAN)은 기계 학습 프레임워크의 한 부류이며, 생성적 AI에 접근하기 위한 두드러진 프레임워크이다. 이 개념은 2014년 6월 이안 굿펠로우와 그의 동료들에 의해 처음 개발되었다. GAN에서는 두 개의 신경망이 제로섬 게임 형태로 서로 경쟁하며, 한 에이전트의 이득은 다른 에이전트의 손실이 된다.
훈련 세트가 주어지면, 이 기법은 훈련 세트와 동일한 통계를 가진 새로운 데이터를 생성하는 방법을 학습한다. 예를 들어, 사진으로 훈련된 GAN은 인간 관찰자에게 표면적으로는 진짜처럼 보이는 새로운 사진을 생성할 수 있으며, 많은 사실적인 특성을 갖는다. 원래 비지도 학습을 위한 생성 모델의 형태로 제안되었지만, GAN은 준지도 학습, 완전 지도 학습, 강화 학습에도 유용함이 입증되었다.
GAN의 핵심 아이디어는 입력이 얼마나 "사실적인지"를 판단할 수 있는 또 다른 신경망인 판별자를 통한 "간접" 훈련에 기반하며, 이 판별자 자체도 동적으로 업데이트된다. 이는 생성자가 특정 이미지와의 거리를 최소화하도록 훈련되는 것이 아니라, 판별자를 속이도록 훈련된다는 것을 의미한다. 이를 통해 모델은 비지도 방식으로 학습할 수 있다. GAN은 진화 생물학의 의태와 유사하며, 두 네트워크 사이에 진화적 군비 경쟁이 벌어진다.
아키텍처 및 훈련
GAN은 생성자와 판별자라는 두 가지 주요 구성 요소로 이루어진다. 생성자는 잠재 공간(종종 다변량 정규 분포)에서 무작위 노이즈를 가져와 이미지와 같은 데이터 샘플로 매핑하는 신경망이다. 판별자는 훈련 데이터 세트의 실제 샘플과 생성자의 합성 샘플을 모두 받아 주어진 입력이 실제인지 생성된 것인지에 대한 확률을 출력하는 또 다른 신경망이다.
훈련은 반복적인 게임으로 진행된다. 판별자는 먼저 알려진 데이터 세트에서 실제와 가짜를 허용 가능한 정확도로 구별하도록 훈련된다. 그런 다음 생성자는 판별자를 속이는 데 성공했는지 여부에 따라 훈련된다. 두 네트워크 모두에 독립적인 역전파 절차가 적용된다. 생성자는 더 설득력 있는 샘플을 생성하도록 가중치를 조정하고, 판별자는 합성 입력을 식별하는 능력을 향상시킨다. 이미지 생성에 사용될 때, 생성자는 일반적으로 디콘볼루션 신경망이고, 판별자는 컨볼루션 신경망이다.
원래 GAN 게임의 목적 함수는 참조 분포(실제 데이터)와 생성자 분포에 대해 정의된다. 판별자는 실제 및 가짜 입력을 올바르게 분류하는 로그 확률을 최대화하는 것을 목표로 하며, 생성자는 동일한 목적을 최소화하여 생성된 샘플에 대해 판별자가 1을 출력하도록 만드는 것을 효과적으로 시도한다. 이 제로섬 공식은 생성자의 분포가 참조 분포와 밀접하게 일치할 때까지 두 네트워크를 개선하도록 이끈다.
수학적 공식화
공식적으로, GAN 게임은 확률 공간 (Ω, μ_ref)에서 정의된다. 생성자의 전략 집합은 Ω에 대한 모든 확률 측도 μ_G의 집합이고, 판별자의 전략 집합은 Ω에서 [0,1]에 대한 확률 측도로의 마르코프 커널로 구성된다. 목적 함수는 다음과 같다:
L(μ_G, μ_D) = E_{x~μ_ref, y~μ_D(x)}[ln y] + E_{x~μ_G, y~μ_D(x)}[ln(1-y)]
생성자는 이 목적을 최소화하여 μ_G ≈ μ_ref에 접근하는 것을 목표로 하고, 판별자는 이를 최대화하여 실제 데이터에 대해 1에 가까운 값을, 생성된 데이터에 대해 0에 가까운 값을 출력하는 것을 목표로 한다. 이 미니맥스 게임은 생성자가 참조 분포를 완벽하게 복제하고 판별자가 무작위 추측보다 더 잘할 수 없는 이론적 평형을 갖는다.
다른 생성 모델과의 관계
GAN은 암시적 생성 모델로, 가능도 함수를 명시적으로 모델링하지 않으며 주어진 샘플에 해당하는 잠재 변수를 찾는 수단을 제공하지 않는다는 점에서 흐름 기반 생성 모델과 같은 대안과 다르다. WaveNet 및 PixelRNN과 같은 완전 가시 신념 네트워크 및 일반적인 자기회귀 모델과 비교하여, GAN은 네트워크를 통한 여러 패스가 필요하지 않고 단일 패스로 하나의 완전한 샘플을 생성할 수 있다.
볼츠만 머신 및 선형 ICA와 달리, GAN은 네트워크가 사용하는 함수 유형에 제한을 두지 않는다. 신경망은 보편 근사자이므로 GAN은 점근적으로 일관적이다. 2026년 현재, 변분 오토인코더도 보편 근사자임이 입증되었지만, GAN은 적대적 훈련 패러다임에서 여전히 구별된다. 이 접근 방식은 사실적인 고차원 샘플 생성이 중요한 이미지 합성, 스타일 전이, 데이터 증강과 같은 작업에서 GAN을 특히 효과적으로 만들었다.
응용 및 영향
GAN은 딥 러닝 및 기계 학습 응용 분야에서 상당한 진전을 이끌었다. 얼굴, 풍경, 의료 이미지를 포함한 사실적인 이미지 생성에 널리 사용되었다. 인공 지능 연구에서 GAN은 레이블된 데이터가 부족한 준지도 학습과 환경을 모델링하거나 훈련 경험을 생성할 수 있는 강화 학습에서 진전을 가능하게 했다.
적대적 훈련 개념은 트랜스포머 및 대규모 언어 모델과 같은 다른 영역에도 영향을 미쳤지만, 이러한 아키텍처는 다른 훈련 목적을 사용한다. GAN은 생성 모델링의 기초 프레임워크로 남아 있으며, 훈련 불안정성 및 생성자가 제한된 다양성을 생성하는 모드 붕괴와 같은 문제를 해결하는 지속적인 연구가 진행 중이다. 그들의 진화적 군비 경쟁 비유는 학계와 산업계 모두에서 새로운 방법에 계속 영감을 주고 있다.
한계 및 과제
강력함에도 불구하고, GAN은 몇 가지 알려진 어려움에 직면한다. 훈련은 불안정할 수 있으며, 두 네트워크가 균형을 유지해야 한다. 판별자가 너무 강해지면 생성자는 소실 기울기를 받고, 너무 약해지면 생성자가 효과적으로 학습하지 못할 수 있다. 모드 붕괴는 또 다른 일반적인 문제로, 생성자가 가능한 출력의 작은 하위 집합만 생성하여 훈련 데이터의 전체 다양성을 포착하지 못한다.
GAN 성능 평가도 명시적 가능도가 없기 때문에 사소하지 않다. 연구자들은 종종 인셉션 점수 또는 프레셰 인셉션 거리와 같은 지표를 사용하지만, 이러한 지표에는 한계가 있다. 2020년대 중반 현재, 확산 모델을 포함한 새로운 생성 모델이 일부 작업에서 인기를 얻었지만, GAN은 특히 실시간 응용 및 단일 패스 생성이 유리한 설정에서 여전히 활발한 연구 영역이다.