인셉션 점수(Inception Score, IS)는 생성적 적대 신경망(GAN)과 같은 생성 이미지 모델이 만든 이미지의 품질을 평가하는 데 사용되는 알고리즘입니다. 2016년 팀 살리만스(Tim Salimans)와 동료들이 GAN 훈련 개선에 관한 논문에서 처음 소개했습니다. 이 점수는 생성 모델이 만든 (일반적으로 약 30,000개의) 이미지 샘플에 대해 사전 훈련된 별도의 인셉션 v3(Inception v3) 이미지 분류 모델을 적용한 출력을 기반으로 계산됩니다. 인셉션 점수는 다음 두 가지 조건이 충족될 때 최대화됩니다. 첫째, 생성된 이미지에 대한 인셉션 v3 모델의 레이블 분포의 엔트로피가 최소화되어야 합니다(즉, 분류 모델이 각 이미지에 대해 단일 레이블을 높은 신뢰도로 예측하며, 이는 이미지가 '선명하거나' '뚜렷함'을 의미). 둘째, 분류 모델의 예측이 가능한 모든 레이블에 걸쳐 고르게 분포되어야 합니다(즉, 출력이 '다양함'을 의미). 이 점수는 관련된 프레셰 인셉션 거리(Fréchet inception distance, FID)에 의해 어느 정도 대체되었습니다. 인셉션 점수는 생성된 이미지의 분포만 평가하는 반면, FID는 생성된 이미지의 분포와 실제 이미지('Ground Truth') 세트의 분포를 비교합니다.
인셉션 점수는 생성형 AI 분야, 특히 GAN 및 기타 생성 모델의 성능을 평가하는 데 널리 사용되는 지표입니다. 이는 생성된 이미지의 품질과 다양성을 모두 포착하는 것을 목표로 하는 단일 스칼라 값을 제공하므로, 서로 다른 모델이나 훈련 과정을 편리하게 비교할 수 있게 해줍니다. 그러나 사전 훈련된 분류기의 선택에 민감하고 실제 이미지와의 비교가 부족하다는 알려진 한계가 있으며, 이러한 문제는 FID가 해결합니다.
정의
이미지 공간 \(\Omega_X\)와 레이블 공간 \(\Omega_Y\)라는 두 공간이 있다고 가정합니다. 레이블 공간은 유한합니다. 평가 대상인 생성 모델의 확률 분포를 \(p_{gen}\)이라고 할 때, 판별기(discriminator)는 \(\Omega_X\)에서 \(\Omega_Y\) 위의 모든 확률 분포의 집합 \(M(\Omega_Y)\)로의 함수, 즉 \(p_{dis}:\Omega_X \to M(\Omega_Y)\)로 정의됩니다. 일반적으로 이 판별기는 ImageNet 데이터셋으로 훈련된 인셉션 v3 네트워크로 구현됩니다. 이미지 \(x\)와 레이블 \(y\)에 대해 \(p_{dis}(y|x)\)는 판별기가 이미지 \(x\)에 레이블 \(y\)를 부여할 확률을 나타냅니다.
\(p_{gen}\)의 \(p_{dis}\)에 대한 인셉션 점수는 다음과 같이 정의됩니다.
\[ IS(p_{gen},p_{dis}) := \exp\left(\mathbb{E}_{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot|x)\|\int p_{dis}(\cdot|x)p_{gen}(x)dx\right)\right]\right) \]
이는 다음과 같이 동등하게 표현할 수 있습니다.
\[ \ln IS(p_{gen},p_{dis}) := \mathbb{E}_{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot|x)\|\mathbb{E}_{x\sim p_{gen}}[p_{dis}(\cdot|x)]\right)\right] \]
실제로는 기대값 \(\mathbb{E}_{x\sim p_{gen}}\)을 생성된 이미지의 유한한 샘플을 통해 근사화하며, 주변 레이블 분포 \(\mathbb{E}_{x\sim p_{gen}}[p_{dis}(\cdot|x)]\)는 해당 샘플 세트에서 추정합니다.
직관 및 해석
인셉션 점수는 생성된 이미지의 두 가지 속성, 즉 선명도(clarity)와 다양성(diversity)을 보상하도록 설계되었습니다. 선명도는 분류기의 신뢰도로 측정됩니다. 분류기가 각 이미지에 대해 단일 레이블에 높은 확률을 할당한다면, 조건부 레이블 분포 \(p_{dis}(\cdot|x)\)의 엔트로피는 낮아지며, 이는 KL 발산(KL divergence) 값을 증가시켜 점수를 높입니다. 다양성은 주변 레이블 분포의 균일성으로 측정됩니다. 생성된 이미지가 많은 클래스에 걸쳐 분포한다면, 주변 분포는 균등 분포에 가까워지며, 이 역시 KL 발산 값을 증가시켜 점수를 높입니다. 지수 함수는 점수를 해석하기 쉽게 만들기 위해 적용되며, 값이 높을수록 더 나은 품질을 나타냅니다.
이 점수의 이름은 이미지 분류를 위해 Google이 개발한 딥 컨볼루션 신경망인 인셉션 v3 모델에서 유래했습니다. 이 모델은 고정된 특징 추출기로 사용되며, 그 예측은 인간의 콘텐츠 인식을 대리하는 역할을 합니다.
생성 모델 평가에서의 사용
인셉션 점수는 2016년부터 2018년 사이에 GAN 및 기타 생성 모델을 평가하는 표준 지표가 되었습니다. 프로그레시브 GAN(Progressive GAN), StyleGAN 등 많은 영향력 있는 논문에서 이 점수를 사용했습니다. 연구자들은 CIFAR-10 및 ImageNet과 같은 벤치마크 데이터셋에서 IS 값을 보고하여 이전 연구보다 성능이 개선되었음을 입증했습니다.
그러나 이 지표는 여러 가지 이유로 비판을 받아왔습니다. 첫째, 생성된 이미지를 실제 이미지와 비교하지 않으므로, 모델이 현실적이지 않지만 다양하고 선명한 이미지를 생성하더라도 높은 점수를 받을 수 있습니다. 둘째, 사용된 특정 인셉션 v3 분류기에 민감하여, 분류기의 버전이나 훈련 절차가 다르면 동일한 생성 모델에 대해 다른 점수가 나올 수 있습니다. 셋째, 분류기가 실제 객체로 오인할 수 있는 특정 인공물(artifact)을 생성하여 점수를 속일 수 있습니다.
프레셰 인셉션 거리와의 관계
프레셰 인셉션 거리(FID)는 2017년 마틴 호이서(Martin Heusel)와 동료들에 의해 도입되었으며, 인셉션 점수의 이러한 한계를 해결하기 위해 개발되었습니다. FID는 생성된 이미지와 실제 이미지의 특징 분포 간의 프레셰 거리(Fréchet distance)를 계산합니다. 이때 특징은 인셉션 v3 네트워크의 두 번째 마지막 층(pooling layer)에서 추출됩니다. IS가 생성된 이미지의 분포만 평가하는 반면, FID는 생성된 분포를 실제 이미지의 참조 분포와 비교하므로 생성된 이미지의 현실성을 더 포괄적으로 측정합니다.
실무에서 FID는 IS보다 선호되는 지표로 자리 잡았으며, 실제 이미지와의 비교를 통해 더 신뢰할 수 있는 평가를 제공하고 점수 조작에 더 강건합니다. 그럼에도 불구하고, 참조 데이터셋을 사용할 수 없거나 빠르고 간단한 평가 지표가 필요할 때 IS는 여전히 사용됩니다.
한계 및 비판
여러 연구에서 인셉션 점수의 한계를 지적했습니다. 예를 들어, 점수는 모델이 생성하는 이미지의 다양성을 완전히 포착하지 못할 수 있습니다. 모델이 극도로 다양한 이미지를 생성하더라도, 분류기가 이를 소수의 클래스로만 분류한다면 IS는 낮게 나올 수 있습니다. 반대로, 모델이 특정 클래스의 이미지만 소수 생성하더라도 분류기가 높은 신뢰도로 분류한다면 IS는 높게 나올 수 있습니다. 또한, IS는 분류기의 훈련 데이터에 의존하므로, 생성 모델이 분류기의 훈련 데이터와 다른 도메인의 이미지를 생성하는 경우 평가가 부정확할 수 있습니다.
역사적 맥락
인셉션 점수는 2016년 팀 살리만스, 이안 굿펠로우(Ian Goodfellow), 보이치에흐 자렘바(Wojciech Zaremba), 비키 청(Vicki Cheung), 알렉 래드퍼드(Alec Radford), 첸 시(Chen Xi)가 작성한 논문 'Improved Techniques for Training GANs'에서 소개되었습니다. 이 논문은 특징 매칭(feature matching)과 미니배치 판별(minibatch discrimination)과 같은 GAN 훈련 기술도 함께 제안했습니다. IS는 단순함과 계산 용이성 덕분에 빠르게 인기를 얻었으며, 이후 더 정교한 평가 방법이 등장하기 전까지 생성 모델 평가의 사실상 표준으로 자리 잡았습니다. 이후 생성 모델링 분야는 크게 발전했고, FID와 같은 더 나은 평가 지표가 개발되면서 IS의 사용은 줄어들었지만, 여전히 많은 교과서와 튜토리얼에서 언급되는 역사적 이정표로 남아 있습니다.
같이 보기
- 생성형 AI
- 신경망
- 머신러닝
- 딥러닝