논문 "Auto-Encoding Variational Bayes"는 2013년 Diederik P. Kingma와 Max Welling이 발표한 것으로, 생성 모델링의 초석이 된 인공 신경망 아키텍처인 변분 오토인코더(VAE)를 소개했다. 이 연구는 Deep learning과 확률적 그래픽 모델을 연결하며, 잠재 공간을 통해 복잡한 데이터 분포를 학습하는 확장 가능한 방법을 제시했다. 이는 Generative AI의 기초 기여로 인정받으며, 이후 Machine learning 및 Artificial intelligence의 발전에 영향을 미쳤다.
변분 오토인코더는 인코더와 디코더라는 두 개의 신경망으로 구성된다. 인코더는 각 입력 데이터 포인트(예: 이미지)를 단일 포인트가 아닌 저차원 잠재 공간의 확률 분포에 매핑한다. 이 분포는 일반적으로 평균과 분산 벡터로 매개변수화된 다변량 가우시안 분포이다. 디코더는 잠재 공간에서 입력 공간으로 역매핑을 수행하며, 역시 분포를 따르지만 실제로는 디코딩 중에 노이즈가 거의 추가되지 않는다. 입력을 분포로 표현함으로써 모델은 훈련 데이터에 대한 과적합을 피한다. 두 네트워크는 재매개변수화 트릭을 사용하여 공동으로 훈련되며, 이는 확률적 샘플링을 통한 경사 기반 최적화를 가능하게 한다.
배경 및 동기
VAE 이전에는 생성 모델이 종종 확률적 PCA나 희소 코딩과 같은 방법에서 볼 수 있는 기대값 최대화 알고리즘에 의존했다. 이러한 접근법은 데이터 우도의 하한을 최적화했지만, 필요한 변분 사후 확률은 일반적으로 각 데이터 포인트에 대해 개별적으로 계산되어 높은 계산 비용을 초래했다. Kingma와 Welling은 단일 신경망이 모든 데이터 포인트에 걸쳐 변분 매개변수를 출력하도록 학습하는 상각 추론 접근법을 제안했다. 이러한 매개변수 재사용은 상당한 메모리 절약을 가져왔고 대규모 데이터셋에서의 훈련을 가능하게 했다. 인코더 네트워크는 변분 분포의 매개변수를 출력하고, 디코더는 잠재 변수를 입력 공간으로 다시 매핑하며, 종종 노이즈 분포의 평균으로 사용된다.
모델은 재구성 오차와 변분 사후 확률과 사전 확률 사이의 쿨백-라이블러 발산(KL-D)이라는 두 항을 포함하는 자유 에너지 표현을 최적화하여 훈련된다. 재구성 항은 디코더가 잠재 샘플에서 입력을 얼마나 잘 재현하는지 측정하고, KL-D 항은 잠재 분포가 사전 확률(일반적으로 표준 가우시안)과 정렬되도록 장려한다. 이러한 항의 정확한 형태는 가정된 노이즈 분포에 따라 달라지며, 예를 들어 ImageNet과 같은 연속 데이터의 경우 가우시안, 이진 MNIST와 같은 이진 데이터의 경우 베르누이 분포가 사용된다.
공식화 및 훈련
목표는 매개변수화된 분포 \(p_\theta(x)\) 하에서 관측 데이터 \(x\)의 우도를 최대화하는 것이며, 이는 종종 가우시안으로 선택된다. 이 우도를 직접 최대화하려면 잠재 변수 \(z\)에 대한 주변화가 필요하며, 이는 다루기 어려운 적분을 초래한다. VAE는 대신 계산 가능한 변분 하한인 증거 하한(ELBO)을 최적화한다. ELBO는 인코더 네트워크로 매개변수화된 근사 사후 확률 \(q_\phi(z|x)\)를 도입하여 유도되며, 재구성 항과 음의 KL-D의 합으로 표현될 수 있다.
훈련은 재매개변수화 트릭을 사용하여 잠재 분포에서 미분 가능한 방식으로 샘플링하는 확률적 경사 하강법을 통해 진행된다. 이 트릭은 샘플 \(z\)를 \(\mu + \sigma \odot \epsilon\)로 표현하며, 여기서 \(\epsilon\)는 표준 정규 분포에서 추출되어 샘플링 연산을 통해 그래디언트가 흐를 수 있게 한다. 노이즈 모델의 분산은 구현에 따라 별도로 학습되거나 고정될 수 있다. 이 접근법은 비지도 학습뿐만 아니라 반지도 및 지도 작업에도 효과적임이 입증되어 적용 범위를 확장했다.
영향 및 유산
VAE 논문은 오토인코더나 제한된 볼츠만 머신과 같은 이전 접근법과 구별되는 심층 생성 모델의 새로운 패러다임을 확립했다. 이는 확률적 보장을 가진 잠재 표현을 학습하는 원리적인 방법을 제공하여 컴퓨터 비전, 자연어 처리, 약물 발견과 같은 분야에 영향을 미쳤다. 이 아키텍처는 조건부 VAE 및 계층적 변형을 포함한 더 고급 모델의 구성 요소가 되었다. 그 아이디어는 이후 등장한 생성적 적대 신경망 및 확산 모델과 같은 다른 생성 프레임워크의 발전에도 기여했다.
Deep learning의 더 넓은 맥락에서 VAE는 신경망과 베이즈 추론을 결합하는 힘을 보여주었으며, 이는 AI 연구 커뮤니티 전반에 걸쳐 공명을 일으킨 주제였다. 논문의 저자인 Kingma와 Welling은 당시 University of Toronto 및 다른 기관에 소속되어 있었으며, 그들의 연구는 이후 문헌에서 광범위하게 인용되었다. VAE는 Machine learning 도구 모음에서 표준 도구로 남아 있으며, 대학원 과정에서 가르치고 이상 탐지부터 데이터 압축까지 산업 응용 프로그램에서 사용된다.
변형 및 확장
이후 연구는 원래 모델의 한계를 해결하기 위해 수많은 VAE 변형을 도입했다. 한 가지 일반적인 문제는 KL-D 항이 모드 추구 행동을 장려하여 생성된 샘플의 다양성이 부족할 수 있다는 점이다. 이를 완화하기 위해 연구자들은 KL-D를 Wasserstein 거리나 최대 평균 불일치와 같은 대체 통계적 거리로 대체했으며, 이는 Wasserstein 오토인코더와 같은 모델로 이어졌다. 다른 확장으로는 KL-D 항의 가중치를 조정하여 분리된 표현을 장려하는 beta-VAE와 고충실도 생성을 위해 이산 잠재 공간을 사용하는 벡터 양자화 VAE가 있다.
이러한 변형은 Neural network 연구, Large language model 개발, 다중 모달 학습을 포함한 다양한 분야에 적용되었다. VAE의 매끄러운 잠재 공간을 학습하는 능력은 이미지에서 얼굴의 포즈나 표정을 변경하는 것과 같은 데이터 속성의 보간 및 조작에도 유용하게 만들었다. 2020년대 초반 현재 VAE 기반 방법은 여전히 활발한 연구 분야로 남아 있으며, 훈련 안정성과 확장성 개선에 대한 지속적인 작업이 진행 중이다.
결론
Kingma와 Welling의 2013년 VAE 논문은 신경망과 변분 추론을 우아하게 결합한 아키텍처를 도입한 기계 학습의 획기적인 기여였다. 그들의 재매개변수화 트릭과 상각 추론 프레임워크는 심층 생성 모델의 확장 가능한 훈련을 가능하게 하여 이후 많은 발전의 길을 열었다. VAE의 영향은 학술 연구와 실용 응용 프로그램 모두에서 지속되며, 이 분야의 기본 기술로서의 위치를 굳혔다.