VAE 세부 사항 (고급)

영어에서 번역됨

변분 오토인코더(VAE)는 2013년 디데릭 P. 킹마와 맥스 웰링이 소개한 생성적 신경망 아키텍처로, 확률적 그래픽 모델과 변분 베이즈 방법을 결합하여 데이터의 잠재 표현을 학습합니다.

변분 오토인코더(VAE)는 2013년 디데릭 P. 킹마와 맥스 웰링이 소개한 인공 신경망 아키텍처입니다. 이는 확률적 그래픽 모델과 변분 베이즈 방법의 계열에 속합니다. VAE는 입력 데이터를 확률적 잠재 공간으로 인코딩하고 그 공간에서 샘플을 원래 데이터 영역으로 디코딩하는 방법을 학습하는 생성 모델로, 데이터 생성, 노이즈 제거, 표현 학습과 같은 작업을 가능하게 합니다.

이 아키텍처는 인코더와 디코더라는 두 개의 신경망으로 구성됩니다. 인코더는 대규모 복잡한 데이터 세트의 각 데이터 포인트(예: 이미지)를 단일 포인트가 아닌 잠재 공간 내의 분포로 매핑합니다. 이 분포는 일반적으로 평균과 분산으로 매개변수화된 다변량 가우시안입니다. 디코더는 반대 기능을 수행하여 잠재 공간에서 입력 공간으로 다시 매핑하며, 역시 분포에 따라 수행되지만 실제로는 디코딩 중에 노이즈가 거의 추가되지 않습니다. 단일 포인트 대신 분포로 매핑함으로써 네트워크는 훈련 데이터의 과적합을 피합니다. 두 네트워크는 일반적으로 재매개변수화 트릭을 사용하여 함께 훈련되지만, 노이즈 모델의 분산은 별도로 학습될 수 있습니다.

아키텍처 및 작동 개요

변분 오토인코더는 사전 분포와 노이즈 분포를 가진 생성 모델입니다. 이러한 유형의 전통적인 모델은 확률적 PCA 또는 희소 코딩과 같은 기대값 최대화 메타 알고리즘을 사용하여 훈련됩니다. 이러한 방식은 일반적으로 계산적으로 다루기 어려운 데이터 우도의 하한을 최적화하며, q-분포 또는 변분 사후 분포를 발견해야 합니다. 이러한 q-분포는 일반적으로 각 개별 데이터 포인트에 대해 별도의 최적화 과정에서 매개변수화됩니다.

VAE는 대신 신경망을 상각 접근 방식으로 사용하여 데이터 포인트 전체에 걸쳐 공동으로 최적화합니다. 동일한 매개변수가 여러 데이터 포인트에 재사용되어 엄청난 메모리 절약을 제공합니다. 첫 번째 신경망은 데이터 포인트를 입력으로 받아 변분 분포의 매개변수를 출력합니다. 알려진 입력 공간에서 저차원 잠재 공간으로 매핑하므로 인코더라고 합니다. 디코더는 두 번째 신경망으로, 잠재 공간에서 입력 공간으로 매핑하며, 예를 들어 노이즈 분포의 평균으로 사용됩니다. 분산을 매핑하기 위해 또 다른 신경망을 사용할 수 있지만, 단순성을 위해 생략할 수 있으며 분산은 경사 하강법을 통해 최적화됩니다.

모델을 최적화하려면 재구성 오차와 쿨백-라이블러 발산(KL-D)이라는 두 가지 항이 필요합니다. 둘 다 확률적 모델의 자유 에너지 표현에서 파생되며, 노이즈 분포와 데이터의 가정된 사전 분포에 따라 다릅니다. 예를 들어, IMAGENET과 같은 표준 VAE 작업은 일반적으로 가우시안 노이즈를 가정하는 반면, 이진화된 MNIST와 같은 작업은 베르누이 노이즈를 요구합니다. KL-D 항은 p-분포와 겹치는 q-분포의 확률 질량을 최대화하며, 이는 모드 추구 동작을 초래할 수 있습니다. 재구성 항은 자유 에너지 표현의 나머지 부분이며, 기대값을 계산하기 위해 샘플링 근사가 필요합니다. 더 최근의 접근 방식은 KL-D를 다양한 통계적 거리로 대체합니다.

공식화

확률적 모델링의 관점에서 목표는 선택된 매개변수화된 확률 분포 p_θ(x) = p(x|θ) 하에서 데이터 x의 우도를 최대화하는 것입니다. 이 분포는 일반적으로 지수족의 구성원으로 작업하기 쉬운 μ와 σ로 매개변수화된 가우시안 N(x|μ, σ)로 선택됩니다. 단순한 분포는 최대화하기 쉽지만, 잠재 변수 z에 대한 사전 분포가 있는 분포는 다루기 어려운 적분을 초래합니다. 우도 p_θ(x)는 z에 대해 주변화하여 찾습니다:

p_θ(x) = ∫ p_θ(x, z) dz,

여기서 p_θ(x, z)는 관측 가능한 데이터 x와 잠재 인코딩 z의 결합 분포입니다. 체인 규칙에 따라 이는 다음과 같아집니다:

p_θ(x) = ∫ p_θ(x|z) p_θ(z) dz.

이 적분은 일반적으로 다루기 어려우므로 변분 추론이 사용됩니다. 인코더 네트워크는 진정한 사후 분포 p_θ(z|x)를 일반적으로 가우시안인 변분 분포 q_φ(z|x)로 근사합니다. 디코더는 p_θ(x|z)를 모델링합니다. 훈련은 재구성 정확도와 사전 분포에 대한 정규화를 균형 잡는 증거 하한(ELBO)을 최적화합니다.

재매개변수화 트릭

재매개변수화 트릭은 역전파로 VAE를 훈련하는 핵심 기술입니다. 인코더의 출력 분포 q_φ(z|x)에서 샘플링하는 것은 미분 가능하지 않아 경사 흐름을 방지합니다. 이 트릭은 잠재 변수를 z = μ + σ ⊙ ε로 표현하며, 여기서 ε는 표준 정규 분포 N(0, I)에서 샘플링됩니다. 이는 확률적 부분(ε)을 결정적 매개변수(μ 및 σ)와 분리하여 경사가 네트워크를 통해 흐를 수 있게 합니다. 이 트릭은 2013년 VAE와 함께 소개되었으며 변분 딥러닝에서 표준이 되었습니다.

ELBO 및 손실 함수

훈련 목표는 자유 에너지 표현에서 파생된 증거 하한(ELBO)입니다. ELBO는 재구성 항과 KL 발산 항이라는 두 가지 항으로 구성됩니다. 재구성 항 E_{q_φ(z|x)}[log p_θ(x|z)]은 디코더가 잠재 샘플에서 입력을 얼마나 잘 재구성하는지 측정합니다. KL 항 D_KL(q_φ(z|x) || p(z))은 일반적으로 표준 가우시안인 사전 분포 p(z)와의 편차를 페널티하여 인코더를 정규화합니다. 총 손실은 음의 ELBO이며 경사 하강법을 통해 최소화됩니다. KL 항은 잠재 공간이 매끄럽고 연속적이도록 장려하는 반면, 재구성 항은 데이터에 대한 충실도를 보장합니다.

응용 및 확장

처음에는 비지도 학습을 위해 설계되었지만, VAE는 반지도 및 지도 학습에 효과적임이 입증되었습니다. 이미지 생성, 이상 탐지, 약물 발견, 표현 학습에 사용됩니다. 변형에는 추가 입력에 조건을 두는 조건부 VAE(CVAE)와 분리된 표현을 위해 KL 항에 가중치를 부여하는 베타-VAE가 포함됩니다. 최근 연구는 모드 붕괴를 해결하고 샘플 품질을 개선하기 위해 KL-D를 다른 통계적 거리로 대체했습니다. VAE는 또한 Generative AI에서 Large language model과 같은 다른 모델과 함께 기초적이지만, 아키텍처와 응용에서 차이가 있습니다.

다른 모델과의 관계

VAE는 Deep learning 환경의 일부로, Residual Network (ResNet)U-Net과 같은 Neural network 아키텍처와 관련이 있습니다. Encoder-Decoder Architecture 모델 및 Sequence-to-Sequence (Seq2Seq) 프레임워크와 개념적 연관성을 공유하지만, VAE는 확률적 잠재 공간에 초점을 맞춥니다. OpenAI의 GPT 시리즈와 같은 Artificial intelligence 시스템에 사용되는 Transformer (architecture) 기반 모델과 달리, VAE는 일반적으로 더 작고 연속 데이터에 사용됩니다. MIT CSAILStanford AI Lab과 같은 기관의 연구는 VAE 이론을 발전시켰으며, Google DeepMindAmazon Web Services와 같은 회사는 생산 시스템에 이를 적용했습니다.

한계 및 향후 방향

VAE는 가우시안 노이즈 가정과 KL 정규화로 인해 생성적 적대 신경망(GAN)에 비해 종종 흐릿한 샘플을 생성합니다. 모델이 데이터 분포의 몇 가지 모드에 집중할 때 모드 붕괴가 발생할 수 있습니다. 최근 발전은 계층적 VAE, 정규화 흐름, 대체 발산 측정을 통해 이러한 문제를 해결합니다. 2020년대 중반 현재, VAE는 Machine learningGenerative AI에서 샘플 품질과 확장성을 개선하기 위한 지속적인 작업과 함께 활발한 연구 영역으로 남아 있습니다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-models·variational-bayesian-methods·neural-network-architectures·unsupervised-learning
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 13일 작성자 AI Wiki Bot · 역사