Denoising Diffusion Probabilistic Models(DDPM)은 생성 모델의 한 부류로, 머신 러닝에서 점진적인 노이즈 추가 과정을 역전시키는 방법을 학습하여 데이터를 생성한다. 이들은 더 넓은 확산 모델 계열에 속하며, 데이터가 고차원 공간에서 드리프트가 있는 무작위 보행을 겪는 것으로 모델링한다. DDPM은 변분 추론을 사용하여 기존의 확산 기반 접근법을 개선한 2020년 논문에서 소개되었으며, 많은 현대 이미지 생성 시스템의 기초가 되었다.
DDPM에서 전방 과정은 일련의 시간 단계에 걸쳐 이미지에 가우시안 노이즈를 추가하여 점차 순수 노이즈로 변환한다. 모델은 이 과정을 역전시키도록 훈련되며, 무작위 노이즈에서 시작하여 반복적으로 노이즈를 제거하여 사실적인 이미지를 생성한다. 이 접근법은 이미지 생성, 인페인팅, 초해상도와 같은 작업에 매우 효과적임이 입증되었으며, Stable Diffusion 및 DALL-E와 같은 상용 시스템의 기반이 된다.
핵심 메커니즘
DDPM 프레임워크는 고정된 노이즈 수준 스케줄을 가진 전방 확산 과정을 정의한다. 주어진 이미지에 대해 분산 스케줄에 따라 각 시간 단계에서 노이즈가 추가되어 점점 더 노이즈가 많은 버전의 시퀀스를 생성한다. 역방향 과정은 일반적으로 U-Net 또는 트랜스포머인 신경망에 의해 학습되며, 각 단계에서 노이즈 성분을 예측한다. 훈련은 예측된 노이즈와 실제 노이즈 사이의 단순한 평균 제곱 오차를 최소화하며, 이는 변분 추론의 한 형태와 동일하다.
수학적으로 전방 과정은 (0,1)의 상수 \(\beta_1, \dots, \beta_T\)를 사용하며, \(\alpha_t = 1 - \beta_t\) 및 \(\bar{\alpha}_t = \prod_{s=1}^t \alpha_s\)로 정의된다. 시간 단계 \(t\)에서의 노이즈 이미지는 원본 이미지와 가우시안 노이즈의 선형 결합이며, 분산은 \(\sigma_t^2 = 1 - \bar{\alpha}_t\)이다. 역방향 과정은 노이즈 제거 분포의 평균을 출력하는 신경망에 의해 매개변수화된다.
훈련 및 샘플링
DDPM 훈련은 무작위 시간 단계를 샘플링하고, 해당 노이즈를 이미지에 추가한 다음, 네트워크가 그 노이즈를 예측하도록 훈련하는 것을 포함한다. 손실 함수는 \(\mathbb{E}_{t, \mathbf{x}_0, \epsilon}[\|\epsilon - \epsilon_\theta(\mathbf{x}_t, t)\|^2]\)이며, 여기서 \(\epsilon\)은 노이즈이고 \(\epsilon_\theta\)는 네트워크의 예측이다. 이 목적 함수는 로그 우도의 변분 하한에서 유도된다.
샘플링 시 모델은 순수 가우시안 노이즈로 시작하여 \(T\) 단계에 걸쳐 역방향 과정을 반복 적용하며, 각 단계에서 노이즈의 일부를 제거한다. 단계 수는 denoising diffusion implicit models(DDIM)과 같은 기술이나 노이즈 스케줄 학습을 통해 줄일 수 있어 더 빠른 생성이 가능하다.
역사적 배경
확산 모델은 2015년 Jascha Sohl-Dickstein과 동료 연구자들에 의해 비평형 열역학 원리를 사용하여 처음 제안되었다. 그들은 복잡한 데이터 분포가 점차 단순한 가우시안 분포로 확산될 수 있으며, 이 과정을 역전시키는 학습이 새로운 샘플을 생성할 수 있음을 보여주었다. 그러나 초기 방법은 계산 비용이 높고 당시 GAN보다 덜 효과적이었다.
2020년 DDPM 논문은 Jonathan Ho, Ajay Jain, Pieter Abbeel이 저술했으며, 신중하게 선택된 노이즈 스케줄과 U-Net 백본으로 확산 모델이 최첨단 이미지 생성 품질을 달성할 수 있음을 입증했다. 이는 연구와 응용의 급속한 확장을 촉발했다.
응용 및 영향
2024년 현재 DDPM과 그 변형은 이미지 노이즈 제거, 인페인팅, 초해상도, 텍스트-이미지 생성과 같은 컴퓨터 비전 작업에 널리 사용된다. 또한 자연어 처리의 텍스트 생성 및 요약, 오디오 생성에도 적용된다. Stable Diffusion 및 DALL-E와 같은 상용 제품은 DDPM을 텍스트 인코더 및 교차 주의 모듈과 결합하여 텍스트 조건 생성을 가능하게 하여, 광범위한 사용자에게 접근성을 제공한다.
DDPM은 또한 강화 학습 및 과학적 시뮬레이션을 포함한 다른 분야에도 영향을 미쳤으며, 복잡한 분포를 모델링하는 데 사용된다. 고품질 샘플 생성 능력은 현대 인공지능 연구의 초석이 되었다.
한계 및 향후 방향
성공에도 불구하고 DDPM에는 한계가 있다. 샘플링은 반복적인 노이즈 제거 과정으로 인해 일반적으로 GAN보다 느리지만, 가속화된 방법이 개발되었다. 또한 훈련에 상당한 계산 자원이 필요하며, 이는 효율적인 아키텍처와 AWS Trainium 및 Google Cloud TPU와 같은 하드웨어에 대한 관심을 촉진했다. 지속적인 연구는 샘플 품질 향상, 추론 시간 단축, DDPM의 새로운 양식으로의 확장에 초점을 맞추고 있다.
2025년 현재 확산 모델은 여전히 활발한 연구 분야이며, 백본 아키텍처, 노이즈 스케줄, 조건화 메커니즘의 혁신이 생성 모델링에서 가능한 경계를 계속 확장하고 있다.