영어에서 번역됨

DDIM(Denoising Diffusion Implicit Models)은 암시적 확률 모델을 통해 확산 샘플링을 가속화하는 생성 모델의 한 부류로, 더 적은 단계로 더 빠른 고품질 이미지 생성을 가능하게 하면서 결정적 매핑을 유지한다.

Denoising Diffusion Implicit Models(DDIM)는 2021년 스탠포드 대학의 Jiaming Song, Chenlin Meng, Stefano Ermon이 소개한 생성 모델 클래스입니다. 이들은 샘플링 과정을 암시적 확률 모델로 재정의하여 확산 모델 프레임워크를 확장하며, 추가 훈련이나 기본 네트워크 수정 없이도 훈련된 확산 모델에서 고품질 샘플을 더 빠르게 생성할 수 있게 합니다. DDIM은 표준 확산 모델의 주요 한계인 느린 샘플링 과정을 해결합니다. 이 과정은 일반적으로 단일 이미지를 생성하기 위해 수천 번의 반복적 노이즈 제거 단계를 필요로 합니다. 역방향 과정을 비마르코프 체인으로 공식화함으로써, DDIM은 동일한 훈련된 모델이 훨씬 적은 단계(종종 10~50배 적음)로 샘플링할 수 있게 하면서도 경쟁력 있는 출력 품질을 유지합니다.

DDIM의 핵심 혁신은 확산 과정의 순방향 및 역방향 전이를 재공식화하는 데 있습니다. 표준 denoising diffusion probabilistic models(DDPM)은 각 단계가 이전 상태에만 의존하는 마르코프 체인을 가정하므로, 가우시안 노이즈에서 깨끗한 샘플을 재구성하려면 많은 수의 단계가 필요합니다. DDIM은 대신 확산 모델의 훈련 목표가 더 넓은 비마르코프 순방향 과정 계열과 일치한다는 점을 관찰하며, 이는 결정적 또는 반결정적 역방향 과정을 허용하도록 설계될 수 있습니다. 이러한 과정을 자유 변수로 매개변수화함으로써, DDIM은 동일한 훈련 손실을 제공하지만 더 유연한 샘플링 궤적을 갖는 생성 모델 클래스를 구성합니다. 이는 노이즈에서 데이터로의 결정적 매핑을 허용하여 간단하고 재현 가능한 방식으로 샘플을 생성할 수 있게 하며, 이는 원래의 확률적 공식에는 없는 속성입니다.

이 비마르코프 관점의 실용적 이점은 축소된 타임스텝 일정을 사용하여 샘플링할 수 있다는 것입니다. DDPM이 일반적으로 1000~2000개의 노이즈 제거 단계를 사용하는 반면, DDIM은 많은 경우 20, 50 또는 100단계만으로 유효한 이미지를 생성할 수 있습니다. 모델의 아키텍처 구성 요소는 DDPM과 동일하게 유지됩니다. 일반적으로 주의 계층이 있는 U-Net인 신경망이 각 단계에서 노이즈 구성 요소를 예측합니다. 차이점은 확률적 과정에 있으며, 이는 노이즈 제거 일정에서 중간 단계를 건너뛰어도 큰 재구성 오류를 도입하지 않도록 합니다. 결과적으로 DDIM은 샘플링 속도와 샘플 충실도 사이의 균형을 제공합니다. 단계 수가 많을수록 높은 정확도를 얻을 수 있고, 단계 수가 적을수록 일부 품질을 희생하지만 시각적으로 일관된 결과를 유지합니다. 이러한 유연성은 추론 시간 안내와 같은 작업에 활용할 수 있으며, 동일한 모델이 다양한 일정에서 다양한 샘플을 생성할 수 있습니다.

속도 외에도 DDIM은 잠재 노이즈와 생성된 데이터 사이의 결정적이고 가역적인 매핑을 가능하게 합니다. 이 속성은 노이즈 공간에서의 보간을 지원하며, 잠재 공간에서 두 샘플 사이를 선형 보간하면 결과 이미지 공간에서 의미론적으로 의미 있는 모핑이 생성됩니다. 이러한 결정적 특성은 또한 생성적 적대적 훈련 모델에서와 같은 샘플링을 허용하여, GAN 훈련의 관련 불안정성 없이 이미지 편집, 인페인팅 또는 부분 관측에서의 재구성과 같은 작업에 사용할 수 있습니다. 암시적 모델 관점은 또한 DDIM을 단순한 결정적 생성 함수를 통해 분포를 정의하는 더 넓은 암시적 확률 모델 계열에 배치하며, 이는 변분 추론 및 정규화 흐름의 개념과 연결됩니다.

DDIM의 알고리즘 개발은 효율적인 확산 기반 Generative AI의 더 넓은 진화에 기여했습니다. 예측된 노이즈와 현재 샘플의 스케일된 계수를 가진 선형 결합으로 자주 작성되는 샘플링 공식은 잠재 확산, 텍스트-이미지 합성 및 고해상도 생성을 다루는 후속 작업의 구성 요소가 되었습니다. DDIM은 ai-archived?와 관련된 Stable Diffusion 모델을 포함한 여러 참조 구현에서 널리 사용되는 노이즈 제거 샘플러입니다. - 단계 건너뛰기 전략과 결정적 공식은 denoising diffusion GAN 및 일관성 모델과 같은 후속 작업의 비교 표준으로 남아 있습니다.

확산 확률 모델과의 관계

DDIM은 확산 확률 모델, 특히 Sohl-Dickstein et al.(2015) 및 Diederik Ho et al.(2020)의 작업이 제공한 이론적 기반 위에 구축됩니다. 표준 DDPM은 1000단계에 걸쳐 가우시안 노이즈로 데이터를 무작위로 교란하고 노이즈를 추정하여 이 과정을 역전시키는 방법을 학습합니다. 효과적이지만, DDPM에서 샘플링하면 각 역방향 단계에서 새로운 무작위 노이즈 샘플을 추출합니다. DDIM은 대신 역방향 과정이 대략 결정적일 수 있는 순방향 과정 계열을 정의합니다. 핵심 이론적 통찰은 손실 함수가 점수 추정기에 의존하도록 선택된 역방향 및 순방향 과정 사이의 KL 발산만 포함한다는 것입니다. 대체 순방향 과정은 훈련에 영향을 주지 않고 가능하므로 샘플링에서 유연성을 허용합니다. DDIM은 그런 다음 이러한 통계적 주변 분포와 일치하는 '암시적' 체인을 구성하여 새로운 샘플링 규칙을 생성합니다.

이 유연성의 직접적인 결과는 DDIM이 별도의 모델 계열이지만 동일한 훈련 절차가 둘 다에 작동한다는 것입니다. 사용자는 동일한 네트워크를 유지해야 하지만, 샘플링 시점에 시간 제약에 따라 DDPM 일정 또는 DDIM 일정을 선택할 수 있습니다. DDIM 공식의 매개변수는 노이즈의 알파(α) 및 시그마(σ) 일정에 의해 결정되며, 이는 종종 확산 계수로 미리 계산됩니다. DDIM의 핵심 방정식은 예측된 노이즈 제거 샘플(x0)과 현재 잠재 변수(xt)를 관련시켜 다음 잠재 변수 x(t-1)를 공식 x(t-1) = sqrt(α(t-1)) x0 + sqrt(1 - α(t-1) - σ(t)^2) ε_θ(xt) + σ(t) z로 생성합니다. 여기서 z는 선택적 노이즈이고 ε는 노이즈 예측입니다. σ가 0으로 설정되면 과정은 완전히 결정적이 되며, 이는 결정적 annealed Langevin dynamics에 해당하는 "비균질" DDIM 계열을 생성합니다.

이 작업은 BAIR (Berkeley AI Research)에서 시작되었으며(Song과 Ermon의 소속 형태로, 당시 스탠포드에 있었지만), 초기 점수 기반 생성 모델 및 노이즈 없는 네트워크와 관련이 있습니다. DDIM 공식은 또한 점수 함수의 신경망 근사기인 Neural network와 밀접하게 연결되어 있으며, 노이즈 예측기가 점수 항을 추정하는 것을 목표로 하는 가우시안이므로 확산 단계의 역전이 데이터 다양체를 포착합니다.

장점과 한계

DDIM의 실용적 이점에는 샘플 시간 제어 가능성, 재현성(무작위 시드가 입력 잠재 변수를 설명하기 때문에), 외삽이 포함됩니다. 고정된 수의 노이즈 제거 단계를 기반으로 이미지의 효과적인 공동 추정을 제공하므로 리소스가 제한된 하드웨어에서 동일한 모델을 활용할 수 있습니다. 그러나 DDIM은 각 단계에서 가우시안 오류를 가정합니다. 실제로 유한 단계 근사는 전체 SDE 샘플러에 비해 품질을 제한합니다. 결과적으로 중간에서 낮은 단계 수에서 성능이 눈에 띄게 저하되며, 매우 적은 단계에서는 심각한 아티팩트가 발생하여 변형된 해부학적 구조나 흐림이 나타납니다. 그럼에도 불구하고 Large language model과 인접한 텍스트-이미지 모델 시대에서 결정적 감소 특성은 Deep learning 추론 중 샘플링 파이프라인을 구축하는 데 유용합니다.

명시적 노이즈 제거 메커니즘은 또한 Stable Diffusion 및 고해상도 이미지 합성에 사용되는 Denoising Diffusion Implicit Models와 같은 DDPM 파생 모델의 공통 아키텍처 구축에 도움이 됩니다. 안정 확산 접근 방식은 축소된 잠재 공간과 DDIM 샘플러를 해당 잠재 코어에서 역확산을 위한 효율적인 솔버로 사용합니다. 이는 널리 사용되는 diffusers(라이브러리) 패키지의 기반을 형성했으며, DDIM의 실제 코드는 종종 다른 모든 확산 모델과 함께 번들로 제공되어 접근성이 높습니다.

샘플링 속도와 품질 균형

DDIM은 원래 확산의 표준에 비해 작고 관리 가능한 2단계 일정을 허용합니다. 단계 수는 추론 시 조정할 수 있는 하이퍼파라미터로 샘플 품질의 균형을 맞춥니다. 20단계에서 DDIM은 많은 상황에서 1000단계 DDPM과 유사한 품질의 이미지를 생성할 수 있지만, 10단계로 줄이면 흐릿한 영역과 같은 더 뚜렷한 시각적 아티팩트가 생성됩니다. Latent Diffusion 모델의 sharp sampler와 같은 특정 모듈에서 DDIM을 사용하면 경쟁력 있는 지표를 위해 50단계를 유지합니다. 초기 노이즈에서 출력으로 이동하는 방법의 일정은 - 예를 들어 시작 잠재 변수와 최종 평균 노이즈 사이의 직선 보간? - 초기 및 후기 단계에서 출력이 중간 품질을 유지하는 경향이 있습니다.

AlignSAM ArrayList 또는 Conclément implicits와 같은 적응형 샘플링 스케줄러를 사용하는 방법과 비교하여 DDIM은 네트워크를 재훈련하지 않고 분류기와 동일하게 노이즈 제거기를 훈련하며, 제안된 방법은 좋은 결과를 얻을 수 있습니다.

영향 및 관련 작업

International Conference on Learning Representations(ICLR) 2021에서 발표된 후, DDIM은 더 넓은 생성 모델링 분야에 영향을 미쳤습니다. 확산 과정에 대한 결정적 샘플링 개념을 도입했으며, 이는 잠재 변수 공간을 이해하는 데 중요하고 Latent Diffusion Models(Rombach et al., 2022)와 같은 다운스트림 작업에서 확산 모델을 사용할 수 있게 합니다. 이는 임베딩의 ID와 DDIM 샘플러를 기반으로 잠급니다. 많은 후속 논문이 "Fisher merger" 및 "authors"에서 이 접근 방식을 인용합니다. 훈련 목표는 DDPM과 동일하지만 샘플 처리는 GAN 스타일의 더 나은 잠재 변수를 이끌어냅니다. DDIM의 역방향 접근 방식은 이미지-이미지 변환 및 역 설정에서 알려진 사후 계열에도 사용되었습니다.

이러한 발견의 존재는 DPM-solver(2022)와 같은 강력한 샘플링 알고리즘의 길을 열었습니다. 이는 적분 분석을 사용하는 결정적 방법이며, denoising diffusion GAN 모델(2022)은 적대적 단계로 단계 과정을 모델링합니다. 이러한 현대적 접근 방식은 종종 DDIM 기반을 수렴하는 연속 테스트와 결합하여 때로는 한 번의 반복으로 샘플을 얻습니다. 비마르코프 관점의 철학은 후속 모델이 개선된 방식이기도 합니다. DDIM의 결정적 역학은 오늘날 AI 시스템 연구소에서 필수적인 도구이며, 예를 들어 LangChain에서 자주 사용됩니다.

또한, 암시적 확률 모델 연구 이론은 컴퓨터 엔진에서 설계 도구로 사용되는 흐름 및 정류 흐름과 연결되었습니다. 이 논문은 높은 인용을 받았으며, 비디오 효과 생성의 오픈 소스 AI 분야의 기초 논문 중 하나로 자리 잡았습니다.

전반적으로 DDIM의 중요성은 높은 단계, 우아함, 그리고 계산적 측면과 실용적 측면 사이의 연결에 있습니다. 고품질 생성에 다양한 사용자가 접근할 수 있게 하며, Google DeepMind와 인접한, OpenAI와 인접한 안정적인 dict 및 Adobe를 포함한 모든 현대 텍스트-이미지 또는 확산 기반 파이프라인에서 표준 샘플러로 남아 있습니다. 2025년의 모든 실용적(내부) 목적에서 DDIM은 고전적인 샘플링 엔진으로 사용됩니다.

출처

  • Song et al., 2021, "Denoising Diffusion Implicit Models"(온라인 사전 인쇄본)
  • Ho et al., 2020, "Denoising Diffusion Probabilistic Models"
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-ai·diffusion-models·deep-learning·image-generation
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사