영어에서 번역됨

확산 모델(diffusion model)은 점진적 노이즈화 과정을 역전시키는 법을 학습하여 데이터를 생성하는 생성 모델이며, 대부분의 현대 텍스트-이미지 및 텍스트-비디오 시스템의 핵심 기술이다.

확산 모델은 점진적인 노이즈 추가 과정을 역전시키는 방법을 학습하여 데이터, 가장 일반적으로는 이미지, 비디오 또는 오디오를 생성하는 생성 모델이다. 이는 손상된 샘플에서 점진적으로 노이즈를 제거하도록 훈련되며, 훈련이 완료되면 순수한 무작위 노이즈에서 시작하여 반복적으로 노이즈를 제거하여 일관된 출력으로 변환함으로써 새로운 데이터를 생성할 수 있다. 확산 모델은 2020년대 중반 기준 대부분의 주요 Text-to-image generationText-to-video generation 시스템의 기반 기술로, 고충실도 이미지 합성의 지배적 접근 방식으로서 Generative adversarial network를 대체했다.

역사

이론적 기초는 2015년 Jascha Sohl-Dickstein과 동료들이 발표한 논문에서 마련되었으며, 이는 비평형 열역학에 비유하여 데이터의 구조를 노이즈로 점진적으로 파괴한 다음 이를 역전시키는 방법을 학습하는 과정을 설명했다. 이 접근 방식은 2020년 Jonathan Ho, Ajay Jain, Pieter Abbeel이 Denoising Diffusion Probabilistic Models(DDPM)을 발표하여 비교적 단순한 훈련 목표가 GAN과 경쟁할 수 있는 이미지 품질을 생성할 수 있음을 보여줄 때까지 연구적 호기심에 머물렀다. 이 기술은 2022년 4월 OpenAI의 DALL-E 2를 통해 주류의 주목을 받았으며, 몇 달 후인 2022년 8월 Stable Diffusion의 오픈소스 공개로 널리 접근 가능해졌다. 이는 2022년 Robin Rombach과 동료들이 도입한 기법인 잠재 확산을 기반으로 하며, 원시 픽셀 대신 압축된 Latent space에서 노이즈 제거 과정을 실행하여 확산 모델을 훈련하고 실행하는 데 필요한 계산량을 대폭 줄였다.

작동 방식

확산 모델 훈련에는 실제 데이터 샘플에 여러 단계에 걸쳐 소량의 가우시안 노이즈를 추가하여 순수한 노이즈와 구별할 수 없게 만드는 순방향 과정과, 각 단계에서 추가된 노이즈를 예측하고 제거하도록 훈련된 신경망(일반적으로 U-Net 또는 점차 Transformer (architecture) 기반 아키텍처)이 포함되며, 이는 역방향 과정을 효과적으로 학습한다. 생성은 이 역방향 과정을 처음부터 실행한다. 무작위 노이즈로 시작하여 모델은 여러 단계에 걸쳐 노이즈를 반복적으로 예측하고 제거하여 점진적으로 일관된 이미지나 비디오를 드러낸다. 가장 일반적으로 텍스트 Prompt를 인코딩하고 교차 주의를 통해 노이즈 제거 네트워크에 공급하는 조건화 메커니즘을 통해 사용자가 모델이 생성하는 내용을 안내할 수 있으며, 분류기 없는 안내와 같은 기법은 출력이 해당 조건화 신호를 얼마나 밀접하게 따르는지 강화한다.

응용 및 생태계

확산 모델은 Stable Diffusion, DALL-E, Midjourney, Flux를 포함하여 널리 사용되는 사실상 모든 주요 이미지 생성기를 구동하며, Sora, Google의 Veo, Kling 및 Seedance와 같은 중국 시스템을 포함한 주요 비디오 생성기의 기반이 된다. 2023년에 도입된 ControlNet과 같은 확장은 구조적 조건화를 추가하여 사용자가 스케치, 포즈 또는 깊이 맵으로 생성을 안내할 수 있게 하며, 오픈 체크포인트를 중심으로 구축된 생태계는 커뮤니티가 훈련한 LoRA 어댑터와 같은 기법을 통한 광범위한 사용자 정의를 지원한다. 확산 기법은 미디어 생성 외에도 단백질 구조 예측 및 분자 설계에 적용되었으며, 연구자들은 대부분의 Large language model이 사용하는 토큰 단위 자동 회귀 접근 방식의 대안으로 텍스트 생성에 확산 기반 접근 방식을 탐구했지만, 2025년 현재 텍스트 생성에서는 자동 회귀 생성이 여전히 지배적이다.

한계

GAN과 비교하여 확산 모델은 단일 샘플을 생성하는 데 수십 또는 수백 번의 순차적 노이즈 제거 단계가 필요할 수 있으므로 추론 시 계산 비용이 많이 든다. 다만 2022년 이후 소수 단계 모델로의 증류 및 개선된 샘플러와 같은 기법이 이 비용을 상당히 줄였다. 대규모의 선별되지 않은 웹 스크랩 데이터 세트로 훈련된 확산 모델은 또한 Training data에 있는 예술가의 스타일이나 유사한 이미지를 생성하는 것이 침해를 구성하는지에 대한 AI and copyright 분쟁에 직면했으며, 특정 조건에서 기억된 훈련 이미지를 그대로 재현하는 능력에 대한 비판을 받아왔다.

분류:deep-learning·generative-ai·image-generation
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사