이산 확산 모델

영어에서 번역됨

이산 확산 모델은 텍스트나 범주형 토큰과 같은 이산 데이터를 노이즈로 점진적으로 손상시키고, 그 과정을 역전시키는 방법을 학습하여 고품질 샘플 생성을 가능하게 하는 생성형 AI 기법이다.

이산 확산 모델은 텍스트 토큰, 범주형 변수, 또는 양자화된 이미지와 같은 이산 상태의 데이터를 다루는 생성 모델의 한 부류이다. 연속 확산 모델이 실수 값 데이터에 가우시안 노이즈를 추가하는 반면, 이산 확산 모델은 무작위 토큰 마스킹이나 전이 확률과 같은 구조화된 손상 과정을 적용하고, 이러한 단계를 역전시키는 방법을 학습하여 새로운 샘플을 생성한다. 이 접근 방식은 언어 모델링 및 이산 이미지 생성과 같은 영역에서 자기회귀 모델의 주요 대안으로 부상했다.

이 개념은 2010년대 초 연속 데이터에 대해 처음 공식화되고 2015년 노이즈 제거 확산 확률 모델(DDPM)의 도입으로 두각을 나타낸 확산 모델의 더 넓은 프레임워크를 기반으로 한다. 이산 변형은 연속 임베딩 없이 본질적으로 이산적인 데이터를 처리하기 위해 개발되었으며, 다항 확산 및 마스크 기반 확산과 같은 방법을 탄생시켰다. 이러한 모델은 텍스트 생성부터 단백질 서열 설계에 이르는 작업을 위해 OpenAI 및 Google DeepMind를 포함한 주요 AI 연구 그룹에서 채택되었다.

수학적 기초

이산 확산 모델은 시간 단계 \(t = 1, \dots, T\)에 걸쳐 이산 데이터 포인트 \(x_0\)를 점진적으로 손상시켜 노이즈 상태 \(x_t\)로 만드는 전방 과정을 정의한다. 손상은 일반적으로 전이 행렬 \(Q_t\)를 갖는 마르코프 체인으로 모델링되며, 각 항목 \([Q_t]_{ij}\)는 상태 \(i\)에서 상태 \(j\)로 전이할 확률을 나타낸다. 일반적인 선택으로는 균일 전이(각 토큰이 동일하게 될 확률) 또는 흡수 상태(토큰이 특수 마스크 토큰으로 대체됨)가 있다.

역방향 과정은 종종 트랜스포머 또는 U-Net인 신경망에 의해 매개변수화되며, 노이즈 샘플이 주어졌을 때 원본 데이터 분포를 예측하도록 학습한다. 훈련은 연속 확산과 유사하지만 이산 범주형 손실을 사용하여 음의 로그 우도에 대한 변분 하한을 최소화한다. 주요 장점은 전방 과정을 폐쇄 형식으로 계산할 수 있어 모든 단계를 시뮬레이션하지 않고도 효율적인 훈련이 가능하다는 점이다.

주요 변형

여러 이산 확산 아키텍처가 제안되었다. 2021년 버클리 AI 연구소의 연구자들이 도입한 다항 확산은 범주형 분포와 균일 전이 행렬을 사용한다. MaskGIT 모델과 같은 마스크 기반 확산은 생성 중에 토큰이 점진적으로 마스킹 해제되는 흡수 상태 과정을 사용한다. D3PM(이산 노이즈 제거 확산 확률 모델) 프레임워크와 같은 최근 연구는 그래프의 인접성이나 텍스트의 의미적 유사성과 같은 도메인별 구조를 포착할 수 있는 학습된 전이 행렬을 허용하여 이를 일반화한다.

언어 모델링의 경우, 이산 확산 모델은 대규모 시스템에 통합되었다. 예를 들어, Google DeepMind의 CDCD(연속 시간 이산 확산) 모델과 OpenAI의 확산 언어 모델에 대한 이후 연구는 언어 모델링 혼란도 및 텍스트 생성 품질과 같은 벤치마크에서 자기회귀 트랜스포머와 경쟁력 있는 성능을 입증했다. 이러한 모델은 종종 위치 인코딩 및 다중 헤드 어텐션을 핵심 구성 요소로 사용한다.

응용 분야

이산 확산 모델은 다양한 생성 작업에 사용된다. 자연어 처리에서는 비자기회귀 텍스트 생성을 가능하게 하며, 모든 토큰이 병렬로 생성되므로 순차 디코딩보다 더 빠를 수 있다. 이는 지연 시간이 중요한 기계 번역 및 텍스트 요약에 특히 유용하다. 컴퓨터 비전에서는 이산 확산이 이산 픽셀 값 또는 양자화된 잠재 코드로 이미지를 생성하는 데 적용되었으며, 종종 연속 모델과 비슷한 품질을 달성하면서 더 해석 가능하다.

텍스트와 이미지 외에도, 이산 확산 모델은 생물정보학에서 단백질 서열 생성, 신약 발견에서 분자 그래프 설계에 사용된다. 또한 계획 및 정책 생성을 위해 강화 학습에도 등장한다. 산업계 채택에는 아마존 웹 서비스 및 마이크로소프트 애저 AI 서비스에서의 사용이 포함되며, 클라우드 플랫폼의 생성 기능을 지원한다.

자기회귀 모델과의 비교

GPT 스타일 트랜스포머와 같은 전통적인 자기회귀 모델은 고정된 순서로 토큰을 하나씩 생성하는데, 이는 간단하지만 순차적이다. 대조적으로, 이산 확산 모델은 모든 토큰을 동시에 생성할 수 있어 AWS 트레이니엄 또는 그록 가속기와 같은 병렬 하드웨어에서 잠재적인 속도 향상을 제공한다. 그러나 종종 더 정교한 훈련 목표가 필요하며 특정 작업에서 약간 낮은 품질의 샘플을 생성할 수 있다. 최근 연구는 이러한 격차를 좁혀 확산 언어 모델이 GLUE 및 SuperGLUE와 같은 벤치마크에서 거의 동등한 성능을 달성했다.

또 다른 차이점은 제어 가능성이다. 확산 모델은 역방향 과정에서 유연한 조건화를 허용하므로 재훈련 없이 인필링 또는 안내 생성과 같은 작업을 가능하게 한다. 이는 코드 완성 또는 대화형 AI와 같은 대화형 응용 프로그램에 매력적으로 만든다.

과제 및 향후 방향

그 가능성에도 불구하고, 이산 확산 모델은 과제에 직면해 있다. 많은 역방향 단계가 필요하여 훈련이 계산 집약적일 수 있지만, 점진적 증류와 같은 최근 방법은 이 비용을 줄인다. 긴 시퀀스에서 샘플링 품질이 저하될 수 있으며, 가변 길이 출력을 처리하는 것은 여전히 해결되지 않은 문제이다. 연구자들은 또한 이산 확산을 RLHF와 결합하여 출력을 인간의 선호도에 맞추는 하이브리드 접근 방식을 탐구하고 있다.

향후 방향에는 이산 확산 모델을 수조 개 매개변수 규모로 확장하고, 검색 메커니즘과 통합하며, 더 효율적인 전이 행렬을 개발하는 것이 포함된다. 2025년 현재, 이산 확산은 스탠포드 AI 연구소 및 MIT CSAIL과 같은 학술 연구소와 앤트로픽 및 메타의 산업 팀의 기여로 활발한 연구 영역으로 남아 있다. 이 접근 방식은 생성 AI의 더 넓은 환경에서 자기회귀 모델을 대체하기보다는 보완할 것으로 기대된다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:generative-ai·machine-learning·deep-learning·natural-language-processing
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사