플로우 매칭은 연속 정규화 플로우(continuous normalizing flows)를 위한 훈련 패러다임으로, 이는 상미분 방정식을 통해 단순한 확률 분포를 복잡한 목표 분포로 변환하는 생성 모델의 한 부류이다. 2022년 Yaron Lipman과 공동 연구자들에 의해 소개된 플로우 매칭은 훈련 중 전체 확산 과정을 시뮬레이션할 필요를 우회한다. 대신, 노이즈 분포에서 데이터 분포로 샘플을 운반하는 사전 정의된 벡터 필드에 신경망을 직접 회귀시킨다. 이 접근 방식은 훈련 목표를 단순화하고 계산 비용을 줄이며, 특히 이미지, 오디오, 비디오 합성 분야에서 현대 생성 AI의 기초 기술이 되었다.
연속 정규화 플로우에서 변환은 상미분 방정식 dz/dt = v_t(z)로 정의되며, 여기서 v_t는 시간 의존적 벡터 필드이다. 플로우 매칭 목표는 모델이 예측한 벡터 필드와 사전 분포와 데이터 분포 사이의 확률 경로를 정의하는 목표 벡터 필드 사이의 기대 제곱 차이를 최소화한다. 확산 모델이 확률적 순방향 과정과 노이즈 제거 점수 매칭 목표를 요구하는 반면, 플로우 매칭은 노이즈와 데이터 사이의 결정론적 보간으로 작동한다. 이 결정론적 공식은 종종 더 빠른 훈련과 샘플링을 가능하게 하며, 보간이 적절히 선택될 때 확산 모델을 특수 사례로 포함하는 통합 프레임워크를 제공한다.
플로우 매칭의 핵심 아이디어는 단순한 사전 분포 p_0(예: 표준 가우시안)를 데이터 포인트 z_1에 연결하는 조건부 확률 경로 p_t(z | z_1)를 구성하는 것이다. 목표 벡터 필드 u_t(z | z_1)는 보간 z_t = (1 - t) z_0 + t z_1의 시간 도함수로 정의되며, 여기서 t는 0에서 1까지 범위를 가진다. 모델은 이 조건부 벡터 필드를 일치시키도록 훈련되며, 주변 벡터 필드가 조건부 필드의 가중 평균이므로 조건부 필드를 일치시키는 것만으로 주변 확률 경로를 학습하기에 충분하다. 플로우 매칭 정리로 공식화된 이 통찰력은 훈련 목표를 상미분 방정식을 풀지 않고 계산할 수 있게 하여 계산 효율성을 높인다.
역사적 배경 및 확산 모델과의 관계
플로우 매칭은 정규화 플로우와 점수 기반 생성 모델의 더 넓은 계보에서 등장했다. NICE, RealNVP, Glow와 같은 전통적인 정규화 플로우는 단순한 분포를 복잡한 분포로 매핑하기 위해 일련의 가역 변환을 사용하지만, 야코비안 행렬식을 다루기 쉽게 유지하기 위해 신중하게 설계된 아키텍처를 종종 요구한다. 2018년 Chen 등이 도입한 연속 정규화 플로우는 변환을 신경망 상미분 방정식으로 매개변수화하지만, 최대 우도로 훈련하려면 상미분 방정식 솔버를 통해 역전파해야 하므로 계산 비용이 많이 든다.
2020년 Ho 등이 대중화한 확산 모델은 데이터에 점진적으로 노이즈를 추가하는 순방향 과정과 노이즈를 제거하는 역방향 과정을 사용한다. 이들은 로그 밀도의 기울기를 학습하는 것과 동등한 점수 매칭으로 훈련된다. 플로우 매칭은 확산 모델의 일반화로 볼 수 있다: 특정 보간 일정을 선택하면 플로우 매칭 목표가 노이즈 제거 점수 매칭 목표로 축소된다. 그러나 플로우 매칭은 확률 경로 설계에서 더 큰 유연성을 제공하며, 종종 더 직선적인 궤적을 생성하여 더 적은 샘플링 단계를 가능하게 한다. 이로 인해 플로우 매칭은 OpenAI 및 Google DeepMind와 같은 기업이 사용하는 것을 포함한 많은 최첨단 생성 시스템에서 선호되는 방법이 되었다.
수학적 공식화
z_0를 일반적으로 표준 가우시안인 사전 분포 p_0에서 추출된 확률 변수라고 하자. 각 데이터 포인트 z_1에 대해 t=0에서 p_0와 t=1에서 z_1의 디랙 델타 사이를 보간하는 조건부 확률 경로 p_t(z | z_1)를 정의한다. 일반적인 선택은 선형 보간 z_t = (1 - t) z_0 + t z_1이며, 이는 평균 (1-t) z_1과 분산 t^2 I를 가진 가우시안 경로를 생성한다. 조건부 벡터 필드는 보간의 시간 도함수인 u_t(z | z_1) = (z_1 - z) / (1 - t)로 정의된다.
플로우 매칭 목표는 모델의 벡터 필드 v_theta(z, t)와 조건부 벡터 필드 u_t(z | z_1) 사이의 기대 제곱 L2 노름을 t, z_0, z_1에 대해 평균하여 최소화하는 것이다. 핵심 정리는 v_theta가 모든 데이터 포인트에 대해 조건부 벡터 필드를 일치시키면 주변 확률 경로 p_t(z) = ∫ p_t(z | z_1) q(z_1) dz_1를 생성하는 주변 벡터 필드도 일치시킨다는 것을 명시하며, 여기서 q는 데이터 분포이다. 이는 상미분 방정식을 시뮬레이션하지 않고 훈련할 수 있게 하며, 추론 시 샘플은 t=0에서 t=1까지 상미분 방정식 dz/dt = v_theta(z, t)를 풀어 생성된다.
훈련 및 구현
실제로 플로우 매칭 모델은 노이즈 샘플 z_t와 시간 단계 t를 입력으로 받고 예측된 벡터 필드를 출력하는 U-Net 또는 Transformer (architecture) 아키텍처를 기반으로 한 신경망을 사용하여 구현된다. 훈련 손실은 균일 분포에서 무작위 t를 샘플링하고, 사전 분포에서 z_0를 샘플링하고, 데이터셋에서 z_1을 샘플링하고, 목표 벡터 필드를 계산하여 계산된다. 모델은 Adam (Optimizer) 및 Learning Rate Scheduling 기술과 같은 표준 최적화기로 훈련된다.
플로우 매칭의 주요 장점 중 하나는 단순성이다: 순방향 확산 과정, 별도의 노이즈 일정, 확산 훈련에서 흔한 중요도 샘플링이나 기타 분산 감소 기술이 필요하지 않다. 목표는 종종 더 안정적이고 튜닝하기 쉬운 단순한 회귀 손실이다. 또한 플로우 매칭은 Data Augmentation 및 Gradient Clipping과 같은 기술과 결합하여 견고성을 향상시킬 수 있다.
생성 AI에서의 응용
플로우 매칭은 특히 고품질 이미지 및 비디오 합성에서 생성 AI에 널리 채택되었다. 예를 들어, Stability AI가 개발한 Stable Diffusion 3 모델은 플로우 매칭 기반 아키텍처를 사용하며 텍스트-이미지 생성에서 최첨단 성능을 입증했다. 유사하게, 오디오 생성 모델 AudioLDM 2는 텍스트 설명에서 소리를 생성하기 위해 플로우 매칭을 사용한다. 비디오 영역에서는 OpenAI의 Sora 및 다양한 Google DeepMind 프로젝트가 일관된 비디오 시퀀스 생성을 위해 플로우 매칭을 탐구했다.
이 기술은 복잡한 분포를 모델링하는 데 연속 정규화 플로우가 유리한 단백질 구조 예측 및 분자 생성과 같은 과학적 응용에도 사용된다. Machine learning 분야에서 플로우 매칭은 생성 모델러의 도구 상자에서 표준 도구가 되었으며, 계산 효율성과 개념적 명확성으로 인해 확산보다 종종 선호된다.
장점 및 한계
플로우 매칭은 대체 생성 모델에 비해 여러 장점을 제공한다. 첫째, 노이즈와 데이터 사이의 결정론적 매핑을 제공하여 정확한 우도 계산과 더 쉬운 역변환을 가능하게 한다. 둘째, 훈련 목표는 계산 효율적이고 안정적인 단순한 회귀 손실이다. 셋째, 결과 상미분 방정식 궤적은 확산 모델보다 종종 더 직선적이어서 더 적은 샘플링 단계와 더 빠른 추론을 허용한다.
그러나 플로우 매칭에는 한계도 있다. 보간 일정과 사전 분포의 선택은 성능에 크게 영향을 미칠 수 있으며, 최적 설정을 찾는 데 실험이 필요할 수 있다. 또한 플로우 매칭은 훈련을 단순화하지만 추론 시 상미분 방정식을 풀어야 하며, 이는 고차원 데이터에 대해 계산 집약적일 수 있다. Generative AI 모델인 GAN과 비교할 때 플로우 매칭은 일부 경우 덜 선명한 샘플을 생성할 수 있지만, 최근 발전으로 이 격차는 좁혀졌다.
확장 및 변형
플로우 매칭의 한계를 해결하기 위해 여러 확장이 제안되었다. 확률적 플로우 매칭은 견고성을 향상시키기 위해 보간에 노이즈를 통합한다. Liu 등이 도입한 정류 플로우는 보간을 반복적으로 정제하여 궤적을 더욱 직선화하여 더 빠른 샘플링을 가능하게 한다. 최적 수송 경로를 사용한 조건부 플로우 매칭은 사전 분포와 데이터 분포 사이의 최적 수송 맵을 사용하여 궤적의 곡률을 줄이고 훈련 효율성을 향상시킬 수 있다.
또 다른 변형은 오토인코더가 학습한 압축 표현에서 모델이 작동하는 잠재 공간에서의 플로우 매칭 사용이다. Stable Diffusion 3와 같은 모델에서 사용되는 이 접근 방식은 차원을 줄이고 플로우 매칭 모델이 가장 중요한 특징에 집중할 수 있게 한다. 또한 플로우 매칭은 다중 모달 생성을 위해 Large language model 아키텍처와 결합되었으며, 동일한 모델이 텍스트, 이미지, 오디오를 생성할 수 있다.
영향 및 미래 방향
플로우 매칭은 생성 모델링 분야에 상당한 영향을 미쳤으며, 확산 모델에 대한 더 간단하고 유연한 대안을 제공한다. OpenAI 및 Google DeepMind와 같은 상업 시스템에서의 채택은 실용적 관련성을 강조한다. 2025년 현재, 연구는 새로운 보간 기법, 더 효율적인 솔버, 3D 생성 및 로봇 공학과 같은 영역에서의 응용을 계속 탐구하고 있다.
플로우 매칭의 미래는 Transformer (architecture) 기반 아키텍처와 점점 더 복잡한 데이터 양식을 처리할 수 있는 Neural network 설계와의 더 깊은 통합을 포함할 가능성이 높다. 또한 플로우 매칭을 더 샘플 효율적으로 만들고 여전히 도전 과제로 남아 있는 이산 데이터로 확장하는 데 대한 활발한 작업이 있다. 전반적으로 플로우 매칭은 더 견고하고 확장 가능한 생성 모델을 향한 핵심 단계를 나타내며, 그 원리는 Artificial intelligence의 미래 발전에 영향을 미칠 가능성이 높다.