Fréchet Video Distance(FVD)는 생성 모델, 특히 Generative AI 분야에서 생성된 비디오의 품질을 평가하는 데 사용되는 정량적 지표입니다. 이는 실제 비디오 세트와 생성된 비디오 세트의 특징 분포 간 거리를 계산하여, 공간적 품질(개별 프레임)과 시간적 일관성(모션 역학)을 모두 포착합니다. FVD는 2019년 Google DeepMind의 연구자들에 의해 정지 이미지에 널리 사용되는 Fréchet Inception Distance(FID)의 확장으로 도입되었습니다. 시간적 정보를 통합함으로써, FVD는 비디오 데이터에 적용될 때 FID의 주요 한계를 해결하며, 텍스트-비디오 생성 및 비디오 예측과 같은 작업의 표준 벤치마크가 되었습니다.
이 지표는 비디오 클립을 사전 훈련된 신경망(일반적으로 I3D(Inflated 3D ConvNet)와 같은 3D 컨볼루션 네트워크)에 통과시켜 고수준 특징을 추출하는 방식으로 작동합니다. 이러한 특징은 다변량 가우시안 분포로 모델링되며, 실제 및 생성 분포 간의 Fréchet 거리가 계산됩니다. 낮은 FVD 점수는 생성된 비디오가 외관과 모션 모두에서 실제 비디오와 더 유사함을 나타냅니다. FVD는 학술 연구 및 산업 평가에서 널리 채택되었으며, OpenAI, Anthropic 및 기타 연구소의 모델이 UCF-101 및 Kinetics-400과 같은 공개 벤치마크에서 FVD 점수를 보고합니다.
수학적 기초
FVD는 두 확률 분포 간의 유사성을 측정하는 Fréchet 거리에 기반을 둡니다. 두 다변량 가우시안 분포(평균 μ₁, μ₂ 및 공분산 행렬 Σ₁, Σ₂)에 대해, Fréchet 거리는 다음과 같이 정의됩니다:
FVD = ||μ₁ - μ₂||² + Tr(Σ₁ + Σ₂ - 2(Σ₁Σ₂)^(1/2))
실제로, 특징은 비디오 인코더에서 추출되며, 평균 및 공분산은 대규모 클립 샘플에서 추정됩니다. 인코더의 선택은 중요합니다; Kinetics-400 동작 인식 데이터셋에서 사전 훈련된 I3D가 가장 일반적이며, 공간적 및 시간적 패턴을 모두 포착합니다. PSNR(peak signal-to-noise ratio) 또는 SSIM(structural similarity index)과 같은 더 단순한 지표와 달리, FVD는 참조 비디오를 프레임별로 요구하지 않으므로, 무조건적 생성 작업에 적합합니다.
다른 지표와의 비교
FVD는 개별 프레임을 독립적으로 평가하고 시간적 역학을 무시하는 FID와 자주 대조됩니다. FID는 프레임 수준 점수를 평균화하여 비디오에 적용될 수 있지만, 깜빡임, 지터, 또는 비현실적인 모션을 처벌하지 못합니다. FVD는 시간에 따른 특징의 결합 분포를 고려하여 이를 해결합니다. 그러나 FVD에는 한계가 있습니다: 특징 추출기의 선택과 샘플 수에 민감하며, 의미적 정확성이나 텍스트-비디오 정렬을 완전히 포착하지 못할 수 있습니다. 텍스트-비디오 유사성을 위한 CLIP 기반 점수와 같은 다른 지표는 FVD와 함께 사용되어 더 포괄적인 평가를 제공하는 경우가 있습니다. 실제로, 연구자들은 FVD와 IS(Inception Score) 또는 사용자 연구와 같은 추가 지표를 함께 보고합니다.
비디오 생성에서의 응용
FVD는 Google DeepMind, OpenAI 및 Meta AI가 개발한 모델을 포함한 비디오 생성 모델 평가에서 사실상의 표준이 되었습니다. 예를 들어, 텍스트-비디오 시스템 개발에서 FVD는 UCF-101(101개 동작 클래스) 및 더 큰 Kinetics-600과 같은 데이터셋에서 모델 변형을 비교하는 데 사용됩니다. 또한 과거 프레임에서 미래 프레임을 예측하는 비디오 예측 작업에도 사용됩니다. 이 지표는 시간적 아티팩트를 줄이는 데 있어 진전을 이끌었으며, 낮은FVD 점수는 더 부드럽고 현실적인 모션과 상관관계가 있습니다. 2023년 및 2024년에는 Runway 및 Stability AI와 같은 여러 상업 및 오픈소스 모델이FVD 개선을 핵심 판매 포인트로 보고했지만, 이 지표는 계산 비용과 인코더 훈련 데이터에 대한 잠재적 편향으로 인해 비판을 받기도 합니다
한계 및 비판
널리 사용됨에도 불구하고, FVD에는 몇 가지 알려진 문제가 있습니다. 첫째, I3D 인코더는 동작 인식에 훈련되었으므로, 미세한 시각적 세부 사항이나 비동작 콘텐츠에 덜 민감할 수 있습니다. 둘째, FVD는 안정적인 추정을 위해 대규모 샘플(일반적으로 수천 개)이 필요하며, 이는 계산 비용이 많이 들 수 있습니다. 셋째, 텍스트 프롬프트와의 의미적 정렬을 측정하지 않으므로, 높은FVD 품질의 비디오가 주제에서 벗어날 수 있습니다. 연구자들은 비디오 트랜스포머를 사용하는 다른 백본을 가진 Fréchet Video Distance와 같은 변형을 제안했지만, 합의는 이루어지지 않았습니다. 또한 FVD 점수는 서로 다른 데이터셋이나 인코더 간에 직접 비교할 수 없어, 발표된 결과에서 잠재적 오해를 초래할 수 있습니다
향후 방향
비디오 생성이 발전함에 따라, FVD는 인간의 지각이나 언어 기반을 통합하는 지표로 보완되거나 대체될 수 있습니다. Large language model 기반 평가자 사용과 같은 일부 노력은 비디오를 더 포괄적으로 판단하는 것을 목표로 합니다. 그러나 FVD는 자동 평가를 위한 견고하고 재현 가능한 기준선으로 남아 있습니다. 연구 커뮤니티는 적응형 샘플 크기와 더 나은 특징 추출기를 탐구하는 최근 작업과 함께 이를 계속 개선하고 있습니다. 현재로서는 FVD는 비디오 합성 작업을 하는 Machine learning 실무자의 도구 상자에서 다른 평가 프레임워크와 함께 필수적인 도구입니다