フレシェ開始距離(FID)は、生成的敵対ネットワーク(GAN)や拡散モデルなどの生成モデルによって作成された画像の品質を評価するために使用される指標です。2017年に導入され、2024年時点で合成画像生成器を評価する標準的な指標となっています。これは、生成画像の分布と、実画像の集合(グラウンドトゥルース集合として知られる)の分布を、深層ニューラルネットワークから抽出された特徴統計間の距離を測定することで比較します。FIDスコアが低いほど、生成画像が実参照画像と品質および多様性においてより類似していることを示し、スコア0は完全な一致を表します。
FID指標は、以前のインセプションスコア(IS)に触発されましたが、ISの重要な限界に対処しています。ISは生成画像の分布のみを評価し、実データと比較しません。対照的に、FIDは生成分布と実分布の間の類似性を測定し、より包括的な評価を提供します。これは、StyleGAN1、StyleGAN2、およびさまざまな拡散モデルなどのモデルをベンチマークするために広く採用されており、生成モデルの評価における基盤であり続けています。
概要
FIDスコアの目的は、参照データセットに対する生成モデルによって作成された画像の多様性と忠実度を測定することです。参照データセットはImageNetやCOCO-2014であり、モデルが生成しようとする画像の完全な多様性を表す必要があります。生成モデルはトレーニング例とは異なる新規画像を生成するため、L2ノルムで行われるようなピクセル単位の比較では品質を評価できません。
代わりに、FIDは2つの画像集合を、実画像用の\(\mathcal{N}(\mu, \Sigma)\)と生成画像用の\(\mathcal{N}(\mu', \Sigma')\)という2つの多次元ガウス分布から抽出されたかのようにモデル化します。これらの分布間の距離は、平均と共分散の両方の差を考慮する2-ワッサースタイン距離として計算されます。このアプローチは、個々の画像が現実的に見えるかどうかだけでなく、生成された集合が実集合と同じ範囲の変動をカバーしているかどうかも捉えます。
FIDは、ピクセル空間で画像を直接比較するのではなく、畳み込みニューラルネットワーク、具体的にはInception v3アーキテクチャを使用して高レベル特徴を抽出します。最深層、つまり最後のプーリング層からの2048次元の活性化ベクトルが、各画像を表すために使用されます。これらの特徴は、犬種や飛行機などの実世界のオブジェクトに対応し、比較を生のピクセルよりも意味的に有意義にします。
すべての画像をInceptionネットワークに通した後、実集合と生成集合の両方について活性化ベクトルの平均と共分散が計算されます。FID距離は次の式で与えられます:
\[ d_F(\mathcal{N}(\mu, \Sigma), \mathcal{N}(\mu', \Sigma'))^2 = \lVert \mu - \mu' \rVert_2^2 + \operatorname{tr}\left(\Sigma + \Sigma' - 2(\Sigma \Sigma')^{1/2}\right) \]
距離が大きいほど生成モデルが劣っていることを示し、スコア0は実分布を正確に再現する完全なモデルを示します。
正式な定義
有限の平均と分散を持つ\(\mathbb{R}^n\)上の任意の2つの確率分布\(\mu\)と\(\nu\)に対して、フレシェ距離は次のように定義されます:
\[ d_F(\mu, \nu) := \left( \inf_{\gamma \in \Gamma(\mu, \nu)} \int_{\mathbb{R}^n \times \mathbb{R}^n} \lVert x - y \rVert^2 \, d\gamma(x, y) \right)^{1/2} \]
ここで、\(\Gamma(\mu, \nu)\)は周辺分布が\(\mu\)と\(\nu\)であるすべてのカップリング(同時分布)の集合です。これは2-ワッサースタイン距離であり、両方の分布がガウス分布の場合に閉形式解を持ちます。FIDの文脈では、分布は特徴ベクトルの経験的平均と共分散を使用してガウス分布として近似され、計算を扱いやすくします。
フレシェ距離を使用することで、カルバック・ライブラー発散のようなより単純な指標ではなく、FIDは平均シフトと共分散の不一致の両方を捉え、分布の類似性のより微妙な尺度を提供します。
インセプションスコアとの比較
FID指標はインセプションスコア(IS)を置き換えるものではなく、補完します。最良(最低)のFIDスコアを達成する分類器はサンプル多様性が大きい傾向があり、最良(最高)のISスコアを達成する分類器は個々の画像内の品質が優れている傾向があります。この違いは、ISが生成画像のみを評価し、確信度の高い多様なクラス予測を生成するモデルに報酬を与えるが、ターゲット分布外の画像を生成するモデルを罰しないことから生じます。FIDは実参照集合と比較することで、忠実度の欠如と多様性の欠如の両方を罰します。
実際には、研究者はモデルパフォーマンスのより完全な全体像を提供するために、FIDとISの両方を報告することがよくあります。しかし、FIDは人間の知覚による画像品質とのより強い相関により、最近の多くの研究で好まれる指標となっています。
生成モデル評価での使用
FIDは、高解像度のStyleGAN1やStyleGAN2ネットワーク、拡散モデルなど、多くの最近のモデルの品質を測定するために使用されています。例えば、StyleGAN2はFFHQやLSUNなどのデータセットで最先端のFIDスコアを達成し、多様で現実的な画像を生成する能力を示しました。DDPMやスコアベースモデルなどの拡散モデルもFIDを使用して評価され、GANと比較して競争力のあるまたは優れたスコアを達成することがよくあります。
この指標は、同じデータセットでトレーニングされたモデルを比較する場合に特に価値があり、進歩を定量化する標準化された方法を提供します。ただし、FIDは参照データセットの選択と使用されるサンプル数に敏感であり、サンプルが少なすぎると不安定な推定につながる可能性があります。研究者は通常、信頼性の高いFIDスコアを計算するために数千の画像を使用します。
限界と批判
広く使用されているにもかかわらず、FIDには限界があります。特徴分布がガウス分布であると仮定していますが、これは実際には当てはまらない可能性があり、潜在的な不正確さにつながります。さらに、FIDは固定されたInceptionネットワークを使用して計算されるため、特に自然画像以外の領域(医療や衛星画像など)では、画像品質のすべての側面を捉えられない可能性があります。この指標はサンプル数によって偏る可能性もあり、画像ごとの品質評価を提供しません。
最近の研究では、Inception特徴の代わりにCLIP埋め込みを使用するなど、意味的類似性によりよく一致させる代替案が提案されています。これらのアプローチはFIDのいくつかの欠点に対処することを目的としていますが、FIDはこの分野の事実上の標準であり続けています。
実装と計算
FIDの計算にはいくつかのステップが含まれます。まず、実画像の参照データセットが選択され、すべての画像が事前トレーニング済みのInception v3ネットワークに通されて2048次元の特徴ベクトルが抽出されます。生成画像についても同じことが行われます。次に、両方の集合について特徴ベクトルの平均と共分散が計算されます。最後に、上記の式を使用してフレシェ距離が計算されます。
実際には、共分散行列は、特にサンプル数が特徴次元よりも少ない場合に、数値的安定性を確保するために正則化されることがよくあります。オープンソースの実装はPyTorchやTensorFlowなどのライブラリで利用可能であり、研究者や実務者がFIDを簡単に計算できます。
将来の方向性
生成モデルが進化し続けるにつれて、評価指標も適応する必要があります。FIDはこの分野の進歩に重要な役割を果たしてきましたが、より堅牢で解釈可能な指標に関する研究が進行中です。前述のCLIP埋め込みの使用はそのような方向性の1つです。さらに、公平性や堅牢性などの他の側面を評価する指標も探求されています。それでも、FIDは生成モデルを評価するためのMachine learningツールボックスにおける重要なツールであり続けています。
さらなる読書については、Inception Score、Generative adversarial network、Diffusion model、StyleGANなどの関連概念を参照してください。FIDの開発は、Deep learningとComputer visionの進歩にも関連しています。