Inception Score(初始分数)

英語からの翻訳

Inception Score(IS)は、生成モデルによって生成された画像の品質を評価するための指標であり、事前学習済みのInception v3分類器によって予測されるラベルの信頼度と多様性に基づいています。これは、生成的敵対ネットワークの研究で広く使用されています。

Inception Score(IS)は、生成的敵対ネットワーク(GAN)などの生成画像モデルによって作成された画像の品質を評価するために使用されるアルゴリズムである。これは2016年にTim Salimansらによって、GANの訓練技術を改善する論文で導入された。スコアは、生成モデルによって生成された(通常約30,000枚の)画像のサンプルに適用される、別途事前訓練されたInception v3画像分類モデルの出力に基づいて計算される。Inception Scoreは、以下の条件が真であるときに最大化される:生成画像に対してInception v3モデルが予測するラベルの分布のエントロピーが最小化される(分類モデルが各画像に対して単一のラベルを自信を持って予測し、画像が「シャープ」または「明確」であることに対応する)、および分類モデルの予測がすべての可能なラベルに均等に分布している(出力が「多様」であることに対応する)。これは関連するFréchet inception distance(FID)によってやや取って代わられている。Inception Scoreが生成画像の分布のみを評価するのに対し、FIDは生成画像の分布と実画像のセット(「グラウンドトゥルース」)の分布を比較する。

Inception Scoreは、Generative AIの分野、特にGANや他の生成モデルの性能を評価する際に広く使用される指標である。これは、生成画像の品質と多様性の両方を捉えることを目的とした単一のスカラー値を提供し、異なるモデルや訓練実行を比較するのに便利である。しかし、事前訓練された分類器の選択に対する感度や、実画像との比較の欠如など、既知の制限があり、これらはFIDによって対処されている。

定義

画像の空間\(\Omega_X\)とラベルの空間\(\Omega_Y\)の2つの空間があるとする。ラベルの空間は有限である。\(p_{gen}\)を、判断したい\(\Omega_X\)上の確率分布とする。判別器を、型\(p_{dis}:\Omega_X \to M(\Omega_Y)\)の関数とする。ここで\(M(\Omega_Y)\)は\(\Omega_Y\)上のすべての確率分布の集合である。任意の画像\(x\)と任意のラベル\(y\)について、\(p_{dis}(y|x)\)を、判別器によると画像\(x\)がラベル\(y\)を持つ確率とする。これは通常、ImageNetで訓練されたInception-v3ネットワークとして実装される。

\(p_{dis}\)に対する\(p_{gen}\)のInception Scoreは次のように定義される:

\[ IS(p_{gen},p_{dis}) := \exp\left(\mathbb{E}_{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot|x)\|\int p_{dis}(\cdot|x)p_{gen}(x)dx\right)\right]\right) \]

同等の書き換えには以下が含まれる:

\[ \ln IS(p_{gen},p_{dis}) := \mathbb{E}_{x\sim p_{gen}}\left[D_{KL}\left(p_{dis}(\cdot|x)\|\mathbb{E}_{x\sim p_{gen}}[p_{dis}(\cdot|x)]\right)\right] \]

実際には、\(p_{gen}\)上の期待値は生成画像の有限サンプルを抽出することで近似され、ラベルの周辺分布はそのサンプルから推定される。

直感と解釈

Inception Scoreは、生成画像の2つの特性、すなわち明瞭さと多様性を評価するように設計されている。明瞭さは分類器の信頼度によって測定される:分類器が各画像に対して単一のラベルに高い確率を割り当てる場合、条件付きラベル分布\(p_{dis}(\cdot|x)\)は低いエントロピーを持ち、KLダイバージェンスが増加する。多様性は周辺ラベル分布の均一性によって測定される:生成画像が多くのクラスにまたがる場合、周辺分布は一様に近くなり、これもKLダイバージェンスを増加させる。指数関数はスコアを解釈しやすくするために適用され、値が高いほど品質が良いことを示す。

スコアは、Googleによって画像分類用に開発された深層畳み込みニューラルネットワークであるInception v3モデルにちなんで名付けられた。このモデルは固定された特徴抽出器として使用され、その予測は画像内容の人間の知覚の代理として機能する。

生成モデル評価における使用

Inception Scoreは、特に2016年から2018年の期間において、GANや他の生成モデルの評価における標準的な指標となった。これは、プログレッシブGAN、StyleGAN、および他のアーキテクチャに関するものを含む、多くの影響力のある論文で使用された。研究者は、CIFAR-10やImageNetなどのベンチマークデータセットでIS値を報告し、以前の研究からの改善を示した。

しかし、このスコアはいくつかの理由で批判されている。第一に、生成画像を実画像と比較しないため、多様だが非現実的な画像のセットを生成するモデルでも高いスコアを得る可能性がある。第二に、スコアは使用される特定の事前訓練された分類器に敏感であり、Inception v3の異なるバージョンや異なる訓練手順によって異なるスコアが得られる可能性がある。第三に、分類器が実際の物体と誤認する特定のアーティファクトを持つ画像を生成するモデルによってスコアが操作される可能性がある。

Fréchet Inception Distanceとの関係

Fréchet inception distance(FID)は、2017年にMartin Heuselらによって導入され、Inception Scoreのいくつかの制限に対処するために開発された。FIDは、Inception v3ネットワークの最後から2番目の層を特徴抽出器として使用し、生成画像と実画像の特徴分布間のFréchet距離を計算する。ISとは異なり、FIDは生成分布を実画像の参照分布と比較し、品質と多様性のより包括的な尺度を提供する。

実際には、FIDは多くの研究設定でISにほぼ取って代わり、好ましい指標となっている。これは、人間の判断とより良く相関し、操作されにくいためである。それにもかかわらず、ISは、参照データセットが利用できない場合や、迅速で単純な指標が望まれる場合など、特定の文脈で依然として使用されている。

制限と批判

いくつかの研究がInception Scoreの制限を強調している。例えば、このスコアは、GANの一般的な失敗モードであるモード崩壊を罰しない。ここでモデルは少数の異なる画像のみを生成する。生成画像がシャープであるが多様でない場合、崩壊したモードがたまたま多くのクラスにまたがっていれば周辺ラベル分布は依然としてある程度一様である可能性があるが、実際にはモード崩壊はしばしば多様性を減らし、スコアを低下させる。しかし、このスコアは、すべてのクラスの一様分布を生成するモデルと、完全なシャープネスを持つクラスごとに単一の画像を生成するモデルを区別することはできない。

もう一つの批判は、Inception Scoreが分類器の選択に対して不変ではないことである。異なるデータセットで訓練された異なる分類器は、同じ生成画像のセットに対して異なるスコアを生成する可能性がある。これにより、まったく同じ分類器が使用されない限り、異なる論文間でスコアを比較することが困難になる。

実装の詳細

Inception Scoreを計算するには、通常、TensorFlowやPyTorchなどのライブラリで利用可能な事前訓練されたInception v3モデルを使用する。モデルは生成画像のサンプルに適用され、ソフトマックス出力が収集される。次に、条件付きラベル分布を使用して周辺分布とのKLダイバージェンスを計算し、平均の指数が取られる。サンプルサイズは、元の論文で推奨されているように、分散を減らすためにしばしば30,000枚の画像に設定される。

実際には、スコアはメモリの問題を避けるためにバッチで計算され、周辺分布はサンプル全体から推定される。計算は比較的高速であり、訓練の進行を監視するのに適している。

応用と拡張

Inception Scoreは、GANを超えて、変分オートエンコーダや拡散モデルなどの他の生成モデルにも適用されてきたが、FIDの台頭によりその使用は減少している。また、クラス数を調整したり、異なる分類器を使用したりする、いくつかの研究で使用される修正Inception Score(mIS)など、さまざまな方法で拡張されている。

Machine learningおよびDeep learningのより広い文脈では、Inception Scoreは生成モデルの品質を定量化する初期の試みを表しており、これは依然として未解決の課題である。生成モデルの精度と再現率などの他の指標も、より詳細な情報を提供するために提案されている。

歴史的背景

Inception Scoreは、2016年に公開されたTim Salimans、Ian Goodfellow、Wojciech Zaremba、Vicki Cheung、Alec Radford、およびXi Chenによる論文「Improved Techniques for Training GANs」で導入された。この論文では、特徴マッチングやミニバッチ判別などの他の技術も導入された。このスコアは、その単純さと当時の代替指標の欠如により、すぐに人気を博した。

それ以来、生成モデリングの分野は大幅に進化し、より洗練されたモデルと評価方法が開発されている。Inception Scoreは歴史的なマイルストーンであり、生成モデルに関する多くの教科書やチュートリアルで今も参照されている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:generative-models·evaluation-metrics·machine-learning·computer-vision
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴