英語からの翻訳

F1スコアは、適合率と再現率の調和平均であり、偽陽性と偽陰性のバランスを取ることで分類モデルを評価するために使用されます。

F1スコアは、分類モデルの性能を評価するために用いられる統計的指標である。これは適合率(precision)と再現率(recall)の調和平均として定義され、偽陽性と偽陰性の間のトレードオフをバランスさせる単一の指標を提供する。F1スコアは0から1の範囲を取り、1は完全な適合率と再現率を示し、0は最悪の性能を示す。これはクラスが不均衡な場合に特に有用であり、正確度(accuracy)だけよりもモデル性能についてより情報量の多い見方を提供する。

F1スコアは、2 (適合率 再現率) / (適合率 + 再現率) として計算される。適合率は、真陽性予測の数を陽性予測の総数(真陽性と偽陽性の合計)で割った比率であり、再現率は、真陽性予測の数を実際の陽性インスタンスの総数(真陽性と偽陰性の合計)で割った比率である。調和平均により、適合率または再現率のいずれかが低い場合にF1スコアが低くなり、一方を犠牲にして他方を優先するモデルを罰する。

歴史的背景

F1スコアは、情報検索と統計的分類にその起源を持つ。適合率と再現率を単一の指標に組み合わせる概念は1950年代に遡り、Karen Simonyan のような研究者による初期の研究がある(彼女の貢献はより最近のものだが、基礎となる考え方はより早期に発展した)。調和平均をF値として具体的に定式化したのは、Chris Bishop らが機械学習評価の文脈で行った。F1スコアは1990年代にテキスト検索の台頭とともに注目を集め、その後、Machine learningDeep learning 研究における標準的な指標となった。

数学的定義

F1スコアは次のように定義される:

F1 = 2 (適合率 再現率) / (適合率 + 再現率)

適合率 = TP / (TP + FP)

再現率 = TP / (TP + FN)

ここで、TPは真陽性の数、FPは偽陽性の数、FNは偽陰性の数である。F1スコアは、真陽性、真陰性、偽陽性、偽陰性の数を要約する混同行列の観点からも表現できる。

他の指標との関係

F1スコアは、適合率と再現率の加重調和平均であるF値のファミリーの一部である。一般式は Fβ = (1 + β²) (適合率 再現率) / (β² * 適合率 + 再現率) であり、βは再現率の適合率に対する重みを制御する。β = 1のとき、F1スコアが得られ、適合率と再現率に等しい重みを与える。他の一般的な指標には、正しい予測の数を予測の総数で割った比率である正確度や、混同行列の4つのカテゴリーすべてを考慮するマシューズ相関係数(MCC)がある。F1スコアは、不均衡データセットにおいて正確度よりも好まれることが多い。なぜなら、正確度は一方のクラスが支配的な場合に誤解を招く可能性があるからである。

機械学習における応用

F1スコアは、Artificial intelligenceMachine learning において分類モデルの評価に広く使用されており、特に自然言語処理、コンピュータビジョン、情報検索で顕著である。例えば、Large language model の評価では、F1は質問応答システムの品質を測定するために使用され、適合率は取得された回答の関連性を反映し、再現率はカバレッジの完全性を反映する。Neural network のトレーニングでは、F1は最良のモデルチェックポイントを選択するための検証指標としてしばしば使用される。OpenAIGoogle DeepMind のような企業は、研究論文でモデル性能をベンチマークするためにF1スコアを報告している。

利点と限界

F1スコアにはいくつかの利点がある。適合率と再現率のバランスを要約する単一の数値を提供し、モデルの比較を容易にする。真陰性を考慮しないため、不均衡データセットで支配的になる可能性があるクラス不均衡に対して頑健である。しかし、F1スコアには限界もある。適合率と再現率が等しく重要であると仮定しており、これはすべてのアプリケーションで真ではない場合がある。例えば、医療診断では、陽性症例を見逃さないために、適合率よりも再現率(感度)がより重要かもしれない。さらに、F1スコアは誤差の根本的な分布に関する情報を提供せず、混同行列の小さな変化に敏感である可能性がある。

変種と拡張

特定のニーズに対応するために、F1スコアのいくつかの変種が存在する。マクロF1スコアは、各クラスに対して独立にF1スコアを計算し、それらを平均して、すべてのクラスに等しい重みを与える。マイクロF1スコアは、すべてのクラスにわたって真陽性、偽陽性、偽陰性を集計してから適合率と再現率を計算し、これは全体のF1と同等である。加重F1スコアは、各クラスのサンプル数で重み付けしたクラス別F1スコアを平均する。これらの変種は、Transformer (architecture) モデルが扱うような多クラス分類タスクで一般的に使用される。

産業と研究での使用

F1スコアは、学術研究と産業実務の両方で標準的な指標である。Deep learning 研究では、論文はSQuAD(質問応答)やGLUE(自然言語理解)のようなベンチマークデータセットでF1スコアを報告することが多い。Amazon Web ServicesMicrosoft AzureGoogle Cloud のようなテック企業は、モデル評価のためにF1スコアを自動計算するツールとサービスを提供している。Generative AI では、F1は生成されたテキストの品質を評価するために使用され、例えば要約タスクでは、適合率と再現率が生成された要約と参照要約の間の重なりを測定する。

計算上の考慮事項

F1スコアの計算は簡単で、混同行列のみを必要とする。実際には、Pythonのscikit-learnのようなライブラリがF1スコアを効率的に計算する関数を提供している。AWS TrainiumCerebras ハードウェアを含む大規模評価では、F1計算は数百万の予測を処理するために並列化される。この指標は、Waymo 自動運転車の知覚のようなリアルタイムシステムでも使用され、安全性にとって適合率と再現率のバランスが重要である。

結論

F1スコアは、分類性能を評価するための Machine learningArtificial intelligence における基本的な指標であり続けている。その調和平均の定式化は適合率と再現率のバランスの取れた見方を提供し、不均衡データセットや多クラス問題に不可欠である。限界にもかかわらず、F1スコアは研究と産業の両方で広く採用され続けており、AIモデルがより複雑になるにつれて、主要な評価ツールであり続ける可能性が高い。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-learning·evaluation-metrics·classification·statistics
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴