精度と再現率は、分類および情報検索においてモデルの予測品質を評価するために使用される2つの基本的な性能指標です。精度は、陽性適中率とも呼ばれ、取得された全インスタンスのうち関連するインスタンスの割合を測定します。再現率は、感度とも呼ばれ、関連するインスタンスのうち正常に取得された割合を測定します。両指標は関連性の概念に基づいており、関連性は通常、データセット内の特定のクラスを識別するなど、特定のタスクによって定義されます。
分類タスクでは、特定のクラスに対する精度は、真陽性(そのクラスに属すると正しくラベル付けされた項目)の数を、そのクラスに属するとラベル付けされた全項目数(真陽性と偽陽性の合計)で割ったものです。再現率は、真陽性の数を、実際にそのクラスに属する全項目数(真陽性と偽陰性の合計)で割ったものです。これらの定義は一般的な式と一致します。精度は関連する取得インスタンスを全取得インスタンスで割ったもの、再現率は関連する取得インスタンスを全関連インスタンスで割ったものです。
デジタル写真内の犬を認識するように設計されたコンピュータプログラムを考えます。写真に猫が10匹と犬が12匹含まれ、プログラムが8つの要素を犬として識別し、そのうち5つが実際に犬(真陽性)で3つが猫(偽陽性)である場合、7匹の犬が見逃され(偽陰性)、7匹の猫が正しく除外されます(真陰性)。プログラムの精度は5/8です。選択された8つの要素のうち5つだけが関連するためです。再現率は5/12です。12匹の関連する犬のうち5匹だけが取得されるためです。この例は、精度と再現率が性能の異なる側面を捉えることを示しています。
仮説検定との関係
精度と再現率は、仮説検定の観点から理解できます。典型的な設定では、帰無仮説は特定の項目が関連しない(例:犬ではない)というものです。第一種過誤は、関連する項目が誤って棄却されたときに発生し、これは偽陽性に対応します。第二種過誤は、関連しない項目が誤って受け入れられたときに発生し、偽陰性に対応します。完全な精度(偽陽性なし)は第一種過誤がないことと同等であり、完全な再現率(偽陰性なし)は第二種過誤がないことと同等です。
より一般的には、再現率は第二種過誤率の補数であり、再現率は1から偽陰性率を引いたものに等しくなります。精度は第一種過誤率に関連しますが、より複雑な方法で、母集団内の関連項目と非関連項目の事前分布にも依存します。犬の例では、10匹の猫のうち3つの第一種過誤(偽陽性)があり、第一種過誤率は3/10です。12匹の犬のうち7つの第二種過誤(偽陰性)があり、第二種過誤率は7/12です。
精度は品質、再現率は量
精度は、取得された項目のうち実際に関連するものがどれだけあるかを示す品質の尺度と見なされることがよくあります。高精度は、アルゴリズムが関連しない結果よりも関連する結果を多く返すことを意味します。一方、再現率は、関連する項目のうちどれだけが取得されるかを示す量の尺度です。高再現率は、アルゴリズムが関連しない結果も返すかどうかに関係なく、関連する結果のほとんどを返すことを意味します。
これらの指標は、単独ではあまり有用ではありません。たとえば、データセット内のすべての項目を単に取得することで完全な再現率を達成することが可能です。逆に、非常に可能性の高い少数の項目のみを選択することで完全な精度を達成でき、多くの関連項目が見逃される場合もあります。したがって、精度と再現率は通常、一緒に評価されます。
分類タスクでは、クラスCに対する精度スコアが1.0であることは、クラスCに属するとラベル付けされたすべての項目が実際にそのクラスに属することを意味しますが、クラスCの項目のうち正しくラベル付けされなかったものがどれだけあるかについては何も示しません。再現率が1.0であることは、クラスCのすべての項目がクラスCに属するとラベル付けされたことを意味しますが、他のクラスの項目がクラスCとして誤ってラベル付けされた数については何も示しません。
精度と再現率のトレードオフ
多くの場合、精度と再現率の間には逆の関係があります。一方を増やすと通常他方が減少しますが、アプリケーションの文脈によってどちらの指標がより重視されるかが決まります。たとえば、煙探知機は一般的に多くの第一種過誤を犯すように設計されており、危険がない状況でも警報を発します。これは、第二種過誤(大規模な火災中に警報を鳴らさないこと)のコストが非常に高いためです。煙探知機はしたがって再現率を重視して設計され、多くの誤警報を犠牲にしてもすべての実際の危険を捉えます。
対照的に、刑事司法制度はしばしば精度を重視します。これはブラックストンの比率に反映されています。「有罪の10人が逃れる方が、無実の1人が苦しむよりも良い」。この原則は、第一種過誤(無実の人を有罪にすること)のコストを強調しています。したがって、制度は精度に向けられており、より多くの有罪者を逃がすコストを払っても誤った有罪判決を避けます。これにより再現率が低下します。
癌性腫瘍を除去する脳外科医もトレードオフを示しています。外科医は再発を防ぐためにすべての腫瘍細胞を除去する必要がありますが、脳機能を維持するために健康な脳細胞の除去も避けなければなりません。外科医が除去する脳の領域に対してより寛大である場合、再現率を上げます(すべての癌細胞を除去)が、精度を下げます(健康な細胞を除去)。外科医がより保守的である場合、精度を上げますが再現率を下げます。より高い再現率はすべての癌細胞を除去する可能性を高めますが、健康な細胞を除去するリスクも高めます。より高い精度は健康な細胞を除去するリスクを減らしますが、すべての癌細胞を除去する可能性も減らします。
精度-再現率曲線と複合指標
実際には、精度と再現率のスコアは単独で議論されることはありません。精度-再現率曲線は、再現率の関数として精度をプロットし、通常、再現率が増加するにつれて精度が減少することを示します。この曲線は、異なる閾値にわたるモデルの性能の包括的なビューを提供します。あるいは、一方の測定値の値を他方の固定レベルで比較することもできます。たとえば、再現率レベル0.75での精度などです。
精度と再現率の両方を組み込んだいくつかの複合指標があります。F1スコアは、精度と再現率の調和平均であり、モデルの性能を単一の数値に要約するために広く使用されています。F1スコアは、クラス分布が不均衡な場合に特に有用であり、精度と再現率の間のトレードオフのバランスを取ります。精度-再現率曲線の下の面積などの他の指標も、特に正のクラスがまれなMachine learningタスクでモデルを評価するために使用されます。
機械学習における応用
精度と再現率は、多くのMachine learningアプリケーション、特に分類エラーが異なる結果をもたらすArtificial intelligenceシステムで不可欠です。たとえば、Large language modelの評価では、精度と再現率を使用して、生成された応答や取得されたドキュメントの関連性を評価できます。Neural networkベースの分類器では、これらの指標が決定閾値の選択とモデルパラメータの調整を導きます。
不正検出や医療診断などの不均衡な分類問題では、多数派クラスが支配的であるため、正確度はしばしば誤解を招きます。精度と再現率はより微妙なビューを提供し、実務者が偽陽性と偽陰性の特定のコストに合わせて最適化できるようにします。Data AugmentationやLoss Functionsなどの技術は、このようなシナリオで精度と再現率を改善するためによく使用されます。
限界と考慮事項
精度と再現率は強力ですが、限界があります。これらは真陰性を考慮しておらず、一部の文脈では重要になる場合があります。たとえば、多数の負のインスタンスを含む二値分類問題では、高精度と高再現率のモデルでも多くの偽陽性がある可能性があり、問題になることがあります。さらに、精度と再現率は正のクラスの選択に敏感であり、多クラス設定では定義が曖昧になる可能性があります。
さらに、精度と再現率は、正のクラスの基本率に依存するため、異なるデータセットやタスク間で直接比較できません。まれな疾患データセットで高再現率のモデルは、一般的な状態ではうまく機能しない場合があります。したがって、これらの指標を解釈する際には、文脈と異なるタイプのエラーに関連するコストを考慮することが重要です。