Präzision und Recall
Präzision und Recall sind zwei grundlegende Leistungskennzahlen, die zur Bewertung der Qualität eines Klassifikations- oder Information-Retrieval-Systems verwendet werden. Sie quantifizieren, wie gut ein Modell relevante Elemente aus einem Datensatz identifiziert, und wägen die Kosten von falsch positiven und falsch negativen Ergebnissen ab. Die Präzision, auch positiver Vorhersagewert genannt, misst den Anteil der abgerufenen Instanzen, die tatsächlich relevant sind. Der Recall, auch Sensitivität genannt, misst den Anteil aller relevanten Instanzen, die erfolgreich abgerufen wurden. Zusammen bieten sie eine differenziertere Sicht auf das Verhalten eines Modells als die Genauigkeit allein, insbesondere bei unausgewogenen Klassen oder wenn die Kosten verschiedener Fehler variieren.
Formal wird die Präzision als die Anzahl der richtig positiven Ergebnisse geteilt durch die Gesamtzahl der vom System als positiv eingestuften Elemente (richtig positiv plus falsch positiv) berechnet. Der Recall wird als die Anzahl der richtig positiven Ergebnisse geteilt durch die Gesamtzahl der Elemente, die tatsächlich zur positiven Klasse gehören (richtig positiv plus falsch negativ), berechnet. Betrachten wir beispielsweise ein Computerprogramm, das Hunde auf digitalen Fotos erkennen soll. Wenn ein Bild zehn Katzen und zwölf Hunde enthält und das Programm acht Elemente als Hunde identifiziert, von denen fünf tatsächlich Hunde sind (richtig positiv) und drei Katzen sind (falsch positiv), dann werden sieben Hunde übersehen (falsch negativ) und sieben Katzen korrekt ausgeschlossen (richtig negativ). Die Präzision des Programms beträgt 5/8, da nur fünf der acht ausgewählten Elemente relevant sind. Sein Recall beträgt 5/12, da nur fünf der zwölf relevanten Hunde gefunden wurden.
Zusammenhang mit statistischen Fehlern
Präzision und Recall lassen sich direkt auf Konzepte des statistischen Hypothesentests abbilden. Wenn die Nullhypothese besagt, dass ein bestimmtes Element irrelevant ist, dann tritt ein falsch positives Ergebnis (Fehler 1. Art) auf, wenn ein irrelevantes Element fälschlicherweise ausgewählt wird, und ein falsch negatives Ergebnis (Fehler 2. Art), wenn ein relevantes Element übersehen wird. Eine perfekte Präzision entspricht null falsch positiven Ergebnissen, was bedeutet, dass jedes abgerufene Element relevant ist. Ein perfekter Recall entspricht null falsch negativen Ergebnissen, was bedeutet, dass jedes relevante Element abgerufen wird. Der Recall ist einfach das Komplement der Fehlerrate 2. Art, berechnet als Eins minus dieser Rate. Die Präzision steht in einem komplexeren Zusammenhang mit der Fehlerrate 1. Art, da sie auch von der A-priori-Verteilung relevanter gegenüber irrelevanter Elemente in der Grundgesamtheit abhängt. Im Hundebeispiel gibt es drei Fehler 1. Art von insgesamt zehn Katzen, was einer Fehlerrate 1. Art von 3/10 entspricht, und sieben Fehler 2. Art von zwölf Hunden, was einer Fehlerrate 2. Art von 7/12 entspricht.
Interpretation und Nutzen
Die Präzision wird oft als Maß für die Qualität beschrieben, das angibt, wie vertrauenswürdig die positiven Vorhersagen sind. Der Recall ist ein Maß für die Quantität, das angibt, wie vollständig die Abdeckung der positiven Klasse durch das System ist. Eine hohe Präzision bedeutet, dass das Modell überwiegend relevante Ergebnisse liefert, während ein hoher Recall bedeutet, dass es die meisten relevanten Ergebnisse liefert, auch wenn einige irrelevante darunter sind. Diese Kennzahlen sind für sich allein betrachtet nicht besonders aussagekräftig. Ein System kann einen perfekten Recall erreichen, indem es einfach jedes Element im Bestand abruft, aber ein solches System hätte eine sehr niedrige Präzision. Umgekehrt kann ein System eine perfekte Präzision erreichen, indem es nur ein einziges Element auswählt, das mit hoher Wahrscheinlichkeit relevant ist, aber dies würde den Recall opfern. In der Praxis werden Präzision und Recall üblicherweise gemeinsam angegeben, oft in Form einer Präzisions-Recall-Kurve, die die Präzision als Funktion des Recalls darstellt. Typischerweise nimmt die Präzision ab, wenn der Recall zunimmt, was den inhärenten Zielkonflikt zwischen den beiden Größen widerspiegelt.
Der Präzisions-Recall-Zielkonflikt
Zwischen Präzision und Recall besteht häufig ein umgekehrtes Verhältnis, bei dem die Verbesserung der einen Größe auf Kosten der anderen geht. Das optimale Gleichgewicht hängt von der spezifischen Anwendung und den relativen Kosten verschiedener Fehlerarten ab. Ein Rauchmelder ist ein klassisches Beispiel für ein System, das auf Recall ausgelegt ist. Er neigt bewusst zu Fehlalarmen (Fehler 1. Art), weil die Kosten dafür, bei einem echten Brand keinen Alarm auszulösen, prohibitiv hoch sind. Der Melder opfert Präzision, um sicherzustellen, dass alle echten Gefahren erkannt werden. Im Gegensatz dazu legt das Strafjustizsystem, das von Blackstones Verhältnis geleitet wird, dass „es besser ist, dass zehn Schuldige entkommen als dass ein Unschuldiger leidet", den Schwerpunkt auf Präzision. Das System ist darauf ausgelegt, die Verurteilung Unschuldiger zu vermeiden, selbst wenn dies bedeutet, dass mehr schuldige Personen freigelassen werden, und opfert damit den Recall.
Ein Hirnchirurg, der einen krebsartigen Tumor entfernt, veranschaulicht den Zielkonflikt auf individueller Ebene. Der Chirurg muss alle Tumorzellen entfernen, um ein Wiederwachstum zu verhindern, aber auch gesunde Gehirnzellen schonen, um die Funktion zu erhalten. Ein aggressiverer Ansatz, bei dem ein größerer Bereich um den Tumor entfernt wird, erhöht den Recall, indem sichergestellt wird, dass alle Krebszellen entfernt werden, aber er erhöht auch die Wahrscheinlichkeit, gesundes Gewebe zu entfernen. Ein konservativerer Ansatz erhöht die Präzision, indem er nur auf bestätigte Krebszellen abzielt, birgt aber das Risiko, einige Tumorzellen zurückzulassen. Beide Ergebnisse haben erhebliche Konsequenzen, und die Wahl des Chirurgen spiegelt die relativen Gewichtungen von Präzision und Recall in diesem Kontext wider.
Verwendung im maschinellen Lernen
Im machine-learning sind Präzision und Recall Standardbewertungsmetriken für Klassifikationsmodelle, insbesondere in Bereichen mit unausgewogenen Datensätzen. In der medizinischen Diagnostik beispielsweise könnte ein Modell zur Erkennung einer seltenen Krankheit eine hohe Genauigkeit aufweisen, indem es einfach die Mehrheitsklasse vorhersagt, aber Präzision und Recall offenbaren seinen tatsächlichen Nutzen. In der artificial-intelligence werden diese Metriken verwendet, um Modelle bei Aufgaben wie Objekterkennung, Spam-Filterung und Dokumentenabruf zu vergleichen. Sie sind auch grundlegend für abgeleitete Metriken wie den F1-Score, der das harmonische Mittel von Präzision und Recall darstellt und eine einzelne Zahl liefert, die beide Aspekte ausbalanciert. Die Konzepte gehen über die binäre Klassifikation hinaus auf Multi-Klassen-Einstellungen, in denen Präzision und Recall pro Klasse berechnet und dann aggregiert werden.
Anwendungen im Information Retrieval
Präzision und Recall haben ihren Ursprung im Bereich des Information Retrieval, wo sie Suchmaschinen und Datenbankabfragesysteme bewerten. In diesem Kontext misst die Präzision den Anteil der abgerufenen Dokumente, die für die Anfrage des Benutzers relevant sind, während der Recall den Anteil aller relevanten Dokumente im Bestand misst, die abgerufen wurden. Suchmaschinen stehen oft vor einem Zielkonflikt: Mehr Ergebnisse zu liefern kann den Recall erhöhen, aber die Präzision durch irrelevante Seiten verwässern. Rangfolgesysteme verwenden die Präzision bei einer festen Anzahl von Ergebnissen, wie z. B. Präzision bei 10, um die Qualität der Top-Ergebnisse zu bewerten. Diese Metriken sind nach wie vor von zentraler Bedeutung für die Bewertung moderner Abrufsysteme, einschließlich solcher, die auf large-language-model und generative-ai basieren.
Grenzen und Erweiterungen
Präzision und Recall haben ihre Grenzen. Sie berücksichtigen keine richtig negativen Ergebnisse, die in einigen Anwendungen wichtig sein können. Sie reagieren auch empfindlich auf die Wahl der positiven Klasse, und ihre Interpretation hängt von der A-priori-Wahrscheinlichkeit der positiven Klasse ab. Wenn die positive Klasse selten ist, kann es schwierig sein, den Recall zu verbessern, ohne viele falsch positive Ergebnisse zu erzeugen. Um diese Probleme zu adressieren, haben Forscher verwandte Metriken entwickelt, wie den F1-Score, die Fläche unter der Präzisions-Recall-Kurve und den Matthews-Korrelationskoeffizienten. In der Praxis hängt die Wahl der Metrik von den Zielen der Anwendung ab, und Präzision und Recall werden oft zusammen mit anderen Statistiken angegeben, um ein vollständiges Bild der Modellleistung zu vermitteln.