Eine Präzisions-Recall-Kurve ist eine grafische Darstellung, die in der Klassifikation verwendet wird, um die Leistung eines Modells zu bewerten, indem die Präzision (positiver Vorhersagewert) auf der y-Achse gegen den Recall (Sensitivität) auf der x-Achse für verschiedene Entscheidungsschwellenwerte aufgetragen wird. Jeder Punkt auf der Kurve entspricht einer bestimmten Schwellenwerteinstellung und zeigt, wie sich Präzision und Recall ändern, wenn der Schwellenwert angepasst wird. Die Kurve ist besonders nützlich für unbalancierte Datensätze, bei denen eine Klasse selten ist, da sie sich auf die Leistung der positiven Klasse konzentriert und nicht auf die echten Negativen.
Präzision ist definiert als der Anteil relevanter Instanzen unter den abgerufenen Instanzen, oder äquivalent, die Anzahl der echten Positiven geteilt durch die Summe aus echten Positiven und falschen Positiven. Recall ist der Anteil relevanter Instanzen, die abgerufen wurden, oder die Anzahl der echten Positiven geteilt durch die Summe aus echten Positiven und falschen Negativen. In einer Klassifikationsaufgabe hätte ein perfekter Klassifikator sowohl eine Präzision als auch einen Recall von 1,0, was zu einer Kurve führt, die durch die obere rechte Ecke verläuft. In der Praxis gibt es jedoch oft eine umgekehrte Beziehung: Eine Erhöhung des Recalls tendiert dazu, die Präzision zu verringern, und umgekehrt. Eine Präzisions-Recall-Kurve fällt typischerweise von einer hohen Präzision bei niedrigem Recall zu einer niedrigeren Präzision bei hohem Recall ab, obwohl die genaue Form vom Modell und den Daten abhängt.
Beziehung zu Fehlern vom Typ I und Typ II
Präzision und Recall sind eng mit Konzepten des Hypothesentests verbunden. Recall ist das Komplement der Fehlerrate vom Typ II (Falsch-Negativ-Rate), was bedeutet, dass ein hoher Recall wenigen verpassten positiven Instanzen entspricht. Präzision steht in Beziehung zur Fehlerrate vom Typ I (Falsch-Positiv-Rate), hängt aber auch von der A-priori-Verteilung positiver und negativer Instanzen ab. Zum Beispiel hat in einem Datensatz mit zehn Katzen und zwölf Hunden ein Hundeerkennungsprogramm, das acht Hunde identifiziert, von denen fünf tatsächlich Hunde sind, eine Präzision von 5/8 und einen Recall von 5/12. Die Fehlerrate vom Typ I beträgt 3/10 (drei falsch Positive unter zehn Katzen), und die Fehlerrate vom Typ II beträgt 7/12 (sieben falsch Negative unter zwölf Hunden). Präzision kann als ein Maß für Qualität angesehen werden (wie viele ausgewählte Elemente relevant sind), während Recall ein Maß für Quantität ist (wie viele relevante Elemente ausgewählt werden).
Abwägungen und praktische Beispiele
Der Kompromiss zwischen Präzision und Recall ist oft kontextabhängig. Beispielsweise ist ein Rauchmelder darauf ausgelegt, den Recall zu priorisieren, da die Kosten eines übersehenen Feuers (ein falsch Negatives) katastrophal sind, selbst wenn dies viele Fehlalarme (niedrige Präzision) bedeutet. Umgekehrt priorisiert das Strafjustizsystem, geleitet von Blackstones Verhältnis - „Es ist besser, dass zehn Schuldige entkommen, als dass ein Unschuldiger leidet" - die Präzision und akzeptiert einen niedrigeren Recall, um die Verurteilung Unschuldiger zu vermeiden. Ein Gehirnchirurg, der einen Tumor entfernt, steht vor einem ähnlichen Dilemma: Das Entfernen eines größeren Bereichs erhöht den Recall (stellt sicher, dass alle Krebszellen entfernt werden), verringert aber die Präzision (Entfernung von gesundem Gewebe), während ein konservativer Ansatz die Präzision erhöht, aber das Risiko birgt, Krebszellen zurückzulassen.
Konstruktion und Interpretation
Um eine Präzisions-Recall-Kurve zu konstruieren, gibt ein Modell für jede Instanz einen Score oder eine Wahrscheinlichkeit aus. Durch Variation des Schwellenwerts, oberhalb dessen eine Instanz als positiv klassifiziert wird, erhält man verschiedene Paare von Präzisions- und Recall-Werten. Diese Paare werden als Kurve aufgetragen. Die Fläche unter der Präzisions-Recall-Kurve (PR-AUC) ist eine einzelne Zahl, die die Kurve zusammenfasst, wobei höhere Werte eine bessere Gesamtleistung anzeigen. Ein zufälliger Klassifikator erzeugt typischerweise eine Kurve, die eine horizontale Linie beim Anteil positiver Instanzen im Datensatz ist, sodass der PR-AUC für ein nützliches Modell über dieser Basislinie liegen sollte. Die Kurve ist besonders informativ, wenn die positive Klasse selten ist, da die Konfusionsmatrix allein irreführend sein kann.
Verwendung im maschinellen Lernen
Präzisions-Recall-Kurven werden häufig im maschinellen Lernen und in der künstlichen Intelligenz verwendet, um binäre Klassifikatoren zu bewerten, insbesondere in Bereichen wie Informationsabruf, medizinischer Diagnose und Betrugserkennung. Sie werden oft mit Receiver-Operating-Characteristic-Kurven (ROC-Kurven) verglichen, die die Richtig-Positiv-Rate gegen die Falsch-Positiv-Rate auftragen. Im Gegensatz zu ROC-Kurven enthalten Präzisions-Recall-Kurven keine echten Negativen, was sie empfindlicher für die Leistung auf der positiven Klasse macht. Viele neuronale Netze und Deep-Learning-Frameworks bieten eingebaute Funktionen zur Berechnung und Darstellung von Präzisions-Recall-Kurven, was die Modellauswahl und Schwellenwertabstimmung erleichtert. Beispielsweise kann in Aufgaben der Verarbeitung natürlicher Sprache wie der Dokumentklassifikation eine Präzisions-Recall-Kurve helfen, den Abruf relevanter Dokumente gegen die Einbeziehung irrelevanter Dokumente abzuwägen.
Einschränkungen und Überlegungen
Präzisions-Recall-Kurven haben Einschränkungen. Sie sind empfindlich gegenüber Klassenungleichgewicht, und ein Modell mit hoher Präzision und hohem Recall auf einem balancierten Datensatz kann auf einem unbalancierten Datensatz schlecht abschneiden. Darüber hinaus vermittelt die Kurve nicht die absolute Anzahl der Instanzen, sodass der Vergleich von Kurven über verschiedene Datensätze hinweg irreführend sein kann. Es ist auch möglich, einen perfekten Recall zu erreichen, indem jede Instanz abgerufen wird, aber ein solches Modell hätte eine niedrige Präzision. Umgekehrt kann eine perfekte Präzision erreicht werden, indem nur die sichersten Instanzen ausgewählt werden, aber der Recall wäre niedrig. Daher werden Präzision und Recall selten isoliert diskutiert; stattdessen bietet die Kurve einen umfassenden Überblick über den Kompromiss, sodass Praktiker einen Schwellenwert wählen können, der mit den Prioritäten der Anwendung übereinstimmt.