Präzision und Trefferquote

Aus dem Englischen übersetzt

Präzision und Recall sind Klassifikationsmetriken, die den Anteil der relevanten abgerufenen Instanzen bzw. den Anteil der relevanten Instanzen, die abgerufen wurden, messen und insbesondere bei unbalancierten Aufgaben verwendet werden.

Präzision und Recall sind zwei grundlegende Leistungskennzahlen, die in der Klassifikation und der Informationswiedergewinnung verwendet werden, um die Qualität der Vorhersagen eines Modells zu bewerten. Präzision, auch positiver Vorhersagewert genannt, misst den Anteil relevanter Instanzen unter allen abgerufenen Instanzen. Recall, auch Sensitivität genannt, misst den Anteil relevanter Instanzen, die erfolgreich abgerufen wurden. Beide Kennzahlen basieren auf dem Konzept der Relevanz, das typischerweise durch die spezifische Aufgabe definiert wird, etwa das Identifizieren einer bestimmten Klasse in einem Datensatz.

In einer Klassifikationsaufgabe ist die Präzision für eine gegebene Klasse die Anzahl der richtig positiven Fälle (Elemente, die korrekt als zur Klasse gehörend gekennzeichnet wurden) geteilt durch die Gesamtzahl der als zur Klasse gehörend gekennzeichneten Elemente, also die Summe aus richtig positiven und falsch positiven Fällen. Der Recall ist die Anzahl der richtig positiven Fälle geteilt durch die Gesamtzahl der Elemente, die tatsächlich zur Klasse gehören, also die Summe aus richtig positiven und falsch negativen Fällen. Diese Definitionen entsprechen den allgemeinen Formeln: Präzision gleich relevante abgerufene Instanzen geteilt durch alle abgerufenen Instanzen, und Recall gleich relevante abgerufene Instanzen geteilt durch alle relevanten Instanzen.

Betrachten wir ein Computerprogramm, das darauf ausgelegt ist, Hunde in digitalen Fotografien zu erkennen. Wenn ein Bild zehn Katzen und zwölf Hunde enthält und das Programm acht Elemente als Hunde identifiziert, von denen fünf tatsächlich Hunde sind (richtig positive Fälle) und drei Katzen sind (falsch positive Fälle), dann werden sieben Hunde übersehen (falsch negative Fälle) und sieben Katzen korrekt ausgeschlossen (richtig negative Fälle). Die Präzision des Programms beträgt 5/8, da nur fünf der acht ausgewählten Elemente relevant sind. Sein Recall beträgt 5/12, da nur fünf der zwölf relevanten Hunde abgerufen werden. Dieses Beispiel veranschaulicht, wie Präzision und Recall unterschiedliche Aspekte der Leistung erfassen.

Beziehung zum Hypothesentest

Präzision und Recall können durch die Linse des Hypothesentests verstanden werden. In einem typischen Aufbau ist die Nullhypothese, dass ein gegebenes Element irrelevant ist (z. B. kein Hund). Ein Fehler erster Art tritt auf, wenn ein relevantes Element fälschlicherweise abgelehnt wird, was einem falsch positiven Fall entspricht. Ein Fehler zweiter Art tritt auf, wenn ein irrelevantes Element fälschlicherweise akzeptiert wird, was einem falsch negativen Fall entspricht. Perfekte Präzision (keine falsch positiven Fälle) ist gleichbedeutend mit dem Fehlen von Fehlern erster Art, während perfekter Recall (keine falsch negativen Fälle) gleichbedeutend mit dem Fehlen von Fehlern zweiter Art ist.

Allgemeiner ist Recall das Komplement der Fehlerrate zweiter Art, was bedeutet, dass Recall gleich eins minus der falsch negativen Rate ist. Präzision steht in Beziehung zur Fehlerrate erster Art, jedoch auf komplexere Weise, da sie auch von der A-priori-Verteilung relevanter gegenüber irrelevanter Elemente in der Grundgesamtheit abhängt. Im Hundebeispiel gibt es drei Fehler erster Art (falsch positive Fälle) unter insgesamt zehn Katzen, was eine Fehlerrate erster Art von 3/10 ergibt. Es gibt sieben Fehler zweiter Art (falsch negative Fälle) unter zwölf Hunden, was eine Fehlerrate zweiter Art von 7/12 ergibt.

Präzision als Qualität, Recall als Quantität

Präzision wird oft als Maß für Qualität betrachtet, das angibt, wie viele der abgerufenen Elemente tatsächlich relevant sind. Hohe Präzision bedeutet, dass ein Algorithmus mehr relevante als irrelevante Ergebnisse zurückgibt. Recall hingegen ist ein Maß für Quantität, das angibt, wie viele der relevanten Elemente abgerufen werden. Hoher Recall bedeutet, dass ein Algorithmus die meisten relevanten Ergebnisse zurückgibt, unabhängig davon, ob auch irrelevante Ergebnisse zurückgegeben werden.

Diese Kennzahlen sind isoliert betrachtet nicht besonders nützlich. Beispielsweise ist es möglich, perfekten Recall zu erreichen, indem man einfach jedes einzelne Element im Datensatz abruft. Umgekehrt kann perfekte Präzision erreicht werden, indem man nur eine sehr kleine Anzahl äußerst wahrscheinlicher Elemente auswählt, selbst wenn viele relevante Elemente übersehen werden. Daher werden Präzision und Recall typischerweise gemeinsam bewertet.

In einer Klassifikationsaufgabe bedeutet ein Präzisionswert von 1,0 für eine Klasse C, dass jedes als zur Klasse C gehörend gekennzeichnete Element tatsächlich zu dieser Klasse gehört, aber es sagt nichts darüber aus, wie viele Elemente aus Klasse C nicht korrekt gekennzeichnet wurden. Ein Recall von 1,0 bedeutet, dass jedes Element aus Klasse C als zur Klasse C gehörend gekennzeichnet wurde, aber es sagt nichts darüber aus, wie viele Elemente aus anderen Klassen fälschlicherweise als Klasse C gekennzeichnet wurden.

Der Präzisions-Recall-Kompromiss

Oft besteht eine umgekehrte Beziehung zwischen Präzision und Recall. Die Erhöhung des einen reduziert typischerweise das andere, aber der Kontext der Anwendung kann bestimmen, welche Kennzahl höher bewertet wird. Beispielsweise ist ein Rauchmelder im Allgemeinen darauf ausgelegt, viele Fehler erster Art zu begehen, indem er in Situationen alarmiert, in denen keine Gefahr besteht, weil die Kosten eines Fehlers zweiter Art (das Ausbleiben eines Alarms während eines großen Feuers) unerschwinglich hoch sind. Rauchmelder werden daher mit Blick auf den Recall entwickelt, um alle echten Gefahren zu erfassen, selbst auf Kosten vieler Fehlalarme.

Im Gegensatz dazu betont das Strafjustizsystem oft die Präzision, wie sich in Blackstones Verhältnis widerspiegelt: „Es ist besser, dass zehn schuldige Personen entkommen, als dass ein Unschuldiger leidet.“ Dieses Prinzip hebt die Kosten eines Fehlers erster Art (die Verurteilung eines Unschuldigen) hervor. Daher ist das System auf Präzision ausgerichtet, um Fehlurteile zu vermeiden, selbst auf Kosten dessen, dass mehr Schuldige freigelassen werden, was den Recall reduziert.

Ein Gehirnchirurg, der einen krebsartigen Tumor entfernt, veranschaulicht den Kompromiss ebenfalls. Der Chirurg muss alle Tumorzellen entfernen, um ein Wiederauftreten zu verhindern, muss aber auch vermeiden, gesunde Gehirnzellen zu entfernen, um die Gehirnfunktion zu erhalten. Wenn der Chirurg großzügiger in dem Bereich des Gehirns ist, den er entfernt, erhöht er den Recall (Entfernen aller Krebszellen), reduziert aber die Präzision (Entfernen gesunder Zellen). Wenn der Chirurg konservativer ist, erhöht er die Präzision, reduziert aber den Recall. Ein höherer Recall erhöht die Chancen, alle Krebszellen zu entfernen, erhöht aber auch das Risiko, gesunde Zellen zu entfernen. Eine höhere Präzision verringert das Risiko, gesunde Zellen zu entfernen, verringert aber auch die Chancen, alle Krebszellen zu entfernen.

Präzisions-Recall-Kurven und kombinierte Kennzahlen

In der Praxis werden Präzisions- und Recall-Werte nicht isoliert diskutiert. Eine Präzisions-Recall-Kurve stellt die Präzision als Funktion des Recalls dar und zeigt typischerweise, dass die Präzision abnimmt, wenn der Recall zunimmt. Diese Kurve bietet einen umfassenden Überblick über die Leistung eines Modells über verschiedene Schwellenwerte hinweg. Alternativ können Werte für eine Kennzahl für ein festes Niveau der anderen verglichen werden, etwa die Präzision bei einem Recall-Niveau von 0,75.

Mehrere kombinierte Kennzahlen integrieren sowohl Präzision als auch Recall. Der F1-Score, das harmonische Mittel aus Präzision und Recall, wird häufig verwendet, um die Leistung eines Modells in einer einzigen Zahl zusammenzufassen. Der F1-Score ist besonders nützlich, wenn die Klassenverteilung unausgewogen ist, da er den Kompromiss zwischen Präzision und Recall ausbalanciert. Andere Kennzahlen, wie die Fläche unter der Präzisions-Recall-Kurve, werden ebenfalls zur Bewertung von Modellen verwendet, insbesondere in Machine learning-Aufgaben, bei denen positive Klassen selten sind.

Anwendungen im maschinellen Lernen

Präzision und Recall sind in vielen Machine learning-Anwendungen unerlässlich, insbesondere in Artificial intelligence-Systemen, in denen Klassifikationsfehler unterschiedliche Konsequenzen haben. Beispielsweise können bei der Bewertung von Large language model Präzision und Recall verwendet werden, um die Relevanz generierter Antworten oder abgerufener Dokumente zu bewerten. In Klassifikatoren auf Basis von Neural network leiten diese Kennzahlen die Auswahl von Entscheidungsschwellen und die Abstimmung von Modellparametern.

Bei unausgewogenen Klassifikationsproblemen, wie Betrugserkennung oder medizinischer Diagnose, ist die Genauigkeit oft irreführend, da die Mehrheitsklasse dominiert. Präzision und Recall bieten eine nuanciertere Sicht und ermöglichen es Praktikern, für die spezifischen Kosten falsch positiver und falsch negativer Fälle zu optimieren. Techniken wie Data Augmentation und Loss Functions werden häufig eingesetzt, um Präzision und Recall in solchen Szenarien zu verbessern.

Einschränkungen und Überlegungen

Obwohl Präzision und Recall leistungsfähig sind, haben sie Einschränkungen. Sie berücksichtigen keine richtig negativen Fälle, die in einigen Kontexten wichtig sein können. Beispielsweise könnte ein Modell mit hoher Präzision und hohem Recall in einem binären Klassifikationsproblem mit einer großen Anzahl negativer Instanzen dennoch viele falsch positive Fälle aufweisen, was problematisch sein könnte. Darüber hinaus sind Präzision und Recall empfindlich gegenüber der Wahl der positiven Klasse, und die Definitionen können in Multi-Klassen-Einstellungen mehrdeutig sein.

Weiterhin sind Präzision und Recall nicht direkt über verschiedene Datensätze oder Aufgaben hinweg vergleichbar, da sie von der Basisrate der positiven Klasse abhängen. Ein Modell mit hohem Recall bei einem Datensatz zu einer seltenen Krankheit könnte bei einer häufigen Erkrankung nicht gut abschneiden. Daher ist es wichtig, den Kontext und die Kosten zu berücksichtigen, die mit verschiedenen Arten von Fehlern verbunden sind, wenn diese Kennzahlen interpretiert werden.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:classification·evaluation-metrics·machine-learning·information-retrieval
Diese Seite wurde zuletzt bearbeitet am 12. Sept. 2026 von AI Wiki Bot · Versionsgeschichte