Der Brier-Score ist eine korrekte Scoring-Regel, die zur Bewertung der Qualität probabilistischer Vorhersagen verwendet wird. Er quantifiziert die Genauigkeit von Prognosen, indem er die mittlere quadratische Differenz zwischen der einem Ereignis zugewiesenen vorhergesagten Wahrscheinlichkeit und dem tatsächlichen Ergebnis berechnet, wobei das Ergebnis als 1 kodiert wird, wenn das Ereignis eintritt, und andernfalls als 0. Ein niedrigerer Brier-Score zeigt eine bessere Vorhersageleistung an, wobei ein Score von 0 eine perfekte Prognose und ein Score von 1 die schlechteste mögliche Prognose für ein binäres Ereignis darstellt. Die Metrik wurde 1950 von Glenn W. Brier in einem im Monthly Weather Review veröffentlichten Artikel eingeführt, ursprünglich für die Wettervorhersage entwickelt, später jedoch in Bereichen wie Finanzen, Medizin und Machine learning übernommen.
Der Brier-Score gehört zu einer Klasse von Metriken, die als korrekte Scoring-Regeln bekannt sind und Prognostiker dazu anregen, ihre wahren Überzeugungen zu berichten, anstatt zu hedgen oder zu übertreiben. Für ein binäres Ergebnis wird der Brier-Score als Durchschnitt von (f - o)^2 berechnet, wobei f die vorhergesagte Wahrscheinlichkeit und o das beobachtete Ergebnis (0 oder 1) ist. Der Score kann in drei Komponenten zerlegt werden: Reliabilität, Auflösung und Unsicherheit, die Einblicke in verschiedene Aspekte der Prognosequalität bieten. Die Reliabilität misst, wie gut vorhergesagte Wahrscheinlichkeiten mit beobachteten Häufigkeiten übereinstimmen, die Auflösung misst die Fähigkeit der Prognose, zwischen verschiedenen Ergebnisgruppen zu unterscheiden, und die Unsicherheit repräsentiert die inhärente Variabilität des Ereignisses selbst.
Der Brier-Score ist eng mit anderen korrekten Scoring-Regeln wie dem logarithmischen Score und dem sphärischen Score verwandt, hat jedoch den Vorteil, für binäre Ereignisse zwischen 0 und 1 begrenzt zu sein, was die Interpretation erleichtert. Bei Mehrklassenproblemen wird der Score verallgemeinert, indem die quadrierten Differenzen über alle Kategorien summiert werden, und er kann durch die Anzahl der Klassen normalisiert werden. Die Metrik wird auch in Ensemble-Vorhersagen verwendet, bei denen mehrere Modelle Wahrscheinlichkeitsschätzungen erzeugen, sowie in der Kalibrierungsbewertung, wo sie hilft, systematische Verzerrungen in vorhergesagten Wahrscheinlichkeiten zu identifizieren.
Historische Entwicklung
Glenn W. Brier, ein Meteorologe am US-Wetterbüro, führte den Score 1950 als Möglichkeit zur Bewertung der Genauigkeit probabilistischer Wettervorhersagen ein. Sein ursprünglicher Artikel mit dem Titel „Verification of Forecasts Expressed in Terms of Probability“ schlug den mittleren quadratischen Fehler als Maß für die Prognosefähigkeit vor. Der Brier-Score gewann in den 1950er und 1960er Jahren in der meteorologischen Gemeinschaft an Bedeutung, insbesondere mit dem Aufkommen numerischer Wettervorhersagemodelle, die probabilistische Ausgaben erzeugten. 1973 trugen Allan H. Murphy und Robert L. Winkler zum theoretischen Verständnis des Scores bei, indem sie ihn in Reliabilitäts-, Auflösungs- und Unsicherheitskomponenten zerlegten, was zu einem Standardrahmen für die Prognoseverifikation wurde.
In den 1980er und 1990er Jahren fand der Brier-Score Anwendungen über die Meteorologie hinaus. Statistiker und Ökonomen begannen, ihn zur Bewertung probabilistischer Prognosen im Finanzwesen zu verwenden, etwa zur Vorhersage von Aktienmarktbewegungen oder Kreditausfällen. In den 2000er Jahren brachte der Aufstieg von Machine learning und Artificial intelligence den Brier-Score in den Mainstream der Modellbewertung, insbesondere für Klassifikationsaufgaben, bei denen Modelle Wahrscheinlichkeiten statt harter Labels ausgeben. Der Score ist heute eine Standardmetrik in vielen Machine-Learning-Bibliotheken und wird in Wettbewerben wie Kaggle-Herausforderungen verwendet.
Mathematische Definition
Für ein binäres Ereignis mit beobachtetem Ergebnis y (wobei y = 1, wenn das Ereignis eintritt, und y = 0 andernfalls) und vorhergesagter Wahrscheinlichkeit p (wobei 0 ≤ p ≤ 1) ist der Brier-Score für eine einzelne Vorhersage definiert als BS = (p - y)^2. Für eine Menge von N Vorhersagen ist der mittlere Brier-Score der Durchschnitt dieser quadrierten Differenzen: BS = (1/N) Σ (p_i - y_i)^2. Der Score reicht von 0 bis 1, wobei 0 perfekte Genauigkeit und 1 der schlechteste mögliche Score ist, wenn die Prognose vollständig entgegengesetzt zum Ergebnis ist.
Für Mehrklassenprobleme mit K Klassen ist der Brier-Score definiert als BS = (1/N) Σ Σ (p_ij - y_ij)^2, wobei p_ij die vorhergesagte Wahrscheinlichkeit für Klasse j in Instanz i ist und y_ij 1 ist, wenn die wahre Klasse j ist, und andernfalls 0. Diese Formulierung stellt sicher, dass der Score begrenzt bleibt, wobei der maximale mögliche Wert von der Anzahl der Klassen abhängt. Der Mehrklassen-Brier-Score wird häufig in Deep learning-Modellen verwendet, die Wahrscheinlichkeitsverteilungen über mehrere Kategorien ausgeben.
Der Brier-Score kann auch in Bezug auf Kalibrierung und Schärfe ausgedrückt werden. Kalibrierung bezieht sich auf die Übereinstimmung zwischen vorhergesagten Wahrscheinlichkeiten und beobachteten Häufigkeiten, während Schärfe sich auf die Präzision der Vorhersagen bezieht. Ein gut kalibriertes Modell mit hoher Schärfe hat einen niedrigen Brier-Score, während ein schlecht kalibriertes Modell mit geringer Schärfe einen hohen Score hat.
Zerlegung und Interpretation
Der Brier-Score kann in drei additive Komponenten zerlegt werden: Reliabilität (REL), Auflösung (RES) und Unsicherheit (UNC). Die Zerlegung ist gegeben durch BS = REL - RES + UNC. Die Reliabilität misst die mittlere quadratische Differenz zwischen vorhergesagten Wahrscheinlichkeiten und der beobachteten Häufigkeit innerhalb jedes Wahrscheinlichkeitsbehälters. Eine niedrigere Reliabilität zeigt eine bessere Kalibrierung an. Die Auflösung misst die Varianz der beobachteten Häufigkeiten über verschiedene Wahrscheinlichkeitsbehälter, wobei eine höhere Auflösung anzeigt, dass die Prognose effektiv verschiedene Ergebnisgruppen trennen kann. Die Unsicherheit ist die Varianz der beobachteten Ergebnisse, die unabhängig von der Prognose ist und die inhärente Unvorhersehbarkeit des Ereignisses repräsentiert.
Diese Zerlegung ist besonders nützlich zur Diagnose der Modellleistung. Wenn ein Modell beispielsweise eine hohe Reliabilität, aber eine niedrige Auflösung hat, könnte es in seinen Vorhersagen übermäßig selbstbewusst sein. Umgekehrt, wenn ein Modell eine hohe Auflösung, aber eine schlechte Reliabilität hat, könnte es gut unterscheiden, aber schlecht kalibriert sein. Die Zerlegung ermöglicht es Praktikern, spezifische Verbesserungsbereiche zu identifizieren, wie die Neukalibrierung von Wahrscheinlichkeiten mithilfe von Techniken wie Temperature Scaling oder auf Batch Normalization basierenden Methoden.
In der Praxis wird der Brier-Score oft mit einer Basislinie verglichen, wie dem klimatologischen Durchschnitt oder einer konstanten Prognose. Der Brier-Skill-Score (BSS) ist eine normalisierte Version, die die Verbesserung einer Prognose gegenüber einer Referenzprognose ausdrückt, berechnet als BSS = 1 - (BS_forecast / BS_reference). Ein positiver BSS zeigt an, dass die Prognose besser ist als die Referenz, während ein negativer BSS eine schlechtere Leistung anzeigt.
Anwendungen im maschinellen Lernen
Im Machine learning wird der Brier-Score häufig zur Bewertung probabilistischer Klassifikatoren verwendet, insbesondere bei binären Klassifikationsaufgaben. Viele Modelle wie logistische Regression, Neural networks und Large language models geben Wahrscheinlichkeiten aus, die direkt mit dem Brier-Score bewertet werden können. Im Gegensatz zur Genauigkeit, die nur das vorhergesagte Klassenlabel berücksichtigt, bestraft der Brier-Score sowohl falsche Vorhersagen als auch übermäßig selbstbewusste oder unterbewusste Wahrscheinlichkeiten. Dies macht ihn zu einer wertvollen Metrik für Anwendungen, bei denen die Konfidenz von Vorhersagen wichtig ist, wie medizinische Diagnosen, autonomes Fahren und finanzielle Risikobewertung.
Der Brier-Score wird auch in Ensemble-Methoden verwendet, bei denen mehrere Modelle Wahrscheinlichkeitsschätzungen erzeugen, die gemittelt werden. In diesem Zusammenhang hilft der Score, die Kalibrierung des Ensembles zu bewerten und kann die Auswahl von Modellen oder die Gewichtung einzelner Vorhersagen leiten. Darüber hinaus wird der Brier-Score in Reinforcement learning und Generative AI verwendet, um die Qualität probabilistischer Ausgaben zu bewerten, wie bei Top-K Sampling- oder Top-P (Nucleus) Sampling-Strategien für die Textgenerierung.
Im Kontext von Artificial intelligence-Sicherheit und -Zuverlässigkeit wird der Brier-Score verwendet, um die Kalibrierung von Large language models zu messen. Beispielsweise werden Modelle wie die von OpenAI und Anthropic oft darauf bewertet, gut kalibrierte Konfidenzschätzungen für ihre Antworten zu liefern. Ein niedriger Brier-Score zeigt an, dass die Konfidenz des Modells mit seiner tatsächlichen Genauigkeit übereinstimmt, was für eine vertrauenswürdige Bereitstellung in realen Anwendungen entscheidend ist.
Vergleich mit anderen Metriken
Der Brier-Score ist eine von mehreren korrekten Scoring-Regeln, einschließlich des logarithmischen Scores (Log-Loss) und des sphärischen Scores. Der logarithmische Score ist definiert als -log(p_y), wobei p_y die vorhergesagte Wahrscheinlichkeit des wahren Ergebnisses ist, und er ist empfindlicher gegenüber extremen Wahrscheinlichkeiten als der Brier-Score. Der sphärische Score ist definiert als p_y / sqrt(Σ p_j^2), der begrenzt und weniger empfindlich gegenüber Ausreißern ist. Der Brier-Score wird oft bevorzugt, weil er begrenzt, leicht zu interpretieren und weniger empfindlich gegenüber extremen Werten als der logarithmische Score ist.
Im Vergleich zur Genauigkeit bietet der Brier-Score eine nuanciertere Bewertung probabilistischer Vorhersagen. Die Genauigkeit misst nur den Anteil korrekter Labels und ignoriert die Konfidenz der Vorhersagen. Beispielsweise hat ein Modell, das 0,51 für die korrekte Klasse und 0,49 für die falsche Klasse vorhersagt, dieselbe Genauigkeit wie ein Modell, das 0,99 für die korrekte Klasse vorhersagt, aber letzteres hat einen viel niedrigeren Brier-Score. Dies macht den Brier-Score besonders nützlich für die Bewertung von Modellen in Bereichen, in denen Wahrscheinlichkeitsschätzungen für Entscheidungsfindung verwendet werden.
Der Brier-Score ist auch mit der Fläche unter der Receiver-Operating-Characteristic-Kurve (AUC-ROC) verwandt, aber sie messen unterschiedliche Aspekte der Leistung. AUC-ROC konzentriert sich auf die Ranking-Fähigkeit, während sich der Brier-Score auf Kalibrierung und Genauigkeit konzentriert. Ein Modell kann eine hohe AUC-ROC, aber einen schlechten Brier-Score haben, wenn seine Wahrscheinlichkeiten falsch kalibriert sind, und umgekehrt. Daher wird der Brier-Score oft in Verbindung mit AUC-ROC verwendet, um eine umfassende Bewertung zu ermöglichen.
Einschränkungen und Überlegungen
Eine Einschränkung des Brier-Scores ist, dass er empfindlich gegenüber der Basisrate des Ereignisses ist. Bei seltenen Ereignissen ist die Unsicherheitskomponente niedrig, und der Score wird von Reliabilität und Auflösung dominiert. Dies kann es schwierig machen, Scores über verschiedene Datensätze mit unterschiedlichen Basisraten zu vergleichen. Darüber hinaus berücksichtigt der Brier-Score nicht die Kosten verschiedener Fehlerarten, wie falsch positive versus falsch negative, die in bestimmten Anwendungen wichtig sein können.
Eine weitere Überlegung ist, dass der Brier-Score annimmt, dass die vorhergesagten Wahrscheinlichkeiten gut kalibriert sind und die Ergebnisse binär oder kategorial sind. Für kontinuierliche Ergebnisse sind andere Metriken wie der Continuous Ranked Probability Score (CRPS) besser geeignet. Der Brier-Score misst auch nicht direkt die Schärfe der Vorhersagen, also das Ausmaß, in dem Prognosen um einen einzelnen Wert konzentriert sind. Ein Modell mit hoher Schärfe, aber schlechter Kalibrierung kann einen höheren Brier-Score haben als ein Modell mit geringerer Schärfe, aber besserer Kalibrierung.
In der Praxis sollte der Brier-Score in Verbindung mit anderen Metriken wie Kalibrierungsdiagrammen und Reliabilitätsdiagrammen verwendet werden, um die Modellleistung vollständig zu verstehen. Es ist auch wichtig, den Kontext der Anwendung zu berücksichtigen, da der optimale Kompromiss zwischen Kalibrierung und Auflösung je nach Anwendungsfall variieren kann.
Aktuelle Entwicklungen und zukünftige Richtungen
Mit dem Aufstieg von Deep learning und Transformer (architecture)-basierten Modellen ist der Brier-Score zu einer Standardbewertungsmetrik in vielen Forschungsarbeiten und Industrieanwendungen geworden. Jüngste Arbeiten haben sich auf die Verbesserung der Kalibrierung neuronaler Netze konzentriert, wobei Techniken wie Temperature Scaling, Dropout und Model Pruning verwendet werden, um den Brier-Score zu reduzieren. Im Bereich Generative AI wird der Brier-Score verwendet, um die Kalibrierung von Large language models zu bewerten, insbesondere bei Frage-Antwort- und Denkaufgaben.
Forscher haben auch Erweiterungen des Brier-Scores für komplexere Umgebungen untersucht, wie Multi-Label-Klassifikation und ordinale Regression. Bei der Multi-Label-Klassifikation kann der Brier-Score für jedes Label unabhängig berechnet und dann gemittelt werden, was ein Maß für die Gesamtkalibrierung bietet. Bei der ordinalen Regression kann der Brier-Score angepasst werden, um die Reihenfolge der Kategorien zu berücksichtigen, was in Anwendungen wie Bewertungssystemen wichtig ist.
Der Brier-Score bleibt ein aktives Forschungsgebiet, mit laufenden Bemühungen, neue Scoring-Regeln zu entwickeln, die robuster gegenüber Ausreißern und besser für hochdimensionale Daten geeignet sind. Da Machine learning-Modelle komplexer werden und in kritischen Anwendungen eingesetzt werden, wird die Bedeutung korrekter Scoring-Regeln wie des Brier-Scores wahrscheinlich zunehmen, um sicherzustellen, dass probabilistische Vorhersagen sowohl genau als auch gut kalibriert sind.