Interpretierbarkeitstechniken sind ein Kernbestandteil der erklärbaren KI (XAI), einem Forschungsfeld, das darauf abzielt, Menschen intellektuelle Aufsicht über Algorithmen der künstlichen Intelligenz zu ermöglichen. Diese Techniken konzentrieren sich auf die Begründung hinter Entscheidungen oder Vorhersagen, die von KI-Modellen getroffen werden, und machen sie verständlicher und transparenter. Dies adressiert das Bedürfnis der Nutzer, automatisierte Entscheidungsfindung in Anwendungen zu prüfen, insbesondere dort, wo Sicherheit und Vertrauen entscheidend sind. Interpretierbarkeitstechniken wirken der „Black-Box“-Tendenz des maschinellen Lernens entgegen, bei der selbst die Entwickler einer KI nicht erklären können, warum sie zu einer bestimmten Entscheidung gelangt ist.
Das primäre Ziel von Interpretierbarkeitstechniken ist es, Nutzern von KI-gestützten Systemen zu helfen, effektiver zu arbeiten, indem ihr Verständnis darüber verbessert wird, wie diese Systeme denken. Sie können auch als Umsetzung des sozialen Rechts auf Erklärung dienen, und selbst ohne gesetzliche Anforderungen können sie die Benutzererfahrung verbessern, indem sie Vertrauen aufbauen. Diese Techniken zielen darauf ab, zu erklären, was getan wurde, was gerade getan wird, was als Nächstes getan wird und auf welchen Informationen diese Handlungen basieren, sodass Nutzer vorhandenes Wissen bestätigen und hinterfragen sowie neue Annahmen generieren können.
Hintergrund: White-Box- und Black-Box-Modelle
Algorithmen des maschinellen Lernens, die in der KI verwendet werden, können als White-Box- oder Black-Box-Modelle kategorisiert werden. White-Box-Modelle liefern Ergebnisse, die für Fachexperten verständlich sind, während Black-Box-Modelle extrem schwer zu erklären sind und möglicherweise selbst von Experten nicht verstanden werden. Interpretierbarkeitstechniken folgen drei Prinzipien: Transparenz, Interpretierbarkeit und Erklärbarkeit.
Ein Modell ist transparent, wenn die Prozesse, die Modellparameter aus Trainingsdaten extrahieren und Labels aus Testdaten generieren, vom Entwickler des Ansatzes beschrieben und begründet werden können. Interpretierbarkeit beschreibt die Möglichkeit, das Modell zu verstehen und die zugrunde liegende Basis für Entscheidungsfindung auf eine für Menschen verständliche Weise darzustellen. Erklärbarkeit, obwohl als wichtig anerkannt, entbehrt einer einheitlichen Definition; eine Möglichkeit ist „die Sammlung von Merkmalen des interpretierbaren Bereichs, die für ein gegebenes Beispiel zur Erzeugung einer Entscheidung beigetragen haben“.
Zusammenfassend bezieht sich Interpretierbarkeit auf die Fähigkeit des Nutzers, Modellausgaben zu verstehen, während Modelltransparenz Simulierbarkeit (Reproduzierbarkeit von Vorhersagen), Zerlegbarkeit (intuitive Erklärungen für Parameter) und algorithmische Transparenz (Erklärung, wie Algorithmen funktionieren) umfasst. Die Modellfunktionalität konzentriert sich auf textuelle Beschreibungen, Visualisierung und lokale Erklärungen, die spezifische Ausgaben oder Instanzen klären, anstatt ganze Modelle. Alle diese Konzepte zielen darauf ab, die Verständlichkeit und Benutzerfreundlichkeit von KI-Systemen zu verbessern.
Hintergrund: White-Box- und Black-Box-Modelle
Maschinelle Lernalgorithmen, die in der KI verwendet werden, können als White-Box- oder Black-Box-Modelle kategorisiert werden. White-Box-Modelle liefern Ergebnisse, die für Fachexperten verständlich sind, während Black-Box-Modelle extrem schwer zu erklären sind und möglicherweise nicht einmal von Experten verstanden werden. Interpretierbarkeitstechniken folgen drei Prinzipien: Transparenz, Interpretierbarkeit und Erklärbarkeit.
Ein Modell ist transparent, wenn die Prozesse, die Modellparameter aus Trainingsdaten extrahieren und Labels aus Testdaten generieren, vom Entwickler des Ansatzes beschrieben und begründet werden können. Interpretierbarkeit beschreibt die Möglichkeit, das Modell zu verstehen und die zugrunde liegende Basis für Entscheidungsfindung auf eine für Menschen verständliche Weise darzustellen. Erklärbarkeit wird zwar als wichtig anerkannt, entbehrt jedoch einer Konsensdefinition; eine Möglichkeit ist „die Sammlung von Merkmalen des interpretierbaren Bereichs, die für ein gegebenes Beispiel zur Erzeugung einer Entscheidung beigetragen haben“.
Zusammenfassend bezieht sich Interpretierbarkeit auf die Fähigkeit des Nutzers, Modellausgaben zu verstehen, während Modelltransparenz Simulationsfähigkeit (Reproduzierbarkeit von Vorhersagen), Zerlegbarkeit (intuitive Erklärungen für Parameter) und algorithmische Transparenz (Erklärung, wie Algorithmen funktionieren) umfasst. Die Modellfunktionalität konzentriert sich auf textuelle Beschreibungen, Visualisierung und lokale Erklärungen, die spezifische Ausgaben oder Instanzen klären, anstatt ganze Modelle. Alle diese Konzepte zielen darauf ab, die Verständlichkeit und Benutzerfreundlichkeit von KI-Systemen zu verbessern.
Merkmalsattributionsmethoden
Merkmalsattributionsmethoden gehören zu den am weitesten verbreiteten Interpretierbarkeitstechniken. Sie weisen Eingabemerkmalen Wichtigkeitsbewertungen zu, die angeben, wie stark jedes Merkmal zur Vorhersage eines Modells beigetragen hat. Beispielsweise könnte eine Merkmalsattributionsmethode in einem Sentimentanalyse-Modell das Wort „schrecklich“ als starken negativen Indikator hervorheben. Diese Methoden sind besonders nützlich für neuronale Netze und andere komplexe Modelle, bei denen die interne Logik undurchsichtig ist.
Häufige Merkmalsattributionstechniken umfassen gradientenbasierte Methoden wie Saliency-Maps, die den Gradienten der Ausgabe in Bezug auf die Eingabe berechnen, sowie perturbationsbasierte Methoden, die beobachten, wie sich Vorhersagen ändern, wenn Eingaben verändert werden. Diese Techniken werden oft in der Bilderkennung eingesetzt, um die einflussreichsten Pixel zu identifizieren, oder in der Verarbeitung natürlicher Sprache, um Schlüsselwörter in einem Text hervorzuheben.
Saliency- und Visualisierungstechniken
Saliency-Techniken sind eine Teilmenge der Merkmalsattribution und konzentrieren sich darauf, die Teile einer Eingabe zu visualisieren, die für die Entscheidung eines Modells am relevantesten sind. In der Computer Vision überlagern Saliency-Karten Heatmaps auf Bildern, um zu zeigen, welche Regionen das Modell fokussiert hat. Beispielsweise könnte ein Modell, das darauf trainiert wurde, Pferde zu erkennen, eine Saliency-Karte erzeugen, die den Körper und die Beine des Pferdes hervorhebt, anstatt Hintergrundelemente.
Visualisierungstechniken erstrecken sich auch auf das Verständnis der internen Repräsentationen von Deep-Learning-Modellen. Beispielsweise können Forscher die Filter visualisieren, die von konvolutionalen Schichten in einem Residualnetzwerk gelernt werden, um zu sehen, welche Muster sie erkennen, wie Kanten oder Texturen. Diese Methoden helfen Experten zu überprüfen, ob das Modell sinnvolle Merkmale lernt und nicht bloß scheinbare Korrelationen.
Salienz- und Visualisierungstechniken
Salienztechniken sind eine Teilmenge der Interpretierbarkeitstechniken, die sich darauf konzentrieren, die Teile einer Eingabe zu visualisieren, die für die Entscheidung eines Modells am relevantesten sind. In der Computervision überlagern Salienzkarten Wärmebilder, um zu zeigen, auf welche Bereiche das Modell fokussiert hat. Beispielsweise könnte ein Modell, das auf die Erkennung von Pferden trainiert wurde, eine Salienzkarte erzeugen, die den Körper und die Beine des Pferdes hervorhebt, anstatt Hintergrundelemente.
Visualisierungstechniken erstrecken sich auch auf das Verständnis der internen Darstellungen von Deep-Learning-Modellen. Beispielsweise können Forscher die von Faltungsschichten in einem Residualnetzwerk gelernten Filter visualisieren, um zu sehen, welche Muster sie erkennen, wie Kanten oder Texturen. Diese Techniken helfen zu verifizieren, dass das Modell bedeutungsvolle Merkmale lernt und nicht nur scheinbare Korrelationen.
Lokale und globale Erklärungen
Interpretierbarkeitstechniken können nach ihrem Umfang kategorisiert werden: Lokale Erklärungen klären einzelne Vorhersagen, während globale Erklärungen das Gesamtverhalten eines Modells beschreiben. Lokale Erklärungsmethoden, wie LIME (Local Interpretable Model-agnostic Explanations), approximieren ein komplexes Modell mit einem einfacheren, interpretierbaren Modell um eine spezifische Instanz. Dies hilft Nutzern zu verstehen, warum eine bestimmte Entscheidung getroffen wurde, beispielsweise warum ein Kreditantrag abgelehnt wurde.
Globale Erklärungen zielen darauf ab, einen Überblick über die Logik des Modells zu geben, oft durch Surrogatmodelle oder Regel-Extraktion. Beispielsweise können Entscheidungsbäume trainiert werden, um ein Black-Box-Modell nachzuahmen und eine für Menschen verständliche Darstellung seiner Entscheidungsgrenzen zu bieten. Diese globalen Methoden sind wertvoll, um Modelle auf Fairness oder Verzerrungen zu prüfen, da sie Muster aufdecken, die sonst unbemerkt bleiben könnten.
Konzept-Bottleneck-Modelle
Konzept-Bottleneck-Modelle sind eine spezifische Art von interpretierbaren Architekturen, die Konzeptabstraktionen verwenden, um die Argumentation des Modells zu erklären. Diese Modelle sagen zunächst menschlich verständliche Konzepte aus der Eingabe voraus und treffen dann die endgültige Entscheidung basierend auf diesen Konzepten. Beispielsweise könnte ein Modell in der medizinischen Bildgebung zunächst das Vorhandensein spezifischer Läsionen vorhersagen und diese Vorhersagen dann zur Diagnose einer Krankheit verwenden. Dieser Ansatz kann sowohl bei Bild- als auch bei Textvorhersageaufgaben angewendet werden.
Konzeptengpassmodelle sind besonders wichtig in Bereichen wie Medizin, Verteidigung, Finanzen und Recht, wo das Verständnis von Entscheidungen und Vertrauensaufbau in die Algorithmen entscheidend sind. Indem die Zwischenlogik explizit gemacht wird, ermöglichen diese Modelle Menschen, zu überprüfen, ob das Modell sinnvolle Kriterien verwendet, anstatt undurchsichtige Korrelationen.
Symbolische Regression und White-Box-Algorithmen
Viele Forscher argumentieren, dass zumindest für überwachtes Lernen die symbolische Regression der richtige Weg ist, bei der der Algorithmus ein Modell findet, das am besten zu einem Datensatz passt, indem er mathematische Ausdrücke durchsucht. Dies führt zu Formeln, die explizit sind und von Menschen inspiziert werden können, was ein hohes Maß an Transparenz bietet. Symbolische Regression wird oft verwendet, um zugrunde liegende physikalische Gesetze aus Daten zu entdecken.
White-Box-Ansätze mit interpretierbarer Struktur, wie Entscheidungsbäume und lineare Modelle, bieten von Natur aus Transparenz. Diese Algorithmen werden in regulierten Branchen bevorzugt, wo Rechenschaftspflicht und das Verständnis von Entscheidungen gesetzlich vorgeschrieben sind. Sie können jedoch in der Genauigkeit hinter komplexeren Modellen zurückbleiben, was einen Kompromiss zwischen Leistung und Interpretierbarkeit darstellt.
Lokale und globale Erklärungen
Interpretierbarkeitstechniken können nach ihrem Umfang kategorisiert werden: Lokale Erklärungen klären einzelne Vorhersagen, während globale Erklärungen das Gesamtverhalten eines Modells beschreiben. Lokale Erklärungsmethoden, wie LIME (Local Interpretable Model-agnostic Explanations), approximieren ein komplexes Modell mit einem einfacheren, interpretierbaren Modell in der Nähe einer spezifischen Instanz. Dies hilft Nutzern zu verstehen, warum eine bestimmte Entscheidung getroffen wurde, beispielsweise warum ein Kreditantrag abgelehnt wurde.
Globale Erklärungen zielen darauf ab, einen Überblick über die Logik des Modells zu geben, oft durch Surrogatmodelle oder Regeln. Beispielsweise können Entscheidungsbäume trainiert werden, um ein Black-Box-Modell nachzuahmen und eine menschenlesbare Darstellung seiner Entscheidungslogik zu bieten. Diese globalen Erklärungen sind wertvoll, um Modelle auf Fairness oder Verzerrungen zu prüfen, da sie allgemeine Muster aufdecken, die sonst unbemerkt blieben.
Konzept-Engpassmodelle
Konzept-Engpassmodelle sind eine spezifische Art von interpretierbarer Architektur, die menschlich verständliche Konzepte als Zwischenschritt verwendet. Diese Modelle sagen zunächst Konzepte aus der Eingabe voraus und nutzen diese dann, um die endgültige Entscheidung zu treffen. Beispielsweise könnte ein medizinisches Bildgebungsmodell zuerst das Vorhandensein bestimmter Läsionen vorhersagen und diese Informationen dann zur Diagnose einer Krankheit verwenden. Dieser Ansatz kann bei Vorhersageaufgaben in Bild- und Textbereichen angewendet werden.
Konzept-Engpassmodelle sind besonders in Bereichen wie Medizin, Verteidigung, Finanzen und Recht nützlich, wo es entscheidend ist, dass Zwischenschritte der Argumentation überprüfbar und nachvollziehbar sind. Durch die explizite Darstellung der Zwischenlogik wird es ermöglicht, dass Menschen die Verwendung sinnvoller Konzepte überprüfen können, anstatt sich auf undurchsichtige Korrelationen zu verlassen.
Symbolische Regression und White-Box-Ansätze
Für überwachtes maschinelles Lernen wird oft argumentiert, dass der Weg nach vorne die symbolische Regression ist, die den Raum mathematischer Ausdrücke durchsucht, um das Modell zu finden, das am besten zu einem gegebenen Datensatz passt. Dieser Ansatz erzeugt Modelle, die explizit und überprüfbar sind, was ein hohes Maß an Transparenz bietet. Symbolische Regression wird häufig verwendet, um physikalische Gesetze aus Daten zu entdecken, was sie für wissenschaftliche Anwendungen geeignet macht.
White-Box-Algorithmen, wie einfache lineare Modelle oder Entscheidungsbäume, werden oft in Branchen bevorzugt, in denen Erklärbarkeit eine regulatorische Anforderung ist. Obwohl sie möglicherweise nicht die gleiche Leistung wie komplexe Modelle erreichen, bieten sie eine klare Beziehung zwischen Eingaben und Ausgaben, was Vertrauen und Audits erleichtert.
Anwendungen und zukünftige Richtungen
Interpretierbarkeitstechniken werden in verschiedenen Bereichen eingesetzt, einschließlich Gesundheitswesen, Finanzen und autonome Systeme. In der Medizin unterstützen klinische Entscheidungsunterstützungssysteme (CDSS) medizinisches Fachpersonal dabei, maschinelle Entscheidungen zu verstehen und zu vertrauen. Im Finanzwesen werden sie verwendet, um die Einhaltung von Vorschriften sicherzustellen und Verzerrungen bei der Kreditvergabe oder im Scoring zu erkennen.
Das XAI-Programm der Defense Advanced Research Projects Agency (DARPA) zielt darauf ab, "Glasbox"-Modelle zu entwickeln, die für einen "Menschen im Kreislauf" erklärbar sind, ohne die KI-Leistung erheblich zu beeinträchtigen. Dieses Programm hat bedeutende Fortschritte in dem Feld vorangetrieben. Zukünftige Richtungen umfassen die Entwicklung von Interpretierbarkeitstechniken für Transformer-basierte Modelle, die Verbesserung der Wiedergabetreue von Erklärungen und die Integration von Interpretierbarkeit in den Trainingsprozess selbst, anstatt sie als nachträgliche Analyse durchzuführen.