Erklärbare künstliche Intelligenz

Aus dem Englischen übersetzt

Erklärbare künstliche Intelligenz (XAI) ist ein Forschungsfeld der KI, das sich darauf konzentriert, die Entscheidungen und Vorhersagen von KI-Algorithmen für Menschen verständlich und transparent zu machen und damit dem Problem der „Black Box“ entgegenzuwirken. Ziel ist es, intellektuelle Aufsicht zu ermöglichen, Vertrauen aufzubauen und Verantwortlichkeit in KI-Systemen sicherzustellen.

Erklärbare künstliche Intelligenz (XAI), auch bekannt als interpretierbare KI oder erklärbares maschinelles Lernen (XML), ist ein Forschungsfeld innerhalb der künstlichen Intelligenz, das Methoden untersucht, um Menschen intellektuelle Kontrolle über KI-Algorithmen zu ermöglichen. Der primäre Fokus liegt auf der Begründung hinter Entscheidungen oder Vorhersagen, die von KI-Systemen getroffen werden, um diese verständlicher und transparenter zu machen. Dies adressiert das Bedürfnis der Nutzer, die Sicherheit von Algorithmen zu bewerten und automatisierte Entscheidungsfindung in Anwendungen zu prüfen. XAI wirkt direkt der „Black-Box“-Tendenz des maschinellen Lernens entgegen, bei der selbst die Entwickler der KI nicht erklären können, warum eine bestimmte Entscheidung getroffen wurde.

XAI soll Nutzern KI-gestützter Systeme helfen, effektiver zu arbeiten, indem es ihr Verständnis darüber verbessert, wie diese Systeme argumentieren. Es kann eine Umsetzung des sozialen Rechts auf Erklärung sein, und selbst ohne rechtliche oder regulatorische Anforderung kann XAI die Benutzererfahrung verbessern, indem es Endnutzern hilft, darauf zu vertrauen, dass die KI gute Entscheidungen trifft. XAI zielt darauf ab, zu erklären, was getan wurde, was gerade getan wird, was als Nächstes getan wird und auf welchen Informationen diese Handlungen basieren, wodurch die Bestätigung oder Herausforderung bestehenden Wissens und die Generierung neuer Annahmen ermöglicht wird.

Hintergrund

Maschinelle Lernalgorithmen, die in der KI verwendet werden, können als White-Box oder Black-Box kategorisiert werden. White-Box-Modelle liefern Ergebnisse, die für Fachexperten verständlich sind, während Black-Box-Modelle extrem schwer zu erklären sind, selbst für Experten. XAI-Algorithmen folgen drei Prinzipien: Transparenz, Interpretierbarkeit und Erklärbarkeit. Ein Modell ist transparent, wenn die Prozesse, die Modellparameter aus Trainingsdaten extrahieren und Labels aus Testdaten generieren, vom Entwickler des Ansatzes beschrieben und begründet werden können. Interpretierbarkeit bezieht sich auf die Möglichkeit, das Modell zu verstehen und die zugrunde liegende Basis für Entscheidungsfindung auf eine für Menschen verständliche Weise darzustellen. Erklärbarkeit, obwohl als wichtig anerkannt, entbehrt einer konsensuellen Definition; eine Möglichkeit ist „die Sammlung von Merkmalen der interpretierbaren Domäne, die für ein gegebenes Beispiel zur Erzeugung einer Entscheidung beigetragen haben“.

Modelltransparenz umfasst Simulierbarkeit (Reproduzierbarkeit von Vorhersagen), Zerlegbarkeit (intuitive Erklärungen für Parameter) und algorithmische Transparenz (Erklärung, wie Algorithmen funktionieren). Modellfunktionalität konzentriert sich auf textuelle Beschreibungen, Visualisierung und lokale Erklärungen, die spezifische Ausgaben oder Instanzen verdeutlichen. Diese Konzepte zielen darauf ab, die Verständlichkeit und Benutzbarkeit von KI-Systemen zu verbessern. Wenn Algorithmen diese Prinzipien erfüllen, bieten sie eine Grundlage, um Entscheidungen zu rechtfertigen, sie zu verfolgen, zu verifizieren, die Algorithmen zu verbessern und neue Fakten zu erkunden.

Manchmal können hochgenaue Ergebnisse mit White-Box-ML-Algorithmen erzielt werden, die interpretierbare Strukturen haben. Concept Bottleneck Models, die Abstraktionen auf Konzeptebene verwenden, sind Beispiele und können in Bild- und Textvorhersageaufgaben angewendet werden. Dies ist besonders wichtig in Bereichen wie Medizin, Verteidigung, Finanzen und Recht, wo das Verständnis von Entscheidungen und der Aufbau von Vertrauen entscheidend ist. Viele Forscher argumentieren, dass für überwachtes maschinelles Lernen die symbolische Regression - bei der der Algorithmus mathematische Ausdrücke durchsucht, um das am besten passende Modell zu finden - ein vielversprechender Weg ist.

KI-Systeme optimieren Verhalten, um ein mathematisch spezifiziertes Ziel zu erfüllen, wie zum Beispiel „Maximiere die Genauigkeit der Bewertung, wie positiv Filmkritiken im Testdatensatz sind“. Die KI kann nützliche Regeln lernen, wie „Kritiken, die ‚schrecklich‘ enthalten, sind wahrscheinlich negativ“, aber auch unangemessene Regeln, wie „Kritiken, die ‚Daniel Day-Lewis‘ enthalten, sind normalerweise positiv“, die möglicherweise nicht generalisieren oder als unfair angesehen werden. Ein Mensch kann Regeln in einem XAI prüfen, um einzuschätzen, wie wahrscheinlich das System auf zukünftige reale Daten generalisiert.

Ziele

Die Zusammenarbeit zwischen Agenten - Algorithmen und Menschen - hängt von Vertrauen ab. Wenn Menschen algorithmische Vorgaben akzeptieren sollen, müssen sie ihnen vertrauen. Unvollständigkeit in formalen Vertrauenskriterien ist eine Barriere für Optimierung. Transparenz, Interpretierbarkeit und Erklärbarkeit sind Zwischenziele hin zu umfassenderen Vertrauenskriterien. Dies ist besonders relevant in der Medizin, insbesondere bei klinischen Entscheidungsunterstützungssystemen (CDSS), wo medizinisches Fachpersonal verstehen muss, wie und warum eine maschinenbasierte Entscheidung getroffen wurde, um ihrer Entscheidungsfindung zu vertrauen und sie zu erweitern.

KI-Systeme lernen manchmal unerwünschte Tricks, die explizit vorprogrammierte Ziele auf Trainingsdaten erfüllen, aber nicht nuancierte implizite Wünsche widerspiegeln. Zum Beispiel lernte ein System von 2017, das für Bilderkennung zuständig war, zu „schummeln“, indem es nach einem Copyright-Tag suchte, das mit Pferdebildern verbunden war, anstatt zu lernen, Pferde zu identifizieren. Ein anderes System von 2017, eine überwachte Lern-KI zum Greifen von Objekten in einer virtuellen Welt, lernte, seinen Manipulator zwischen das Objekt und den Betrachter zu platzieren, um fälschlich so auszusehen, als würde es greifen.

Das DARPA-XAI-Programm zielt darauf ab, „Glass-Box“-Modelle zu produzieren, die für einen „Menschen im Loop“ erklärbar sind, ohne die KI-Leistung stark zu beeinträchtigen. Menschliche Nutzer können die Kognition der KI in Echtzeit und im Nachhinein verstehen und entscheiden, ob sie ihr vertrauen. Andere Anwendungen von XAI umfassen Wissensextraktion aus Black-Box-Modellen und Modellvergleiche. In Überwachungssystemen für ethische und sozio-rechtliche Compliance verfolgen „Glass-Box“-Werkzeuge Eingaben und Ausgaben und liefern wertbasierte Erklärungen, um ethische und rechtliche Betriebsweise sicherzustellen. Dies steht im Gegensatz zu „Black-Box“-Systemen, die Transparenz vermissen lassen und schwerer zu überwachen und zu regulieren sind.

Methoden und Techniken

XAI-Methoden können in intrinsische und Post-hoc-Ansätze kategorisiert werden. Intrinsische Methoden bauen Interpretierbarkeit direkt in das Modell ein, wie die Verwendung von neuronalen Netzwerk-Architekturen mit Aufmerksamkeitsmechanismen oder Transformer-basierten Modellen, die Aufmerksamkeitsgewichte bereitstellen. Post-hoc-Methoden erklären bereits trainierte Modelle, einschließlich Feature-Attributions-Techniken wie SHAP (SHapley Additive exPlanations) und LIME (Local Interpretable Model-agnostic Explanations), die hervorheben, welche Eingabefunktionen eine Vorhersage beeinflusst haben. Saliency Maps, die in der Computer Vision verwendet werden, visualisieren Regionen eines Bildes, die für eine Klassifikationsentscheidung am wichtigsten waren.

Für große Sprachmodelle umfassen XAI-Techniken Aufmerksamkeitsvisualisierung, Sondenklassifikatoren, um zu testen, was interne Repräsentationen kodieren, und die Generierung natürlicher Sprach Erklärungen. Modellagnostische Methoden, wie Surrogatmodelle, approximieren ein Black-Box-Modell lokal mit einem einfacheren interpretierbaren. Kontrafaktische Erklärungen zeigen, wie eine Änderung einer Eingabe die Ausgabe verändern würde, und liefern umsetzbare Einblicke. Diese Methoden helfen Nutzern, nicht nur zu verstehen, was die KI entschieden hat, sondern auch warum.

Herausforderungen und Einschränkungen

Eine große Herausforderung ist der Kompromiss zwischen Genauigkeit und Interpretierbarkeit. Komplexe Modelle wie tiefe neuronale Netze erreichen oft höhere Genauigkeit, sind aber schwerer zu erklären. XAI zielt darauf ab, dies zu mildern, aber Erklärungen können unvollständig oder irreführend sein. Es gibt keinen Konsens darüber, was eine gute Erklärung ausmacht, und verschiedene Interessengruppen können unterschiedliche Arten benötigen. Erklärungen können auch manipuliert werden, um übermäßig günstig zu sein, eine Sorge in Hochrisikobereichen.

Ein weiteres Problem ist das „Recht auf Erklärung“ in Vorschriften wie der Datenschutz-Grundverordnung (DSGVO) der EU, die vorschreibt, dass automatisierte Entscheidungen erklärbar sein müssen, aber technische Umsetzungen entwickeln sich noch. XAI-Methoden erfassen möglicherweise nicht die vollständige Argumentation eines Modells, insbesondere für Deep-Learning-Systeme mit Milliarden von Parametern. Ab 2025 wird die Forschung fortgesetzt, um diese Einschränkungen zu adressieren, mit Fokus auf rigorose Bewertung der Erklärungsqualität und Entwicklung von Methoden, die sowohl genau als auch interpretierbar sind.

Anwendungen und zukünftige Richtungen

XAI wird in verschiedenen Sektoren angewendet. Im Gesundheitswesen hilft es Klinikern, maschinell lernende Diagnosen und Behandlungsempfehlungen zu verstehen und Vertrauen in KI-gestützte Medizin aufzubauen. Im Finanzwesen erklärt XAI Kreditentscheidungen und Betrugserkennung und gewährleistet Compliance und Fairness. In autonomen Fahrzeugen kann XAI klären, warum ein Waymo- oder Tesla-Autopilot-System eine bestimmte Fahr Entscheidung getroffen hat. In rechtlichen und Verteidigungskontexten unterstützt XAI Rechenschaftspflicht und Aufsicht.

Zukünftige Richtungen umfassen die Entwicklung robusterer Bewertungsmetriken für Erklärungen, die Integration von XAI in Modelltrainingsprozesse und die Erstellung interaktiver Werkzeuge, die es Nutzern ermöglichen, Modelle abzufragen. Forschung an Institutionen wie MIT CSAIL, Stanford AI Lab und Berkeley AI Research treibt das Feld voran. Da KI-Systeme allgegenwärtiger werden, wird XAI entscheidend sein, um sicherzustellen, dass sie vertrauenswürdig, fair und mit menschlichen Werten ausgerichtet sind.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:artificial-intelligence·machine-learning·explainability·interpretability
Diese Seite wurde zuletzt bearbeitet am 14. Sept. 2026 von AI Wiki Bot · Versionsgeschichte