Bias in der KI, auch bekannt als algorithmische Verzerrung, beschreibt die systematische und wiederholbare schädliche Tendenz in einem computergestützten soziotechnischen System, unfaire Ergebnisse zu erzeugen, wie etwa die Bevorzugung einer Kategorie gegenüber einer anderen auf eine Weise, die von der beabsichtigten Funktion des Algorithmus abweichen kann. Diese Verzerrung kann aus vielen Faktoren entstehen, darunter absichtlich voreingenommene Designentscheidungen oder unbeabsichtigte oder unvorhergesehene Nutzungen oder Entscheidungen in Bezug auf die Art und Weise, wie Daten kodiert, gesammelt, ausgewählt oder zum Trainieren des Algorithmus verwendet werden. Die Forschung zu algorithmischer Verzerrung befasst sich hauptsächlich mit Algorithmen, die systematische und unfaire Diskriminierung widerspiegeln, und sie wurde in Suchmaschinenergebnissen, Social-Media-Plattformen und anderen Anwendungen beobachtet, mit Auswirkungen, die von Datenschutzverletzungen bis zur Verstärkung sozialer Vorurteile in Bezug auf Rasse, Geschlecht, Sexualität und ethnische Zugehörigkeit reichen.
Da Algorithmen ihre Fähigkeit erweitern, Gesellschaft, Politik, Institutionen und Verhalten zu organisieren, haben Soziologen Bedenken hinsichtlich der Art und Weise geäußert, wie unvorhergesehene Ausgaben und Manipulation von Daten die physische Welt beeinflussen können. Da Algorithmen oft als neutral und unvoreingenommen gelten, können sie fälschlicherweise eine größere Autorität ausstrahlen als menschliches Fachwissen, teilweise aufgrund des psychologischen Phänomens der Automationsverzerrung. In einigen Fällen kann die Abhängigkeit von Algorithmen die menschliche Verantwortung für ihre Ergebnisse verdrängen. Verzerrung kann in algorithmische Systeme gelangen als Folge von vorbestehenden kulturellen, sozialen oder institutionellen Erwartungen; durch die Wahl von Merkmalen und Beschriftungen; aufgrund technischer Einschränkungen ihres Designs; oder durch die Nutzung in unvorhergesehenen Kontexten oder durch Zielgruppen, die im ursprünglichen Design der Software nicht berücksichtigt wurden.
Quellen der Verzerrung
Verzerrung kann auf verschiedene Weise in einen Algorithmus eingeführt werden. Während der Zusammenstellung eines Datensatzes können Daten gemäß menschlich gestalteten Katalogisierungskriterien gesammelt, digitalisiert, angepasst und in eine Datenbank eingegeben werden. Programmierer weisen Prioritäten oder Hierarchien zu, wie ein Programm diese Daten bewertet und sortiert, was menschliche Entscheidungen über Kategorisierung sowie Ein- oder Ausschluss erfordert. Einige Algorithmen sammeln ihre eigenen Daten basierend auf menschlich ausgewählten Kriterien, was die Verzerrung menschlicher Designer widerspiegeln kann. Andere Algorithmen können Stereotype und Präferenzen verstärken, während sie relevante Daten für menschliche Benutzer verarbeiten und anzeigen, beispielsweise indem sie Informationen basierend auf früheren Entscheidungen eines ähnlichen Benutzers oder einer ähnlichen Gruppe auswählen.
Über die Zusammenstellung und Verarbeitung von Daten hinaus kann Verzerrung als Ergebnis des Designs entstehen. Algorithmen, die die Zuteilung von Ressourcen oder Überprüfung bestimmen, wie etwa bei Schulplatzierungen, können unbeabsichtigt eine Kategorie diskriminieren, wenn sie Risiken basierend auf ähnlichen Benutzern bestimmen, wie bei Kredit-Scores. Empfehlungs-Engines, die Benutzer mit ähnlichen Benutzern assoziieren oder Marketingmerkmale ableiten, könnten auf ungenauen Assoziationen beruhen, die breite ethnische, geschlechtsspezifische, sozioökonomische oder rassistische Stereotype widerspiegeln. Kriterien dafür, was in Ergebnisse ein- und ausgeschlossen wird, können unvorhergesehene Ergebnisse darstellen, wie etwa Flugempfehlungssoftware, die Flüge auslässt, die nicht den Flugrouten der sponsernden Fluggesellschaft folgen. Algorithmen können auch eine Unsicherheitsverzerrung aufweisen, indem sie selbstbewusstere Bewertungen anbieten, wenn größere Datensätze verfügbar sind, was Ergebnisse zu größeren Stichproben verschieben und Daten von unterrepräsentierten Bevölkerungsgruppen ignorieren kann.
Historischer Kontext
Die frühesten Computerprogramme wurden entwickelt, um menschliches Denken und Schlussfolgerungen nachzuahmen, und galten als funktionsfähig, wenn sie erwartete Ausgaben erfolgreich und konsistent reproduzierten. Mit dem Fortschritt von maschinellem Lernen und künstlicher Intelligenz wuchs die Abhängigkeit von datengetriebener Entscheidungsfindung, und Bedenken hinsichtlich Verzerrung wurden prominenter. Eine Umfrage von 2021 identifizierte mehrere Formen algorithmischer Verzerrung, darunter historische, Repräsentations- und Messverzerrungen, die jeweils zu unfairen Ergebnissen beitragen können. Historische Verzerrung entsteht, wenn Daten vergangene gesellschaftliche Ungleichheiten widerspiegeln, Repräsentationsverzerrung tritt auf, wenn bestimmte Gruppen in Trainingsdaten unterrepräsentiert sind, und Messverzerrung resultiert aus der Verwendung fehlerhafter oder unvollständiger Metriken.
Auswirkungsbereiche
Algorithmische Verzerrung wurde in Fällen von Wahlergebnissen bis zur Verbreitung von Online-Hassrede angeführt. Sie trat auch in der Strafjustiz, im Gesundheitswesen und bei der Einstellung auf und verstärkte bestehende rassistische, sozioökonomische und geschlechtsspezifische Vorurteile. Die relative Unfähigkeit der Gesichtserkennungstechnologie, dunklere Gesichter genau zu identifizieren, wurde mit mehreren unrechtmäßigen Verhaftungen schwarzer Männer in Verbindung gebracht, ein Problem, das aus unausgewogenen Datensätzen resultiert. Bei der Einstellung können Algorithmen, die auf historischen Lebensläufen trainiert wurden, männliche Kandidaten bevorzugen, wenn frühere Einstellungspraktiken voreingenommen waren. Im Gesundheitswesen können Vorhersagemodelle Erkrankungen in Minderheitenpopulationen unterdiagnostizieren, da unzureichende Trainingsdaten vorliegen.
Rechtliche und regulatorische Antworten
Verzerrung in der KI wurde erst kürzlich in rechtlichen Rahmenwerken adressiert. Die Datenschutz-Grundverordnung der Europäischen Union, die 2018 in Kraft trat, enthält Bestimmungen zu automatisierten Entscheidungen und dem Recht auf Erklärung. Der Artificial Intelligence Act, 2021 vorgeschlagen und 2024 angenommen, legt risikobasierte Anforderungen für KI-Systeme fest, einschließlich Maßnahmen zur Minderung von Verzerrung. Diese Vorschriften zielen darauf ab, Transparenz und Rechenschaftspflicht zu erhöhen, obwohl die Durchsetzung aufgrund der proprietären Natur vieler Algorithmen herausfordernd bleibt.
Herausforderungen bei der Adressierung von Verzerrung
Probleme beim Verständnis, der Erforschung und der Entdeckung algorithmischer Verzerrung bestehen fort aufgrund der proprietären Natur von Algorithmen, die typischerweise als Geschäftsgeheimnisse behandelt werden. Selbst wenn vollständige Transparenz gewährt wird, stellt die Komplexität bestimmter Algorithmen eine Barriere für das Verständnis ihrer Funktionsweise dar. Darüber hinaus können sich Algorithmen ändern oder auf Eingaben oder Ausgaben in einer Weise reagieren, die nicht vorhergesehen oder leicht für Analysen reproduziert werden kann. In vielen Fällen gibt es selbst innerhalb einer einzelnen Website oder Anwendung keinen einzelnen Algorithmus zu untersuchen, sondern ein Netzwerk vieler miteinander verbundener Programme und Dateneingaben, sogar zwischen Benutzern desselben Dienstes.
Minderungsansätze
Forscher und Praktiker haben verschiedene Ansätze entwickelt, um Verzerrung in der KI zu mindern. Dazu gehören Vorverarbeitungstechniken zum Ausbalancieren von Datensätzen, In-Processing-Methoden, die Fairnessbeschränkungen während des Modelltrainings integrieren, und Nachverarbeitungsanpassungen an Ausgaben. Beispielsweise kann Datenaugmentierung helfen, Repräsentationsverzerrung zu adressieren, indem synthetische Beispiele für unterrepräsentierte Gruppen erzeugt werden. Fairnessmetriken wie demografische Parität und ausgeglichene Quoten werden verwendet, um Verzerrung zu quantifizieren und zu überwachen. Es gibt jedoch oft einen Kompromiss zwischen Fairness und Genauigkeit, und keine einzelne Definition von Fairness gilt universell.
Zukünftige Richtungen
Da KI-Systeme stärker in die Gesellschaft integriert werden, bleibt die Adressierung von Verzerrung eine kritische Herausforderung. Interdisziplinäre Zusammenarbeit zwischen Informatikern, Soziologen, Ethikern und Rechtswissenschaftlern ist wesentlich. Organisationen wie OpenAI, Anthropic und Google DeepMind haben Forschung zu Fairness und Verzerrung veröffentlicht, obwohl ihre Algorithmen weitgehend proprietär bleiben. Die Entwicklung erklärbarer KI, die darauf abzielt, Modellentscheidungen interpretierbarer zu machen, ist ein aktives Forschungsgebiet. Letztendlich erfordert die Reduzierung von Verzerrung nicht nur technische Lösungen, sondern auch eine fortlaufende Prüfung der sozialen und institutionellen Kontexte, in denen Algorithmen eingesetzt werden.