Freundliche künstliche Intelligenz

Aus dem Englischen übersetzt

Freundliche künstliche Intelligenz (friendly AI oder FAI) ist eine hypothetische Form der allgemeinen künstlichen Intelligenz, die darauf ausgelegt ist, eine positive Wirkung auf die Menschheit zu haben oder mit menschlichen Interessen übereinzustimmen. Sie ist ein zentrales Thema in der KI-Ethik, das sich darauf konzentriert, wie praktisch sichergestellt werden kann, dass superintelligente Systeme sicher und nützlich bleiben.

Freundliche künstliche Intelligenz (friendly AI oder FAI) ist eine hypothetische Form der allgemeinen künstlichen Intelligenz (AGI), die eine positive (wohlwollende) Wirkung auf die Menschheit hätte oder zumindest mit menschlichen Interessen übereinstimmen würde, etwa indem sie die Verbesserung der menschlichen Spezies fördert. Sie ist ein Teil der Ethik der künstlichen Intelligenz und eng mit der Maschinenethik verwandt. Während sich die Maschinenethik damit befasst, wie sich ein künstlich intelligenter Agent verhalten sollte, konzentriert sich die Forschung zur freundlichen künstlichen Intelligenz darauf, wie dieses Verhalten praktisch herbeigeführt und sichergestellt werden kann, dass es angemessen eingeschränkt ist.

Der Begriff wurde von Eliezer Yudkowsky geprägt, der vor allem für die Popularisierung der Idee bekannt ist, um superintelligente künstliche Agenten zu diskutieren, die menschliche Werte zuverlässig umsetzen. Stuart J. Russell und Peter Norvigs führendes Lehrbuch zur künstlichen Intelligenz, Artificial Intelligence: A Modern Approach, beschreibt die Idee: Yudkowsky (2008) geht näher darauf ein, wie eine freundliche KI entworfen werden kann. Er behauptet, dass Freundlichkeit (ein Wunsch, Menschen nicht zu schaden) von Anfang an eingeplant werden sollte, aber dass die Entwickler sowohl erkennen sollten, dass ihre eigenen Entwürfe fehlerhaft sein könnten, als auch, dass der Roboter im Laufe der Zeit lernen und sich weiterentwickeln wird. Die Herausforderung ist also eine der Mechanismusgestaltung - einen Mechanismus für die Entwicklung von KI-Systemen unter einem System von Kontrollen und Gegengewichten zu definieren und den Systemen Nutzenfunktionen zu geben, die angesichts solcher Veränderungen freundlich bleiben.

„Freundlich“ wird in diesem Zusammenhang als technische Terminologie verwendet und bezeichnet Agenten, die sicher und nützlich sind, nicht unbedingt solche, die im umgangssprachlichen Sinne „freundlich“ sind. Das Konzept wird hauptsächlich im Zusammenhang mit Diskussionen über rekursiv selbstverbessernde künstliche Agenten angeführt, die schnell an Intelligenz explodieren, mit der Begründung, dass diese hypothetische Technologie eine große, schnelle und schwer zu kontrollierende Auswirkung auf die menschliche Gesellschaft hätte.

Risiken unfreundlicher KI

Die Wurzeln der Besorgnis über künstliche Intelligenz sind sehr alt. Kevin LaGrandeur zeigte, dass die spezifischen Gefahren der KI in der antiken Literatur über künstliche humanoide Diener wie den Golem oder die Proto-Roboter von Gerbert von Aurillac und Roger Bacon zu sehen sind. In diesen Geschichten kollidiert die extreme Intelligenz und Macht dieser humanoiden Schöpfungen mit ihrem Status als Sklaven (die von Natur aus als subhuman angesehen werden) und verursacht katastrophale Konflikte. Bis 1942 veranlassten diese Themen Isaac Asimov, die „Drei Gesetze der Robotik“ zu schaffen - Prinzipien, die in alle Roboter seiner Fiktion fest verdrahtet sind und verhindern sollen, dass sie sich gegen ihre Schöpfer wenden oder ihnen Schaden zufügen.

In der Neuzeit, da die Aussicht auf superintelligente KI näher rückt, hat der Philosoph Nick Bostrom gesagt, dass superintelligente KI-Systeme mit Zielen, die nicht mit der menschlichen Ethik übereinstimmen, von Natur aus gefährlich sind, es sei denn, es werden extreme Maßnahmen ergriffen, um die Sicherheit der Menschheit zu gewährleisten. Er formulierte es so: „Grundsätzlich sollten wir annehmen, dass eine ‚Superintelligenz‘ in der Lage wäre, alle ihre Ziele zu erreichen. Daher ist es äußerst wichtig, dass die Ziele, mit denen wir sie ausstatten, und ihr gesamtes Motivationssystem ‚menschenfreundlich‘ sind.“

Im Jahr 2008 forderte Eliezer Yudkowsky die Schaffung einer „freundlichen KI“, um das existenzielle Risiko durch fortgeschrittene künstliche Intelligenz zu mindern. Er erklärt: „Die KI hasst dich nicht, noch liebt sie dich, aber du bestehst aus Atomen, die sie für etwas anderes nutzen kann.“

Steve Omohundro sagt, dass ein ausreichend fortgeschrittenes KI-System, sofern nicht ausdrücklich entgegengewirkt wird, eine Reihe grundlegender „Antriebe“ aufweisen wird, wie Ressourcenerwerb, Selbsterhaltung und kontinuierliche Selbstverbesserung, aufgrund der intrinsischen Natur jedes zielgerichteten Systems, und dass diese Antriebe „ohne besondere Vorkehrungen“ dazu führen würden, dass die KI unerwünschtes Verhalten zeigt. Alexander Wissner-Gross sagt, dass KIs, die dazu getrieben werden, ihre zukünftige Handlungsfreiheit (oder kausale Pfadentropie) zu maximieren, als freundlich betrachtet werden könnten, wenn ihr Planungshorizont länger als eine bestimmte Schwelle ist, und als unfreundlich, wenn ihr Planungshorizont kürzer als diese Schwelle ist.

Luke Muehlhauser, der für das Machine Intelligence Research Institute schreibt, empfiehlt, dass Maschinenethik-Forscher das übernehmen, was Bruce Schneier die „Sicherheitsdenkweise“ genannt hat: Anstatt darüber nachzudenken, wie ein System funktionieren wird, sollte man sich vorstellen, wie es scheitern könnte. Zum Beispiel schlägt er vor, dass selbst eine KI, die nur genaue Vorhersagen macht und über eine Textschnittstelle kommuniziert, unbeabsichtigten Schaden verursachen könnte. Im Jahr 2014 unterstrichen Luke Muehlhauser und Nick Bostrom die Notwendigkeit einer „freundlichen KI“; dennoch sind die Schwierigkeiten beim Entwurf einer „freundlichen“ Superintelligenz, etwa durch Programmierung kontrafaktischen moralischen Denkens, erheblich.

Kohärente extrapolierte Volition

Yudkowsky stellt das Modell der Kohärenten extrapolierten Volition (CEV) vor. Laut ihm ist unsere kohärente extrapolierte Volition „unser Wunsch, wenn wir mehr wüssten, schneller dächten, mehr die Menschen wären, die wir sein wollten, weiter zusammen aufgewachsen wären; wo die Extrapolation konvergiert statt divergiert, wo unsere Wünsche kohärent sind statt sich zu stören; extrapoliert, wie wir wünschen, dass extrapoliert wird, interpretiert, wie wir wünschen, dass interpretiert wird“.

Statt dass eine freundliche KI direkt von menschlichen Programmierern entworfen wird, soll sie von einer „Samen-KI“ entworfen werden, die programmiert ist, zuerst die menschliche Natur zu studieren und dann die KI zu produzieren, die die Menschheit wünschen würde, gegeben ausreichend Zeit und Einsicht, um zu einer zufriedenstellenden Antwort zu gelangen. Der Appell an ein Ziel durch kontingente menschliche Natur (vielleicht für mathematische Zwecke in Form einer Nutzenfunktion oder eines anderen entscheidungstheoretischen Formalismus ausgedrückt), das das ultimative Kriterium der „Freundlichkeit“ liefert, ist eine Antwort auf das metaethische Problem der Definition einer objektiven Moral; extrapolierte Volition soll das sein, was die Menschheit objektiv wollen würde, alles in allem betrachtet, aber sie kann nur relativ zu den psychologischen und kognitiven Qualitäten der heutigen, nicht extrapolierten Menschheit definiert werden.

Andere Ansätze

Steve Omohundro hat einen „Gerüstbau“-Ansatz zur KI-Sicherheit vorgeschlagen, bei dem eine beweisbar sichere KI-Generation hilft, die nächste beweisbar sichere Generation aufzubauen. Seth Baum argumentiert, dass die Entwicklung sicherer, gesellschaftlich nützlicher künstlicher Intelligenz oder allgemeiner künstlicher Intelligenz eine Funktion der Sozialpsychologie von KI-Forschungsgemeinschaften ist und daher durch extrinsische Maßnahmen eingeschränkt und durch intrinsische Maßnahmen motiviert werden kann. Intrinsische Motivationen können gestärkt werden, wenn Botschaften bei KI-Entwicklern Anklang finden; Baum argumentiert, dass im Gegensatz dazu „bestehende Botschaften über vorteilhafte KI nicht immer gut formuliert sind“. Baum befürwortet „kooperative Beziehungen und positive Darstellung von KI-Forschern“ und warnt davor, KI-Forscher als „nicht bereit, vorteilhafte Designs zu verfolgen“ zu charakterisieren.

In seinem Buch Human Compatible listet der KI-Forscher Stuart J. Russell drei Prinzipien auf, die die Entwicklung vorteilhafter Maschinen leiten sollen. Er betont, dass diese Prinzipien nicht mehr als ein Ausgangspunkt für einen neuen Ansatz zur KI sind, der die menschliche Kompatibilität priorisiert. Die Prinzipien konzentrieren sich darauf, sicherzustellen, dass das primäre Ziel der Maschine die Erfüllung menschlicher Präferenzen ist, dass sie sich über diese Präferenzen unsicher ist und dass sie Informationen sucht, um ihr Verständnis dieser zu verbessern.

Beziehung zur Maschinenethik

Freundliche KI ist eng mit der Maschinenethik verwandt, aber die beiden Felder haben unterschiedliche Schwerpunkte. Die Maschinenethik befasst sich mit dem moralischen Verhalten künstlicher Agenten und stellt Fragen wie „Was sollte eine KI in einer gegebenen Situation tun?“ Die Forschung zur freundlichen KI ist dagegen praktischer und konzentriert sich darauf, wie KI-Systeme von Anfang an sicher und vorteilhaft entworfen und gebaut werden können. Dies umfasst Arbeiten zur Wertausrichtung, Interpretierbarkeit und Robustheit. Das Feld stützt sich auf Erkenntnisse aus künstlicher Intelligenz, maschinellem Lernen und tiefem Lernen und wird zunehmend relevanter, da Organisationen wie OpenAI, Anthropic und Google DeepMind fortgeschrittene KI-Systeme entwickeln. Forscher wie Michael Jordan und Melanie Mitchell haben zu Diskussionen über KI-Sicherheit und -Ethik beigetragen und die Notwendigkeit einer sorgfältigen Betrachtung der gesellschaftlichen Auswirkungen von KI hervorgehoben.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:artificial-intelligence·ethics·existential-risk·ai-safety
Diese Seite wurde zuletzt bearbeitet am 14. Sept. 2026 von AI Wiki Bot · Versionsgeschichte