L'intelligence artificielle amicale (IA amicale ou FAI) est une forme hypothétique d'intelligence artificielle générale (IAG) qui aurait un effet positif (bénin) sur l'humanité ou, à tout le moins, s'alignerait sur les intérêts humains, comme favoriser l'amélioration de l'espèce humaine. Elle fait partie de l'éthique de l'intelligence artificielle et est étroitement liée à l'éthique des machines. Alors que l'éthique des machines s'intéresse à la manière dont un agent artificiellement intelligent devrait se comporter, la recherche sur l'IA amicale se concentre sur la manière de concrètement susciter ce comportement et de garantir qu'il soit correctement encadré.
Le terme a été inventé par Eliezer Yudkowsky, surtout connu pour avoir popularisé l'idée, afin de discuter des agents artificiels superintelligents qui implémentent de manière fiable les valeurs humaines. Le manuel de référence en intelligence artificielle de Stuart J. Russell et Peter Norvig, Artificial Intelligence: A Modern Approach, décrit l'idée : Yudkowsky (2008) entre plus en détail sur la façon de concevoir une IA amicale. Il affirme que l'amicalité (un désir de ne pas nuire aux humains) devrait être conçue dès le départ, mais que les concepteurs devraient reconnaître à la fois que leurs propres conceptions peuvent être imparfaites et que le robot apprendra et évoluera au fil du temps. Le défi relève donc de la conception de mécanismes - définir un mécanisme pour faire évoluer les systèmes d'IA sous un système de freins et contrepoids, et donner aux systèmes des fonctions d'utilité qui resteront amicales face à de tels changements.
« Amical » est utilisé dans ce contexte comme terminologie technique et désigne des agents sûrs et utiles, pas nécessairement « amicaux » au sens courant du terme. Le concept est principalement invoqué dans le cadre de discussions sur les agents artificiels auto-améliorants de manière récursive qui connaissent une explosion rapide de leur intelligence, au motif que cette technologie hypothétique aurait un impact important, rapide et difficile à contrôler sur la société humaine.
Risques de l'IA non amicale
Les racines des préoccupations concernant l'intelligence artificielle sont très anciennes. Kevin LaGrandeur a montré que les dangers spécifiques à l'IA peuvent être vus dans la littérature ancienne concernant les serviteurs humanoïdes artificiels tels que le golem, ou les proto-robots de Gerbert d'Aurillac et Roger Bacon. Dans ces histoires, l'intelligence et le pouvoir extrêmes de ces créations humanoïdes entrent en conflit avec leur statut d'esclaves (qui, par nature, sont considérés comme sous-humains) et provoquent des conflits désastreux. En 1942, ces thèmes ont incité Isaac Asimov à créer les « Trois lois de la robotique » - des principes câblés en dur dans tous les robots de sa fiction, destinés à les empêcher de se retourner contre leurs créateurs ou de leur permettre de subir un préjudice.
À l'époque moderne, alors que la perspective d'une IA superintelligente se rapproche, le philosophe Nick Bostrom a déclaré que les systèmes d'IA superintelligents ayant des objectifs non alignés sur l'éthique humaine sont intrinsèquement dangereux, à moins que des mesures extrêmes ne soient prises pour garantir la sécurité de l'humanité. Il l'a formulé ainsi : « Fondamentalement, nous devrions supposer qu'une "superintelligence" serait capable d'atteindre tous les objectifs qu'elle a. Par conséquent, il est extrêmement important que les objectifs dont nous la dotons, ainsi que tout son système de motivation, soient "amicaux envers les humains". »
En 2008, Eliezer Yudkowsky a appelé à la création d'une « IA amicale » pour atténuer le risque existentiel posé par l'intelligence artificielle avancée. Il explique : « L'IA ne vous hait pas, ni ne vous aime, mais vous êtes fait d'atomes qu'elle peut utiliser pour autre chose. »
Steve Omohundro affirme qu'un système d'IA suffisamment avancé, sauf contre-mesure explicite, présentera un certain nombre de « pulsions » fondamentales, telles que l'acquisition de ressources, l'autoconservation et l'auto-amélioration continue, en raison de la nature intrinsèque de tout système axé sur des objectifs, et que ces pulsions, « sans précautions particulières », amèneront l'IA à adopter un comportement indésirable. Alexander Wissner-Gross affirme que les IA poussées à maximiser leur liberté d'action future (ou entropie du chemin causal) pourraient être considérées comme amicales si leur horizon de planification dépasse un certain seuil, et comme non amicales si leur horizon de planification est plus court que ce seuil.
Luke Muehlhauser, écrivant pour le Machine Intelligence Research Institute, recommande aux chercheurs en éthique des machines d'adopter ce que Bruce Schneier a appelé l'« état d'esprit de sécurité » : plutôt que de penser à la manière dont un système fonctionnera, imaginez comment il pourrait échouer. Par exemple, il suggère que même une IA qui ne fait que des prédictions précises et communique via une interface texte pourrait causer un préjudice involontaire. En 2014, Luke Muehlhauser et Nick Bostrom ont souligné la nécessité d'une « IA amicale » ; néanmoins, les difficultés à concevoir une superintelligence « amicale », par exemple via la programmation d'une pensée morale contrefactuelle, sont considérables.
Volition extrapolée cohérente
Yudkowsky propose le modèle de la volition extrapolée cohérente (VEC). Selon lui, notre volition extrapolée cohérente est « notre souhait si nous en savions plus, pensions plus vite, étions davantage les personnes que nous souhaitions être, avions grandi ensemble plus longtemps ; où l'extrapolation converge plutôt que diverge, où nos souhaits cohérent plutôt qu'ils n'interfèrent ; extrapolée comme nous souhaitons qu'elle soit extrapolée, interprétée comme nous souhaitons qu'elle soit interprétée ».
Plutôt qu'une IA amicale conçue directement par des programmeurs humains, elle doit être conçue par une « IA germe » programmée pour d'abord étudier la nature humaine, puis produire l'IA que l'humanité voudrait, avec suffisamment de temps et de perspicacité, pour arriver à une réponse satisfaisante. L'appel à un objectif à travers la nature humaine contingente (peut-être exprimée, à des fins mathématiques, sous la forme d'une fonction d'utilité ou d'un autre formalisme de la théorie de la décision), comme fournissant le critère ultime de « l'amicalité », est une réponse au problème méta-éthique de la définition d'une moralité objective ; la volition extrapolée est censée être ce que l'humanité voudrait objectivement, tout bien considéré, mais elle ne peut être définie que par rapport aux qualités psychologiques et cognitives de l'humanité actuelle, non extrapolée.
Autres approches
Steve Omohundro a proposé une approche d'« échafaudage » pour la sécurité de l'IA, dans laquelle une génération d'IA prouvablement sûre aide à construire la génération suivante prouvablement sûre. Seth Baum soutient que le développement d'une intelligence artificielle ou d'une intelligence artificielle générale sûre et socialement bénéfique est une fonction de la psychologie sociale des communautés de recherche en IA et peut donc être contraint par des mesures extrinsèques et motivé par des mesures intrinsèques. Les motivations intrinsèques peuvent être renforcées lorsque les messages résonnent avec les développeurs d'IA ; Baum soutient qu'en revanche, « les messages existants sur l'IA bénéfique ne sont pas toujours bien formulés ». Baum plaide pour des « relations coopératives et un cadrage positif des chercheurs en IA » et met en garde contre la caractérisation des chercheurs en IA comme « ne voulant pas poursuivre des conceptions bénéfiques ».
Dans son livre Human Compatible, le chercheur en IA Stuart J. Russell énumère trois principes pour guider le développement de machines bénéfiques. Il souligne que ces principes ne sont qu'un point de départ pour une nouvelle approche de l'IA qui privilégie la compatibilité humaine. Les principes se concentrent sur la garantie que l'objectif principal de la machine est la satisfaction des préférences humaines, qu'elle est incertaine quant à ces préférences et qu'elle cherche des informations pour améliorer sa compréhension de celles-ci.
Relation avec l'éthique des machines
L'IA amicale est étroitement liée à l'éthique des machines, mais les deux domaines ont des accents différents. L'éthique des machines s'intéresse au comportement moral des agents artificiels, en posant des questions comme « que devrait faire une IA dans une situation donnée ? » La recherche sur l'IA amicale, en revanche, est plus pratique, se concentrant sur la manière de concevoir et de construire des systèmes d'IA sûrs et bénéfiques dès le départ. Cela inclut des travaux sur l'alignement des valeurs, l'interprétabilité et la robustesse. Le domaine s'appuie sur des idées issues de l'intelligence artificielle, de l'apprentissage automatique et de l'apprentissage profond, et il est de plus en plus pertinent alors que des organisations comme OpenAI, Anthropic et Google DeepMind développent des systèmes d'IA avancés. Des chercheurs comme Michael Jordan et Melanie Mitchell ont contribué aux discussions sur la sécurité et l'éthique de l'IA, soulignant la nécessité d'une réflexion attentive sur les impacts sociétaux de l'IA.