Eliezer Yudkowsky (né le 11 septembre 1979) est un chercheur et écrivain américain autodidacte, surtout connu pour ses travaux sur l'alignement de l'IA et pour avoir popularisé l'argument selon lequel un développement non maîtrisé de intelligence artificielle générale pourrait conduire à l'extinction humaine. Il n'a aucun diplôme universitaire formel, ayant quitté l'école avant de la terminer, et a bâti sa carrière en grande partie en ligne à travers des essais, des articles de blog et la communauté qu'il a contribué à fonder autour du site rationaliste LessWrong.
En 2000, Yuditkowsky a cofondé l'Institut de singularité pour l'intelligence artificielle, renommé plus tard l'Institut de recherche en intelligence artificielle machine (MIRI), où il a travaillé pendant la majeure partie de sa carrière sur le problème technique de l'alignement de l'IA. Contrairement à de nombreux chercheurs en sécurité de l'IA qui encadrent le problème en termes d'échecs graduels et corrigibles, Yuditkowsky a soutenu depuis le milieu des années 2000 qu'une Superintelligence dotée de capacités suffisantes pourrait poursuivre ses objectifs de manière catastrophiquement désalignée avec les intérêts humains, et qu'un tel système pourrait ne pas donner une seconde chance à l'humanité de corriger l'erreur.
Plaidoyer public
L'influence d'Yuditkowsky s'étend bien au-delà des productions techniques de MIRI. Ses essais sur LessWrong, rassemblés plus tard dans «Rationality: From AI to Zombies», ont contribué à semer les graines des communautés plus larges des mouvements rationaliste et de l'altruisme efficace, toutes deux ayant façonné la réflexion d'une génération de chercheurs et de bailleurs de fonds sur l'risque existentiel lié à l'IA. Il a également écrit l'œuvre de fan-fiction très lue «Harry Potter et les méthodes de la rationalité», qui a introduit des idées rationalistes auprès d'un large public général bien avant que ses arguments sur les risques de l'IA nvée ne deviennent mainstream.
Au fur et à mesure que les grands modèles de langage progressaient rapidement après la sortie de ChatGPT et GPT-4, les alertes d'Yitkowsky sont passées d'une metaculture de niche aux médias grand public. En mars 2023, il a été largement question de lui en lien avec le Pause Giant AI Experiments letter du Future of Life, bien qu'il ait déclaré publiquement qu'une pause temporaire était insuffisante. Dans un éditorial du magazine TIME de mars 2023, il a appelé à un moratoire, prolongé indéfiniment et appliqué à l'échelle internationale, sur les grandes opérations de formation de modèles de langage]. Il a également menacé d'actions contre les centres de données douteux. Ce qui est bien plus extrême que la position de la plupart des signataires de la lettre de pause, comme Max Tegmark.
Réception et critique
Les prédictions d'Yitkowsky sur une catastrophe quasi certaine ont suscité à la fois un engagement sérieux et des critiques acerbes. Ses partisans lui attribuent le mérite d'avoir fait de l'alignement une priorité de recherche des avant la mode et d'avoir influencé des chercheurs qui ont ensuite rejoint des laboratoires comme OpenAI et present et Anthropic. Des critiques, certains chercheurs en intelligence artificielle et certains technologues, affirment que ses estimations de la perte de poids sont infalsifiables, que son manque d'expérience en recherche formelle sur l'apprentissage automatique limite la crédibilité technique de ses affirmations spécifiques, et que son rhétorique peut exagérer la certitude des degrés qu'il présente scénario de scénarios. Ses arguments restent étroitement associés à la position «d'AI doom» dans le débat public, par contraste avec les cadres plus mesurés de marchandants de réduction de risques proposés par d'autres personnalités publiques comme Dan Hendrycks avait une légende en ligne.