Traduit de l'anglais

Richard Sutton est un informaticien canado-américain considéré comme un fondateur de l'apprentissage par renforcement moderne, connu pour l'apprentissage par différence temporelle, l'essai [[the-bitter-lesson|The Bitter Lesson]], et le prix Turing 2024.

Richard Sutton est un informaticien largement reconnu comme l'un des fondateurs de l'apprentissage par renforcement moderne, la branche de l'apprentissage automatique qui s'intéresse aux agents apprenant par essais et erreurs à partir de signaux de récompense.

Carrière et contributions

Sutton a obtenu un doctorat en informatique à l'Université du Massachusetts à Amherst en 1984, travaillant avec Andrew Barto, avec qui il a développé l'apprentissage par différence temporelle (TD), une méthode pour mettre à jour les estimations de valeur basée sur la différence entre des prédictions successives plutôt que d'attendre un résultat final. L'apprentissage TD est devenu l'une des idées algorithmiques centrales de l'apprentissage par renforcement, plus tard combiné avec l'approximation de fonction par réseaux de neurones dans des systèmes allant du TD-Gammon de Gerald Tesauro, jouant au backgammon dans les années 1990, à AlphaGo et ses successeurs développés des décennies plus tard chez Google DeepMind par des chercheurs comme David Silver, qui a étudié sous Sutton. Le manuel de Sutton et Barto, Reinforcement Learning: An Introduction, publié pour la première fois en 1998, reste la référence standard dans le domaine.

Sutton a passé une grande partie de sa carrière ultérieure en tant que professeur à l'Université de l'Alberta et en tant que chercheur scientifique distingué au laboratoire Alberta de Google DeepMind, et il sert de conseiller scientifique principal à l'Institut Alberta d'intelligence artificielle (Amii), l'un des pôles qui ont aidé à établir le Canada comme un centre de recherche en apprentissage par renforcement.

« La leçon amère »

En 2019, Sutton a publié un court essai largement discuté intitulé « The Bitter Lesson » (La leçon amère), arguant que, dans l'histoire de la recherche en IA, les méthodes généralistes qui exploitent une puissance de calcul croissante, comme la recherche et l'apprentissage, ont constamment surpassé les approches reposant sur l'encodage manuel de connaissances humaines spécifiques au domaine, et que les chercheurs résistent à cette leçon parce qu'elle peut sembler être un abandon de la compréhension. L'essai est devenu une référence dans les débats sur les lois de mise à l'échelle et la conception des systèmes de grands modèles de langage, souvent invoqué pour justifier la priorité donnée à l'échelle et aux algorithmes généraux plutôt qu'aux heuristiques artisanales, et il est souvent lu en parallèle avec des travaux plus récents sur le calcul au moment du test et les systèmes de modèles de raisonnement qui utilisent un entraînement de type apprentissage par renforcement sur des tâches vérifiables.

Sutton a partagé le prix Turing 2024 avec Andrew Barto « pour avoir développé les fondements conceptuels et algorithmiques de l'apprentissage par renforcement », une reconnaissance survenue alors que les techniques d'apprentissage par renforcement, y compris le RLHF, étaient devenues centrales non seulement pour les systèmes de jeu, mais aussi pour aligner le comportement de l'IA conversationnelle moderne.

Catégories:reinforcement-learning·history-of-ai·academia
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique