Traduit de l'anglais

Informaticien américain connu pour ses systèmes d'IA capables de jouer au poker et à Diplomacy à un niveau surhumain, qui a ensuite dirigé la recherche sur le raisonnement chez OpenAI, à l'origine du modèle o1.

Noam Brown est un informaticien américain connu pour avoir développé des systèmes de jeu capables de battre les meilleurs professionnels humains dans des jeux longtemps considérés comme résistants à l'IA, et pour avoir ensuite dirigé des recherches sur les modèles de raisonnement chez OpenAI.

Brown a obtenu son doctorat à l'Université Carnegie Mellon, où il a travaillé avec Tuomas Sandholm sur des agents de poker. Leur système Libratus a battu les meilleurs joueurs professionnels au Texas hold'em sans limite en tête-à-tête en 2017, et un successeur, Pluribus, a battu plusieurs professionnels simultanément au poker à six joueurs en 2019, un résultat notable car il impliquait plus de deux agents concurrents à la fois, un cadre multi-agents bien plus difficile que les jeux à somme nulle à deux joueurs que l'IA avait précédemment maîtrisés, comme les échecs ou le go.

Diplomatie et CICERO

Après avoir rejoint Meta AI (alors Facebook AI Research), Brown a contribué à diriger l'équipe derrière CICERO, un système qui jouait au jeu de société Diplomacy, lequel exige une négociation en langage naturel, de la persuasion et une planification stratégique entre joueurs humains. Publié dans Science en 2022, CICERO combinait un modèle de langage pour générer des dialogues avec un moteur de raisonnement stratégique, et atteignait un niveau de performance humain dans les ligues de Diplomacy en ligne, une étape souvent citée comme preuve que l'IA pouvait gérer un raisonnement social coopératif et adversarial, et pas seulement des jeux adversariaux avec information parfaite.

Passage à OpenAI et o1

Brown a rejoint OpenAI en 2023, où il a travaillé sur le calcul au moment du test, l'idée que la réponse d'un modèle peut être améliorée en le laissant « réfléchir » plus longtemps au moment de l'inférence plutôt qu'en augmentant uniquement l'entraînement. Ces travaux ont alimenté OpenAI o1, sorti en 2024, qui utilisait un raisonnement en chaîne de pensée étendu, entraîné par apprentissage par renforcement, pour améliorer les performances en mathématiques, en programmation et en logique. Brown a soutenu publiquement que l'augmentation du calcul au moment du test représente un deuxième axe de progrès de l'IA, parallèlement à l'augmentation des données et des paramètres de pré-entraînement, établissant une analogie avec ses propres agents de poker qui s'amélioraient considérablement lorsqu'ils disposaient de plus de temps pour chercher avant d'agir, plutôt que seulement plus d'entraînement.

Reconnaissance

Les travaux de Brown sur le poker et Diplomacy ont été largement couverts comme preuve que les techniques d'IA basées sur la théorie des jeux se généralisent au-delà des jeux de société étroits, dans des contextes impliquant des informations cachées, la négociation et de nombreux agents simultanés, des thèmes qui réapparaissent dans ses recherches ultérieures sur le raisonnement. Il est devenu l'une des voix de recherche les plus visibles expliquant la feuille de route de raisonnement d'OpenAI lors de conférences et d'interviews publiques, présentant souvent l'augmentation du calcul au moment du test comme complémentaire, plutôt que comme un remplacement, des gains continus issus de plus grandes exécutions de pré-entraînement.

Catégories:ai-industry·reasoning-models·game-playing-ai
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique