Traduit de l'anglais

Un système d'apprentissage par renforcement développé par DeepMind, annoncé en décembre 2017, qui a appris à jouer aux échecs, au shogi et au jeu de Go à un niveau surhumain uniquement par auto-jeu, sans utiliser aucune donnée de jeu humaine.

AlphaZero est un système de apprentissage par renforcement développé par DeepMind qui a appris à jouer aux échecs, au shogi et au go à des niveaux surhumains en utilisant un algorithme généraliste unique et sans données de jeu générées par des humains. DeepMind a annoncé AlphaZero dans un article publié en décembre 2017, décrivant un système qui, à partir uniquement des règles de chaque jeu, apprenait entièrement par auto-jeu, en utilisant un réseau de neurones profond combiné à une recherche arborescente de Monte Carlo pour évaluer les positions et sélectionner les coups, puis en améliorant ce réseau grâce aux résultats des parties jouées contre lui-même.

Relation avec AlphaGo

AlphaZero a généralisé l'approche d'auto-jeu démontrée pour la première fois par AlphaGo Zero, la version de AlphaGo qui avait appris le go purement par auto-jeu sans données de jeu humaines, à d'autres jeux. Là où AlphaGo et AlphaGo Zero étaient spécialisés uniquement pour le go, AlphaZero a utilisé la même architecture sous-jacente et la même procédure d'entraînement, sans réglage spécifique au jeu au-delà des règles elles-mêmes, pour atteindre des performances surhumaines aux échecs et au shogi également, démontrant que l'approche d'apprentissage par renforcement par auto-jeu n'était pas un artifice spécifique au go, mais une méthode véritablement générale pour maîtriser les jeux d'information parfaite.

Résultat aux échecs

Le résultat d'AlphaZero aux échecs a attiré une attention particulière au sein des communautés de l'IA et des échecs, car les échecs avaient une histoire beaucoup plus longue de développement de moteurs informatiques que le go, dominée pendant deux décennies par des moteurs traditionnels utilisant une recherche par force brute profonde et réglée manuellement, le plus célèbre étant Stockfish. Après seulement quatre heures d'entraînement par auto-jeu, sans utiliser de livres d'ouvertures, de bases de table de finales ou d'autres connaissances humaines spécifiques aux échecs au-delà des règles de base, AlphaZero a vaincu Stockfish lors d'un match de 100 parties. Les commentateurs, y compris des grands maîtres qui ont examiné les parties, ont noté que le jeu d'AlphaZero aux échecs affichait un style distinctif, privilégiant la mobilité des pièces à long terme et la sécurité du roi plutôt que les heuristiques de comptage de matériel intégrées dans les moteurs traditionnels, et faisait fréquemment des sacrifices qui produisaient des avantages positionnels durables plutôt qu'un gain matériel immédiat, un style que certains ont décrit comme plus intuitif ou esthétiquement frappant que celui des moteurs précédents.

Importance

La démonstration par AlphaZero qu'un seul algorithme d'apprentissage par renforcement par auto-jeu pouvait maîtriser plusieurs jeux distincts d'information parfaite sans ingénierie spécifique au domaine a été considérée comme une étape importante vers des systèmes d'apprentissage plus généralistes, bien qu'AlphaZero soit resté limité aux jeux entièrement observables, déterministes et à deux joueurs, et ne se soit pas étendu au type de tâches ouvertes et réelles associées à l'intelligence artificielle générale. Son architecture et sa méthodologie d'entraînement par auto-jeu ont influencé les recherches ultérieures de DeepMind, notamment MuZero, un système de suivi qui a appris à jouer à des jeux, y compris ceux dont les règles sont inconnues, en apprenant un modèle du monde interne de l'environnement plutôt qu'en recevant directement les règles. Les parties d'échecs d'AlphaZero ont ensuite été étudiées de manière approfondie par des joueurs professionnels et des développeurs de moteurs, et certaines de ses tendances stylistiques ont influencé la conception et l'évaluation des moteurs d'échecs ultérieurs, y compris des moteurs open source basés sur des réseaux de neurones qui ont adopté des méthodes d'entraînement par auto-jeu similaires.

Réception

AlphaZero est largement cité dans la recherche en IA comme une démonstration marquante de la puissance de l'apprentissage par renforcement par auto-jeu combiné à des réseaux de neurones profonds et à la recherche, prolongeant l'importance des résultats antérieurs d'AlphaGo, y compris sa victoire de 2016 contre Lee Sedol, et renforçant le récit de recherche plus large de DeepMind selon lequel des algorithmes d'apprentissage généraux, avec une puissance de calcul suffisante, pouvaient égaler ou dépasser des décennies de connaissances humaines et d'ingénierie manuelle accumulées dans des domaines bien définis.

Catégories:reinforcement-learning·history-of-ai·games
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique