AlphaGo Zero est un programme informatique développé par Google DeepMind qui joue au jeu de plateau Go. Il s'agit d'un système basé sur un réseau de neurones qui a appris à jouer au Go entièrement par auto-jeu, sans aucune donnée de parties humaines ni connaissance préalable au-delà des règles de base du jeu. Publié en octobre 2017, il a surpassé les performances de son prédécesseur, AlphaGo, qui avait battu les meilleurs joueurs humains, et a établi une nouvelle référence pour l'intelligence artificielle dans les jeux de stratégie complexes.
Contrairement aux versions antérieures d'AlphaGo, qui étaient initialement entraînées sur des milliers de parties humaines amateurs et professionnelles, AlphaGo Zero a commencé avec une page blanche. Il utilisait un seul réseau de neurones entraîné par apprentissage par renforcement, jouant des millions de parties contre lui-même. Cette approche a démontré qu'un système peut atteindre des performances surhumaines dans un domaine sans s'appuyer sur l'expertise humaine, une étape importante dans la recherche en apprentissage profond.
Architecture et entraînement
L'architecture d'AlphaGo Zero était plus simple et plus efficace que celle de ses prédécesseurs. Il utilisait un seul réseau de neurones profond avec des blocs résiduels, une conception inspirée de ResNet, pour évaluer les positions du plateau et sélectionner les coups. Le réseau était entraîné en combinant des sorties de politique et de valeur, où la tête de politique prédisait la probabilité de chaque coup et la tête de valeur estimait le résultat attendu de la partie à partir de la position actuelle.
L'entraînement se déroulait par auto-jeu, où la version actuelle du réseau jouait contre elle-même pour générer des données de parties. Le réseau était mis à jour à l'aide d'une variante de l'optimiseur descente de gradient stochastique, spécifiquement l'optimiseur Adam, avec un programme de taux d'apprentissage qui diminuait au fil du temps. Le système utilisait également une augmentation de données en faisant pivoter et en reflétant les positions du plateau pour accroître la diversité des exemples d'entraînement. Ce processus était répété sur des millions de parties, le réseau améliorant continuellement son jeu.
Performances et résultats
Dans une série d'expériences, AlphaGo Zero a obtenu des résultats remarquables. Après seulement 72 heures d'entraînement par auto-jeu, il a pu vaincre la version précédemment publiée AlphaGo Lee, celle qui avait battu le champion du monde Lee Sedol en 2016, avec un score de 100 parties à 0. Après environ 40 jours d'entraînement, il a surpassé AlphaGo Master, une version plus forte qui avait battu les meilleurs professionnels début 2017. La version finale d'AlphaGo Zero, entraînée pendant environ 40 jours, a été évaluée comme plus forte que toutes les versions précédentes d'AlphaGo, avec un classement Elo estimé à plus de 5000, contre environ 4800 pour AlphaGo Master.
Ces résultats ont montré qu'un système entraîné sans connaissance humaine pouvait non seulement égaler, mais dépasser les performances de systèmes entraînés sur des parties humaines. L'approche par auto-jeu s'est également révélée plus efficace sur le plan computationnel, utilisant moins de ressources que les versions antérieures.
Importance et impact
Le succès d'AlphaGo Zero a eu des implications profondes pour le domaine de l'IA. Il a démontré que l'apprentissage par renforcement, combiné à des réseaux de neurones profonds, pouvait résoudre des problèmes complexes sans avoir besoin de données d'entraînement générées par l'homme. Cela était particulièrement notable dans un jeu comme le Go, qui possède un espace de recherche énorme et a longtemps été considéré comme un défi majeur pour l'IA.
L'approche utilisée dans AlphaGo Zero a influencé les recherches ultérieures en apprentissage automatique, y compris des applications au-delà des jeux. Elle a mis en évidence le potentiel de l'auto-jeu et de l'apprentissage par curriculum dans l'entraînement d'agents, et a contribué au développement d'algorithmes d'apprentissage par renforcement plus généraux. Les principes ont été appliqués à d'autres domaines, tels que les modèles génératifs et la robotique, bien qu'avec des degrés de succès variables.
Héritage et orientations futures
AlphaGo Zero a été une réalisation clé dans l'histoire de DeepMind et de la recherche en IA. Il a été suivi par AlphaZero, une version plus générale capable de jouer également aux échecs et au shogi, démontrant encore davantage la polyvalence de l'approche par auto-jeu. Les idées d'AlphaGo Zero ont été intégrées dans d'autres systèmes d'IA et continuent d'informer la recherche sur les réseaux de neurones et l'apprentissage par renforcement.
Le programme a également soulevé des questions sur la nature de l'expertise humaine et le potentiel de l'IA à découvrir des stratégies novatrices. Dans ses parties, AlphaGo Zero a parfois effectué des coups non conventionnels selon les normes humaines, suggérant que l'IA peut trouver des solutions que les humains n'ont pas envisagées. Cela a suscité des discussions sur le rôle de l'IA dans la découverte scientifique et la résolution de problèmes.
Au début des années 2020, les techniques pionnières d'AlphaGo Zero restent influentes, et le système est souvent cité comme un exemple marquant de ce qui est possible avec le apprentissage profond moderne et l'apprentissage par renforcement. Son héritage se manifeste dans le développement continu de systèmes d'IA plus performants dans divers domaines.
Voir aussi
Références
- Silver, D., et al. (2017). "Mastering the game of Go without human knowledge." Nature, 550, 354-359.
- Silver, D., et al. (2018). "A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play." Science, 362, 1140-1144.