MuZero est un programme informatique développé par la société de recherche en intelligence artificielle DeepMind, une filiale de Google, afin de maîtriser des jeux sans en connaître les règles ni la dynamique sous-jacente. Sa sortie en 2019 a inclus des benchmarks de ses performances au Go, aux échecs, au shogi et dans une suite de 57 jeux Atari différents. L'algorithme utilise une approche similaire à AlphaZero, où une combinaison de recherche arborescente et d'un modèle appris est déployée. Il a égalé les performances d'AlphaZero aux échecs et au shogi, amélioré ses performances au Go, et amélioré l'état de l'art dans la maîtrise d'une suite de 57 jeux Atari (l'Arcade Learning Environment), un domaine visuellement complexe.
MuZero a été entraîné par auto-apprentissage, sans accès aux règles, aux ouvertures ou aux tablebases de finales. L'algorithme entraîné utilisait la même architecture convolutive et résiduelle qu'AlphaZero, mais avec 20 % de pas de calcul en moins par nœud dans l'arbre de recherche.
Historique
Le 19 novembre 2019, l'équipe de DeepMind a publié un preprint introduisant MuZero. Ce travail s'appuie directement sur l'algorithme AlphaZero, qui avait démontré des performances surhumaines aux échecs, au shogi et au Go en combinant apprentissage automatique avec la recherche arborescente de Monte-Carlo. MuZero a étendu ce paradigme en supprimant l'exigence d'un simulateur programmé des règles du jeu.
Dérivation d'AlphaZero
MuZero (MZ) est une combinaison de l'algorithme de planification haute performance d'AlphaZero (AZ) avec des approches d'apprentissage par renforcement sans modèle. Cette combinaison permet un entraînement plus efficace dans les régimes de planification classiques, comme le Go, tout en gérant des domaines avec des entrées beaucoup plus complexes à chaque étape, comme les jeux vidéo visuels.
MuZero a été dérivé directement du code d'AZ, partageant ses règles de réglage des hyperparamètres. Les différences entre les approches incluent :
- Le processus de planification d'AZ utilise un simulateur qui connaît les règles du jeu et doit être explicitement programmé. Un réseau de neurones prédit ensuite la politique et la valeur d'une position future. La connaissance parfaite des règles du jeu est utilisée pour modéliser les transitions d'état dans l'arbre de recherche, les actions disponibles à chaque nœud et la terminaison d'une branche de l'arbre. MZ n'a pas accès aux règles et les apprend à la place avec des réseaux de neurones.
- AZ dispose d'un modèle unique pour le jeu (de l'état du plateau aux prédictions) ; MZ dispose de modèles séparés pour la représentation de l'état courant (de l'état du plateau à son plongement interne), la dynamique des états (comment les actions modifient les représentations des états du plateau) et la prédiction de la politique et de la valeur d'une position future (étant donné une représentation d'état).
- Le modèle caché de MZ peut être complexe, et il pourrait s'avérer qu'il puisse héberger des calculs ; explorer les détails du modèle caché dans une instance entraînée de MZ est un sujet d'exploration future.
- MZ ne s'attend pas à un jeu à deux joueurs où le gagnant rafle tout. Il fonctionne avec des scénarios d'apprentissage par renforcement standard, y compris des environnements à agent unique avec des récompenses intermédiaires continues, éventuellement d'une magnitude arbitraire et avec un facteur d'actualisation temporelle. AZ a été conçu pour des jeux à deux joueurs qui pouvaient être gagnés, perdus ou nuls.
Comparaison avec R2D2
La technique précédente de l'état de l'art pour apprendre à jouer à la suite de jeux Atari était R2D2, le DQN distribué à relecture récurrente. MuZero a surpassé les performances moyennes et médianes de R2D2 sur l'ensemble de la suite de jeux, bien qu'il n'ait pas fait mieux sur chaque jeu.
Entraînement et résultats
MuZero a utilisé 16 unités de traitement tensoriel (TPU) de troisième génération pour l'entraînement et 1000 TPU pour l'auto-apprentissage dans les jeux de plateau, avec 800 simulations par étape, et 8 TPU pour l'entraînement et 32 TPU pour l'auto-apprentissage dans les jeux Atari, avec 50 simulations par étape. AlphaZero utilisait 64 TPU de deuxième génération pour l'entraînement et 5000 TPU de première génération pour l'auto-apprentissage. Comme la conception des TPU s'est améliorée (les puces de troisième génération sont 2 fois plus puissantes individuellement que celles de deuxième génération, avec des progrès supplémentaires en bande passante et en interconnexion entre puces dans un pod), ces configurations d'entraînement sont comparables. R2D2 a été entraîné pendant 5 jours sur 2 millions d'étapes.
Résultats initiaux
MuZero a égalé les performances d'AlphaZero aux échecs et au shogi après environ 1 million d'étapes d'entraînement. Il a égalé les performances d'AZ au Go après 500 000 étapes et l'a surpassé après 1 million d'étapes. Il a égalé les performances moyennes et médianes de R2D2 sur la suite de jeux Atari après 500 000 étapes et l'a surpassé après 1 million d'étapes, bien qu'il n'ait jamais bien performé sur 6 jeux de la suite.
Réactions et travaux connexes
MuZero a été considéré comme une avancée significative par rapport à AlphaZero, et une étape généralisable dans les techniques d'apprentissage non supervisé. Ces travaux ont été perçus comme faisant progresser la compréhension de la manière de composer des systèmes à partir de composants plus petits, un développement au niveau des systèmes, plus qu'un simple développement d'apprentissage automatique pur.
Alors que seule la pseudocode a été publiée par l'équipe de développement, Werner Duvaud a produit une implémentation open source basée sur celle-ci. MuZero a été utilisé comme implémentation de référence dans d'autres travaux, par exemple comme moyen de générer un comportement basé sur un modèle.
Fin 2021, une variante plus efficace de MuZero a été proposée, nommée EfficientZero. Elle atteint 194,3 % de la performance humaine moyenne et 109,0 % de la performance humaine médiane sur le benchmark Atari 100k avec seulement deux heures d'expérience de jeu en temps réel. Début 2022, une variante de MuZero a été proposée pour jouer à des jeux stochastiques (par exemple 2048, backgammon), appelée Stochastic MuZero, qui utilise la dynamique des afterstates et des codes de hasard pour tenir compte de la nature stochastique de l'environnement lors de l'entraînement du réseau de dynamique.
En février 2022, DeepMind a rapporté une première application de MuZero à une tâche du monde réel, en collaboration avec YouTube pour améliorer la compression vidéo dans le codec open source VP9. Une version appelée MuZero-RC a remplacé le mécanisme de contrôle de débit par défaut de VP9, en sélectionnant le paramètre de quantification pour chaque image, et a obtenu une réduction moyenne du débit binaire de 4 % sur un ensemble diversifié de vidéos sans dégradation de la qualité.
Voir aussi
- Jeu de général
- Apprentissage non supervisé