AlphaGo est un programme informatique qui joue au jeu de plateau Go, développé par DeepMind Technologies, basé à Londres, une filiale acquise de Google. Le programme et ses algorithmes ont été décrits dans un article publié dans la revue Nature le 27 janvier 2016, coïncidant avec l'annonce de sa victoire sur le champion européen Fan Hui. Cet article a marqué une étape importante dans l'intelligence artificielle, car AlphaGo est devenu le premier programme informatique de Go à battre un joueur professionnel humain sans handicap sur un plateau complet de 19×19. Cette victoire a été reconnue par Science comme l'une des finalistes de la percée de l'année le 22 décembre 2016.
AlphaGo utilise une combinaison de apprentissage automatique et de réseaux neuronaux artificiels pour évaluer les positions du plateau et sélectionner les coups. Il emploie un algorithme de recherche arborescente de Monte Carlo guidé par un réseau de politiques d'apprentissage profond et un réseau de valeurs, entraînés à la fois par apprentissage supervisé à partir de parties humaines et par apprentissage par renforcement à partir de l'auto-jeu. Cette approche a permis à AlphaGo de surmonter les défis du grand facteur de branchement du Go, qui avait entravé les méthodes antérieures d'intelligence artificielle.
Développement et contexte
Le Go est considéré comme beaucoup plus difficile à gagner pour les ordinateurs que d'autres jeux comme les échecs, car sa nature stratégique et esthétique rend difficile la construction directe d'une fonction d'évaluation, et son facteur de branchement beaucoup plus grand rend prohibitif l'utilisation de méthodes d'IA traditionnelles telles que l'élagage alpha-bêta, le parcours d'arbre et la recherche heuristique. Près de deux décennies après que l'ordinateur Deep Blue d'IBM a battu le champion du monde d'échecs Garry Kasparov lors du match de 1997, les programmes de Go les plus puissants utilisant des techniques d'intelligence artificielle n'atteignaient qu'environ le niveau amateur 5-dan, et ne pouvaient toujours pas battre un joueur professionnel de Go sans handicap. En 2012, le logiciel Zen, fonctionnant sur un cluster de quatre PC, a battu Masaki Takemiya (9p) deux fois avec des handicaps de cinq et quatre pierres. En 2013, Crazy Stone a battu Yoshio Ishida (9p) avec un handicap de quatre pierres.
Selon David Silver de DeepMind, le projet de recherche AlphaGo a été formé vers 2014 pour tester comment un réseau neuronal utilisant le apprentissage profond peut rivaliser au Go. AlphaGo représente une amélioration significative par rapport aux programmes de Go précédents. Sur 500 parties contre d'autres programmes de Go disponibles, y compris Crazy Stone et Zen, AlphaGo fonctionnant sur un seul ordinateur a gagné toutes sauf une. Dans un match similaire, AlphaGo fonctionnant sur plusieurs ordinateurs a gagné les 500 parties jouées contre d'autres programmes de Go, et 77 % des parties jouées contre AlphaGo fonctionnant sur un seul ordinateur. La version distribuée en octobre 2015 utilisait 1 202 CPU et 176 GPU.
Match contre Fan Hui
En octobre 2015, la version distribuée d'AlphaGo a vaincu le champion européen de Go Fan Hui, un professionnel 2-dan (sur 9 dan possibles), cinq à zéro. C'était la première fois qu'un programme informatique de Go battait un joueur professionnel humain sur un plateau complet sans handicap. L'annonce de la nouvelle a été retardée jusqu'au 27 janvier 2016 pour coïncider avec la publication de l'article dans la revue Nature décrivant les algorithmes utilisés.
Match contre Lee Sedol
AlphaGo a joué contre le joueur professionnel sud-coréen de Go Lee Sedol, classé 9-dan, l'un des meilleurs joueurs de Go, avec cinq parties se déroulant à l'hôtel Four Seasons à Séoul, en Corée du Sud, les 9, 10, 12, 13 et 15 mars 2016, diffusées en direct en vidéo. Sur cinq parties, AlphaGo a gagné quatre parties et Lee a gagné la quatrième, ce qui en fait le seul joueur humain ayant battu AlphaGo dans toutes ses 74 parties officielles. AlphaGo fonctionnait sur le cloud computing de Google avec ses serveurs situés aux États-Unis. Le match utilisait les règles chinoises avec un komi de 7,5 points, et chaque camp avait deux heures de temps de réflexion plus trois périodes de byoyomi de 60 secondes. La version d'AlphaGo jouant contre Lee utilisait une puissance de calcul similaire à celle utilisée lors du match contre Fan Hui. The Economist a rapporté qu'elle utilisait 1 920 CPU et 280 GPU. Au moment du jeu, Lee Sedol avait le deuxième plus grand nombre de victoires en championnat international de Go au monde après le joueur sud-coréen Lee Chang-ho, qui a détenu le titre de champion du monde pendant 16 ans. Comme il n'existe pas de méthode officielle unique de classement au Go international, les classements peuvent varier selon les sources. Bien qu'il ait parfois été classé premier, certaines sources le classaient comme le quatrième meilleur joueur du monde à l'époque. AlphaGo n'a pas été spécifiquement entraîné pour affronter Lee ni conçu pour rivaliser avec des joueurs humains spécifiques.
Les trois premières parties ont été gagnées par AlphaGo suite aux abandons de Lee. Cependant, Lee a battu AlphaGo dans la quatrième partie, gagnant par abandon au coup 180. AlphaGo a ensuite continué à obtenir une quatrième victoire, gagnant la cinquième partie par abandon. Le prix était de 1 million de dollars américains. Comme AlphaGo a gagné quatre sur cinq et donc la série, le prix a été donné à des œuvres de charité, y compris l'UNICEF. Lee Sedol a reçu 150 000 $ pour sa participation aux cinq parties et 20 000 $ supplémentaires pour sa victoire dans la partie 4.
En juin 2016, lors d'une présentation tenue dans une université aux Pays-Bas, Aja Huang, membre de l'équipe DeepMind, a révélé qu'ils avaient corrigé la faiblesse logique survenue lors de la 4e partie du match entre AlphaGo et Lee, et qu'après le coup 78 (surnommé le « coup divin » par de nombreux professionnels), il jouerait comme prévu et maintiendrait l'avantage de Noir. Avant le coup 78, AlphaGo menait tout au long de la partie, mais le coup de Lee a détourné et confondu les capacités de calcul du programme. Huang a expliqué que le réseau de politiques d'AlphaGo avait mal évalué la position, conduisant à la défaite.
Conséquences et héritage
En reconnaissance de la victoire, AlphaGo a reçu un 9-dan honorifique de l'Association coréenne de Baduk. La préparation et le match de défi contre Lee Sedol ont été documentés dans un film documentaire également intitulé AlphaGo, réalisé par Greg Kohs. Lors du sommet Future of Go 2017, la version Master d'AlphaGo a battu Ke Jie, le joueur numéro un mondial à l'époque, dans un match de trois parties, après quoi AlphaGo a reçu le 9-dan professionnel de l'Association chinoise de Weiqi. Après le match entre AlphaGo et Ke Jie, DeepMind a retiré AlphaGo, tout en poursuivant la recherche en IA dans d'autres domaines. L'AlphaGo Zero autodidacte a obtenu une victoire de 100 à 0 contre la version compétitive précoce d'AlphaGo, et son successeur AlphaZero a été perçu comme le meilleur joueur mondial de Go à la fin des années 2010. AlphaZero a à son tour été remplacé par un programme connu sous le nom de MuZero qui apprend sans qu'on lui enseigne les règles. Ces successeurs, construits sur les mêmes principes que l'AlphaGo original, ont influencé la recherche chez DeepMind et au-delà, contribuant aux avancées dans le IA générative et d'autres domaines.