AlphaGo es un programa informático que juega al juego de mesa Go, desarrollado por DeepMind, una empresa con sede en Londres adquirida por Google. El programa y sus algoritmos fueron descritos en un artículo publicado en la revista Nature el 27 de enero de 2016, coincidiendo con el anuncio de su victoria sobre el campeón europeo Fan Hui. Este artículo marcó un hito en la inteligencia artificial, ya que AlphaGo se convirtió en el primer programa informático en derrotar a un jugador profesional humano de Go sin handicap en un tablero completo de 19×19. La victoria fue reconocida por Science como una de las finalistas del "Avance del Año" el 22 de diciembre de 2016.
AlphaGo utiliza una combinación de aprendizaje automático y redes neuronales artificiales para evaluar posiciones del tablero y seleccionar movimientos. Emplea un algoritmo de búsqueda en árbol de Monte Carlo guiado por una red de políticas basada en aprendizaje profundo y una red de valores, entrenadas tanto mediante aprendizaje supervisado a partir de partidas humanas como mediante aprendizaje por refuerzo a partir de la autocompetición. Este enfoque permitió a AlphaGo superar los desafíos del gran factor de ramificación del Go, que había obstaculizado los métodos anteriores de inteligencia artificial.
Desarrollo y antecedentes
Se considera que el Go es mucho más difícil de dominar para las computadoras que otros juegos como el ajedrez, debido a su naturaleza estratégica y estética, que dificulta la construcción directa de una función de evaluación, y a su mucho mayor factor de ramificación, que hace prohibitivo el uso de métodos tradicionales de inteligencia artificial como la poda alfa-beta, el recorrido de árboles y la búsqueda heurística. Casi dos décadas después de que la computadora Deep Blue de IBM venciera al campeón mundial de ajedrez Garry Kasparov en 1997, los programas más fuertes de Go basados en técnicas de inteligencia artificial solo alcanzaban aproximadamente el nivel de aficionado 5.º dan, y aún no podían derrotar a un jugador profesional de Go sin handicap. En 2012, el programa Zen, ejecutándose en un clúster de cuatro PC, venció a Masaki Takemiya (9.º dan) dos veces con handicaps de cinco y cuatro piedras. En 2013, Crazy Stone venció a Yoshio Ishida (9.º dan) con un handicap de cuatro piedras.
Según David Silver, de DeepMind, el proyecto de investigación AlphaGo se formó alrededor de 2014 para probar hasta qué punto una red neuronal basada en aprendizaje profundo podía competir en el Go. AlphaGo representa una mejora significativa con respecto a los programas anteriores de Go. En 500 partidas contra otros programas disponibles, incluidos Crazy Stone y Zen, AlphaGo, ejecutándose en una sola computadora, ganó todas excepto una. En una confrontación similar, AlphaGo, ejecutándose en múltiples computadoras, ganó las 500 partidas jugadas contra otros programas, y el 77% de las partidas jugadas contra AlphaGo en una sola computadora. La versión distribuida de octubre de 2015 utilizaba 1.202 CPU y 176 GPU.
Partida contra Fan Hui
En octubre de 2015, la versión distribuida de AlphaGo derrotó al campeón europeo de Go, Fan Hui, un profesional de 2.º dan (de un máximo de 9.º dan), por cinco a cero. Esta fue la primera vez que un programa informático de Go vencía a un jugador profesional humano en un tablero completo sin handicap. El anuncio de la noticia se retrasó hasta el 27 de enero de 2016 para coincidir con la publicación del artículo en la revista Nature que describía los algoritmos utilizados.
Partida contra Lee Sedol
AlphaGo se enfrentó al jugador profesional surcoreano de Go Lee Sedol, clasificado como 9.º dan y considerado uno de los mejores jugadores de Go, en una serie de cinco partidas celebradas en el Hotel Four Seasons de Seúl, Corea del Sur, los días 9, 10, 12, 13 y 15 de marzo de 2016, que se transmitieron en vivo por video. De las cinco partidas, AlphaGo ganó cuatro y Lee ganó la cuarta, convirtiéndose así en el único jugador humano que ha derrotado a AlphaGo en sus 74 partidas oficiales. AlphaGo se ejecutó en servidores de computación en la nube de Google ubicados en Estados Unidos. La partida se disputó con reglas chinas, con un komi de 7,5 puntos, y cada jugador dispuso de dos horas de tiempo de reflexión más tres períodos de byoyomi de 60 segundos. La versión de AlphaGo que jugó contra Lee utilizó una cantidad similar de potencia de cálculo a la usada en la partida contra Fan Hui. The Economist informó que utilizaba 1.920 CPU y 280 GPU. En el momento de la partida, Lee Sedol ocupaba el segundo lugar en número de victorias en campeonatos internacionales de Go, solo por detrás del jugador surcoreano Lee Chang-ho, quien mantuvo el título mundial durante 16 años. Dado que no existe un método oficial único de clasificación en el Go internacional, los rankings pueden variar según la fuente. Si bien algunas fuentes lo clasificaban como el cuarto mejor jugador del mundo en ese momento, otras lo situaban en los primeros puestos. AlphaGo no fue entrenado específicamente para enfrentarse a Lee ni fue diseñado para competir contra jugadores humanos concretos.
Las tres primeras partidas fueron ganadas por AlphaGo tras la rendición de Lee. Sin embargo, Lee venció a AlphaGo en la cuarta partida, ganando por rendición de su oponente en el movimiento 180. AlphaGo continuó y ganó la quinta partida, también por rendición de Lee. El premio fue de 1 millón de dólares estadounidenses. Dado que AlphaGo ganó cuatro de las cinco partidas y, por tanto, la serie, el premio se donó a organizaciones benéficas, incluida UNICEF. Lee Sedol recibió 150.000 dólares por participar en las cinco partidas y 20.000 dólares adicionales por su victoria en la cuarta partida.
Consecuencias y legado
En junio de 2016, en una presentación celebrada en una universidad de los Países Bajos, Aja Huang, miembro del equipo de DeepMind, reveló que habían corregido la debilidad lógica que se manifestó durante la cuarta partida de la serie contra Lee Sedol, y que, tras el movimiento 78 (denominado el "movimiento divino" por muchos profesionales), el programa habría jugado según lo previsto y habría mantenido la ventaja de las negras. Antes del movimiento 78, AlphaGo iba ganando durante toda la partida, pero el movimiento de Lee provocó que el programa desviara su potencia de cálculo y se confundiera. Huang explicó que la red de políticas de AlphaGo evaluó mal la posición, lo que condujo a la derrota.
Consecuencias y legado
En reconocimiento a la victoria, la Asociación Coreana de Baduk otorgó a AlphaGo un 9.º dan honorífico. La preparación y la serie de partidas contra Lee Sedol quedaron documentadas en un documental titulado AlphaGo, dirigido por Greg Kohs. En la Cumbre del Futuro del Go de 2017, la versión Master de AlphaGo venció a Ke Jie, el jugador número uno del mundo en ese momento, en una serie de tres partidas, tras lo cual AlphaGo recibió el 9.º dan profesional de la Asociación China de Weiqi. Después de la serie contra Ke Jie, DeepMind retiró AlphaGo, mientras continuaba investigando en otras áreas de la inteligencia artificial. La versión autodidacta AlphaGo Zero logró una victoria de 100 a 0 contra la versión competitiva anterior de AlphaGo, y su sucesor, AlphaZero, fue considerado el mejor jugador de Go del mundo a finales de la década de 2010. AlphaZero, a su vez, fue sucedido por un programa conocido como MuZero, que aprende sin que se le enseñen las reglas. Estos sucesores, construidos sobre los mismos principios que el AlphaGo original, han influido en la investigación en DeepMind y más allá, contribuyendo a avances en inteligencia artificial generativa y otros campos.