AlphaGo es un programa informático desarrollado por DeepMind para jugar al juego de mesa Go, un juego considerado durante mucho tiempo un gran desafío sin resolver para la inteligencia artificial debido a su vasto espacio de búsqueda, mucho mayor que el del ajedrez, lo que hacía inviables computacionalmente los enfoques de fuerza bruta como los utilizados en Deep Blue. AlphaGo combinó redes neuronales profundas con la búsqueda de árbol de Monte Carlo, utilizando redes entrenadas tanto con partidas de expertos humanos como con aprendizaje por refuerzo mediante auto-juego para evaluar posiciones del tablero y seleccionar movimientos.
La partida contra Lee Sedol
AlphaGo alcanzó fama internacional a través de su partida de 2016 contra Lee Sedol, uno de los jugadores profesionales de Go más fuertes del mundo, celebrada en Seúl, Corea del Sur, del 9 al 15 de marzo de 2016. AlphaGo ganó la partida al mejor de cinco juegos por 4 a 1, un resultado que sorprendió a gran parte de las comunidades del Go y la IA, que generalmente esperaban que el dominio humano del Go se mantuviera frente a las máquinas durante al menos otra década dada la complejidad del juego. La partida se transmitió a nivel mundial y fue vista por un estimado de 200 millones de personas, convirtiéndose en una de las demostraciones públicas más visibles de la capacidad de la IA hasta ese momento, posiblemente el momento en que el aprendizaje profundo entró en la conciencia pública general de la misma manera que el lanzamiento de ChatGPT lo haría siete años después.
Movimiento 37
La segunda partida del encuentro produjo un momento que se volvió emblemático de la novedad de AlphaGo: en el movimiento 37, AlphaGo jugó una piedra en la quinta línea del tablero que los comentaristas profesionales y el propio Lee Sedol consideraron inicialmente muy inusual, incluso un posible error, ya que contradecía siglos de estrategia humana acumulada en el Go. El movimiento resultó más tarde fundamental para la victoria de AlphaGo en esa partida, y fue ampliamente citado después como evidencia de que el sistema había derivado una visión estratégica genuinamente novedosa en lugar de simplemente imitar o interpolar entre el juego humano, una afirmación que los análisis posteriores de las estimaciones internas de probabilidad de movimientos del sistema respaldaron en gran medida. El movimiento 37 se convirtió en un ejemplo frecuentemente citado, tanto en la investigación de IA como en la divulgación, de un sistema de aprendizaje automático que produce una resolución de problemas creativa y no humana.
Predecesor de AlphaZero
El entrenamiento de AlphaGo se basó inicialmente en un gran conjunto de datos de partidas de expertos humanos registradas para iniciar su red de políticas antes de que el aprendizaje por refuerzo mediante auto-juego lo refinara aún más. Posteriormente, DeepMind desarrolló AlphaGo Zero, anunciado en 2017, que aprendió Go puramente a través del auto-juego desde una inicialización aleatoria, sin utilizar ningún dato de partidas humanas, y que superó la fuerza de juego del AlphaGo original. Esta línea de investigación condujo directamente a AlphaZero, una generalización del mismo enfoque de auto-juego al ajedrez y al shogi, además del Go, lanzada más tarde en 2017.
Recepción y legado
La victoria de AlphaGo sobre Lee Sedol es ampliamente considerada un hito en la historia de la IA, comparable en importancia cultural a la derrota de Garry Kasparov por parte de Deep Blue en 1997 en el ajedrez, pero se distingue por la dependencia de AlphaGo del reconocimiento de patrones aprendido en lugar de la búsqueda exhaustiva, lo que refleja el cambio en la investigación de la IA de los métodos simbólicos y de fuerza bruta hacia los enfoques basados en el aprendizaje profundo. Lee Sedol se retiró de la competición profesional de Go en 2019, citando en parte la sensación de que la IA se había vuelto imbatible en el juego, y comentando que ni siquiera como el mejor jugador podía derrotar a "una entidad que no puede ser derrotada". El programa de investigación de AlphaGo de DeepMind se cita con frecuencia junto con AlphaFold como evidencia de la estrategia más amplia de DeepMind de aplicar el aprendizaje por refuerzo y el aprendizaje profundo a problemas bien definidos y previamente intratables.