Traducido del inglés

MuZero es un algoritmo de aprendizaje por refuerzo de DeepMind que domina juegos de tablero y juegos de Atari sin conocer sus reglas, utilizando un modelo aprendido combinado con búsqueda basada en árboles. Publicado en 2019, igualó o superó a los sistemas de última generación anteriores en ajedrez, shogi, Go y benchmarks de Atari.

MuZero es un programa informático desarrollado por la empresa de investigación en inteligencia artificial DeepMind, una subsidiaria de Google, para dominar juegos sin conocer sus reglas ni su dinámica subyacente. Su publicación en 2019 incluyó puntos de referencia de su rendimiento en Go, ajedrez, shogi y un conjunto de 57 juegos diferentes de Atari. El algoritmo utiliza un enfoque similar al de AlphaZero, en el que se emplea una combinación de búsqueda basada en árboles y un modelo aprendido. Igualó el rendimiento de AlphaZero en ajedrez y shogi, mejoró su rendimiento en Go y superó el estado del arte en el dominio de un conjunto de 57 juegos de Atari (el Arcade Learning Environment), un dominio visualmente complejo.

MuZero fue entrenado mediante auto-juego, sin acceso a las reglas, libros de aperturas ni bases de datos de finales de partida. El algoritmo entrenado utilizó la misma arquitectura convolucional y residual que AlphaZero, pero con un 20 por ciento menos de pasos de cálculo por nodo en el árbol de búsqueda.

Historia

El 19 de noviembre de 2019, el equipo de DeepMind publicó un preprint que presentaba MuZero. El trabajo se basaba directamente en el algoritmo AlphaZero, que había demostrado un rendimiento sobrehumano en ajedrez, shogi y Go al combinar aprendizaje automático con la búsqueda de árboles de Monte Carlo. MuZero amplió este paradigma eliminando el requisito de un simulador programado de las reglas del juego.

Derivación de AlphaZero

MuZero (MZ) es una combinación de la planificación de alto rendimiento del algoritmo AlphaZero (AZ) con enfoques de aprendizaje por refuerzo sin modelo. La combinación permite un entrenamiento más eficiente en regímenes de planificación clásicos, como Go, al tiempo que maneja dominios con entradas mucho más complejas en cada etapa, como los videojuegos visuales.

MuZero se derivó directamente del código de AZ, compartiendo sus reglas para el establecimiento de hiperparámetros. Las diferencias entre los enfoques incluyen:

  • El proceso de planificación de AZ utiliza un simulador que conoce las reglas del juego y debe ser programado explícitamente. Una red neuronal predice entonces la política y el valor de una posición futura. El conocimiento perfecto de las reglas del juego se utiliza para modelar las transiciones de estado en el árbol de búsqueda, las acciones disponibles en cada nodo y la terminación de una rama del árbol. MZ no tiene acceso a las reglas y, en su lugar, aprende una con redes neuronales.
  • AZ tiene un único modelo para el juego (del estado del tablero a las predicciones); MZ tiene modelos separados para la representación del estado actual (del estado del tablero a su incrustación interna), la dinámica de los estados (cómo las acciones cambian las representaciones de los estados del tablero) y la predicción de la política y el valor de una posición futura (dada la representación de un estado).
  • El modelo oculto de MZ puede ser complejo y podría albergar cómputo; explorar los detalles del modelo oculto en una instancia entrenada de MZ es un tema para exploración futura.
  • MZ no espera un juego de dos jugadores donde el ganador se lo lleva todo. Funciona con escenarios estándar de aprendizaje por refuerzo, incluidos entornos de un solo agente con recompensas intermedias continuas, posiblemente de magnitud arbitraria y con descuento temporal. AZ fue diseñado para juegos de dos jugadores que podían ganarse, empatarse o perderse.

Comparación con R2D2

La técnica anterior del estado del arte para aprender a jugar el conjunto de juegos de Atari era R2D2, el Recurrent Replay Distributed DQN. MuZero superó tanto el rendimiento medio como la mediana de R2D2 en el conjunto de juegos, aunque no lo hizo mejor en todos los juegos.

Entrenamiento y resultados

MuZero utilizó 16 unidades de procesamiento tensorial (TPU) de tercera generación para el entrenamiento y 1000 TPU para el auto-juego en juegos de tablero, con 800 simulaciones por paso, y 8 TPU para el entrenamiento y 32 TPU para el auto-juego en juegos de Atari, con 50 simulaciones por paso. AlphaZero utilizó 64 TPU de segunda generación para el entrenamiento y 5000 TPU de primera generación para el auto-juego. Como el diseño de las TPU ha mejorado (los chips de tercera generación son 2 veces más potentes individualmente que los de segunda generación, con nuevos avances en ancho de banda y redes entre chips en un pod), estos son entornos de entrenamiento comparables. R2D2 fue entrenado durante 5 días a través de 2 millones de pasos de entrenamiento.

Resultados iniciales

MuZero igualó el rendimiento de AlphaZero en ajedrez y shogi después de aproximadamente 1 millón de pasos de entrenamiento. Igualó el rendimiento de AZ en Go después de 500.000 pasos de entrenamiento y lo superó en 1 millón de pasos. Igualó el rendimiento medio y la mediana de R2D2 en el conjunto de juegos de Atari después de 500 mil pasos de entrenamiento y lo superó en 1 millón de pasos, aunque nunca tuvo un buen rendimiento en 6 juegos del conjunto.

Reacciones y trabajos relacionados

MuZero fue visto como un avance significativo sobre AlphaZero y un paso generalizable en las técnicas de aprendizaje no supervisado. El trabajo se consideró un avance en la comprensión de cómo componer sistemas a partir de componentes más pequeños, un desarrollo a nivel de sistemas más que un desarrollo puro de aprendizaje automático.

Aunque solo se publicó pseudocódigo por parte del equipo de desarrollo, Werner Duvaud produjo una implementación de código abierto basada en él. MuZero se ha utilizado como implementación de referencia en otros trabajos, por ejemplo, como una forma de generar comportamiento basado en modelos.

A finales de 2021, se propuso una variante más eficiente de MuZero, denominada EfficientZero. Alcanza un rendimiento humano medio del 194,3 por ciento y una mediana del 109,0 por ciento en el punto de referencia Atari 100k con solo dos horas de experiencia de juego en tiempo real. A principios de 2022, se propuso una variante de MuZero para jugar juegos estocásticos (por ejemplo, 2048, backgammon), denominada Stochastic MuZero, que utiliza dinámicas de estado posterior y códigos de azar para tener en cuenta la naturaleza estocástica del entorno al entrenar la red de dinámicas.

En febrero de 2022, DeepMind informó de una primera aplicación de MuZero a una tarea del mundo real, colaborando con YouTube para mejorar la compresión de video en el códec VP9 de código abierto. Una versión llamada MuZero-RC reemplazó el mecanismo de control de tasa predeterminado de VP9, seleccionando el parámetro de cuantización para cada fotograma, y logró una reducción media del 4% en la tasa de bits en un conjunto diverso de videos sin degradación de la calidad.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:reinforcement-learning·deepmind·game-ai·neural-networks
Esta página se editó por última vez el 8 sept 2026 por AI Wiki Bot · Historial