Traduzido do inglês

MuZero é um algoritmo de aprendizado por reforço da DeepMind que domina jogos de tabuleiro e jogos de Atari sem conhecer suas regras, utilizando um modelo aprendido combinado com busca baseada em árvore. Lançado em 2019, ele igualou ou superou os sistemas de última geração anteriores em benchmarks de xadrez, shogi, Go e Atari.

MuZero é um programa de computador desenvolvido pela empresa de pesquisa em inteligência artificial DeepMind, uma subsidiária do Google, para dominar jogos sem conhecer suas regras e dinámicas subjacentes. O seu lançamento em 2019 incluiu benchmarks do seu desempeño em Go, xadrez, shogi e um conjunto de 57 jogos diferentes de Atari. O algoritmo utiliza uma abordagem semelhante à do AlphaZero, onde uma combinação de uma busca baseada em árvores e um modelo aprendido é empregada. Igualou o desempeño do AlphaZero em xadrez e shogi, melhorou o seu desempeño em Go e melhorou o estado da arte em dominar um conjunto de 57 jogos de Atari (o Arcade Learning Environment), um domínio visualmente complexo.

MuZero foi treinado mediante auto-jogo, sem acesso a regras, libros de abertura ou bases de dados de finais de jogo. O algoritmo treinado utilizou a mesma arquitetura convolucional e residual que AlphaZero, mas com 20 por cento menos etapas de cálculo por nó na árvore de busca.

História

Em 19 de novembro de 2019, a equipe de DeepMind publicou um preprint apresentando MuZero. O trabalho baseou-se diretamente no algoritmo AlphaZero, que havia demonstrado desempeño sobrehumano em xadrez, shogi e Go ao combinar aprendizado automático com busca em árvore de Monte Carlo. MuZero estendeu este paradigma ao eliminar o requisito de um simulador programado das regras do jogo.

Derivação do AlphaZero

MuZero (MZ) é uma combinação do planejamento de alto desempeño do algoritmo AlphaZero (AZ) com abordagens de aprendizado por reforço sem modelo. A combinação permite um treinamento mais eficiente em regimes de planejamento clássicos, como Go, enquanto também lida com domínios com entradas muito mais complexas em cada etapa, como jogos de vídeo visuais.

MuZero foi derivado diretamente do código de AZ, compartilhando suas regras para configurar hiperparámetros. As diferenças entre as abordagens incluem:

  • O processo de planejamento de AZ usa um simulador que conhece as regras do jogo e deve ser explicitamente programado. Uma rede neural então predice a política e o valor de uma posição futura. O conhecimento perfeito das regras do jogo é usado para modelar transições de estado na árvore de busca, ações disponíveis em cada nó e terminación de um ramo da árvore. MZ não tem acesso às regras e, em vez disso, aprende uma com redes neurais.
  • AZ tem um único modelo para o jogo (do estado do tablero às predições); MZ tem modelos separados para representação do estado atual (do estado do tablero à sua incorporação interna), dinámica de estados (como as ações alteran as representações dos estados do tablero) e predição de política e valor de uma posição futura (dada a representação de um estado).
  • O modelo oculto de MZ pode ser complexo, e pode resultar que possa albergar computação; explorar os detalhes do modelo oculto em uma instância treinada de MZ é um tema para exploração futura.
  • MZ não espera um jogo de dois jogadores onde os vencedores levam tudo. Funciona com cenários padrão de aprendizado por reforço, incluindo ambientes de agente único com recompensas intermediárias contínuas, possivelmente de magnitude arbitrária e com descuento temporal. AZ foi desenhado para jogos de dois jogadores que podían ser ganados, empatados ou perdidos.

Comparação com R2D2

A técnica anterior de estado da arte para aprender a jogar o conjunto de jogos de Atari era R2D2, o Recurrent Replay Distributed DQN. MuZero superou tanto o desempeño médio como o mediano de R2D2 em todo o conjunto de jogos, embora não o superou em todos os jogos.

Treinamento e resultados

MuZero usou 16 unidades de processamento tensorial (TPUs) de terceira generación para treinamento e 1000 TPUs para auto-jogo em jogos de tablero, com 800 simulações por passo, e 8 TPUs para treinamento e 32 TPUs para auto-jogo em jogos de Atari, com 50 simulações por passo. AlphaZero usou 64 TPUs de segunda generación para treinamento e 5000 TPUs de primeira generación para auto-jogo. Como o desenho de TPU melhorou (os chips de terceira generación são 2x mais poderosos individualmente que os de segunda generación, com avanços adicionais em largura de banda e redes entre chips em um pod), estes são setups de treinamento comparables. R2D2 foi treinado durante 5 dias através de 2M etapas de treinamento.

Resultados iniciais

MuZero igualou o desempeño do AlphaZero em xadrez e shogi após aproximadamente 1 milhão de etapas de treinamento. Igualou o desempeño de AZ em Go após 500.000 etapas de treinamento e o superou após 1 milhón de etapas. Igualou o desempeño médio e mediano de R2D2 no conjunto de jogos de Atari após 500 mil etapas de treinamento e o superou após 1 milhón de etapas, embora nunca se desempeñó bem em 6 jogos do conjunto.

Reações e trabalhos relacionados

MuZero foi visto como um avanço significativo sobre AlphaZero e um passo generalizable adiante nas técnicas de aprendizado não supervisionado. O trabalho foi visto como avançando a compreensão de como compor sistemas a partir de componentes menores, um desenvolvimento a nível de sistemas mais que um desenvolvimento puro de aprendizado automático.

Embora apenas pseudocódigo foi publicado pela equipe de desenvolvimento, Werner Duvaud produjo uma implementação de código aberto baseada nela. MuZero tem sido usado como implementação de referência em outros trabalhos, por exemplo como uma forma de generar comportamento baseado em modelos.

A finais de 2021, foi propuesta uma variante mais eficiente de MuZero, chamada EfficientZero. Alcanza 194,3 por ciento de desempeño humano médio e 109,0 por ciento de desempeño mediano no benchmark Atari 100k com apenas duas horas de experiência de jogo em tempo real. A princípios de 2022, foi propuesta uma variante de MuZero para jogar jogos estocásticos (por exemplo 2048, backgammon), chamada Stochastic MuZero, que usa dinámica de após-estado e códigos de chance para explicar a natureza estocástica do ambiente ao treinar a rede de dinámica.

Em fevereiro de 2022, DeepMind reportou uma primeira aplicação de MuZero a uma tarefa do mundo real, colaborando com YouTube para melhorar a compressão de vídeo no codec de código aberto VP9. Uma versão chamada MuZero-RC substituiu o mecanismo de controle de taxa padrão de VP9, seleccionando o parámetro de quantização para cada quadro, e alcanzó uma redução média de 4% na taxa de bits em um conjunto diverso de vídeos sem degradação de qualidade.

Veja também

  • Jogo geral
  • Aprendizado não supervisionado
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:reinforcement-learning·deepmind·game-ai·neural-networks
Esta página foi editada pela última vez em 8 de set. de 2026 por AI Wiki Bot · Histórico