DeepStack é um programa de computador de inteligência artificial projetado para jogar pôquer entre dois jogadores, especificamente Texas hold 'em sem limite heads-up. É o primeiro programa de computador a superar profissionais humanos neste jogo. O programa foi desenvolvido por uma equipe internacional da Universidade Charles, da Universidade Técnica Tcheca e da Universidade de Alberta.
Contexto
O pôquer é um jogo de referência fundamental na comunidade acadêmica, e pesquisas substanciais foram realizadas para encontrar estratégias ótimas contra adversários no pior caso. Enquanto profissionais humanos foram superados em grandes jogos de informação perfeita, como o xadrez, décadas antes, jogos de informação imperfeita exigem raciocínio recursivo muito mais complexo. Abordagens populares anteriores dependiam principalmente da simplificação do jogo por meio de abstrações. No entanto, abstrações em jogos de informação imperfeita frequentemente resultam em estratégias altamente exploráveis. Em vez disso, o DeepStack utiliza várias inovações algorítmicas, como o uso de redes neurais e resolução contínua.
Algoritmo
No núcleo do programa está o uso de redes neurais para determinar o valor de combinações específicas de cartas. As redes são treinadas apenas em um pequeno número de estados de jogo e são usadas para generalizar para situações não vistas durante o treinamento. O programa usa busca com as redes neurais e resolução contínua para garantir que a estratégia encontrada em cada etapa seja consistente com a estratégia usada em etapas anteriores. O procedimento de busca usa minimização de arrependimento contrafactual para atualizar iterativamente a estratégia em sua árvore de antecipação, e as redes neurais são usadas para avaliação de folhas. A avaliação de folhas evita raciocinar sobre todo o restante do jogo, substituindo o cálculo além de uma certa profundidade por uma estimativa aproximada rápida.
Torneio de 2016 com Jogadores Profissionais
Em um estudo concluído em dezembro de 2016, o DeepStack derrotou 11 jogadores profissionais de pôquer ao jogar 44.000 mãos de pôquer. Em todos os jogos disputados, o DeepStack venceu 49 big blinds por 100 mãos (sempre desistir perderia apenas 75 big blinds por 100), mais de quatro desvios padrão de zero, tornando-o o primeiro programa de computador a vencer jogadores profissionais de pôquer em Texas hold 'em sem limite heads-up. Este resultado foi um marco significativo na pesquisa de inteligência artificial, demonstrando que a IA poderia lidar com as complexidades de jogos de informação imperfeita.
Abordagens Concorrentes
Concomitantemente ao DeepStack, uma abordagem concorrente do grupo de pesquisa da Universidade Carnegie Mellon foi publicada, chamada Libratus. De 11 a 31 de janeiro de 2017, o Libratus foi colocado em um torneio contra quatro jogadores humanos de pôquer de alto nível. O algoritmo também foi publicado na Science. O Libratus não usa redes neurais para avaliação de folhas. Especialistas argumentam que o uso de aprendizado com redes neurais (como feito pelo DeepStack) é mais geral, e foi de fato usado em trabalhos subsequentes que generalizam para outros jogos com informação imperfeita. Essa distinção destaca a aplicabilidade mais ampla da abordagem do DeepStack dentro do campo de aprendizado de máquina.
Recepção pela Comunidade de Pôquer
Dara O'Kearney, um profissional de pôquer irlandês que completou 456 mãos, afirmou que o DeepStack jogou em um estilo semelhante ao usado por alguns jogadores humanos, baseado na teoria dos jogos. O sucesso do programa foi visto como uma validação do potencial das técnicas de aprendizado profundo na tomada de decisões estratégicas, e despertou maior interesse em aplicar métodos semelhantes a outros domínios.
Ver Também
- Jogadores de pôquer computadorizados
- Cepheus (bot de pôquer)
- Libratus
- Pluribus (bot de pôquer)