Traduzido do inglês

Cientista da computação americano conhecido por sistemas de IA super-humanos para pôquer e Diplomacia, que posteriormente liderou a pesquisa de raciocínio na OpenAI por trás do modelo o1.

Noam Brown é um cientista da computação americano conhecido por construir sistemas de jogos que derrotam os melhores profissionais humanos em jogos há muito considerados resistentes à IA, e por liderar posteriormente pesquisas sobre modelos de raciocínio na OpenAI.

Brown obteve seu doutorado na Universidade Carnegie Mellon, onde trabalhou com Tuomas Sandholm em agentes de pôquer. Seu sistema Libratus derrotou os principais jogadores profissionais no Texas hold'em sem limite heads-up em 2017, e um sucessor, Pluribus, venceu vários profissionais simultaneamente no pôquer de seis jogadores em 2019, um resultado notável por envolver mais de dois agentes competindo ao mesmo tempo, um cenário multiagente muito mais difícil do que os jogos de soma zero de dois jogadores que a IA havia dominado anteriormente, como xadrez ou Go.

Diplomacia e CICERO

Após ingressar na Meta AI (então Facebook AI Research), Brown ajudou a liderar a equipe por trás do CICERO, um sistema que jogava o jogo de tabuleiro Diplomacia, que exige negociação em linguagem natural, persuasão e planejamento estratégico entre jogadores humanos. Publicado na Science em 2022, o CICERO combinava um modelo de linguagem para gerar diálogo com um motor de raciocínio estratégico, e alcançou desempenho de nível humano em ligas online de Diplomacia, um marco frequentemente citado como evidência de que a IA poderia lidar com raciocínio social cooperativo e adversarial, não apenas jogos adversariais com informação perfeita.

Mudança para a OpenAI e o1

Brown ingressou na OpenAI em 2023, onde trabalhou em computação em tempo de teste, a ideia de que a resposta de um modelo pode ser melhorada permitindo que ele "pense" por mais tempo na inferência, em vez de apenas escalar o treinamento. Esse trabalho alimentou o OpenAI o1, lançado em 2024, que usava raciocínio estendido de cadeia de pensamento treinado com aprendizado por reforço para melhorar o desempenho em tarefas de matemática, codificação e lógica. Brown argumentou publicamente que escalar a computação em tempo de teste representa um segundo eixo de progresso da IA, além do escalonamento de dados e parâmetros de pré-treinamento, traçando uma analogia com seus próprios agentes de pôquer, que melhoraram drasticamente quando recebiam mais tempo para buscar antes de agir, em vez de apenas mais treinamento.

Reconhecimento

O trabalho de Brown em pôquer e Diplomacia foi amplamente coberto como evidência de que técnicas de IA baseadas em teoria dos jogos generalizam além de jogos de tabuleiro restritos para cenários que envolvem informação oculta, negociação e muitos agentes simultâneos, temas que reaparecem em sua pesquisa posterior sobre raciocínio. Ele se tornou uma das vozes de pesquisa mais visíveis explicando o roteiro de raciocínio da OpenAI em palestras e entrevistas públicas, frequentemente enquadrando o escalonamento da computação em tempo de teste como complementar, e não substituto, aos ganhos contínuos de execuções maiores de pré-treinamento.

Categorias:ai-industry·reasoning-models·game-playing-ai
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico