Andrew Geh Barto (nascido em 1948) é um cientista da computação americano e professor emérito de ciência da computação na Universidade de Massachusetts Amherst. Ele é amplamente reconhecido como um pioneiro da aprendizagem por reforço computacional moderna, um campo que sustenta muitos avanços em inteligência artificial e aprendizado de máquina. Seu trabalho, especialmente em colaboração com seu ex-aluno de doutorado Richard S. Sutton, estabeleceu as bases conceituais e algorítmicas para como agentes aprendem a partir de recompensas em ambientes incertos.
A pesquisa de Barto foi fundamental para transformar a aprendizagem por reforço de ideias teóricas em algoritmos práticos, influenciando áreas que vão da robótica a jogos. Seu livro-texto, Reinforcement Learning: An Introduction, tornou-se uma referência padrão no campo, e suas contribuições foram reconhecidas com o Prêmio ACM A.M. Turing de 2024, frequentemente chamado de "Prêmio Nobel da Computação".
Início da Vida e Educação
Andrew Geh Barto nasceu em 1948. Inicialmente, estudou arquitetura naval e engenharia na Universidade de Michigan, mas, após entrar em contato com o trabalho de Michael Arbib, Warren Sturgis McCulloch e Walter Pitts, fascinou-se pelo uso da matemática e da computação para modelar o cérebro. Mudou seu foco e obteve um bacharelado com distinção em matemática em 1970. Continuou na mesma instituição, concluindo um doutorado em ciência da computação em 1975, com uma tese sobre autômatos celulares.
Carreira Acadêmica na UMass Amherst
Em 1977, Barto ingressou na Faculdade de Ciências da Informação e Computação da Universidade de Massachusetts Amherst como pesquisador de pós-doutorado. Ele progrediu na carreira, tornando-se professor associado em 1982 e professor titular em 1991. Atuou como chefe do departamento de 2007 a 2011 e foi membro central do programa de Neurociência e Comportamento.
Na UMass, Barto codirigiu o Laboratório de Aprendizagem Autônoma (inicialmente chamado de Laboratório de Redes Adaptativas), que se tornou um centro de referência para a pesquisa em aprendizagem por reforço. Seu aluno de doutorado, Richard Sutton, colaborou com ele no desenvolvimento das ideias-chave que, juntos, formaram a estrutura matemática que definiria o campo.
Fundamentos da Aprendizagem por Reforço
Quando Barto começou na UMass, juntou-se a um grupo que explorava como o comportamento dos neurônios no cérebro poderia servir de base para a inteligência, um conceito avançado por A. Harry Klopf. Barto e Sutton utilizaram os processos de decisão de Markov (MDPs) como fundamento matemático para explicar como agentes tomam decisões em ambientes estocásticos, recebendo recompensas após cada ação. A teoria tradicional de MDPs pressupunha que os agentes tivessem conhecimento completo do ambiente; a inovação de Barto e Sutton permitiu lidar com ambientes desconhecidos e recompensas, tornando os algoritmos aplicáveis a uma ampla gama de problemas do mundo real.
Seu trabalho estabeleceu as bases para a aprendizagem por reforço moderna, que mais tarde impulsionou avanços como o AlphaGo, do Google, que derrotou campeões humanos. A técnica tornou-se uma pedra angular do atual boom da inteligência artificial, influenciando a pesquisa em aprendizado profundo e redes neurais.
Publicações e Influência
Barto publicou mais de cem artigos e capítulos em periódicos, livros e anais de conferências. Sua obra mais influente é o livro-texto Reinforcement Learning: An Introduction, coautorado com Richard Sutton, publicado pela primeira vez pela MIT Press em 1998, com uma segunda edição em 2018. Ele também coeditou o Handbook of Learning and Approximate Dynamic Programming (Wiley-IEEE Press, 2004) com Jennie Si, Warren Powell e Don Wunch II.
Sua pesquisa influenciou diretamente muitas áreas, incluindo robótica, jogos e sistemas autônomos, e suas ideias são fundamentais para o desenvolvimento de grandes modelos de linguagem e IA generativa.
Prêmios e Honrarias
Barto recebeu inúmeras distinções por suas contribuições. Ele é membro da Associação Americana para o Avanço da Ciência, membro e membro sênior do IEEE, e membro da Associação Americana de Inteligência Artificial e da Sociedade de Neurociência. Recebeu o Prêmio Pioneiro da Sociedade de Redes Neurais do IEEE em 2004, o Prêmio IJCAI de Excelência em Pesquisa em 2017 e o Prêmio de Realização Vitalícia em Neurociência da UMass em 2019.
Em 2024, ele foi agraciado com o Prêmio Turing da Associação para Maquinaria de Computação, juntamente com Richard S. Sutton, com a citação: "Por desenvolver as bases conceituais e algorítmicas da aprendizagem por reforço." Essa honra consolidou seu status como uma figura fundamental no campo.