PaLM 2 é um modelo de linguagem de grande porte (LLM) desenvolvido pelo Google e anunciado na palestra anual do Google I/O em maio de 2023. Ele é o sucessor do Pathways Language Model (PaLM), um LLM denso baseado em transformer, somente decodificador, com 540 bilhões de parâmetros, desenvolvido pelo Google AI. O PaLM 2 é relatado como um modelo de 340 bilhões de parâmetros treinado em 3,6 trilhões de tokens, representando um avanço significativo em escala e capacidade em relação ao seu predecessor.
O modelo faz parte dos esforços mais amplos do Google em Generative AI e modelos de linguagem de grande porte, baseando-se na arquitetura transformer que sustenta os sistemas modernos de aprendizado profundo. O PaLM 2 foi desenvolvido em conjunto com o Google DeepMind, refletindo a integração das divisões de pesquisa em IA do Google.
Arquitetura e Capacidades
O PaLM 2 segue o design de transformer somente decodificador estabelecido por seu predecessor, utilizando mecanismos de atenção de múltiplas cabeças e codificação posicional para processar dados sequenciais. O modelo é capaz de realizar uma ampla gama de tarefas, incluindo raciocínio de senso comum, raciocínio aritmético, explicação de piadas, geração de código e tradução. Quando combinado com prompting de cadeia de pensamento, o PaLM 2 alcança um desempenho significativamente melhor em conjuntos de dados que exigem raciocínio de múltiplas etapas, como problemas de palavras e questões baseadas em lógica.
O treinamento do modelo em 3,6 trilhões de tokens - um aumento substancial em relação aos 780 bilhões de tokens usados para o PaLM original - permite um desempenho aprimorado em diversos domínios. Esse corpus de treinamento inclui páginas da web filtradas, livros, artigos da Wikipédia, notícias, código-fonte de repositórios de código aberto e conversas em redes sociais, com a porção de redes sociais compreendendo 50% do corpus para apoiar capacidades conversacionais.
Infraestrutura de Treinamento
O PaLM 540B original foi treinado em dois Pods de TPU v4 com 3.072 chips TPU v4 em cada Pod, conectados a 768 hosts, utilizando uma combinação de paralelismo de modelo e de dados. Essa configuração, usando 6.144 chips no total, marcou um recorde de maior eficiência de treinamento alcançada para LLMs nessa escala, com uma utilização de FLOPs de hardware de 57,8%. A infraestrutura de treinamento do PaLM 2 segue princípios semelhantes, embora detalhes específicos sobre sua configuração de hardware não tenham sido totalmente divulgados.
Modelos Relacionados e Aplicações
O Google estendeu a arquitetura PaLM para criar várias variantes especializadas. O Med-PaLM, uma versão ajustada em dados médicos, supera modelos anteriores em benchmarks de perguntas e respostas médicas e foi o primeiro a obter uma pontuação de aprovação em questões de licenciamento médico dos EUA. Ele fornece raciocínio e pode avaliar suas próprias respostas, além de responder com precisão a perguntas de múltipla escolha e abertas.
O PaLM-E, outra extensão que usa um transformer de visão, serve como um modelo de visão-linguagem para manipulação robótica sem a necessidade de retreinamento ou ajuste fino. Em junho de 2023, o Google anunciou o AudioPaLM para tradução de fala para fala, que usa a arquitetura e a inicialização do PaLM-2.
Disponibilidade e Impacto
O PaLM original foi anunciado pela primeira vez em abril de 2022 e permaneceu privado até março de 2023, quando o Google lançou uma API inicialmente disponível para um número limitado de desenvolvedores por meio de uma lista de espera. O anúncio do PaLM 2 no Google I/O em maio de 2023 sinalizou o compromisso do Google em competir no cenário em rápida evolução da inteligência artificial, ao lado de outros grandes players como OpenAI e Anthropic. As capacidades do modelo têm implicações para os serviços Google Cloud e aplicações empresariais mais amplas, posicionando o Google como uma força significativa no desenvolvimento de sistemas avançados de aprendizado de máquina.