Google PaLM 2 é um modelo de linguagem de grande porte (LLM) desenvolvido pelo Google AI, anunciado no keynote anual do Google I/O em maio de 2023. É o sucessor do Pathways Language Model (PaLM), um modelo denso baseado em transformer, somente decodificador, com 540 bilhões de parâmetros, introduzido pela primeira vez em abril de 2022. O PaLM 2 é relatado como um modelo de 340 bilhões de parâmetros treinado em 3,6 trilhões de tokens, um aumento significativo em relação aos 780 bilhões de tokens de seu predecessor. O modelo alimenta o Bard, o serviço de IA conversacional do Google, e outros produtos de IA do Google, com capacidades multilíngues aprimoradas, raciocínio melhorado e maior proficiência em codificação.
O PaLM 2 baseia-se nos fundamentos arquitetônicos do PaLM, que foi projetado como um transformer denso somente decodificador. O modelo PaLM original demonstrou forte desempenho em tarefas como raciocínio de senso comum, raciocínio aritmético, explicação de piadas, geração de código e tradução. Quando combinado com o prompting de cadeia de pensamento, o PaLM alcançou resultados significativamente melhores em conjuntos de dados que exigem raciocínio de múltiplas etapas, incluindo problemas de palavras e questões baseadas em lógica. O PaLM 2 estende essas capacidades, particularmente em contextos multilíngues, permitindo que ele compreenda e gere texto em uma gama mais ampla de idiomas com maior precisão.
Desenvolvimento e Anúncio
O modelo PaLM original foi anunciado pela primeira vez em abril de 2022, mas permaneceu privado até março de 2023, quando o Google lançou uma API para o PaLM e várias outras tecnologias. A API estava inicialmente disponível para um número limitado de desenvolvedores que entraram em uma lista de espera antes de ser liberada ao público. O PaLM 2 foi revelado no Google I/O em maio de 2023, marcando um marco importante nos esforços de IA generativa do Google. O anúncio destacou a eficiência e o desempenho aprimorados do PaLM 2 em relação ao seu predecessor, com foco em aplicações práticas no ecossistema de produtos do Google.
O Google e a DeepMind também desenvolveram versões especializadas do PaLM. O Med-PaLM, uma versão do PaLM 540B ajustada em dados médicos, superou modelos anteriores em benchmarks de perguntas e respostas médicas. Foi o primeiro modelo a obter uma pontuação de aprovação em questões de licenciamento médico dos EUA, fornecendo raciocínio e autoavaliação juntamente com respostas precisas. Outra variante, o PaLM-E, estendeu o PaLM usando um transformer de visão para criar um modelo de visão-linguagem para manipulação robótica sem retreinamento ou ajuste fino. Em junho de 2023, o Google anunciou o AudioPaLM para tradução de fala para fala, que usa a arquitetura e a inicialização do PaLM-2.
Arquitetura e Treinamento
O PaLM 2 é um modelo transformer denso somente decodificador, semelhante ao seu predecessor, mas com um corpus de treinamento maior. O PaLM original foi pré-treinado em um corpus de alta qualidade de 780 bilhões de tokens, incluindo páginas da web filtradas, livros, artigos da Wikipédia, artigos de notícias, código-fonte de repositórios de código aberto no GitHub e conversas em redes sociais. A porção de conversas em redes sociais compunha 50% do corpus, auxiliando nas capacidades conversacionais. Os dados de treinamento do PaLM 2 foram expandidos para 3,6 trilhões de tokens, permitindo melhor generalização e desempenho multilíngue.
O PaLM 540B original foi treinado em dois Pods TPU v4, cada um com 3.072 chips TPU v4 conectados a 768 hosts, usando uma combinação de paralelismo de modelo e dados. Essa configuração, totalizando 6.144 chips, marcou um recorde de maior eficiência de treinamento alcançada para LLMs nessa escala, com uma utilização de FLOPs de hardware de 57,8%. Os detalhes de treinamento do PaLM 2 são menos documentados publicamente, mas provavelmente usaram infraestrutura semelhante, refletindo o investimento do Google em Google Cloud e hardware especializado.
Capacidades e Aplicações
O PaLM 2 é projetado para se destacar em tarefas multilíngues, raciocínio e codificação. Ele alimenta o Bard, a IA conversacional do Google, e está integrado a outros produtos, como Google Workspace e os serviços de IA do Google Cloud. As capacidades multilíngues aprimoradas do modelo permitem que ele lide com tradução, sumarização e perguntas e respostas em vários idiomas de forma mais eficaz do que modelos anteriores. Suas capacidades de raciocínio são aprimoradas por meio de técnicas como o prompting de cadeia de pensamento, permitindo a resolução de problemas em múltiplas etapas.
Em codificação, o PaLM 2 suporta geração de código e depuração em várias linguagens de programação, tornando-o uma ferramenta para desenvolvedores. A versatilidade do modelo é demonstrada em aplicações que vão desde pesquisa em aprendizado de máquina até soluções empresariais. O Google posicionou o PaLM 2 como um modelo fundamental para seu ecossistema de IA, competindo com ofertas da OpenAI e da Anthropic.
Comparação com Outros Modelos
Os 340 bilhões de parâmetros do PaLM 2 o colocam no nível superior dos modelos de linguagem de grande porte, embora menor do que alguns concorrentes, como o GPT-4 da OpenAI, que é relatado como tendo mais de um trilhão de parâmetros em uma arquitetura de mistura de especialistas. No entanto, o treinamento do PaLM 2 em 3,6 trilhões de tokens e seu foco em eficiência permitem que ele alcance desempenho competitivo em benchmarks. A arquitetura do modelo, baseada no framework transformer, é semelhante à de outros LLMs, mas as técnicas proprietárias de treinamento e a infraestrutura do Google conferem vantagens distintas em escalabilidade.
Em comparação com seu predecessor PaLM, o PaLM 2 oferece melhorias significativas na compreensão multilíngue e no raciocínio, bem como requisitos computacionais reduzidos para inferência. Isso o torna mais acessível para implantação em aplicações do mundo real. A integração do PaLM 2 pelo Google em produtos como Bard e Vertex AI do Google Cloud ampliou seu alcance, posicionando-o como um ator-chave no cenário de inteligência artificial.
Impacto e Recepção
O lançamento do PaLM 2 em maio de 2023 foi recebido com atenção da comunidade de IA e de observadores da indústria. Demonstrou o compromisso do Google em avançar as tecnologias de aprendizado profundo e redes neurais, particularmente no campo competitivo da IA generativa. As capacidades multilíngues aprimoradas do modelo foram vistas como um passo à frente para tornar a IA acessível a falantes não nativos de inglês, e suas habilidades de codificação atraíram desenvolvedores.
No entanto, o PaLM 2 também levantou questões sobre o impacto ambiental do treinamento de modelos grandes, embora o Google tenha enfatizado melhorias de eficiência. A integração do modelo no Bard gerou discussões sobre a ética da IA, incluindo questões de viés e desinformação, que são preocupações comuns para sistemas de IA generativa. O Google implementou medidas de segurança, mas as implicações mais amplas permanecem um tópico de debate.
Direções Futuras
Após o PaLM 2, o Google continuou a evoluir seus modelos de IA. No final de 2023, o Google anunciou o Gemini, um sucessor do PaLM 2, que integra capacidades multimodais e é projetado para ser mais poderoso e versátil. A arquitetura e os métodos de treinamento do PaLM 2 influenciaram desenvolvimentos subsequentes, incluindo melhorias em técnicas de atenção de múltiplas cabeças e codificação posicional. O legado do modelo é evidente nos esforços contínuos do Google para ultrapassar os limites da inteligência artificial, com aplicações em campos que vão da saúde à robótica.
Em 2025, o PaLM 2 permanece um marco significativo na história dos LLMs, representando uma ponte entre modelos anteriores, como o LaMDA, e sistemas mais avançados, como o Gemini. Suas contribuições para a IA multilíngue e o treinamento eficiente tiveram um impacto duradouro no campo, e seus princípios continuam a informar a pesquisa no Google DeepMind e além.
Veja Também
- LaMDA, predecessor do PaLM
- Gemini, sucessor do PaLM
- Chinchilla, um LLM relacionado
- Transformer, a arquitetura subjacente
- Google Cloud, infraestrutura para treinamento
Referências
- Blog do Google AI, maio de 2023, anúncio do PaLM 2
- Wikipédia, PaLM (Pathways Language Model), acessado em 2025
- Google Research, PaLM: Scaling Language Modeling with Pathways, 2022