PaLM (Pathways Language Model) é um modelo de linguagem de grande porte desenvolvido pelo Google AI, anunciado pela primeira vez em abril de 2022. É um modelo denso baseado em transformador, apenas com decodificador, com 540 bilhões de parâmetros, tornando-o um dos maiores modelos de linguagem na época de seu lançamento. O modelo foi treinado usando o sistema Pathways do Google, que permite treinamento eficiente em múltiplos pods de TPU. Os pesquisadores também treinaram versões menores com 8 e 62 bilhões de parâmetros para estudar os efeitos da escala do modelo no desempenho.
O PaLM demonstrou fortes capacidades em uma ampla gama de tarefas, incluindo raciocínio de senso comum, raciocínio aritmético, explicação de piadas, geração de código e tradução. Quando combinado com prompting de cadeia de pensamento, o PaLM alcançou desempenho significativamente melhor em conjuntos de dados que exigem raciocínio de múltiplas etapas, como problemas de palavras e questões baseadas em lógica. O modelo permaneceu privado até março de 2023, quando o Google lançou uma API para o PaLM, inicialmente disponível a um número limitado de desenvolvedores por meio de uma lista de espera antes do lançamento público.
Arquitetura e Treinamento
O PaLM é baseado na arquitetura transformador, especificamente um design apenas com decodificador. A versão de 540B foi pré-treinada em um corpus de 780 bilhões de tokens, compreendendo páginas da web filtradas, livros, artigos da Wikipédia, artigos de notícias, código-fonte de repositórios do GitHub e conversas em mídias sociais. O conjunto de dados foi derivado daquele usado para treinar o modelo LaMDA do Google, com conversas em mídias sociais compondo 50% do corpus para aprimorar as capacidades conversacionais.
O treinamento do modelo de 540B exigiu dois pods de TPU v4, cada um com 3.072 chips TPU v4 conectados a 768 hosts, ligados usando uma combinação de paralelismo de modelo e dados. Essa configuração, totalizando 6.144 chips, foi o maior setup de TPU na época e alcançou uma utilização de FLOPs de hardware de 57,8%, um recorde de eficiência de treinamento nessa escala. O processo de treinamento aproveitou o sistema Pathways, que permitiu escalonamento eficiente em múltiplos pods.
Variantes e Aplicações
O Google e o DeepMind desenvolveram o Med-PaLM, uma versão do PaLM 540B ajustada com dados médicos. O Med-PaLM superou modelos anteriores em benchmarks de perguntas e respostas médicas e foi o primeiro a obter uma pontuação de aprovação em questões de licenciamento médico dos EUA. Ele fornece raciocínio para suas respostas e pode avaliar suas próprias respostas.
O Google também estendeu o PaLM com um transformador de visão para criar o PaLM-E, um modelo de visão-linguagem para manipulação robótica que não requer retreinamento ou ajuste fino para novas tarefas. Em junho de 2023, o Google anunciou o AudioPaLM para tradução de fala para fala, que usa a arquitetura e a inicialização do PaLM-2.
Sucessor: PaLM 2
Em maio de 2023, o Google anunciou o PaLM 2 na palestra anual do Google I/O. O PaLM 2 é relatado como um modelo de 340 bilhões de parâmetros treinado em 3,6 trilhões de tokens. Ele serve como sucessor do PaLM e alimenta vários produtos e serviços do Google. O PaLM 2 melhorou em relação ao seu predecessor em áreas como capacidades multilíngues, raciocínio e codificação, e foi disponibilizado por meio da API do PaLM e outros serviços do Google Cloud.
Impacto e Legado
O PaLM representou um passo significativo no desenvolvimento de modelos de linguagem de grande porte, demonstrando a viabilidade de treinar modelos em escala sem precedentes usando sistemas distribuídos. Seu sucesso influenciou modelos subsequentes, incluindo o Gemini, que sucedeu o PaLM como o modelo de linguagem principal do Google. As contribuições do PaLM para o prompting de cadeia de pensamento e extensões multimodais como o PaLM-E também avançaram a pesquisa em raciocínio e IA incorporada.
Veja Também
- LaMDA - Predecessor do PaLM
- Gemini - Sucessor do PaLM
- Chinchilla - Um modelo de linguagem relacionado