Chinchilla é uma família de modelos de linguagem de grande porte (LLMs) desenvolvida pela equipe de pesquisa do Google DeepMind, apresentada em março de 2022. A família foi projetada para investigar as leis de escala de modelos de linguagem, com base em trabalhos anteriores com a família de modelos Gopher. Os modelos Chinchilla são baseados em transformadores e foram treinados para alcançar melhor desempenho sob orçamentos computacionais fixos, levando a uma recomendação amplamente citada para o treinamento eficiente de modelos grandes.
O nome "Chinchilla" reflete seu papel como um desenvolvimento adicional sobre a família de modelos Gopher anterior. Ambas as famílias foram treinadas para explorar como o tamanho do modelo e o volume de dados de treinamento interagem. Chinchilla afirmou superar o GPT-3 usando significativamente menos parâmetros, simplificando o uso downstream ao exigir menos poder computacional para inferência e ajuste fino.
Leis de Escala e Treinamento
A descoberta central da pesquisa Chinchilla foi que, para um determinado orçamento computacional, o tamanho do modelo e o número de tokens de treinamento devem escalar proporcionalmente. Especificamente, se o tamanho do modelo for dobrado, o número de tokens de treinamento também deve ser dobrado. Esse princípio foi derivado da análise do treinamento de modelos de linguagem empregados anteriormente. A DeepMind usou essa hipótese para treinar Chinchilla, que possui 70 bilhões de parâmetros e foi treinada em 1,4 trilhão de tokens, quatro vezes mais dados do que os 300 bilhões de tokens do Gopher, a um custo computacional geral semelhante.
Essa abordagem computacionalmente ótima contrasta com práticas anteriores que frequentemente priorizavam apenas o aumento dos parâmetros do modelo. A equipe do Chinchilla recomendou que o uso de conjuntos de dados de treinamento maiores e de maior qualidade pode levar a melhores resultados em tarefas downstream, mesmo quando o tamanho do modelo não é aumentado. As descobertas influenciaram metodologias de treinamento subsequentes em todo o campo da pesquisa em IA.
Desempenho e Benchmarks
Chinchilla alcançou uma precisão média de 67,5% no benchmark Measuring Massive Multitask Language Understanding (MMLU), que é 7% maior do que o desempenho do Gopher. Essa melhoria foi notável, dado que o Gopher tinha 280 bilhões de parâmetros, quatro vezes mais do que o Chinchilla. A eficiência do modelo o tornou prático para uma gama mais ampla de aplicações, pois exigia menos computação tanto para inferência quanto para ajuste fino.
Em 12 de janeiro de 2023, o Chinchilla ainda estava em fase de testes, indicando que suas capacidades e limitações completas estavam sendo avaliadas. O sucesso do modelo em benchmarks como o MMLU demonstrou que o treinamento computacionalmente ótimo poderia produzir resultados competitivos ou superiores em comparação com modelos maiores treinados com menos dados.
Arquitetura
Tanto as famílias Gopher quanto Chinchilla são famílias de modelos transformadores. Elas são essencialmente as mesmas do GPT-2, com tamanhos diferentes e modificações menores. A família Gopher usa RMSNorm em vez de LayerNorm e codificação posicional relativa em vez de codificação posicional absoluta. A família Chinchilla é idêntica à família Gopher, mas é treinada com o otimizador AdamW em vez do otimizador Adam.
A família Gopher contém seis modelos de tamanho crescente, de 44 milhões de parâmetros a 280 bilhões de parâmetros, com o maior referido como "Gopher" por padrão. Convenções de nomenclatura semelhantes se aplicam à família Chinchilla, que inclui modelos de vários tamanhos, sendo a versão de 70 bilhões de parâmetros a mais proeminente. A Tabela 1 do artigo original detalha toda a família Gopher, enquanto a Tabela 4 compara o Chinchilla de 70 bilhões de parâmetros com o Gopher 280B.
Aplicações e Influência
Chinchilla foi usado como base para outros modelos, incluindo o modelo de visão-linguagem Flamingo, que integra compreensão visual e textual. As leis de escala estabelecidas por Chinchilla tornaram-se uma referência padrão no campo do aprendizado de máquina, orientando decisões sobre tamanho do modelo e tamanho do conjunto de dados em desenvolvimentos subsequentes de LLMs.
A pesquisa contribuiu para o desenvolvimento de um paradigma de treinamento eficaz para grandes modelos de linguagem autorregressivos com recursos computacionais limitados. Ao demonstrar que o volume de dados é tão importante quanto o tamanho do modelo, Chinchilla mudou o foco para a qualidade e curadoria de conjuntos de dados. Isso teve um impacto duradouro em como organizações como OpenAI e Anthropic abordam o treinamento de modelos, embora os detalhes específicos de suas práticas internas nem sempre sejam públicos.
Ver Também
- Gopher
- Leis de escala
- Aprendizado profundo