Traduzido do inglês

Chinchilla 70B é um modelo de linguagem de grande porte com 70 bilhões de parâmetros, desenvolvido pela Google DeepMind, introduzido em 2022 como parte da família Chinchilla para demonstrar leis de escalonamento de treinamento otimizado por computação.

Chinchilla 70B é um modelo de linguagem de grande porte desenvolvido pela Google DeepMind, introduzido em 2022. É a variante de 70 bilhões de parâmetros da família de modelos Chinchilla, que foram projetados para testar e validar leis de escalonamento para treinar redes neurais eficientes em termos computacionais. O modelo foi um artefato central em um artigo de pesquisa que argumentava por um equilíbrio diferente entre tamanho do modelo e dados de treinamento do que era comum na época, influenciando trabalhos subsequentes em modelos de linguagem de grande porte e pesquisa em aprendizado de máquina.

O projeto Chinchilla foi motivado pela observação de que muitos modelos de linguagem de grande porte contemporâneos, incluindo o GPT-3 da OpenAI, eram treinados com muito menos tokens do que seria ideal, dado o número de parâmetros. Os pesquisadores propuseram que, para um orçamento computacional fixo, o melhor desempenho vem de escalar o tamanho do modelo e os dados de treinamento aproximadamente igualmente, em vez de favorecer um em detrimento do outro. O Chinchilla 70B foi treinado com aproximadamente 1,4 trilhão de tokens, um conjunto de dados substancialmente maior em relação ao seu tamanho do que muitos predecessores, e superou modelos muito maiores em uma variedade de benchmarks.

Arquitetura e Treinamento

O Chinchilla 70B usa uma arquitetura Transformer padrão, semelhante a outros modelos de linguagem de grande porte de sua época. Ele emprega atenção de múltiplas cabeças e codificações posicionais, com uma estrutura somente decodificadora. O modelo foi treinado usando o otimizador Adam com um agendamento de taxa de aprendizado que incluía aquecimento e decaimento cosseno. Clipping de gradiente foi aplicado para estabilizar o treinamento.

O conjunto de dados de treinamento compreendia um subconjunto filtrado e deduplicado de texto público da web, livros e outras fontes, totalizando cerca de 1,4 trilhão de tokens. Essa foi uma escolha deliberada para testar a hipótese de que mais dados, em vez de mais parâmetros, poderiam produzir melhor desempenho para um determinado orçamento computacional. O treinamento usou um grande cluster de TPUs, aproveitando a infraestrutura do Google Cloud.

Leis de Escalonamento e Significância

A principal contribuição do Chinchilla 70B foi a evidência empírica para leis de escalonamento otimizadas computacionalmente. A equipe de pesquisa, incluindo Jordan Hoffmann e outros, analisou a relação entre tamanho do modelo, tamanho do conjunto de dados e orçamento computacional. Eles descobriram que, para um orçamento computacional fixo, o tamanho ideal do modelo é muito menor do que se supunha anteriormente, e o número ideal de tokens de treinamento é muito maior. Esse resultado, frequentemente chamado de "lei de escalonamento Chinchilla", sugeriu que muitos modelos existentes eram superparametrizados e subtreinados.

O Chinchilla 70B, apesar de ter menos parâmetros do que modelos como GPT-3 (175B) e Gopher (280B), alcançou desempenho superior em muitos benchmarks de inteligência artificial, incluindo modelagem de linguagem, compreensão de leitura e tarefas de raciocínio. Isso demonstrou que a eficiência do treinamento poderia ser mais importante do que o número bruto de parâmetros.

Desempenho e Benchmarks

Em um conjunto de benchmarks padrão, o Chinchilla 70B superou o Gopher (280B parâmetros) e o GPT-3 (175B parâmetros) na maioria das tarefas. Por exemplo, alcançou maior precisão no MMLU (Massive Multitask Language Understanding) e melhores resultados em conjuntos de dados de resposta a perguntas e raciocínio de senso comum. O modelo também mostrou forte desempenho em tarefas de raciocínio matemático e científico, embora ainda tivesse limitações comuns aos modelos de linguagem da época, como erros factuais e sensibilidade à formulação do prompt.

O desempenho do modelo foi particularmente notável no contexto do desenvolvimento de IA generativa, pois mostrou que modelos menores e melhor treinados poderiam ser mais práticos e econômicos. Isso influenciou o desenvolvimento subsequente de modelos na Anthropic, OpenAI e outras organizações, que começaram a prestar mais atenção ao volume de dados de treinamento.

Impacto e Legado

As leis de escalonamento Chinchilla tiveram um impacto significativo no campo do aprendizado profundo. Elas provocaram uma mudança na forma como pesquisadores e empresas alocam recursos computacionais, enfatizando a importância de conjuntos de dados grandes e de alta qualidade. As descobertas também informaram decisões sobre arquitetura de modelos e orçamentos de treinamento em modelos posteriores, como o LLaMA e outros, que adotaram proporções semelhantes de dados para parâmetros.

O Chinchilla 70B em si não foi lançado como um modelo de pesos abertos, mas suas descobertas de pesquisa foram amplamente divulgadas e influenciaram esforços subsequentes de código aberto. A arquitetura do modelo e a abordagem de treinamento tornaram-se um ponto de referência para pesquisa acadêmica e industrial, e a análise das leis de escalonamento continua sendo uma referência fundamental no campo.

Recepção e Críticas

Embora os resultados do Chinchilla tenham sido amplamente elogiados, alguns pesquisadores notaram que a análise das leis de escalonamento foi baseada em um conjunto limitado de tamanhos de modelo e orçamentos computacionais, e que a proporção ideal poderia variar com diferentes arquiteturas ou distribuições de dados. Trabalhos subsequentes refinaram essas leis, mas a percepção central - de que o volume de dados de treinamento é tão importante quanto o tamanho do modelo - foi amplamente aceita.

Alguns também apontaram que a abordagem otimizada computacionalmente não leva necessariamente ao melhor desempenho para um determinado orçamento de inferência, pois modelos maiores podem ser mais eficientes na inferência, mesmo que sejam menos eficientes para treinar. Essa nuance levou à exploração contínua do escalonamento de modelos em diferentes direções, incluindo arquiteturas de mistura de especialistas e outras técnicas de eficiência.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-model·google-deepmind·artificial-intelligence·machine-learning
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico