Traduzido do inglês

Gopher é uma família de modelos de linguagem grandes baseados em transformadores, desenvolvida pela Google DeepMind, com a maior variante contendo 280 bilhões de parámetros. Fue projetada para investigar as [[scaling-laws|leis de escalamento]] para modelos de linguagem e serviu como predecessora da família de modelos [[chinchilla|Chinchilla]].

Gopher é uma família de modelos de linguagem de grande porte desenvolvida pela equipe de pesquisa do Google DeepMind. A família consiste em seis modelos baseados em transformadores de tamanhos crescentes, variando de 44 milhões de parâmetros a 280 bilhões de parâmetros, sendo o maior modelo referido como "Gopher" por padrão. O Gopher foi apresentado no final de 2021 e treinado para investigar as leis de escala de modelos de linguagem de grande porte, formando a base para a subsequente família de modelos Chinchilla, introduzida em março de 2022.

A família Gopher foi projetada como parte de um esforço de pesquisa mais amplo sobre como o desempenho do modelo escala com parâmetros e dados de treinamento. Os modelos são essencialmente a mesma arquitetura do GPT-2, com modificações menores, incluindo o uso de RMSNorm em vez de LayerNorm e codificação posicional relativa em vez de codificação posicional absoluta. O maior modelo Gopher, com 280 bilhões de parâmetros, foi treinado em aproximadamente 300 bilhões de tokens.

Leis de Escala e Treinamento

O desenvolvimento do Gopher foi motivado pela questão de como alocar recursos computacionais de forma otimizada ao treinar modelos de linguagem de grande porte. Antes do Gopher, muitos modelos, incluindo o GPT-3 da OpenAI, foram treinados com foco em aumentar o tamanho do modelo enquanto mantinham os dados de treinamento relativamente fixos. A equipe de pesquisa do Gopher, no entanto, descobriu por meio de estudos empíricos que, para um orçamento computacional dado, o tamanho ideal do modelo e o número de tokens de treinamento seguem uma relação específica: se o tamanho do modelo for dobrado, o número de tokens de treinamento também deve ser dobrado. Essa descoberta, posteriormente formalizada no artigo do Chinchilla, sugeriu que muitos modelos existentes eram subtreinados.

O treinamento do Gopher usou um grande corpus de dados de texto, e o modelo demonstrou forte desempenho em uma variedade de benchmarks de processamento de linguagem natural. No entanto, seu desempenho no benchmark Measuring Massive Multitask Language Understanding (MMLU) foi de 60,5% de precisão média, um número que mais tarde seria superado por seu sucessor, o Chinchilla.

Arquitetura e Variantes

A família Gopher inclui seis modelos com contagens de parâmetros de 44 milhões, 117 milhões, 417 milhões, 1,4 bilhão, 7,1 bilhões e 280 bilhões. Todos os modelos compartilham a mesma arquitetura central baseada na arquitetura transformador, especificamente semelhante ao GPT-2, mas com as modificações observadas. O uso de RMSNorm, uma variante da normalização de camadas que é computacionalmente mais eficiente, e codificação posicional relativa, que pode melhorar a generalização para sequências mais longas, foram diferenças-chave em relação aos modelos de transformadores anteriores.

O maior modelo Gopher foi treinado usando uma configuração de treinamento distribuído, aproveitando milhares de aceleradores. O processo de treinamento foi intensivo em recursos, e o modelo exigiu poder computacional significativo tanto para inferência quanto para ajuste fino, uma limitação que motivou o desenvolvimento posterior do Chinchilla.

Desempenho e Avaliação

O Gopher foi avaliado em uma variedade de benchmarks, incluindo modelagem de linguagem, compreensão de leitura e resposta a perguntas. Ele mostrou fortes capacidades em muitas áreas, mas seu desempenho não foi uniformemente superior ao de modelos menores em todas as tarefas. Por exemplo, em algumas tarefas de raciocínio e intensivas em conhecimento, o Gopher teve bom desempenho, mas também exibiu limitações em áreas como consistência factual e raciocínio de senso comum.

Em comparação com o GPT-3, o Gopher alcançou resultados competitivos ou melhores em vários benchmarks, mas as diferenças nem sempre foram dramáticas. A equipe de pesquisa observou que os ganhos de desempenho do Gopher eram frequentemente modestos em relação ao grande aumento no tamanho do modelo, o que destacou ainda mais a importância da escala dos dados de treinamento.

Legado e Sucessor

O principal legado do Gopher é sua contribuição para a compreensão das leis de escala em modelos de linguagem. Os insights obtidos com o treinamento do Gopher informaram diretamente o design do Chinchilla, uma família de modelos com 70 bilhões de parâmetros treinados em 1,4 trilhão de tokens. O Chinchilla, apresentado em março de 2022, alcançou maior precisão média (67,5% no MMLU) do que o Gopher, usando um orçamento computacional semelhante, demonstrando que as recomendações das leis de escala eram eficazes.

A família Chinchilla compartilha a mesma arquitetura do Gopher, mas foi treinada com o otimizador AdamW em vez de Adam. O Gopher também serviu como base para outros modelos, como o modelo de visão-linguagem Flamingo, que utilizou componentes da família Gopher. Em janeiro de 2023, o Chinchilla ainda estava em fase de testes, enquanto o Gopher havia sido superado por seu sucessor mais eficiente.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-models·google-deepmind·transformer-models·artificial-intelligence
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico