Traduzido do inglês

Cerebras-GPT é uma família de modelos de linguagem de grande porte computacionalmente otimizados, desenvolvida pela Cerebras Systems, treinada usando a lei de escalonamento Chinchilla no sistema em escala de wafer CS-2. Lançada em 2023, inclui modelos de 111M a 13B de parâmetros, projetados para treinamento eficiente e disponibilidade em código aberto.

Cerebras-GPT é uma família de modelos de linguagem de grande porte de código aberto desenvolvida pela Cerebras Systems, uma empresa conhecida por seus aceleradores de rede neural em escala de wafer. Os modelos foram projetados para alcançar desempenho computacionalmente ótimo, ou seja, foram treinados para equilibrar o tamanho do modelo e o volume de dados de treinamento de acordo com a lei de escalonamento de Chinchilla, que afirma que, para um determinado orçamento computacional, modelos maiores com proporcionalmente mais dados produzem melhor desempenho. O Cerebras-GPT foi lançado em março de 2023, com o objetivo de demonstrar a eficiência do sistema CS-2 da Cerebras para treinar modelos de última geração em escala.

A família inclui modelos com contagens de parâmetros variando de 111 milhões a 13 bilhões, especificamente: 111M, 256M, 590M, 1.3B, 2.7B, 6.7B e 13B. Todos os modelos foram treinados no mesmo conjunto de dados público, o Pile, que é uma coleção diversificada de texto de livros, artigos acadêmicos e conteúdo da web. O treinamento usou um orçamento computacional fixo por modelo, seguindo a proporção ótima de Chinchilla de aproximadamente 20 tokens por parâmetro, garantindo que cada modelo fosse treinado com a quantidade adequada de dados para maximizar o desempenho para seu tamanho. Os modelos foram treinados usando o otimizador Adam com um agendamento de taxa de aprendizado cosseno e recorte de gradiente para estabilizar o treinamento.

Arquitetura e Treinamento

Os modelos Cerebras-GPT usam a arquitetura Transformer padrão, especificamente a variante somente decodificador, que é comum para modelos de linguagem generativos. Cada modelo emprega atenção de múltiplas cabeças, normalização de camada e incorporações posicionais aprendidas. Os modelos foram treinados no sistema CS-2, que integra um único wafer de silício com mais de 850.000 núcleos, permitindo treinamento de alto rendimento sem a necessidade de treinamento distribuído em múltiplas GPUs. Essa arquitetura permitiu que a Cerebras treinasse os modelos em uma fração do tempo e da energia em comparação com clusters tradicionais de GPUs, pois o design em escala de wafer reduz a sobrecarga de comunicação.

O treinamento foi conduzido em precisão bfloat16, e os modelos foram treinados do zero, sem checkpoints pré-existentes. O processo de treinamento usou um tamanho de lote de 256 sequências, cada uma com comprimento de 2048 tokens, e o total de tokens de treinamento para cada modelo foi determinado pela fórmula de Chinchilla. Por exemplo, o modelo de 13B foi treinado em aproximadamente 260 bilhões de tokens, enquanto o modelo de 111M foi treinado em cerca de 2,2 bilhões de tokens. Os dados de treinamento foram embaralhados e processados para garantir diversidade, e os modelos foram avaliados em benchmarks padrão, como modelagem de linguagem perplexidade e tarefas downstream.

Desempenho e Benchmarks

Os modelos Cerebras-GPT foram avaliados em vários benchmarks, incluindo LAMBADA, HellaSwag e Winogrande, que testam compreensão e raciocínio de linguagem. Os resultados mostraram que os modelos tiveram desempenho competitivo com outros modelos de código aberto de tamanho semelhante, como os da OpenAI e Anthropic, apesar de terem sido treinados com uma receita mais simples. Por exemplo, o modelo de 13B alcançou uma precisão LAMBADA de 72,3%, que é comparável a outros modelos de 13B disponíveis na época. Os modelos também demonstraram forte desempenho no conjunto de validação retido do Pile, com a perplexidade diminuindo à medida que o tamanho do modelo aumentava, como esperado.

Um aspecto notável do Cerebras-GPT é seu foco na eficiência computacional. A empresa relatou que treinar o modelo de 13B no CS-2 levou aproximadamente 10 dias, enquanto uma execução de treinamento comparável em um cluster de 512 NVIDIA A100 GPUs levaria cerca de 30 dias. Essa eficiência é atribuída ao design em escala de wafer, que elimina a necessidade de paralelismo de modelo e reduz a comunicação entre chips. Os modelos foram lançados sob a licença Apache 2.0, permitindo uso e modificação irrestritos, o que foi uma medida deliberada para promover pesquisa e desenvolvimento na comunidade de código aberto.

Comparação com Outros Modelos

Na época do lançamento, o Cerebras-GPT se destacou entre os modelos de código aberto por sua adesão à lei de escalonamento de Chinchilla. Muitos modelos anteriores, como o GPT-3, foram treinados com mais dados do que o computacionalmente ótimo, levando a ineficiências. O Cerebras-GPT foi uma das primeiras famílias a seguir explicitamente a abordagem computacionalmente ótima, o que significava que cada modelo era treinado exatamente com a quantidade certa de dados para sua contagem de parâmetros. Essa abordagem foi validada pelo fato de que os modelos alcançaram desempenho comparável ou melhor do que modelos treinados com proporções subótimas de dados para parâmetros.

Em comparação com modelos posteriores como LLaMA (que foi lançado mais tarde em 2023), o Cerebras-GPT era menor em tamanho máximo, mas oferecia um estudo mais sistemático de escalonamento. Os modelos também eram notáveis por sua reprodutibilidade, pois o código de treinamento e as configurações foram disponibilizados como código aberto, permitindo que pesquisadores replicassem os resultados. No entanto, os modelos não foram ajustados por instruções ou ajustados para chat, então foram destinados principalmente à pesquisa sobre leis de escalonamento e treinamento eficiente, em vez de implantação em aplicações.

Impacto e Legado

O Cerebras-GPT contribuiu para a tendência mais ampla de democratizar modelos de linguagem de grande porte, fornecendo uma família de modelos que podiam ser executados em hardware modesto. O menor modelo (111M) podia ser ajustado em uma única GPU, enquanto o maior (13B) exigia uma configuração de múltiplas GPUs, mas ainda era acessível a muitos laboratórios de pesquisa. O lançamento também destacou o potencial de arquiteturas de hardware alternativas, como a integração em escala de wafer, na redução do custo e da pegada de energia do treinamento de modelos grandes.

Os modelos foram usados em pesquisas subsequentes sobre aprendizagem curricular e aumento de dados, pois sua natureza de código aberto permitia fácil experimentação. A Cerebras Systems continuou a desenvolver modelos maiores, como as variantes Cerebras-GPT 7B e, posteriormente, Cerebras-GPT 13B, mas a família original permanece como um ponto de referência para treinamento computacionalmente ótimo. A empresa também usou a experiência para informar o desenvolvimento de seu hardware de próxima geração, o CS-3, que foi anunciado em 2024.

Disponibilidade e Uso

Os modelos Cerebras-GPT estão disponíveis no Hugging Face e através do Cerebras Model Zoo, que fornece checkpoints pré-treinados e scripts de inferência. Os modelos podem ser usados com frameworks de aprendizado de máquina padrão, como PyTorch, e o código de treinamento está disponível no GitHub. A licença Apache 2.0 permite uso comercial, tornando os modelos atraentes para startups e empresas que desejam implantar modelos de linguagem sem taxas de licenciamento. No entanto, os usuários devem estar cientes de que os modelos não foram alinhados com preferências humanas, então podem produzir saídas tendenciosas ou prejudiciais, e salvaguardas apropriadas são recomendadas para implantação.

Em resumo, o Cerebras-GPT é uma contribuição significativa para o campo da inteligência artificial, demonstrando que o treinamento computacionalmente ótimo é alcançável com hardware especializado e fornecendo um recurso valioso para pesquisadores que estudam leis de escalonamento e eficiência de modelos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:large-language-models·open-source-ai·scaling-laws·wafer-scale-computing
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico