Traduzido do inglês

EleutherAI é um grupo de pesquisa sem fins lucrativos em inteligência artificial fundado em 2020 para criar versões de código aberto do GPT-3, conhecido por lançar grandes modelos de linguagem e conjuntos de dados como The Pile e GPT-NeoX-20B.

EleutherAI é um grupo de pesquisa não lucrativo em inteligência artificial que desenvolve modelos de IA e conjuntos de dados de código aberto. Fundado em 2020, o coletivo é frequentemente descrito como uma contraparte de código aberto da OpenAI, com o objetivo de democratizar o acesso a modelos de linguagem de grande porte e pesquisas relacionadas. No início de 2023, formalizou-se como o Instituto EleutherAI, um instituto de pesquisa sem fins lucrativos. Em 2025, a organização mantém conjuntos de dados de treinamento amplamente utilizados, conduz pesquisas em áreas como interpretabilidade e alinhamento, e participa de discussões de políticas públicas.

O grupo originou-se em um servidor do Discord e cresceu até se tornar uma comunidade colaborativa de centenas de pesquisadores voluntários. Seu trabalho influenciou o campo mais amplo da IA generativa ao fornecer modelos e conjuntos de dados disponíveis gratuitamente, que impulsionaram novas startups e pesquisas acadêmicas.

História

EleutherAI começou como um servidor do Discord em 7 de julho de 2020, sob o nome provisório "LibreAI", antes de ser renomeado para "EleutherAI" no final daquele mês, em referência à palavra grega para liberdade, eleutheria. Os membros fundadores foram Connor Leahy, Leo Gao e Sid Black, que coescreveram o código inicial para criar um modelo de aprendizado de máquina semelhante ao GPT-3.

Em 31 de dezembro de 2020, o grupo lançou The Pile, um conjunto de dados curado com textos diversos para treinar modelos de linguagem de grande porte. Os primeiros modelos, GPT-Neo, foram lançados em 21 de março de 2021, seguidos pelo GPT-J-6B em 9 de junho de 2021, que era então o maior modelo de código aberto semelhante ao GPT-3. Esses modelos foram lançados sob a licença Apache 2.0 e são considerados por terem impulsionado uma onda totalmente nova de startups.

Inicialmente, EleutherAI recusou ofertas de financiamento, contando com o Programa de Pesquisa em Nuvem TPU do Google para computação. No início de 2021, aceitaram financiamento da CoreWeave e da SpellML na forma de acesso a clusters de GPU. Em 10 de fevereiro de 2022, lançaram o GPT-NeoX-20B, um modelo maior possibilitado por esses recursos.

No início de 2023, EleutherAI incorporou-se como um instituto de pesquisa sem fins lucrativos liderado por Stella Biderman, Curtis Huebner e Shivanshu Purohit. A organização mudou o foco para interpretabilidade, alinhamento e pesquisa científica, já que treinar e lançar LLMs havia se tornado mais comum em outros lugares.

Em julho de 2024, uma investigação da Proof News e da Wired descobriu que o conjunto de dados The Pile incluía legendas de mais de 170.000 vídeos do YouTube de mais de 48.000 canais, atraindo críticas e acusações de roubo. Em resposta, EleutherAI lançou o "Common Pile" em 2025, um conjunto de dados sem o material protegido por direitos autorais controverso, e treinou dois modelos a partir dele. Em colaboração com o Instituto de Segurança de IA do Reino Unido, também descobriram que filtrar dados de treinamento para remover conceitos-chave pode manter o desempenho enquanto reduz informações prejudiciais.

Pesquisa e Modelos

A pesquisa da EleutherAI abrange várias áreas, com centenas de colaboradores voluntários. O grupo lançou vários modelos e conjuntos de dados notáveis que são amplamente utilizados na comunidade de IA.

The Pile

The Pile é um conjunto de dados de 886 GB projetado para treinar modelos de linguagem de grande porte. Originalmente desenvolvido para o GPT-Neo, foi usado para treinar outros modelos, incluindo o Megatron-Turing Natural Language Generation da Microsoft. Suas características distintivas são a seleção curada de dados escolhidos por pesquisadores e sua documentação completa. A versão inicial enfrentou escrutínio por conter material protegido por direitos autorais, incluindo livros e legendas de várias mídias.

Common Pile

Common Pile v0.1, lançado em junho de 2025 em parceria com muitos colaboradores, contém apenas obras cujas licenças permitem o uso para treinar modelos de IA. Isso aborda os problemas de direitos autorais do The Pile.

Modelos GPT

EleutherAI treinou modelos de linguagem de grande porte de código aberto inspirados no GPT-3 da OpenAI, com contagens de parâmetros de 125 milhões, 1,3 bilhão, 2,7 bilhões, 6 bilhões e 20 bilhões. O GPT-Neo (125M, 1.3B, 2.7B) foi lançado em março de 2021, seguido pelo GPT-J (6B) em junho de 2021, ambos sendo os maiores modelos de código aberto no estilo GPT-3 em seus lançamentos. O GPT-NeoX-20B seguiu em 10 de fevereiro de 2022.

VQGAN-CLIP

Depois que a OpenAI lançou o DALL-E em janeiro de 2021 sem acesso público, Katherine Crowson, da EleutherAI, e o artista digital Ryan Murdock desenvolveram uma técnica usando o Contrastive Language-Image Pre-training (CLIP) para converter modelos de geração de imagens regulares em sistemas de síntese de texto para imagem. Com base em ideias do DeepDream do Google, eles combinaram CLIP com VQGAN para criar o VQGAN-CLIP. Crowson compartilhou a tecnologia por meio de notebooks que as pessoas podiam executar gratuitamente.

Impacto e Políticas

Os modelos e conjuntos de dados de código aberto da EleutherAI influenciaram significativamente o ecossistema de IA, permitindo que startups e pesquisadores trabalhassem com modelos de linguagem de grande porte sem restrições proprietárias. A organização também participa de discussões de políticas públicas, defendendo a pesquisa aberta e abordando preocupações éticas em torno do uso de dados e da segurança dos modelos.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:artificial-intelligence·open-source·non-profit·large-language-models
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico