EleutherAI começou em julho de 2020 como um coletivo informal de pesquisa voluntária, organizado principalmente por meio de um servidor no Discord, formado em resposta à decisão da OpenAI de lançar o GPT-3 apenas por meio de uma API comercial, em vez de pesos abertos ou com detalhes completos de treinamento. Os primeiros organizadores incluíram Connor Leahy, Leo Gao e Sid Black, e o grupo atraiu contribuições de pesquisadores independentes, estudantes de pós-graduação e engenheiros que queriam um equivalente publicamente disponível ao GPT-3 para fins de pesquisa.
O Pile e os primeiros modelos
A primeira grande produção da EleutherAI foi o Pile, um conjunto de dados curado de 800 gigabytes, montado a partir de 22 fontes menores, incluindo livros, artigos acadêmicos, repositórios de código e texto da web, lançado em 2020 como uma alternativa aberta às misturas não divulgadas de dados de treinamento usadas por laboratórios fechados. O Pile tornou-se um corpus de pré-treinamento amplamente utilizado, adotado muito além dos próprios modelos da EleutherAI por outros esforços de pesquisa aberta, em um papel comparável ao que o Common Crawl havia fornecido como dados brutos da web. O grupo então treinou e lançou o GPT-Neo e o GPT-J, modelos de linguagem transformer que, embora menores que o GPT-3, estavam entre os maiores checkpoints abertamente disponíveis de sua época, seguidos em 2022 pelo GPT-NeoX-20B, então um dos maiores lançamentos abertos de modelo de fundação publicamente disponíveis.
Formalização e trabalhos posteriores
A EleutherAI incorporou-se como um instituto de pesquisa sem fins lucrativos em 2022, formalizando o que havia começado como um esforço voluntário ad hoc e permitindo que recebesse bolsas e doações, incluindo apoio de organizações interessadas em segurança de IA e acesso aberto à pesquisa. A organização expandiu seu escopo além da replicação de modelos de linguagem para pesquisa empírica mais ampla sobre comportamento de modelos, interpretabilidade e metodologia de avaliação, e manteve e distribuiu ferramentas de avaliação, incluindo um harness de avaliação de LLM amplamente utilizado, adotado em toda a comunidade de pesquisa para medir o desempenho em benchmarks de forma consistente.
Legado e influência
Os modelos e conjuntos de dados da EleutherAI antecederam e informaram diretamente a onda de lançamentos de pesos abertos que se seguiu, incluindo trabalhos posteriormente hospedados extensivamente no Hugging Face e esforços de organizações mais bem financiadas, como o Allen Institute for AI e o programa LLaMA da Meta AI. Comentaristas creditaram ao coletivo ter demonstrado que um grupo frouxamente organizado, em grande parte voluntário, sem grande apoio corporativo, poderia contribuir significativamente para a pesquisa de modelos de linguagem na fronteira, e ter estabelecido normas em torno da documentação de conjuntos de dados e lançamentos abertos que esforços posteriores de modelos abertos, mais bem financiados, continuaram a seguir.