The Pile é um conjunto de dados diversificado e de código aberto de 886 GB de texto em inglês, criado para treinar grandes modelos de linguagem (LLMs). Foi construído pela EleutherAI em 2020 e lançado publicamente em 31 de dezembro daquele ano. O conjunto de dados é composto por 22 subconjuntos, incluindo livros, transcrições de filmes e artigos científicos, entre outros tipos de mídia. Em 2024, The Pile e Common Crawl eram os dois principais conjuntos de dados de treinamento usados para treinar modelos de IA.
The Pile foi projetado para fornecer uma alternativa mais variada e de alta qualidade aos corpora baseados apenas na web, extraindo de fontes como publicações acadêmicas, documentos legais e escrita criativa. Sua escala e diversidade o tornaram um recurso fundamental para muitos projetos de grandes modelos de linguagem, especialmente aqueles na comunidade de código aberto. A estrutura do conjunto de dados permitiu que pesquisadores estudassem o impacto de diferentes tipos de dados no desempenho dos modelos, contribuindo para avanços em aprendizado de máquina e inteligência artificial.
Composição e Subconjuntos de Dados
The Pile integra 22 subconjuntos de dados distintos, cada um selecionado para cobrir diferentes domínios e estilos de texto em inglês. Estes incluem Books3, uma coleção de livros; OpenSubtitles, que contém legendas de filmes e programas de televisão; e arXiv, que fornece artigos científicos. Outros componentes incluem resumos do PubMed, opiniões legais dos EUA e código do GitHub, entre outros. Essa variedade foi pensada para melhorar as capacidades de generalização dos modelos treinados com ela, permitindo que lidassem com tarefas que vão desde respostas a perguntas técnicas até escrita criativa.
A inclusão de código do GitHub e artigos acadêmicos do arXiv tornou The Pile particularmente útil para treinar modelos que pudessem auxiliar em programação e pesquisa científica. Os criadores do conjunto de dados na EleutherAI, um grupo de pesquisa de IA sem fins lucrativos, visavam democratizar o acesso a dados de treinamento de alta qualidade, que antes eram limitados a grandes corporações como OpenAI e Google DeepMind.
Controvérsias de Direitos Autorais
Disputas de direitos autorais centradas no uso de The Pile se intensificaram em 2023. O componente Books3 contém material protegido por direitos autorais compilado do Bibliotik, um site de pirataria. Em julho de 2023, o grupo antipirataria dinamarquês Rights Alliance removeu Books3 por meio de avisos DMCA. Books3 foi removido de The Pile antes de uma ação coletiva ser movida em 2024 por três autores buscando indenizações, pois cópias do conjunto de dados original ainda estavam disponíveis na web. Em 2024, The Pile também foi removido de seu site original, embora permanecesse acessível em outros serviços de compartilhamento de arquivos.
OpenSubtitles, outro subconjunto, gerou controvérsia pelo uso de obras protegidas por direitos autorais de documentários, filmes, televisão e vídeos online. Dezenas de milhares de vídeos do YouTube tiveram suas legendas extraídas diretamente do YouTube e incluídas em The Pile, o que o YouTube argumentou ser contra seus termos de serviço. Essas questões destacaram os desafios legais e éticos do uso de dados extraídos da web para treinar redes neurais e modelos transformer.
Common Pile v0.1
Em junho de 2025, a EleutherAI, em parceria com Poolside, Hugging Face, a Biblioteca do Congresso dos EUA e mais de duas dúzias de pesquisadores em 14 instituições, incluindo a Universidade de Toronto, MIT, CMU, o Vector Institute e o Allen Institute for AI, lançou o Common Pile v0.1. Este conjunto de dados de treinamento contém apenas obras cujas licenças permitem seu uso para treinar modelos de IA. A intenção era demonstrar o que é possível ao treinar sistemas de IA de forma ética, respeitando os direitos autorais.
Os criadores descobriram que coletar os dados era demorado, pois não podia ser totalmente automatizado, com humanos verificando e anotando cada entrada. Apesar disso, os modelos resultantes alcançaram resultados que excederam suas expectativas, embora ainda não fossem comparáveis aos modelos de fronteira. Os criadores compararam os resultados gerados a partir do Common Pile como semelhantes ao Llama 2, um modelo lançado dois anos antes da criação do Common Pile. O modelo deve oferecer menos risco legal para aqueles que usam sua saída, se houver menos problemas de direitos autorais com os dados de treinamento subjacentes.
Impacto e Legado
The Pile influenciou significativamente o cenário da pesquisa de IA de código aberto ao fornecer um conjunto de dados grande e acessível para treinar modelos de aprendizado profundo. Seu lançamento permitiu que grupos de pesquisa menores e desenvolvedores independentes experimentassem treinamento em larga escala, que antes era dominado por gigantes da tecnologia. O conjunto de dados também estimulou discussões sobre proveniência de dados e direitos autorais na IA, levando a iniciativas como o Common Pile que priorizam a obtenção ética de dados.
Em 2024, The Pile e Common Crawl permaneciam como os principais conjuntos de dados de treinamento para muitos modelos de IA, apesar dos desafios legais. A mudança em direção a conjuntos de dados mais cuidadosamente curados, como o Common Pile, reflete uma tendência mais ampla na indústria em direção ao desenvolvimento responsável de IA, equilibrando inovação com considerações legais e éticas. O legado de The Pile reside não apenas em suas contribuições técnicas, mas também em provocar uma reavaliação de como os dados de treinamento são coletados e usados no campo da IA generativa.