C4, abreviação de Colossal Clean Crawled Corpus, é um conjunto de dados de texto em larga escala usado para pré-treinamento de modelos de linguagem de grande porte. Foi introduzido por pesquisadores da Google em 2019 como parte do projeto original baseado em Transformer (architecture) T5 (Text-to-Text Transfer Transformer). O conjunto de dados consiste em centenas de gigabytes de texto em inglês extraídos do arquivo Common Crawl, um repositório publicamente disponível de bilhões de páginas da web coletadas ao longo de muitos anos. O C4 foi projetado para fornecer uma alternativa mais limpa e gerenciável aos dados brutos de rastreamento da web, que normalmente contêm ruído significativo, como texto de navegação padrão, conteúdo duplicado e texto de baixa qualidade ou gerado por máquina.
A criação do C4 envolveu um pipeline de filtragem em várias etapas aplicado aos dados brutos do Common Crawl. A etapa inicial envolveu a deduplicação do conjunto de dados, removendo sentenças e documentos quase idênticos, o que ajudou a reduzir redundância e melhorar a eficiência do treinamento. Em seguida, o pipeline removeu páginas que continham texto de espaço reservado, como "lorem ipsum" ou frases comuns de boilerplate, e descartou páginas que não eram predominantemente em inglês, conforme determinado por um classificador de idiomas. Além disso, o pipeline filtrou páginas contendo conteúdo ofensivo ou inadequado, incluindo aquelas com certas palavras-chave ou termos. O conjunto de dados final compreendeu aproximadamente 750 gigabytes de texto, ou cerca de 156 bilhões de tokens, tornando-o um dos maiores corpora de pré-treinamento publicamente disponíveis na época.
Composição e Características
O conjunto de dados C4 é notável por sua escala e diversidade. Inclui texto de uma ampla gama de domínios da web, incluindo artigos de notícias, blogs, fóruns e páginas acadêmicas. No entanto, por ser derivado de rastreamentos da web, o conjunto de dados reflete os vieses e limitações do conteúdo da web, como a super-representação de certos tópicos e a sub-representação de outros. O processo de filtragem também introduziu um viés em direção ao inglês formal e bem escrito, pois removeu muitos textos informais ou não padronizados. Pesquisadores desde então analisaram o C4 quanto a questões como contaminação de dados (onde conjuntos de teste se sobrepõem a dados de treinamento) e a presença de informações pessoalmente identificáveis, levando ao desenvolvimento de versões mais refinadas, como C4-200M e C4-en-1.0.
Uso em Pré-treinamento
O C4 foi originalmente usado para pré-treinar o modelo T5, que enquadrou todas as tarefas de processamento de linguagem natural como problemas de texto para texto. O tamanho e a limpeza do conjunto de dados o tornaram adequado para treinar modelos com bilhões de parâmetros. Após o T5, o C4 se tornou um padrão de referência para avaliar técnicas de curadoria de dados e foi adotado por muitos modelos subsequentes, incluindo variantes de BERT e GPT. Por exemplo, o modelo GPT-3 da OpenAI usou uma abordagem semelhante de filtragem do Common Crawl, embora não o conjunto de dados C4 exato. O conjunto de dados também serviu como base para extensões multilíngues, como o mC4, que cobre mais de 100 idiomas.
Impacto e Legado
A introdução do C4 teve um impacto significativo no campo de aprendizado de máquina e inteligência artificial. Demonstrou a importância da qualidade dos dados no pré-treinamento de modelos em larga escala, mostrando que uma filtragem cuidadosa poderia levar a melhorias substanciais no desempenho em tarefas downstream. O C4 também destacou os desafios práticos de trabalhar com dados em escala da web, incluindo armazenamento, processamento e considerações éticas. Sua liberação como um conjunto de dados aberto permitiu que pesquisadores em todo o mundo experimentassem pré-treinamento em larga escala sem precisar coletar seus próprios rastreamentos da web, democratizando o acesso a dados de treinamento de alta qualidade.
Limitações e Críticas
Apesar de seu uso generalizado, o C4 enfrentou críticas. O processo de filtragem, embora eficaz na remoção de ruído, também removeu conteúdo que poderia ser valioso para certas tarefas, como trechos de código ou dialetos não padronizados do inglês. A dependência do conjunto de dados em texto exclusivamente em inglês limitou sua aplicabilidade a modelos multilíngues, embora isso tenha sido posteriormente abordado pelo mC4. Além disso, o C4 original não foi totalmente deduplicado no nível de documento, levando a possíveis vieses de conteúdo repetido. Pesquisadores também notaram que o conjunto de dados contém informações desatualizadas, pois foi derivado de rastreamentos da web até 2019, e que pode incluir material protegido por direitos autorais, levantando questões legais e éticas sobre seu uso em modelos comerciais.
Ver Também
- Common Crawl
- T5
- Curadoria de Dados
- Pré-treinamento