Traduzido do inglês

O Common Crawl é uma organização sem fins lucrativos e seu arquivo gratuito e atualizado regularmente de dados de rastreamento da web, amplamente utilizado como matéria-prima para corpora de treinamento de modelos de linguagem de grande escala.

Common Crawl é uma organização sem fins lucrativos, e também o nome de seu arquivo regularmente atualizado e disponível gratuitamente, contendo petabytes de dados de rastreamento web, coletados ao rastrear sistematicamente bilhões de páginas da web e disponibilizando o HTML bruto, o texto extraído e os metadados para download público. Fundado em 2007 por Gil Elbaz, o Common Crawl antecede a era moderna dos modelos de linguagem de grande escala em mais de uma década, mas seu arquivo se tornou uma das matérias-primas mais importantes para o pré-treinamento de LLMs quando pesquisadores começaram a treinar grandes modelos de texto em dados em escala web no final dos anos 2010 e 2020.

O Common Crawl lança um novo rastreamento aproximadamente mensalmente, e em meados dos anos 2020 seu arquivo acumulado abrangia centenas de bilhões de páginas da web, tornando-o, ao lado de conjuntos de dados licenciados e curados, uma das maiores fontes únicas de texto bruto disponível para treinamento de IA.

História e operação

O Common Crawl foi estabelecido como uma organização sem fins lucrativos com a missão declarada de democratizar o acesso a dados em escala web que anteriormente estavam disponíveis principalmente para grandes empresas de mecanismos de busca, fornecendo a pesquisadores, startups e desenvolvedores independentes um recurso comparável em escala ao que Google ou Microsoft poderiam rastrear internamente. A organização recebeu financiamento e apoio de várias empresas de tecnologia e fundações ao longo dos anos. Seu rastreador segue links pela web pública de forma amplamente indiscriminada, sujeito a robots.txt e outras convenções padrão de rastreamento, o que significa que o arquivo bruto inclui uma ampla gama de qualidade de conteúdo, desde material de referência de alto valor até spam, texto de marketing e conteúdo gerado por IA de baixa qualidade em rastreamentos mais recentes.

Papel no treinamento de IA

Como o arquivo bruto do Common Crawl é não filtrado e altamente heterogêneo, a maioria dos laboratórios de IA não treina diretamente nele, mas constrói conjuntos de dados derivados e filtrados sobre ele. Exemplos bem conhecidos incluem o conjunto de dados C4 usado para treinar o modelo T5 do Google, os conjuntos de dados subjacentes aos primeiros modelos GPT, como GPT-2 e GPT-3, e RefinedWeb e FineWeb, derivados filtrados e deduplicados do Common Crawl lançados por grupos de pesquisa afiliados à Hugging Face e outros nos anos 2020 especificamente para treinamento aberto de modelos de fundação. Esses conjuntos de dados derivados aplicam etapas como deduplicação, identificação de idioma, classificadores de qualidade treinados para imitar texto de referência curado como a Wikipédia, e filtragem de toxicidade ou spam, geralmente retendo apenas uma fração das páginas rastreadas originais.

Críticas e controvérsias

O papel do Common Crawl como insumo fundamental para o treinamento comercial de IA atraiu escrutínio crescente junto com a onda mais ampla de processos judiciais de direitos autorais de IA a partir de 2023, uma vez que o arquivo inclui artigos de notícias, livros e outros materiais protegidos por direitos autorais coletados sem a permissão explícita dos detentores de direitos, reunidos sob as mesmas normas de rastreamento web nas quais os mecanismos de busca há muito se baseavam, mas aplicadas a um caso de uso novo e mais controverso. Alguns editores passaram a bloquear o rastreador do Common Crawl, o CCBot, via robots.txt após 2023 especificamente para impedir que seu conteúdo fluísse para pipelines de treinamento de IA, uma resposta espelhada em muitos sites em relação a rastreadores relacionados à IA em geral. O Common Crawl afirmou que cumpre tais exclusões e opera como um serviço neutro de coleta de dados, argumentando que a responsabilidade pelo uso downstream recai sobre as organizações que constroem conjuntos de dados de treinamento a partir de seu arquivo.

Significância

A existência contínua do Common Crawl como uma alternativa gratuita e aberta a índices web proprietários foi citada por pesquisadores, incluindo em organizações como EleutherAI e o Allen Institute for AI, como importante para permitir que a pesquisa de IA não comercial e de código aberto permaneça viável em um campo cada vez mais dominado por laboratórios fechados bem financiados com sua própria infraestrutura privada de rastreamento.

Categorias:datasets·infrastructure
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico