Traduzido do inglês

OpenWebText é um conjunto de dados de código aberto de páginas web extraídas de submissões do Reddit, criado para replicar o corpus privado WebText usado no treinamento do modelo de linguagem GPT-2 da OpenAI. Ele fornece um corpus de texto grande e diversificado para treinar e avaliar modelos de linguagem de grande porte.

OpenWebText é um conjunto de dados de código aberto de páginas da web extraídas de submissões do Reddit, criado para replicar o corpus privado WebText usado para treinar o modelo de linguagem GPT-2 da OpenAI. Ele fornece um corpus de texto grande e diversificado para treinar e avaliar modelos de linguagem de grande porte.

Contexto e Motivação

O OpenWebText foi introduzido em 2019 por Aaron Gokaslan e Vanya Cohen, pesquisadores na época afiliados à Universidade de Maryland e à Universidade Johns Hopkins, respectivamente. A motivação veio da decisão da OpenAI de não divulgar o conjunto de dados completo do WebText, usado para treinar o GPT-2. O WebText consistia em links externos de postagens do Reddit que receberam pelo menos 3 de karma, totalizando aproximadamente 40GB de texto. Para permitir a reprodutibilidade e pesquisas adicionais, Gokaslan e Cohen criaram o OpenWebText coletando todos os links externos de submissões do Reddit de 2005 até abril de 2018, aplicando o mesmo limite de karma e filtrando conteúdo em inglês. O conjunto de dados resultante contém mais de 8 milhões de documentos, totalizando cerca de 38GB de texto, espelhando de perto o tamanho e a diversidade do WebText original.

Características do Conjunto de Dados

O OpenWebText é um corpus de texto não estruturado e em grande escala. Ao contrário de conjuntos de dados curados, como Wikipedia ou livros, ele captura uma ampla variedade de estilos de escrita, tópicos e formatos, incluindo artigos de notícias, postagens de blogs, discussões em fóruns e sites pessoais. Essa diversidade o torna valioso para treinar modelos de linguagem de propósito geral. O conjunto de dados é fornecido como uma coleção de arquivos de texto, com cada documento separado por uma nova linha. Ele é comumente usado na comunidade de pesquisa como referência para avaliar o desempenho de modelos em previsão de próxima palavra e outras tarefas de modelagem de linguagem. No entanto, por ser derivado de conteúdo público da web, ele herda problemas como conteúdo duplicado, texto de baixa qualidade e possíveis vieses presentes no discurso online.

Uso no Treinamento de Modelos de Linguagem

O OpenWebText foi amplamente adotado no campo do processamento de linguagem natural (PLN). Ele serve como um corpus de treinamento padrão para muitos modelos de linguagem de código aberto, incluindo variantes do GPT-2 e outras arquiteturas baseadas em transformadores. Por exemplo, a Hugging Face fornece uma versão pré-processada do OpenWebText que é comumente usada para ajuste fino e avaliação. Pesquisadores frequentemente o usam para comparar o desempenho de modelos com o GPT-2, pois ele fornece uma distribuição de treinamento comparável. O conjunto de dados também tem sido usado em estudos sobre curadoria de dados, escalonamento de modelos e efeitos dos dados de treinamento no comportamento do modelo. Sua disponibilidade facilitou a pesquisa reproduzível no desenvolvimento de modelos de linguagem de grande porte, particularmente no contexto da IA generativa.

Impacto e Limitações

O OpenWebText teve um impacto significativo na comunidade de IA de código aberto ao democratizar o acesso a um corpus web em grande escala. Ele permitiu que pesquisadores sem acesso a conjuntos de dados proprietários treinassem e avaliassem modelos de escala semelhante ao GPT-2. No entanto, o conjunto de dados tem limitações. Ele não é tão limpo quanto corpora curados e contém uma quantidade substancial de texto boilerplate, elementos de navegação e outros ruídos. Além disso, a metodologia de coleta baseada no karma do Reddit introduz um viés de seleção, favorecendo conteúdo que agrada aos usuários do Reddit. O conjunto de dados também carece de informações de licenciamento explícitas para muitas das páginas da web incluídas, levantando preocupações de direitos autorais. Apesar desses problemas, o OpenWebText permanece um recurso fundamental no desenvolvimento de modelos de linguagem de grande porte e continua a ser referenciado na literatura acadêmica.

Conjuntos de Dados Relacionados e Evolução

O OpenWebText faz parte de um ecossistema mais amplo de conjuntos de dados de texto em escala web usados em PLN. Outros exemplos notáveis incluem o Common Crawl, que é uma varredura massiva da web, e o The Pile, uma coleção curada de fontes diversas. Conjuntos de dados mais recentes, como C4 (Colossal Clean Crawled Corpus) e RefinedWeb, foram desenvolvidos para lidar com alguns dos problemas de ruído e qualidade presentes em varreduras web brutas. Esses conjuntos de dados mais novos empregam técnicas mais sofisticadas de filtragem e deduplicação. No entanto, o OpenWebText permanece relevante como uma referência histórica e uma linha de base para avaliar métodos de curadoria de dados. Sua criação também destacou a importância de dados abertos no campo da inteligência artificial, influenciando esforços subsequentes para liberar corpora de treinamento para uso público.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·datasets·machine-learning
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico