Traduzido do inglês

WikiText é um conjunto de dados de modelagem de linguagem em larga escala derivado de artigos da Wikipédia, amplamente utilizado para treinar e avaliar modelos de redes neurais em processamento de linguagem natural.

WikiText é uma coleção de conjuntos de dados de texto em inglês extraídos de artigos verificados da Wikipédia, projetada para treinamento e avaliação de modelos de linguagem. Foi introduzido para fornecer um corpus maior e mais realista do que conjuntos de dados anteriores, como o Penn Treebank, com foco em preservar a estrutura original dos artigos, incluindo títulos, listas e links. O conjunto de dados é comumente usado em pesquisas sobre aprendizado de máquina e aprendizado profundo para tarefas como previsão da próxima palavra e avaliação de modelos.

As principais versões são WikiText-2 e WikiText-103, contendo 2 milhões e 103 milhões de tokens, respectivamente. Esses conjuntos de dados são curados para excluir tabelas e listas, e retêm o texto bruto com tokens especiais para palavras desconhecidas, tornando-os adequados para testar a capacidade dos modelos de lidar com um grande vocabulário e dependências de longo prazo. WikiText se tornou um benchmark padrão no campo, citado em inúmeros artigos sobre redes neurais e grandes modelos de linguagem.

Construção do Conjunto de Dados

O WikiText foi criado pela Salesforce Research em 2016, com o objetivo de fornecer um corpus mais desafiador do que as opções anteriores. O processo de extração envolveu a seleção de artigos da Wikipédia classificados como 'Bons' ou 'Destacados' pela comunidade da Wikipédia, garantindo alta qualidade e consistência. O texto foi então limpo para remover a marcação, mas a capitalização original, pontuação e números foram preservados, o que é uma diferença em relação a conjuntos de dados anteriores que frequentemente convertiam tudo para minúsculas.

Uma característica chave é o uso de um vocabulário de 267.735 palavras para o WikiText-103, que inclui todas as palavras que aparecem pelo menos três vezes no conjunto de treinamento. Palavras raras são substituídas por um token '<unk>'. Esse grande vocabulário força os modelos a aprender representações para muitas palavras, testando sua capacidade de generalização. O conjunto de dados é dividido em conjuntos de treinamento, validação e teste, com o conjunto de teste contendo artigos de um período diferente para evitar vazamento de dados.

Aplicações em Modelagem de Linguagem

O WikiText é usado principalmente para avaliar modelos de linguagem, que preveem a probabilidade de uma sequência de palavras. Pesquisadores o utilizam para medir a perplexidade, uma métrica que indica quão bem um modelo prevê a próxima palavra. Pontuações de perplexidade mais baixas são melhores, e o WikiText-103 se tornou um padrão para comparar modelos baseados em transformers, como os desenvolvidos pela OpenAI e Google DeepMind.

Por exemplo, modelos como GPT-2 e BERT foram avaliados no WikiText-103, com pontuações de perplexidade relatadas melhorando ao longo do tempo. Os artigos longos do conjunto de dados, com média de cerca de 3.000 palavras, testam a capacidade de um modelo de lidar com contexto de longo alcance, o que é crucial para tarefas como sumarização de documentos e resposta a perguntas. Isso torna o WikiText um recurso valioso para avançar a pesquisa em inteligência artificial.

Comparação com Outros Conjuntos de Dados

Antes do WikiText, o benchmark padrão era o Penn Treebank (PTB), que contém apenas cerca de 1 milhão de tokens de artigos do Wall Street Journal. O PTB é menor e tem um vocabulário restrito, tornando mais fácil para os modelos alcançarem baixa perplexidade. O WikiText oferece um desafio mais realista ao usar um vocabulário maior e documentos mais longos, o que reflete melhor o texto do mundo real.

Outro conjunto de dados, o One Billion Word Benchmark, é maior, mas consiste em frases embaralhadas, perdendo a estrutura do documento. O WikiText mantém a ordem original dos artigos, permitindo que os modelos aprendam com narrativas coerentes. Essa diferença estrutural é significativa para treinar modelos que precisam entender o contexto entre frases e parágrafos, uma capacidade essencial para sistemas de IA generativa.

Limitações e Críticas

Apesar de sua popularidade, o WikiText tem limitações. O conjunto de dados é derivado da Wikipédia, que tem um estilo formal e enciclopédico, portanto, pode não representar linguagem informal ou conversacional. Além disso, o processo de limpeza remove tabelas e listas, que podem ser informativas para certas tarefas. Alguns pesquisadores notaram que o tratamento do token '<unk>' pode enviesar a avaliação, pois os modelos podem depender dele em vez de aprender palavras raras.

Outra crítica é que o WikiText-103, embora grande, ainda é menor do que conjuntos de dados modernos em escala web usados para treinar grandes modelos de linguagem como os da Anthropic ou Microsoft (AI). Em 2025, muitos modelos são treinados com trilhões de tokens, tornando o WikiText mais um benchmark para pesquisa acadêmica do que uma fonte de treinamento para sistemas de produção. No entanto, ele continua sendo um padrão para comparações reproduzíveis no campo.

Direções Futuras

O desenvolvimento do WikiText influenciou a criação de outros conjuntos de dados, como The Pile e RedPajama, que combinam múltiplas fontes. Esses conjuntos de dados mais novos visam abordar as limitações do WikiText ao incluir diversos tipos de texto e escalas maiores. No entanto, a simplicidade e a facilidade de uso do WikiText garantem sua relevância contínua na educação e na pesquisa, particularmente para aqueles que estudam fundamentos de aprendizado profundo.

Pesquisadores também estão explorando maneiras de adaptar o WikiText para tarefas multilíngues e multimodais, embora a versão original seja apenas em inglês. À medida que os modelos de IA evoluem, a necessidade de conjuntos de dados estruturados e de alta qualidade permanece, e o WikiText serve como um exemplo fundamental de como construir tais recursos. Seu legado é evidente nos muitos artigos que o citam como linha de base, garantindo seu lugar na história do desenvolvimento de aprendizado de máquina.

Veja Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·natural-language-processing·language-modeling·wikipedia
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico