I need the source text to translate. Please provide the English Wikipedia article content.

Traducido del inglés

WikiText es un conjunto de datos de modelado de lenguaje a gran escala derivado de artículos de Wikipedia, ampliamente utilizado para entrenar y evaluar modelos de redes neuronales en el procesamiento del lenguaje natural.

WikiText es una colección de conjuntos de datos de texto en inglés extraídos de artículos verificados de Wikipedia, diseñados para el entrenamiento y la evaluación de modelos de lenguaje. Se introdujo para proporcionar un corpus más amplio y realista que conjuntos de datos anteriores como Penn Treebank, con un enfoque en preservar la estructura original de los artículos, incluidos encabezados, listas y enlaces. Este conjunto de datos se utiliza comúnmente en la investigación de aprendizaje automático y aprendizaje profundo para tareas como la predicción de la siguiente palabra y la evaluación de modelos.

Las versiones principales son WikiText-2 y WikiText-103, que contienen 2 millones y 103 millones de tokens, respectivamente. Estos conjuntos de datos están curados para excluir tablas y listas, y conservan el texto sin procesar con tokens especiales para palabras desconocidas, lo que los hace adecuados para evaluar la capacidad de los modelos para manejar un vocabulario extenso y dependencias de largo alcance. WikiText se ha convertido en un punto de referencia estándar en el campo, citado en numerosos artículos sobre redes neuronales y modelos de lenguaje grandes.

Construcción del conjunto de datos

WikiText fue creado por Salesforce Research en 2016, con el objetivo de ofrecer un corpus más desafiante que las opciones anteriores. El proceso de extracción consistió en seleccionar artículos de Wikipedia que fueron calificados como 'buenos' o 'destacados' por la comunidad de Wikipedia, garantizando así alta calidad y consistencia. El texto se limpió para eliminar el marcado, pero se conservaron las mayúsculas, la puntuación y los números, a diferencia de conjuntos de datos anteriores que a menudo normalizaban todo a minúsculas.

Una característica clave es el uso de un vocabulario de 267,735 palabras para WikiText-103, que incluye todas las palabras que aparecen al menos tres veces en el conjunto de entrenamiento. Las palabras raras se reemplazan con el token '<unk>'. Este amplio vocabulario obliga a los modelos a aprender representaciones para muchas palabras, poniendo a prueba su capacidad de generalización. El conjunto de datos se divide en conjuntos de entrenamiento, validación y prueba, y el conjunto de prueba contiene artículos de un período diferente para evitar la filtración de datos.

Aplicaciones en el modelado de lenguaje

WikiText se utiliza principalmente para evaluar modelos de lenguaje, que predicen la probabilidad de una secuencia de palabras. Los investigadores lo emplean para medir la perplejidad, una métrica que indica qué tan bien predice un modelo la siguiente palabra. Puntuaciones más bajas de perplejidad son mejores, y WikiText-103 se ha convertido en un estándar para comparar modelos basados en transformers, como los desarrollados por OpenAI y Google DeepMind.

Por ejemplo, modelos como GPT-2 y BERT han sido evaluados en WikiText-103, con puntuaciones de perplejidad que mejoran con el tiempo. Los artículos largos del conjunto de datos, que promedian alrededor de 3,000 palabras, ponen a prueba la capacidad de los modelos para manejar contexto de largo alcance, algo crucial para tareas como el resumen de documentos y la respuesta a preguntas. Esto hace que WikiText sea un recurso valioso para avanzar en la investigación de inteligencia artificial.

Comparación con otros conjuntos de datos

Antes de WikiText, el punto de referencia estándar era Penn Treebank (PTB), que contiene solo alrededor de 1 millón de tokens de artículos del Wall Street Journal. PTB es más pequeño y tiene un vocabulario restringido, lo que facilita que los modelos alcancen baja perplejidad. WikiText ofrece un desafío más realista al usar un vocabulario más amplio y documentos más largos, reflejando mejor el texto del mundo real.

Otro conjunto de datos, el One Billion Word Benchmark, es más grande pero consiste en oraciones barajadas, perdiendo la estructura del documento. WikiText conserva el orden original de los artículos, permitiendo que los modelos aprendan de narrativas coherentes. Esta diferencia estructural es significativa para entrenar modelos que necesitan comprender el contexto a través de oraciones y párrafos, una capacidad clave para los sistemas de IA generativa.

Limitaciones y críticas

A pesar de su popularidad, WikiText tiene limitaciones. El conjunto de datos se deriva de Wikipedia, que tiene un estilo formal y enciclopédico, por lo que puede no representar el lenguaje informal o conversacional. Además, el proceso de limpieza elimina tablas y listas, que pueden ser informativas para ciertas tareas. Algunos investigadores han señalado que el manejo del token '<unk>' puede sesgar la evaluación, ya que los modelos podrían depender de él en lugar de aprender palabras raras.

Otra crítica es que WikiText-103, aunque grande, sigue siendo más pequeño que los conjuntos de datos modernos a escala web utilizados para entrenar modelos de lenguaje grandes como los de Anthropic o Microsoft. A partir de 2025, muchos modelos se entrenan con billones de tokens, lo que hace que WikiText sea más un punto de referencia académico que una fuente de entrenamiento para sistemas de producción. No obstante, sigue siendo un estándar para comparaciones reproducibles en el campo.

Direcciones futuras

El desarrollo de WikiText ha influido en la creación de otros conjuntos de datos, como The Pile y RedPajama, que combinan múltiples fuentes. Estos conjuntos más nuevos buscan abordar las limitaciones de WikiText al incluir diversos tipos de texto y escalas más grandes. Sin embargo, la simplicidad y facilidad de uso de WikiText aseguran su relevancia continua en la educación y la investigación, especialmente para quienes estudian los fundamentos del aprendizaje profundo.

Los investigadores también están explorando formas de adaptar WikiText para tareas multilingües y multimodales, aunque la versión original es solo en inglés. A medida que los modelos de IA evolucionan, la necesidad de conjuntos de datos estructurados y de alta calidad sigue siendo crucial, y WikiText sirve como un ejemplo fundacional de cómo construir tales recursos. Su legado es evidente en los numerosos artículos que lo citan como línea base, asegurando su lugar en la historia del aprendizaje automático.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·natural-language-processing·language-modeling·wikipedia
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial