OpenWebText es un conjunto de datos de código abierto compuesto por páginas web extraídas de publicaciones de Reddit, creado para replicar el corpus privado WebText utilizado para entrenar el modelo de lenguaje GPT-2 de OpenAI. Proporciona un corpus de texto grande y diverso para entrenar y evaluar modelos de lenguaje de gran escala.
Antecedentes y Motivación
OpenWebText fue presentado en 2019 por Aaron Gokaslan y Vanya Cohen, investigadores afiliados en ese momento a la Universidad de Maryland y la Universidad Johns Hopkins, respectivamente. La motivación surgió de la decisión de OpenAI de no publicar el conjunto de datos completo de WebText, que se utilizó para entrenar a GPT-2. WebText consistía en enlaces externos de publicaciones de Reddit que recibían al menos 3 puntos de karma, sumando aproximadamente 40 GB de texto. Para permitir la reproducibilidad y una mayor investigación, Gokaslan y Cohen crearon OpenWebText al extraer todos los enlaces externos de las publicaciones de Reddit desde 2005 hasta abril de 2018, aplicando el mismo umbral de karma y filtrando el contenido en inglés. El conjunto de datos resultante contiene más de 8 millones de documentos, con un total de aproximadamente 38 GB de texto, lo que refleja de cerca el tamaño y la diversidad del WebText original.
Características del Conjunto de Datos
OpenWebText es un corpus de texto no estructurado a gran escala. A diferencia de conjuntos de datos curados como Wikipedia o libros, captura una amplia variedad de estilos de escritura, temas y formatos, incluidos artículos de noticias, blogs, foros de discusión y sitios web personales. Esta diversidad lo hace valioso para entrenar modelos de lenguaje de propósito general. El conjunto de datos se proporciona como una colección de archivos de texto, con cada documento separado por una nueva línea. Se utiliza comúnmente en la comunidad de investigación como un punto de referencia para evaluar el rendimiento del modelo en la predicción de la siguiente palabra y otras tareas de modelado de lenguaje. Sin embargo, debido a que se deriva de contenido web público, hereda problemas como contenido duplicado, texto de baja calidad y posibles sesgos presentes en el discurso en línea.
Uso en el Entrenamiento de Modelos de Lenguaje
OpenWebText ha sido ampliamente adoptado en el campo del procesamiento del lenguaje natural (NLP). Sirve como un corpus de entrenamiento estándar para muchos modelos de lenguaje de código abierto, incluidas variantes de GPT-2 y otras arquitecturas basadas en transformadores. Por ejemplo, Hugging Face proporciona una versión preprocesada de OpenWebText que se utiliza comúnmente para el ajuste fino y la evaluación. Los investigadores a menudo lo utilizan para comparar el rendimiento del modelo con GPT-2, ya que proporciona una distribución de entrenamiento comparable. El conjunto de datos también se ha utilizado en estudios sobre curación de datos, escalado de modelos y los efectos de los datos de entrenamiento en el comportamiento del modelo. Su disponibilidad ha facilitado la investigación reproducible en el desarrollo de modelos de lenguaje de gran escala, particularmente en el contexto de la IA generativa.
Impacto y Limitaciones
OpenWebText ha tenido un impacto significativo en la comunidad de IA de código abierto al democratizar el acceso a un corpus web a gran escala. Ha permitido a investigadores sin acceso a conjuntos de datos propietarios entrenar y evaluar modelos de escala similar a GPT-2. Sin embargo, el conjunto de datos tiene limitaciones. No es tan limpio como los corpus curados y contiene una cantidad sustancial de texto repetitivo, elementos de navegación y otro ruido. Además, la metodología de extracción basada en el karma de Reddit introduce un sesgo de selección, favoreciendo el contenido que atrae a los usuarios de Reddit. El conjunto de datos también carece de información de licencia explícita para muchas de las páginas web incluidas, lo que plantea preocupaciones de derechos de autor. A pesar de estos problemas, OpenWebText sigue siendo un recurso fundamental en el desarrollo de modelos de lenguaje de gran escala y continúa siendo referenciado en la literatura académica.
Conjuntos de Datos Relacionados y Evolución
OpenWebText es parte de un ecosistema más amplio de conjuntos de datos de texto a escala web utilizados en NLP. Otros ejemplos notables incluyen Common Crawl, que es un rastreo masivo de la web, y The Pile, una colección curada de diversas fuentes. Conjuntos de datos más recientes, como C4 (Colossal Clean Crawled Corpus) y RefinedWeb, se han desarrollado para abordar algunos de los problemas de ruido y calidad presentes en los rastreos web en bruto. Estos conjuntos de datos más nuevos emplean técnicas de filtrado y deduplicación más sofisticadas. No obstante, OpenWebText sigue siendo relevante como un punto de referencia histórico y una línea base para evaluar métodos de curación de datos. Su creación también destacó la importancia de los datos abiertos en el campo de la inteligencia artificial, influyendo en esfuerzos posteriores para publicar corpus de entrenamiento para uso público.
Véase También
- Modelo de lenguaje de gran escala
- GPT-2
- Common Crawl
- The Pile
- Curación de datos