C4, abreviatura de Colossal Clean Crawled Corpus, es un conjunto de datos de texto a gran escala utilizado para el preentrenamiento de modelos de lenguaje grandes. Fue introducido por investigadores de Google en 2019 como parte del proyecto original basado en transformers T5 (Text-to-Text Transfer Transformer). El conjunto de datos consiste en cientos de gigabytes de texto en inglés extraído del archivo web Common Crawl, que es un repositorio público de miles de millones de páginas web recopiladas durante muchos años. C4 fue diseñado para proporcionar una alternativa más limpia y manejable a los datos brutos de rastreo web, que típicamente contienen ruido significativo, como texto de navegación repetitivo, contenido duplicado y texto de baja calidad o generado por máquinas.
La creación de C4 implicó un proceso de filtrado en múltiples pasos aplicado a los datos brutos de Common Crawl. El paso inicial consistió en deduplicar el conjunto de datos eliminando oraciones y documentos casi idénticos, lo que ayudó a reducir la redundancia y mejorar la eficiencia del entrenamiento. A continuación, el proceso eliminó páginas que contenían texto de relleno, como "lorem ipsum" o frases comunes de plantilla, y descartó páginas que no estaban principalmente en inglés, según lo determinado por un clasificador de idiomas. Además, el proceso filtró páginas que contenían contenido ofensivo o inapropiado, incluidas aquellas con ciertas palabras clave o términos. El conjunto de datos final comprendió aproximadamente 750 gigabytes de texto, o alrededor de 156 mil millones de tokens, lo que lo convirtió en uno de los corpus de preentrenamiento públicos más grandes en ese momento.
Composición y Características
El conjunto de datos C4 es notable por su escala y diversidad. Incluye texto de una amplia gama de dominios web, incluidos artículos de noticias, blogs, foros y páginas académicas. Sin embargo, debido a que se deriva de rastreos web, el conjunto de datos refleja los sesgos y limitaciones del contenido web, como la sobrerrepresentación de ciertos temas y la subrepresentación de otros. El proceso de filtrado también introdujo un sesgo hacia el inglés formal y bien escrito, ya que eliminó muchos textos informales o no estándar. Desde entonces, los investigadores han analizado C4 en busca de problemas como la contaminación de datos (donde los conjuntos de prueba se superponen con los datos de entrenamiento) y la presencia de información personal identificable, lo que llevó al desarrollo de versiones más refinadas como C4-200M y C4-en-1.0.
Uso en el Preentrenamiento
C4 se utilizó originalmente para preentrenar el modelo T5, que enmarcaba todas las tareas de procesamiento de lenguaje natural como problemas de texto a texto. El tamaño y la limpieza del conjunto de datos lo hicieron adecuado para entrenar modelos con miles de millones de parámetros. Después de T5, C4 se convirtió en un estándar de referencia para evaluar técnicas de curación de datos y fue adoptado por muchos modelos posteriores, incluidas variantes de BERT y GPT. Por ejemplo, el modelo GPT-3 de OpenAI utilizó un enfoque similar de Common Crawl filtrado, aunque no el conjunto de datos C4 exacto. El conjunto de datos también sirvió como base para extensiones multilingües, como mC4, que cubre más de 100 idiomas.
Impacto y Legado
La introducción de C4 tuvo un impacto significativo en el campo del aprendizaje automático y la inteligencia artificial. Demostró la importancia de la calidad de los datos en el preentrenamiento de modelos a gran escala, mostrando que un filtrado cuidadoso podía conducir a mejoras sustanciales en el rendimiento de tareas posteriores. C4 también destacó los desafíos prácticos de trabajar con datos a escala web, incluidos el almacenamiento, el procesamiento y las consideraciones éticas. Su publicación como conjunto de datos abierto permitió a investigadores de todo el mundo experimentar con el preentrenamiento a gran escala sin necesidad de recopilar sus propios rastreos web, democratizando el acceso a datos de entrenamiento de alta calidad.
Limitaciones y Críticas
A pesar de su uso generalizado, C4 ha enfrentado críticas. El proceso de filtrado, aunque efectivo para eliminar ruido, también eliminó contenido que podría ser valioso para ciertas tareas, como fragmentos de código o dialectos de inglés no estándar. La dependencia del conjunto de datos en texto solo en inglés limitó su aplicabilidad a modelos multilingües, aunque esto se abordó posteriormente con mC4. Además, el C4 original no estaba completamente deduplicado a nivel de documento, lo que llevó a posibles sesgos por contenido repetido. Los investigadores también han señalado que el conjunto de datos contiene información desactualizada, ya que se derivó de rastreos web hasta 2019, y que puede incluir material protegido por derechos de autor, lo que plantea cuestiones legales y éticas sobre su uso en modelos comerciales.
Véase También
- Common Crawl
- T5
- Curación de Datos
- Preentrenamiento