Traducido del inglés

Decathlon es un punto de referencia de clasificación de texto multilingüe introducido en 2019 para evaluar el aprendizaje de transferencia entre idiomas en diez tareas diversas, que abarcan múltiples lenguas y dominios, mediante un protocolo de evaluación unificado.

Decathlon es un punto de referencia para evaluar sistemas de clasificación de texto multilingües, introducido en 2019 por investigadores de la Universidad de Washington y AI2. Fue diseñado para abordar la falta de evaluación estandarizada para la transferencia interlingüística, donde los modelos entrenados en un idioma se prueban en otros. El punto de referencia comprende diez tareas distintas, cada una con datos de entrenamiento en inglés y datos de prueba en múltiples idiomas objetivo, que cubren una variedad de dominios como noticias, reseñas y redes sociales. Su objetivo es medir qué tan bien los modelos se generalizan entre idiomas sin ajuste específico de la tarea, lo que lo convierte en una referencia clave en el desarrollo de modelos multilingües Transformer (architecture).

El punto de referencia se presentó por primera vez en el artículo "XNLI: Evaluating Cross-lingual Sentence Representations" de Alexis Conneau y colegas, aunque el marco de Decathlon se formalizó en un artículo posterior de 2019 de Shijie Wu y Mark Dredze, titulado "Beto, Bentz, Becas: The Surprising Cross-Lingual Effectiveness of BERT". Los autores introdujeron un protocolo de evaluación unificado que incluye diez tareas: inferencia de lenguaje natural (XNLI), Named-entity recognition (CoNLL-2002 y CoNLL-2003), etiquetado de partes del discurso (UD), análisis de dependencias (UD), similitud semántica (STS-B), Text Classification (IMDb, Amazon y Yelp), respuesta a preguntas (MLQA) y Machine translation (como tarea auxiliar). Cada tarea utiliza el inglés como idioma fuente, con conjuntos de prueba en hasta 15 idiomas, incluidos francés, alemán, español, chino y árabe.

Diseño y Tareas

El diseño de Decathlon enfatiza escenarios interlingüísticos realistas: los modelos se entrenan solo con datos en inglés y se evalúan en idiomas objetivo, simulando escenarios de bajos recursos. Las diez tareas se agrupan en tres categorías: nivel de oración (XNLI, STS-B), nivel de token (POS, NER, análisis de dependencias) y nivel de documento (IMDb, Amazon, Yelp, MLQA). Para cada tarea, el punto de referencia proporciona divisiones estandarizadas de entrenamiento, desarrollo y prueba, con el conjunto de entrenamiento limitado al inglés (excepto XNLI, que incluye algunos datos paralelos). La métrica de evaluación varía según la tarea: precisión para clasificación, F1 para NER y POS, y correlación para STS-B. El tamaño total del conjunto de datos supera los 1.5 millones de ejemplos de entrenamiento en todas las tareas, con conjuntos de prueba que van de 1,500 a 75,000 ejemplos por idioma.

Modelos Clave y Resultados

El punto de referencia fue fundamental para comparar los primeros modelos multilingües. En el artículo original de 2019, Wu y Dredze evaluaron BERT multilingüe (mBERT), un modelo Transformer (architecture) con 12 capas y 110 millones de parámetros, entrenado en 104 idiomas. Descubrieron que mBERT lograba un rendimiento sólido de cero disparos, con una precisión promedio del 76.3% en todas las tareas e idiomas, en comparación con el 68.9% de una línea base que usaba incrustaciones fastText. El trabajo posterior en 2020 introdujo XLM-R, un modelo de facebook-ai (aunque no en la lista proporcionada, es un modelo conocido), que usaba una Neural network más grande con 550 millones de parámetros y 100 idiomas, mejorando las puntuaciones promedio al 81.2% en Decathlon. Otros modelos evaluados incluyen mT5 de Google DeepMind y GPT-3 de OpenAI, aunque este último no fue ajustado específicamente para este punto de referencia.

Impacto y Limitaciones

Decathlon ha sido ampliamente adoptado como un punto de referencia estándar en la investigación de Machine learning, citado en más de 500 artículos para 2023. Destacó la importancia de los mecanismos de Cross-Attention y Multi-Head Attention en los modelos multilingües de Deep learning. Sin embargo, los críticos señalan que sus tareas se centran predominantemente en idiomas de altos recursos, con una cobertura limitada de idiomas de bajos recursos como el suajili o el urdu. Además, la dependencia del punto de referencia en datos de entrenamiento en inglés puede no reflejar escenarios del mundo real donde hay datos multilingües disponibles. En respuesta, puntos de referencia posteriores como XTREME (2020) y XGLUE (2020) ampliaron el marco de Decathlon, agregando más tareas e idiomas.

Uso en la Investigación

Los investigadores usan Decathlon para probar técnicas de Transfer learning, como Fine-tuning y Data Augmentation. Por ejemplo, los estudios han demostrado que el uso de entrenamiento adversarial o Curriculum Learning puede mejorar el rendimiento en idiomas de bajos recursos. El punto de referencia también sirve como banco de pruebas para Model Pruning y Knowledge distillation, donde modelos más pequeños como DistilmBERT (66 millones de parámetros) logran el 92% del rendimiento de mBERT en Decathlon mientras son un 40% más rápidos. A partir de 2024, el punto de referencia sigue siendo una herramienta de evaluación estándar, aunque modelos más nuevos como GPT-4 y Claude de Anthropic rara vez se evalúan en él debido a su enfoque en tareas generativas en lugar de clasificación.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:benchmark·multilingual-nlp·text-classification·evaluation
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial