Traduit de l'anglais

Le benchmark de classification de textes multilingue Decathlon a été introduit en 2019 pour évaluer l'apprentissage par transfert cross-lingue à travers dix tâches diverses, couvrant plusieurs langues et domaines, en utilisant un protocole d'évaluation unifié.

Decathlon est un benchmark pour évaluer les systèmes de classification de texte multilingues, introduit en 2019 par des chercheurs de l'Université de Washington et de l'AI2. Il a été conçu pour combler le manque d'évaluation standardisée pour le transfert interlingue, où des modèles entraînés sur une langue sont testés sur d'autres. Le benchmark comprend dix tâches distinctes, chacune avec des données d'entraînement en anglais et des données de test dans plusieurs langues cibles, couvrant une gamme de domaines tels que les actualités, les critiques et les médias sociaux. Son objectif est de mesurer la capacité des modèles à généraliser à travers les langues sans ajustement spécifique à la tâche, ce qui en fait une référence clé dans le développement des modèles multilingues Transformer (architecture).

Le benchmark a été présenté pour la première fois dans l'article « XNLI: Evaluating Cross-lingual Sentence Representations » par Alexis Conneau et ses collègues, bien que le cadre Decathlon lui-même ait été formalisé dans un article ultérieur de 2019 par Shijie Wu et Mark Dredze, intitulé « Beto, Bentz, Becas: The Surprising Cross-Lingual Effectiveness of BERT ». Les auteurs ont introduit un protocole d'évaluation unifié comprenant dix tâches : l'inférence en langage naturel (XNLI), la Named-entity recognition (CoNLL-2002 et CoNLL-2003), l'étiquetage morphosyntaxique (UD), l'analyse syntaxique de dépendances (UD), la similarité sémantique (STS-B), la Text Classification (IMDb, Amazon et Yelp), la réponse aux questions (MLQA) et la Machine translation (comme tâche auxiliaire). Chaque tâche utilise l'anglais comme langue source, avec des ensembles de test dans jusqu'à 15 langues, dont le français, l'allemand, l'espagnol, le chinois et l'arabe.

Conception et Tâches

La conception de Decathlon met l'accent sur des contextes interlingues réalistes : les modèles sont entraînés uniquement sur des données en anglais et évalués sur les langues cibles, simulant des scénarios à faibles ressources. Les dix tâches sont regroupées en trois catégories : au niveau de la phrase (XNLI, STS-B), au niveau du jeton (POS, NER, analyse syntaxique de dépendances) et au niveau du document (IMDb, Amazon, Yelp, MLQA). Pour chaque tâche, le benchmark fournit des divisions standardisées d'entraînement, de développement et de test, avec l'ensemble d'entraînement limité à l'anglais (sauf pour XNLI, qui inclut certaines données parallèles). La métrique d'évaluation varie selon la tâche : la précision pour la classification, le F1 pour la NER et la POS, et la corrélation pour STS-B. La taille totale du jeu de données dépasse 1,5 million d'exemples d'entraînement à travers toutes les tâches, avec des ensembles de test allant de 1 500 à 75 000 exemples par langue.

Modèles Clés et Résultats

Le benchmark a été déterminant pour comparer les premiers modèles multilingues. Dans l'article original de 2019, Wu et Dredze ont évalué BERT multilingue (mBERT), un modèle Transformer (architecture) avec 12 couches et 110 millions de paramètres, entraîné sur 104 langues. Ils ont constaté que mBERT atteignait une performance zero-shot solide, avec une précision moyenne de 76,3 % sur toutes les tâches et langues, contre 68,9 % pour une ligne de base utilisant des plongements fastText. Des travaux ultérieurs en 2020 ont introduit XLM-R, un modèle de facebook-ai (bien que non inclus dans la liste fournie, c'est un modèle connu), qui utilisait un Neural network plus grand avec 550 millions de paramètres et 100 langues, améliorant les scores moyens à 81,2 % sur Decathlon. D'autres modèles évalués incluent mT5 de Google DeepMind et GPT-3 de OpenAI, bien que ce dernier n'ait pas été spécifiquement ajusté pour ce benchmark.

Impact et Limites

Decathlon a été largement adopté comme benchmark standard dans la recherche en Machine learning, cité dans plus de 500 articles d'ici 2023. Il a souligné l'importance des mécanismes de Cross-Attention et de Multi-Head Attention dans les modèles multilingues de Deep learning. Cependant, les critiques notent que ses tâches concernent principalement des langues à hautes ressources, avec une couverture limitée des langues à faibles ressources comme le swahili ou l'ourdou. De plus, la dépendance du benchmark aux données d'entraînement en anglais peut ne pas refléter les scénarios réels où des données multilingues sont disponibles. En réponse, des benchmarks ultérieurs comme XTREME (2020) et XGLUE (2020) ont élargi le cadre de Decathlon, ajoutant plus de tâches et de langues.

Utilisation dans la Recherche

Les chercheurs utilisent Decathlon pour tester les techniques de Transfer learning, telles que le Fine-tuning et la Data Augmentation. Par exemple, des études ont montré que l'utilisation de l'entraînement adversarial ou de l'Curriculum Learning peut améliorer les performances sur les langues à faibles ressources. Le benchmark sert également de banc d'essai pour le Model Pruning et la Knowledge distillation, où des modèles plus petits comme DistilmBERT (66 millions de paramètres) atteignent 92 % de la performance de mBERT sur Decathlon tout en étant 40 % plus rapides. En 2024, le benchmark reste un outil d'évaluation standard, bien que les modèles plus récents comme GPT-4 et Claude d'Anthropic soient rarement évalués sur celui-ci en raison de leur orientation vers des tâches génératives plutôt que de classification.

Voir Aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:benchmark·multilingual-nlp·text-classification·evaluation
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique