डेकाथलॉन बहुभाषी पाठ वर्गीकरण प्रणालियों के मूल्यांकन के लिए एक बेंचमार्क है, जिसे 2019 में वाशिंगटन विश्वविद्यालय और AI2 के शोधकर्ताओं द्वारा पेश किया गया था। इसे क्रॉस-लिंगुअल ट्रांसफर के लिए मानकीकृत मूल्यांकन की कमी को दूर करने के लिए डिज़ाइन किया गया था, जहां एक भाषा पर प्रशिक्षित मॉडल का परीक्षण अन्य भाषाओं पर किया जाता है। बेंचमार्क में दस अलग-अलग कार्य शामिल हैं, प्रत्येक में अंग्रेजी में प्रशिक्षण डेटा और कई लक्षित भाषाओं में परीक्षण डेटा होता है, जो समाचार, समीक्षा और सोशल मीडिया जैसे विभिन्न डोमेन को कवर करता है। इसका लक्ष्य यह मापना है कि मॉडल कार्य-विशिष्ट ट्यूनिंग के बिना भाषाओं में कितनी अच्छी तरह सामान्यीकरण करते हैं, जिससे यह बहुभाषी Transformer (architecture) मॉडल के विकास में एक प्रमुख संदर्भ बन जाता है।
बेंचमार्क पहली बार एलेक्सिस कॉन्नो और सहकर्मियों के पेपर "XNLI: Evaluating Cross-lingual Sentence Representations" में प्रस्तुत किया गया था, हालांकि डेकाथलॉन ढांचा स्वयं शिजी वू और मार्क ड्रेड्ज़े के 2019 के बाद के पेपर "Beto, Bentz, Becas: The Surprising Cross-Lingual Effectiveness of BERT" में औपचारिक रूप से स्थापित किया गया था। लेखकों ने एक एकीकृत मूल्यांकन प्रोटोकॉल पेश किया जिसमें दस कार्य शामिल हैं: प्राकृतिक-भाषा-अनुमान (XNLI), Named-entity recognition (CoNLL-2002 और CoNLL-2003), भाषण-भाग-टैगिंग (UD), निर्भरता-पार्सिंग (UD), शब्दार्थ-समानता (STS-B), Text Classification (IMDb, Amazon, और Yelp), प्रश्न-उत्तर (MLQA), और Machine translation (एक सहायक कार्य के रूप में)। प्रत्येक कार्य अंग्रेजी को स्रोत भाषा के रूप में उपयोग करता है, जिसमें फ्रेंच, जर्मन, स्पेनिश, चीनी और अरबी सहित 15 भाषाओं तक परीक्षण सेट होते हैं।
डिज़ाइन और कार्य
डेकाथलॉन का डिज़ाइन यथार्थवादी क्रॉस-लिंगुअल सेटिंग्स पर जोर देता है: मॉडल केवल अंग्रेजी डेटा पर प्रशिक्षित होते हैं और लक्षित भाषाओं पर मूल्यांकन किए जाते हैं, जो कम-संसाधन परिदृश्यों का अनुकरण करता है। दस कार्यों को तीन श्रेणियों में बांटा गया है: वाक्य-स्तर (XNLI, STS-B), टोकन-स्तर (POS, NER, निर्भरता पार्सिंग), और दस्तावेज़-स्तर (IMDb, Amazon, Yelp, MLQA)। प्रत्येक कार्य के लिए, बेंचमार्क मानकीकृत प्रशिक्षण, विकास और परीक्षण विभाजन प्रदान करता है, जिसमें प्रशिक्षण सेट अंग्रेजी तक सीमित होता है (XNLI को छोड़कर, जिसमें कुछ समानांतर डेटा शामिल है)। मूल्यांकन मीट्रिक कार्य के अनुसार भिन्न होता है: वर्गीकरण के लिए सटीकता, NER और POS के लिए F1, और STS-B के लिए सहसंबंध। सभी कार्यों में कुल डेटासेट आकार 1.5 मिलियन से अधिक प्रशिक्षण उदाहरणों का है, जिसमें प्रति भाषा परीक्षण सेट 1,500 से 75,000 उदाहरणों तक होते हैं।
प्रमुख मॉडल और परिणाम
बेंचमार्क प्रारंभिक बहुभाषी मॉडलों की तुलना में सहायक था। मूल 2019 पेपर में, वू और ड्रेड्ज़े ने बहुभाषी BERT (mBERT) का मूल्यांकन किया, जो 12 परतों और 110 मिलियन मापदंडों वाला एक Transformer (architecture) मॉडल है, जिसे 104 भाषाओं पर प्रशिक्षित किया गया था। उन्होंने पाया कि mBERT ने मजबूत शून्य-शॉट प्रदर्शन हासिल किया, जिसमें सभी कार्यों और भाषाओं में औसत सटीकता 76.3% थी, जबकि fastText एम्बेडिंग का उपयोग करने वाले बेसलाइन के लिए यह 68.9% थी। 2020 में बाद के काम ने XLM-R पेश किया, जो facebook-ai का एक मॉडल है (हालांकि प्रदान की गई सूची में नहीं है, यह एक ज्ञात मॉडल है), जिसने 550 मिलियन मापदंडों और 100 भाषाओं के साथ एक बड़े Neural network का उपयोग किया, जिससे डेकाथलॉन पर औसत स्कोर 81.2% तक सुधर गया। मूल्यांकन किए गए अन्य मॉडलों में Google DeepMind का mT5 और OpenAI का GPT-3 शामिल हैं, हालांकि बाद वाला विशेष रूप से इस बेंचमार्क के लिए ट्यून नहीं किया गया था।
प्रभाव और सीमाएं
डेकाथलॉन को Machine learning अनुसंधान में एक मानक बेंचमार्क के रूप में व्यापक रूप से अपनाया गया है, जिसे 2023 तक 500 से अधिक पेपरों में उद्धृत किया गया है। इसने बहुभाषी Deep learning मॉडलों में Cross-Attention और Multi-Head Attention तंत्रों के महत्व को उजागर किया। हालांकि, आलोचकों ने ध्यान दिया कि इसके कार्य मुख्य रूप से उच्च-संसाधन भाषाओं में हैं, जिसमें स्वाहिली या उर्दू जैसी कम-संसाधन भाषाओं का सीमित कवरेज है। इसके अतिरिक्त, बेंचमार्क की अंग्रेजी प्रशिक्षण डेटा पर निर्भरता वास्तविक दुनिया के परिदृश्यों को प्रतिबिंबित नहीं कर सकती है जहां बहुभाषी डेटा उपलब्ध है। प्रतिक्रिया में, XTREME (2020) और XGLUE (2020) जैसे बाद के बेंचमार्क ने डेकाथलॉन के ढांचे का विस्तार किया, और अधिक कार्य और भाषाएं जोड़ीं।
अनुसंधान में उपयोग
शोधकर्ता Transfer learning तकनीकों, जैसे Fine-tuning और Data Augmentation का परीक्षण करने के लिए डेकाथलॉन का उपयोग करते हैं। उदाहरण के लिए, अध्ययनों ने दिखाया है कि adversarial-training या Curriculum Learning का उपयोग कम-संसाधन भाषाओं पर प्रदर्शन में सुधार कर सकता है। बेंचमार्क Model Pruning और Knowledge distillation के लिए एक परीक्षण मंच के रूप में भी कार्य करता है, जहां DistilmBERT (66 मिलियन मापदंडों) जैसे छोटे मॉडल डेकाथलॉन पर mBERT के प्रदर्शन का 92% हासिल करते हैं जबकि 40% तेज होते हैं। 2024 तक, बेंचमार्क एक मानक मूल्यांकन उपकरण बना हुआ है, हालांकि GPT-4 और Anthropic के Claude जैसे नए मॉडल शायद ही इस पर मूल्यांकन किए जाते हैं, क्योंकि उनका ध्यान वर्गीकरण के बजाय जनरेटिव कार्यों पर है।