XTREME (Cross-lingual TRansfer Evaluation of Multilingual Encoders) एक बेंचमार्क सूट है जिसे बहुभाषी मॉडलों की क्रॉस-भाषाई सामान्यीकरण क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2020 में Google Research के शोधकर्ताओं द्वारा पेश किया गया, यह उच्च-संसाधन भाषाओं पर प्रशिक्षित मॉडलों की कम-संसाधन भाषाओं में ज्ञान स्थानांतरित करने की क्षमता का आकलन करने के लिए एक मानकीकृत ढांचा प्रदान करता है। बेंचमार्क 40 भाषाओं को कवर करता है और इसमें तीन श्रेणियों में फैले 9 कार्य शामिल हैं: वाक्य वर्गीकरण, अनुक्रम लेबलिंग, और प्रश्न उत्तर। XTREME बहुभाषी मॉडलों की तुलना के लिए व्यापक रूप से अपनाया गया मानक बन गया है, जिसने XTREME-R और GLUE-X जैसे बाद के बेंचमार्क को प्रभावित किया है।
बेंचमार्क को बहुभाषी प्रतिनिधित्वों के व्यवस्थित मूल्यांकन की बढ़ती आवश्यकता को संबोधित करने के लिए बनाया गया था, विशेष रूप से जब Transformer (architecture)-आधारित मॉडल जैसे multilingual-BERT और XLM-R उभरने लगे थे। इसका डिज़ाइन यथार्थवादी क्रॉस-भाषाई परिदृश्यों पर जोर देता है, जहां मॉडल को अंग्रेजी डेटा पर फाइन-ट्यून किया जाता है और बिना अतिरिक्त प्रशिक्षण के अन्य भाषाओं में मूल्यांकन किया जाता है। यह ज़ीरो-शॉट स्थानांतरण सेटिंग मॉडल की भाषा-अज्ञेय विशेषताओं को सीखने की क्षमता का परीक्षण करती है, जो बहुभाषी Natural language processing में व्यावहारिक अनुप्रयोगों के लिए महत्वपूर्ण है।
कार्य संरचना
XTREME में नौ कार्य शामिल हैं जो भाषाई क्षमताओं की एक श्रृंखला को कवर करते हैं। वाक्य वर्गीकरण के लिए, इसमें Multilingual Amazon Reviews Corpus (MARC) शामिल है, जो छह भाषाओं में भावना विश्लेषण से संबंधित है, और Cross-lingual Natural Language Inference (XNLI) कार्य, जो निहितार्थ और विरोधाभास तर्क का परीक्षण करता है। अनुक्रम लेबलिंग के लिए, इसमें named entity recognition (NER) के लिए Wikiann डेटासेट और part-of-speech tagging के लिए Universal Dependencies (UD) डेटासेट शामिल है, जो दोनों कई भाषाओं को कवर करते हैं। प्रश्न उत्तर के लिए, इसमें Machine Reading Comprehension (MLQA) और Cross-lingual Question Answering (XQuAD) डेटासेट शामिल हैं, जिन्हें कई भाषाओं में पैसेज से उत्तर निकालने की आवश्यकता होती है। इसके अतिरिक्त, इसमें टाइपोलॉजिकल रूप से विविध भाषाओं के लिए TyDiQA-GoldP कार्य और परिभाषा पहचान के लिए PAWS-X कार्य शामिल है।
प्रत्येक कार्य को अत्याधुनिक मॉडलों के लिए चुनौतीपूर्ण फिर भी संभव बनाने के लिए डिज़ाइन किया गया है, जिसमें कार्य प्रकार के अनुसार मूल्यांकन मेट्रिक्स शामिल हैं, जैसे वर्गीकरण के लिए सटीकता, अनुक्रम लेबलिंग के लिए F1 स्कोर, और प्रश्न उत्तर के लिए exact match। बेंचमार्क एक एकीकृत स्कोरिंग तंत्र प्रदान करता है जो सभी कार्यों में प्रदर्शन का औसत निकालता है, जिससे विभिन्न मॉडलों की सीधी तुलना संभव होती है।
भाषा कवरेज
XTREME में 40 भाषाओं का चयन भाषाई परिवारों और लिपियों की एक विस्तृत श्रृंखला का प्रतिनिधित्व करने के लिए किया गया है, जिसमें इंडो-यूरोपीय, सिनो-तिब्बती, अफ्रो-एशियाई और अन्य शामिल हैं। यह विविधता सुनिश्चित करती है कि बेंचमार्क केवल शाब्दिक स्थानांतरण का ही नहीं, बल्कि वाक्यात्मक और रूपात्मक सामान्यीकरण का भी परीक्षण करता है। भाषाएं अंग्रेजी, स्पेनिश और चीनी जैसी उच्च-संसाधन भाषाओं से लेकर योरूबा, किन्यारवांडा और उइघुर जैसी कम-संसाधन भाषाओं तक होती हैं। कम-संसाधन भाषाओं का समावेश विशेष रूप से महत्वपूर्ण है, क्योंकि यह उन मॉडलों की सीमाओं को उजागर करता है जो बड़ी मात्रा में एकभाषी डेटा पर अत्यधिक निर्भर करते हैं।
बेंचमार्क में अरबी, हिंदी और थाई जैसी विभिन्न लिपियों वाली भाषाएं भी शामिल हैं, जो टोकनाइजेशन और प्रतिनिधित्व के लिए अतिरिक्त चुनौतियां पेश करती हैं। इस कवरेज ने XTREME को बहुभाषी सेटिंग्स में Data Augmentation और Model Pruning जैसी तकनीकों की प्रभावशीलता का मूल्यांकन करने के लिए एक मानक बना दिया है।
मूल्यांकन प्रोटोकॉल
XTREME के लिए मानक मूल्यांकन प्रोटोकॉल में दो मुख्य चरण शामिल हैं। पहले, एक मॉडल को बड़े बहुभाषी कॉर्पस पर पूर्व-प्रशिक्षित किया जाता है, अक्सर masked language modeling जैसे उद्देश्यों का उपयोग करके। दूसरे, मॉडल को प्रत्येक कार्य के लिए अंग्रेजी प्रशिक्षण डेटा पर फाइन-ट्यून किया जाता है, और फिर अन्य सभी भाषाओं में संबंधित परीक्षण सेटों पर मूल्यांकन किया जाता है। यह ज़ीरो-शॉट स्थानांतरण सेटिंग वास्तविक दुनिया के परिदृश्यों का अनुकरण करने के लिए है जहां कई भाषाओं के लिए लेबल किया गया डेटा दुर्लभ होता है।
निष्पक्ष तुलना सुनिश्चित करने के लिए, बेंचमार्क Google DeepMind, OpenAI, और शैक्षणिक संस्थानों सहित विभिन्न मॉडलों के परिणामों के साथ एक सार्वजनिक लीडरबोर्ड प्रदान करता है। लीडरबोर्ड प्रत्येक कार्य पर प्रदर्शन और समग्र औसत को ट्रैक करता है, जिससे शोधकर्ताओं को विभिन्न आर्किटेक्चर में ताकत और कमजोरियों की पहचान करने में सक्षम बनाता है। 2023 तक, XLM-RoBERTa-large और mT5 जैसे मॉडलों ने मजबूत परिणाम प्राप्त किए हैं, लेकिन कोई भी मॉडल अभी तक सभी कार्यों पर मानव-स्तरीय प्रदर्शन तक नहीं पहुंचा है।
प्रभाव और विस्तार
XTREME का क्रॉस-भाषाई सीखने के क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा है। इसने प्रतिकूल प्रशिक्षण, भाषा-विशिष्ट एडेप्टर और बेहतर टोकनाइजेशन रणनीतियों जैसी तकनीकों में अनुसंधान को बढ़ावा दिया है। बेंचमार्क को XTREME-R तक भी विस्तारित किया गया है, जो अधिक कार्य और भाषाएं जोड़ता है, और XTREME-UP तक, जो भाषण और छवि समझ जैसे उपयोगकर्ता-केंद्रित कार्यों पर केंद्रित है।
आलोचकों ने नोट किया है कि XTREME की ज़ीरो-शॉट सेटिंग वास्तविक दुनिया के प्रदर्शन को पूरी तरह से कैप्चर नहीं कर सकती है, क्योंकि मॉडल अक्सर लक्ष्य-भाषा डेटा की थोड़ी मात्रा से लाभान्वित होते हैं। फिर भी, यह बहुभाषी मॉडलों के मूल्यांकन के लिए एक आधारभूत उपकरण बना हुआ है, और इसके कार्य अक्सर Machine learning अनुसंधान में उपयोग किए जाते हैं। बेंचमार्क का कोड और डेटासेट सार्वजनिक रूप से उपलब्ध हैं, जिससे प्रतिलिपि प्रस्तुत करने योग्यता और आगे के नवाचार की सुविधा मिलती है।
यह भी देखें
- cross-lingual-transfer
- multilingual-model
- Natural language processing
- benchmark-dataset