अंग्रेज़ी से अनुवादित

RACE एक बड़े पैमाने का पठन समझ डेटासेट है, जो चीनी मध्य और उच्च विद्यालय के अंग्रेजी परीक्षाओं से प्राप्त किया गया है। इसका उपयोग AI मॉडलों की लंबे अनुच्छेदों पर तर्क करने और बहुविकल्पीय प्रश्नों के उत्तर देने की क्षमता का मूल्यांकन करने के लिए किया जाता है।

RACE (रीडिंग कॉम्प्रिहेंशन फ्रॉम एग्जामिनेशन) कृत्रिम बुद्धिमत्ता प्रणालियों की पठन-समझ और तर्क क्षमताओं का मूल्यांकन करने के लिए एक बेंचमार्क डेटासेट है। इसे 2017 में कार्नेगी मेलन विश्वविद्यालय और माइक्रोसॉफ्ट रिसर्च के शोधकर्ताओं द्वारा पेश किया गया था, और इसमें चीनी माध्यमिक विद्यालय और उच्च विद्यालय के छात्रों को दिए गए अंग्रेजी भाषा की परीक्षाओं से लिए गए 100,000 से अधिक बहुविकल्पीय प्रश्न शामिल हैं। यह डेटासेट लंबे अनुच्छेदों, जटिल प्रश्न प्रकारों और सरल पाठ मिलान से परे गहन अनुमान की आवश्यकता पर अपने जोर के लिए उल्लेखनीय है।

पहले के पठन-समझ डेटासेट के विपरीत, जो अक्सर छोटे अनुच्छेदों या तथ्य-आधारित प्रश्नों पर निर्भर करते थे, RACE ऐसे प्रश्न प्रस्तुत करता है जो विभिन्न संज्ञानात्मक कौशलों की मांग करते हैं, जिनमें निहित जानकारी का अनुमान लगाने, कथा संरचना को समझने और सामान्य ज्ञान तर्क लागू करने की क्षमता शामिल है। डेटासेट को दो मुख्य उपसमुच्चयों में विभाजित किया गया है: RACE-M (माध्यमिक विद्यालय) और RACE-H (उच्च विद्यालय), जिसमें उच्च विद्यालय भाग को लंबे अनुच्छेदों और अधिक अमूर्त प्रश्नों के कारण आम तौर पर अधिक चुनौतीपूर्ण माना जाता है।

संरचना और संरचना

RACE में कुल 27,933 अनुच्छेद और 97,687 प्रश्न हैं, जो प्रशिक्षण, विकास और परीक्षण सेटों में विभाजित हैं। अनुच्छेद वास्तविक परीक्षाओं से लिए गए हैं, प्रत्येक के साथ चार उत्तर विकल्पों वाले कई बहुविकल्पीय प्रश्न जुड़े हैं। औसत अनुच्छेद लंबाई लगभग 320 शब्द है, जो कई समकालीन पठन-समझ बेंचमार्क से काफी लंबी है। यह लंबाई मॉडलों को विस्तारित पाठ पर संदर्भ बनाए रखने और कई अनुच्छेदों में फैली प्रासंगिक जानकारी की पहचान करने की आवश्यकता डालती है।

RACE के प्रश्नों को कई प्रकारों में वर्गीकृत किया गया है, जिनमें तथ्यात्मक स्मरण, अनुमान, और लेखक के इरादे या पात्रों की प्रेरणाओं के बारे में तर्क का परीक्षण करने वाले प्रश्न शामिल हैं। एक उल्लेखनीय विशेषता "क्यों" और "कैसे" प्रश्नों की उपस्थिति है, जो अक्सर अनुच्छेद के विभिन्न भागों से जानकारी को संश्लेषित करने की आवश्यकता डालते हैं।

AI अनुसंधान पर प्रभाव

RACE तेजी से पठन-समझ मॉडलों के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया। जब इसे जारी किया गया, तो अत्याधुनिक मॉडलों ने मानव प्रदर्शन से काफी कम सटीकता दर हासिल की, जो लगभग 95% अनुमानित थी। प्रारंभिक तंत्रिका मॉडल, जिनमें तंत्रिका नेटवर्क और ट्रांसफार्मर पर आधारित शामिल थे, परीक्षण सेट पर 60% सटीकता से अधिक हासिल करने के लिए संघर्ष कर रहे थे। इस अंतर ने नई वास्तुकलाओं और प्रशिक्षण तकनीकों में महत्वपूर्ण अनुसंधान को प्रेरित किया।

डेटासेट ने बड़े भाषा मॉडल और जनरेटिव AI प्रणालियों के विकास में भूमिका निभाई। जैसे-जैसे मॉडल पैमाने में बढ़े और विशाल कोरपोरा पर पूर्व-प्रशिक्षित हुए, RACE पर उनका प्रदर्शन नाटकीय रूप से बेहतर हुआ। 2021 तक, OpenAI के GPT-3 और बाद के संस्करणों जैसे मॉडलों ने 90% से अधिक सटीकता हासिल की, जो मानव-स्तरीय प्रदर्शन के करीब पहुंच गई। इस प्रगति ने जटिल तर्क कार्यों से निपटने में पैमाने और पूर्व-प्रशिक्षण के महत्व को उजागर किया।

अन्य बेंचमार्क के साथ तुलना

RACE की तुलना अक्सर SQuAD (स्टैनफोर्ड प्रश्न उत्तर डेटासेट) और CNN/डेली मेल जैसे अन्य पठन-समझ डेटासेट से की जाती है। SQuAD के विपरीत, जो निष्कर्षणात्मक प्रश्न-उत्तर पर केंद्रित है जहां उत्तर पाठ का एक खंड है, RACE को पूर्व-निर्धारित विकल्पों में से चयन की आवश्यकता होती है और इसमें अक्सर ऐसे प्रश्न शामिल होते हैं जिन्हें सरल पाठ खोज द्वारा उत्तर नहीं दिया जा सकता। यह RACE को वास्तविक समझ और तर्क का अधिक कठोर परीक्षण बनाता है।

डेटासेट के डिजाइन ने बाद के बेंचमार्क को भी प्रभावित किया, जैसे अधिक चुनौतीपूर्ण RACE-C और अन्य प्रतिकूल डेटासेट जिनका उद्देश्य मॉडल तर्क में कमजोरियों को उजागर करना है। शोधकर्ताओं ने मॉडल अति-आत्मविश्वास और गहन समझ के बजाय सतही संकेतों पर निर्भर रहने की प्रवृत्ति जैसी घटनाओं का अध्ययन करने के लिए RACE का उपयोग किया है।

सीमाएं और आलोचनाएं

व्यापक उपयोग के बावजूद, RACE की सीमाएं हैं। कुछ शोधकर्ताओं ने नोट किया है कि डेटासेट के प्रश्न, वास्तविक परीक्षाओं से लिए जाने के बावजूद, पूर्वाग्रह या अस्पष्टताएं रख सकते हैं जो उन्हें सामान्य तर्क के मूल्यांकन के लिए कम उपयुक्त बनाती हैं। उदाहरण के लिए, कुछ प्रश्न चीनी शैक्षिक संदर्भों के लिए विशिष्ट सांस्कृतिक ज्ञान पर निर्भर करते हैं, जो मुख्य रूप से अंग्रेजी पाठ पर प्रशिक्षित मॉडलों को नुकसान पहुंचा सकते हैं। इसके अतिरिक्त, बहुविकल्पीय प्रारूप मॉडलों को उत्तर विकल्पों में सांख्यिकीय नियमितताओं, जैसे स्थिति पूर्वाग्रह या लंबाई अनुमान, का शोषण करने की अनुमति दे सकता है।

इन मुद्दों को संबोधित करने के प्रयासों ने डेटासेट के संशोधित संस्करणों के निर्माण को जन्म दिया है, जैसे RACE-C, जो अधिक चुनौतीपूर्ण प्रश्न जोड़ता है और सतही संकेतों के प्रभाव को कम करता है। ये विविधताएं मजबूत पठन-समझ पर अनुसंधान में उपयोग की जाती रहती हैं।

विरासत और निरंतर उपयोग

RACE कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के क्षेत्र में व्यापक रूप से उद्धृत बेंचमार्क बना हुआ है। यह GLUE और SuperGLUE बेंचमार्क जैसे कई मॉडल मूल्यांकन सुइट्स में शामिल है, और Google DeepMind और Anthropic सहित प्रमुख शोध संगठनों द्वारा अपने मॉडलों की तर्क क्षमताओं का आकलन करने के लिए उपयोग किया जाता है। डेटासेट की दीर्घायु इसके डिजाइन का प्रमाण है, जिसने कई चुनौतियों का पूर्वानुमान किया जो बाद में AI अनुसंधान के केंद्र में बन गईं, जैसे लंबे-संदर्भ समझ और बहु-चरणीय अनुमान।

2025 तक, RACE का उपयोग शैक्षिक अनुसंधान और उद्योग मूल्यांकनों में जारी है, हालांकि MMLU और BIG-bench जैसे नए बेंचमार्क ने सामान्य ज्ञान के आकलन के लिए इसे आंशिक रूप से प्रतिस्थापित किया है। फिर भी, परीक्षा-शैली के प्रश्नों पर RACE का ध्यान इसे शैक्षिक AI अनुप्रयोगों और स्वचालित ट्यूटरिंग प्रणालियों में प्रगति को मापने के लिए एक मूल्यवान उपकरण बनाता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reading-comprehension·benchmark·dataset·nlp
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास