Winogrande एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों की सामान्य ज्ञान तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, विशेष रूप से सर्वनाम समाधान के क्षेत्र में। इसे 2019 में एलन इंस्टीट्यूट फॉर एआई (AI2) के शोधकर्ताओं द्वारा मूल विनोग्राद स्कीमा चैलेंज के एक बड़े पैमाने और अधिक चुनौतीपूर्ण उत्तराधिकारी के रूप में पेश किया गया था। यह नाम "विनोग्राद" और "ग्रांडे" का एक मिश्रित शब्द है, जो इसके बड़े पैमाने को दर्शाता है। बेंचमार्क में वाक्य जोड़े शामिल हैं जो एक शब्द, आमतौर पर एक सर्वनाम, से भिन्न होते हैं, जिसके लिए एक प्रणाली को केवल सांख्यिकीय संबंध के बजाय विश्व ज्ञान का उपयोग करके एक अस्पष्ट संदर्भ को हल करने की आवश्यकता होती है।
Winogrande में प्राथमिक कार्य एक द्विआधारी विकल्प समस्या है। प्रत्येक उदाहरण एक रिक्त स्थान के साथ एक वाक्य प्रस्तुत करता है, और प्रणाली को दो उम्मीदवार संज्ञा वाक्यांशों में से एक सर्वनाम के लिए सही पूर्ववर्ती का चयन करना होता है। उदाहरण के लिए, एक वाक्य पढ़ सकता है, "द ट्रॉफी डज़न्ट फिट इन द ब्राउन सूटकेस बिकॉज़ इट इज़ टू लार्ज," जहाँ प्रणाली को यह निर्धारित करना होगा कि "इट" ट्रॉफी या सूटकेस को संदर्भित करता है। सही उत्तर भौतिक गुणों और विशिष्ट आकार संबंधों को समझने पर निर्भर करता है, जो मनुष्यों के लिए तुच्छ हैं लेकिन मशीनों के लिए कठिन हैं। डेटासेट में 44,000 उदाहरण शामिल हैं, जो प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित हैं, परीक्षण सेट को ओवरफिटिंग को रोकने के लिए निजी रखा गया है।
डिज़ाइन और निर्माण
Winogrande के निर्माण में गुणवत्ता और कठिनाई सुनिश्चित करने के लिए एक दो-चरणीय प्रक्रिया शामिल थी। पहले, क्राउडवर्कर्स ने 1,600 मूल विनोग्राद स्कीमा के सेट के आधार पर वाक्य जोड़े उत्पन्न किए, जो स्वयं मूल 273-स्कीमा विनोग्राद स्कीमा चैलेंज से प्राप्त हुए थे। प्रत्येक स्कीमा को विविधता बढ़ाने और सतह-स्तरीय शाब्दिक संकेतों का शोषण करने की प्रणालियों की संभावना को कम करने के लिए कई व्याख्यात्मक रूपों में विस्तारित किया गया था। दूसरे चरण में एक प्रतिकूल फ़िल्टरिंग तकनीक का उपयोग किया गया, जहाँ पूर्व-प्रशिक्षित भाषा मॉडलों के एक सेट का उपयोग उन उदाहरणों की पहचान करने और हटाने के लिए किया गया जो उन मॉडलों द्वारा सही ढंग से हल किए जा सकते थे, जिससे मूल्यांकन के लिए केवल सबसे चुनौतीपूर्ण उदाहरण बरकरार रहे।
यह प्रतिकूल फ़िल्टरिंग प्रक्रिया Winogrande को पहले के बेंचमार्क से अलग करने के लिए महत्वपूर्ण थी। समकालीन मॉडलों के लिए बहुत आसान उदाहरणों को पुनरावृत्त रूप से त्यागकर, निर्माताओं ने सुनिश्चित किया कि शेष डेटासेट मौजूदा Machine learning और Deep learning दृष्टिकोणों की सीमाओं को आगे बढ़ाएगा। अंतिम डेटासेट में उदाहरणों का एक संतुलित वितरण होता है, जिसमें आधे को पहले संज्ञा वाक्यांश के रूप में उत्तर की आवश्यकता होती है और आधे को दूसरे की, जिससे किसी भी स्थितीय पूर्वाग्रह को समाप्त किया जा सके।
मूल्यांकन और प्रभाव
Winogrande Large language model और अन्य Neural network आर्किटेक्चर में सामान्य ज्ञान तर्क को मापने के लिए एक मानक मूल्यांकन उपकरण बन गया है। कई बेंचमार्क के विपरीत जो तथ्यात्मक स्मरण या वाक्यविन्यास पार्सिंग पर केंद्रित हैं, Winogrande विशेष रूप से निहित वास्तविक-विश्व ज्ञान को लागू करने की क्षमता को लक्षित करता है। Winogrande पर प्रदर्शन आमतौर पर सटीकता के रूप में रिपोर्ट किया जाता है, जिसमें यादृच्छिक अनुमान 50% देता है। प्रारंभिक Transformer (architecture)-आधारित मॉडल, जैसे BERT, ने लगभग 60-65% सटीकता हासिल की, जबकि हाल के मॉडलों ने 2024 तक 90% से अधिक पार कर लिया है, जो क्षेत्र में महत्वपूर्ण प्रगति को दर्शाता है।
बेंचमार्क ने संबंधित कार्यों और डेटासेट के विकास को भी प्रभावित किया है। इसकी सफलता ने WinoGrande-X, एक बहुभाषी विस्तार, और WinoBias के निर्माण को प्रेरित किया, जो सर्वनाम समाधान में लिंग पूर्वाग्रह का परीक्षण करने के लिए स्कीमा को अनुकूलित करता है। शोधकर्ताओं ने मॉडल सीमाओं की जांच करने के लिए Winogrande का उपयोग किया है, यह प्रकट करते हुए कि कई प्रणालियाँ वास्तविक तर्क के बजाय स्प्यूरियस सहसंबंधों या याद किए गए पैटर्न पर निर्भर करती हैं, एक खोज जिसने अधिक मजबूत मूल्यांकन पद्धतियों पर काम को प्रेरित किया है।
विनोग्राद स्कीमा चैलेंज से संबंध
मूल विनोग्राद स्कीमा चैलेंज, जिसे 2011 में हेक्टर लेवेस्क द्वारा प्रस्तावित किया गया था, ट्यूरिंग परीक्षण के विकल्प के रूप में डिज़ाइन किया गया था, जो भाषा समझ के एक संकीर्ण लेकिन गहरे रूप पर केंद्रित था। प्रत्येक स्कीमा में दो वाक्य होते हैं जो एक शब्द को छोड़कर समान होते हैं, जिसमें सर्वनाम समाधान दोनों के बीच उलट जाता है। Winogrande इस मूल संरचना को संरक्षित करता है लेकिन इसे 273 उदाहरणों से दसियों हज़ारों तक बढ़ाता है, जिससे बेंचमार्किंग के लिए यह सांख्यिकीय रूप से अधिक विश्वसनीय हो जाता है। पैमाने में वृद्धि विभिन्न प्रकार के सामान्य ज्ञान, जैसे भौतिक, सामाजिक और स्थानिक तर्क, में मॉडल व्यवहार के सूक्ष्म-विश्लेषण की भी अनुमति देती है।
एक उल्लेखनीय अंतर यह है कि Winogrande उदाहरण विशेषज्ञों द्वारा हस्त-निर्मित होने के बजाय क्राउडवर्कर्स द्वारा उत्पन्न किए जाते हैं, जो अधिक भाषाई विविधता लाता है लेकिन संभावित शोर भी। प्रतिकूल फ़िल्टरिंग चरण इसे कम करता है यह सुनिश्चित करके कि केवल वे उदाहरण जो मजबूत मॉडलों को मात देते हैं, बरकरार रखे जाते हैं, जिससे उच्च कठिनाई बनी रहती है। क्राउड-सोर्सिंग प्लस स्वचालित फ़िल्टरिंग का यह संकर दृष्टिकोण Artificial intelligence समुदाय में अन्य बेंचमार्क निर्माताओं द्वारा अपनाया गया है।
सीमाएँ और आलोचनाएँ
अपनी लोकप्रियता के बावजूद, Winogrande को आलोचना का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि बेंचमार्क को सच्ची समझ के बिना डेटासेट में सांख्यिकीय नियमितताओं, जैसे शब्द आवृत्ति या सह-घटना पैटर्न, का शोषण करके खेला जा सकता है। अध्ययनों से पता चला है कि प्रशिक्षण सेट पर फाइन-ट्यून किए गए मॉडल उथले अनुमानों को सीखकर उच्च सटीकता प्राप्त कर सकते हैं। इसके अतिरिक्त, द्विआधारी विकल्प प्रारूप समस्या को सरल बनाता है, क्योंकि वास्तविक-विश्व सर्वनाम समाधान में अक्सर दो से अधिक उम्मीदवार शामिल होते हैं या स्पष्टीकरण उत्पन्न करने की आवश्यकता होती है।
एक और सीमा क्राउड-सोर्स किए गए उदाहरणों में सांस्कृतिक और भाषाई पूर्वाग्रह की संभावना है, जो मुख्य रूप से अंग्रेजी में हैं और पश्चिमी-केंद्रित सामान्य ज्ञान धारणाओं को दर्शाते हैं। यह विविध डेटा पर प्रशिक्षित या बहुभाषी संदर्भों में मूल्यांकन किए गए मॉडलों को नुकसान पहुंचा सकता है। WinoGrande-X जैसे अधिक समावेशी संस्करण बनाने के प्रयासों ने इसे संबोधित करने का प्रयास किया है, लेकिन भाषाओं में कवरेज असमान बनी हुई है।
भविष्य की दिशाएँ
Winogrande सामान्य ज्ञान तर्क में प्रगति का मूल्यांकन करने के लिए एक बेंचमार्क के रूप में काम करना जारी रखता है, लेकिन इसकी भूमिका विकसित हो रही है। जैसे-जैसे मॉडल लगभग पूर्ण स्कोर प्राप्त करते हैं, शोधकर्ता अधिक जटिल तर्क कार्यों पर ध्यान केंद्रित कर रहे हैं जिनके लिए बहु-चरणीय अनुमान या बाहरी ज्ञान के साथ एकीकरण की आवश्यकता होती है। Winogrande के पीछे के सिद्धांत, विशेष रूप से प्रतिकूल फ़िल्टरिंग और निहित ज्ञान पर जोर, ने HellaSwag और ARC जैसे नए बेंचमार्क के डिज़ाइन को सूचित किया है, जो Generative AI क्षमताओं के व्यापक पहलुओं का परीक्षण करते हैं। डेटासेट अनुसंधान के लिए सार्वजनिक रूप से उपलब्ध रहता है, और इसकी पद्धति अक्सर मॉडल मूल्यांकन और मजबूती पर अध्ययनों में उद्धृत की जाती है।