अंग्रेज़ी से अनुवादित

SQuAD-Shifts एक बेंचमार्क डेटासेट है जो प्रश्न उत्तर देने में वितरण बदलाव का मूल्यांकन करने के लिए है, जो SQuAD से व्युत्पन्न है। यह मापता है कि मॉडल विकिपीडिया डोमेन में नए डेटा वितरणों के लिए कितनी अच्छी तरह सामान्यीकरण करते हैं, जिसे 2019 में Google शोधकर्ताओं द्वारा पेश किया गया था।

SQuAD-Shifts एक बेंचमार्क डेटासेट है जिसे वितरण बदलाव (distribution shift) के तहत प्रश्न-उत्तर मॉडल की मजबूती का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसे 2019 में Google के शोधकर्ताओं (जिनमें जॉन मिलर, कार्ल क्राउथ और लुडविग श्मिट शामिल हैं) द्वारा स्टैनफोर्ड प्रश्न उत्तर डेटासेट (SQuAD) के साथी के रूप में पेश किया गया था। डेटासेट में विकिपीडिया लेखों से एकत्र किए गए नए प्रश्न-उत्तर जोड़े शामिल हैं जो मूल SQuAD प्रशिक्षण डेटा में मौजूद नहीं थे, जिससे विषय वितरण और लेखन शैली में प्राकृतिक बदलाव पैदा होता है। इसका प्राथमिक उद्देश्य यह मापना है कि SQuAD पर प्रशिक्षित मॉडल अनदेखे डेटा पर कितनी अच्छी तरह सामान्यीकरण करते हैं, जो Artificial intelligence प्रणालियों के वास्तविक दुनिया में तैनाती के लिए एक महत्वपूर्ण गुण है।

बेंचमार्क में तीन अलग-अलग उपसमूह शामिल हैं: SQuAD-Shifts-New, जिसमें पूरी तरह से नए विकिपीडिया लेखों के बारे में प्रश्न शामिल हैं; SQuAD-Shifts-Wiki, जो उन लेखों का उपयोग करता है जो SQuAD के निर्माण के समय मौजूद थे लेकिन मूल डेटासेट में शामिल नहीं थे; और SQuAD-Shifts-Reddit, जिसमें विकिपीडिया लेखों के बारे में Reddit उपयोगकर्ताओं के प्रश्न शामिल हैं। प्रत्येक उपसमूह एक अलग प्रकार का वितरण बदलाव पेश करता है, विषय नवीनता से लेकर शैलीगत भिन्नता तक। डेटासेट SQuAD के समान प्रारूप पर बनाया गया है, जिसमें प्रत्येक उदाहरण में एक संदर्भ पैराग्राफ, एक प्रश्न और उत्तर स्पैन का एक सेट होता है।

Motivation and Design

वितरण बदलाव Machine learning में एक मौलिक चुनौती है, जहां एक डेटा वितरण पर प्रशिक्षित मॉडल दूसरे पर लागू होने पर अक्सर खराब प्रदर्शन करते हैं। SQuAD-Shifts को इस घटना का नियंत्रित लेकिन यथार्थवादी मूल्यांकन प्रदान करने के लिए बनाया गया था। सिंथेटिक गड़बड़ी के विपरीत, SQuAD-Shifts में बदलाव मानव-निर्मित सामग्री में प्राकृतिक भिन्नताओं से उत्पन्न होते हैं। डिज़ाइन इस सिद्धांत का पालन करता है कि मजबूती को उस डेटा पर मापा जाना चाहिए जो तैनाती में संभावित रूप से सामना किया जाता है, न कि केवल प्रतिकूल रूप से तैयार किए गए उदाहरणों पर।

डेटासेट विकिपीडिया की संरचना का लाभ उठाता है, जो लगातार संपादित और विस्तारित होता रहता है। मूल SQuAD रिलीज़ के बाद नए लेख और प्रश्न एकत्र करके, निर्माताओं ने सुनिश्चित किया कि परीक्षण डेटा प्रशिक्षण डेटा से अस्थायी रूप से अलग है। यह अस्थायी पृथक्करण एक प्रमुख विशेषता है, क्योंकि यह मॉडल को विशिष्ट लेखों को याद रखने से रोकता है और उन्हें सामान्य समझ कौशल पर निर्भर रहने के लिए मजबूर करता है।

Evaluation Protocol

SQuAD-Shifts पर मानक मूल्यांकन SQuAD के समान मेट्रिक्स का उपयोग करता है: Exact Match (EM) और F1 स्कोर। EM उन भविष्यवाणियों का प्रतिशत मापता है जो ग्राउंड-ट्रुथ उत्तरों में से एक से बिल्कुल मेल खाती हैं, जबकि F1 टोकन-स्तरीय ओवरलैप पर सटीकता और रिकॉल का हार्मोनिक माध्य गणना करता है। मॉडल आमतौर पर मूल SQuAD प्रशिक्षण सेट पर प्रशिक्षित होते हैं और फिर बिना किसी अनुकूलन के तीन SQuAD-Shifts उपसमूहों पर मूल्यांकन किए जाते हैं। इन-डिस्ट्रीब्यूशन SQuAD विकास सेट की तुलना में प्रदर्शन में गिरावट मॉडल की वितरण बदलाव के प्रति संवेदनशीलता को मापती है।

मूल पेपर में, लेखकों ने कई बेसलाइन मॉडलों का मूल्यांकन किया, जिनमें BiDAF और BERT शामिल हैं। उन्होंने पाया कि सभी मॉडलों ने स्थानांतरित उपसमूहों पर महत्वपूर्ण प्रदर्शन गिरावट दिखाई, जिसमें SQuAD-Shifts-Reddit पर अधिक गिरावट थी, जिसमें अधिक अनौपचारिक और वविध प्रश्न वाक्यांश शामिल हैं। इसने उजागर किया कि Deep learning मॉडल, जैसे Transformer (architecture)-आधारित आर्किटेक्चर, भी प्राकृतिक वितरण बदलावों के प्रति मजबूत नहीं थे, जिससे डोमेन अनुकूलन और मजबूत प्रशिक्षण में आगे क अनुसंधान कौ प्रेरित किया।

Relationship to Other Benchmarks

SQuAD-Shifts प्राकृतिक भाषा प्रसंस्करण में वितरण बदलाव बेंचमार्क के वयापक परिवार का हिस्सा है। यह GLUE-X और RobustQA जैसे डेटासेट का पूरक है, जो विभिन्न गड़बड़ी के तहत सामान्यीकरण का परीक्षण करते हैं। हालांकि, SQuAD-Shifts कृत्रिम संशोधनों के बजाय प्राकृतिक रूप से होने वाले बदलावों के उपयोग में अदवितीय है। यह इसे वास्तविक दुनिया की स्थितियों के लिए अधिक यथार्थवादी प्रॉक्सी बनाता है, जहां डेटा वितरण समय कै साथ उपयोगकर्ता वयवहार, सामग्री निर्माण और भाषा उपयोग में परिवर्तनों कै कारण विकसित होता है।

बेंचमार्क Large language model मूल्यांकन कै विकास में पर्भावशाली रहा है। कई पर्भावर्ती अधययनों ने SQuAD-Shifts कौ उपयोग OpenAI कै GPT शृंखला और Google DeepMind कै मॉडलों की मजबूती कौ आकलन कै लिए किया है। इसकौ उपयोग विभिन्न प्रशिक्षण रणनीतियों, जैसै डेटा वर्ध्धि और डोमेन अनुकूलन, की तुलना कै लिए भी किया गय है, जिससै दिखा गय कि ये तकनीकें पर्ददर्शन अंतर कौ कम कर सकती हैं लेकिन समाप्त नहीं कर सकतीं।

Limitations and Criticisms

SQuAD-Shifts की एक सीमा यह है कि यह कवल पठन समझन, जो भाषा समझन कै भीतर एक सकड़ कार्य है, कौ शामिल करता है। बदलाव भी कवल विकिपीडिया-आधारित सामग्री तक सीमित हैं, जो समाचार, सोशिल मीडिया, या तकनीकी दसतावेजों जैसै अनय डोमेनों कै बदलावों कौ पर्ितिबबिंबित नहीं कर सकता है। इसके अतिरिक्त, डेटासेट आधुनिक प्रशिक्षण कॉरपोरा की तुलना में अपेक्षाकृत छोटा है, जिससै मूल्यांकन परिणामों में उच्च विभिन्नत हो सकती है। कुछ शोधकर्ताओों ने नोट किया है कि SQuAD-Shifts पर पर्ददर्शन गिरावट आंशिक रूप सै प्रश्न कठिनाई में अंतर कै कारण हो सकता है, न कि कवल शुद्ध वितरण बदलाव कै कारण, हालांकि निर्माताओों ने प्रश्न पर्कारों कौ मिलान करकै इसकौ नियंत्रित किया।

इन सीमाओों कै बावजूद, SQuAD-Shifts मजबूती शोध कै लिए वयापक रूप सै उपयोग होन वाला बेंचमार्क बना रहा है। इसै कई लीडरबोर्ड और मूल्यांकन सूइटों, जिसमें Robustness Gym शामिल है, में शामिल किया गय है। डेटासेट सार्वजनिक रूप सै उपलब्ध है और आधिकारिक रिपोजिटोरी सै डाउनलोड किया जा सकता है, जिससै शोधकर्ता परिणामों कौ पुन:उत्पन्न कर सकतै हैं और विश्लेषण कौ विस्तारित कर सकतै हैं।

Impact and Legacy

SQuAD-Shifts कै परिचोशन ने Artificial intelligence में वितरण बदलाव समस्या कै पर्ति बढ़ती जागरूकता में योगदान दिया। इसने आनुभविक सबूत पर्ददान किया कि मानक बेंचमार्कों पर अति-आधुनिक परिणाम पर्ाप्त करन वालै मॉडल थोड़ै अलग डेटा पर नाटकीय रूप सै विफल हो सकतै हैं। इसने परवर्ती बेंचमार्कों कै डिजाइन कौ पर्भावित किया, जैसै WILDS सूइट, जिसमें कई डोमेन और कार्य शामिल हैं जिसमें प्राकृतिक बदलाव हैं। इसने डोमेन-इनवारियंट रिप्रिसेंटेशन लरनिंग और टेस्ट-टाइम अनुकूलन जैसी तकनीकों में शोध कौ भी पर्ित किया।

Generative AI कै संदर्भ में, SQuAD-Shifts कौ उपयोग Anthropic कै Clauडे और google-clouड कै AI सेवाओं जैसै मॉडलों की मजबूती कौ मूल्यांकन कै लिए किया गय है। बेंचमार्क कौ प्राकृतिक बदलावों पर धयान इसै उन अनुप्रयोगों कै लिए विशेष रूप सै पर्िासंगिक बनाता है जहां डेटा लगातार विकसित हो रहा है, जैसै सच इंजन और वर्िचुअल असिस्टेंट। 2024 कै अनुसार, SQuAD-Shifts मॉडल मजबूती पर पेपरों में उधृत होना जारी है और पर्शन उत्तर में सामान्यीकरण कौ मपन कै लिए एक मानक उपकरण माना जाता है।

See Also

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·question-answering·distribution-shift·nlp
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास