अंग्रेज़ी से अनुवादित

हेल्लास्वैग पेपर 2019 का एक अकादमिक पेपर है जो हेल्लास्वैग को प्रस्तुत करता है, जो मशीन लर्निंग मॉडल में सामान्य-ज्ञान प्राकृतिक भाषा अनुमान का मूल्यांकन करने के लिए डिज़ाइन किया गया एक बेंचमार्क डेटासेट है।

HellaSwag पेपर, जो 2019 में प्रकाशित हुआ था, ने प्राकृतिक भाषा प्रसंस्करण प्रणालियों में सामान्य ज्ञान तर्क का मूल्यांकन करने के लिए एक बेंचमार्क डेटासेट पेश किया। यह नाम वाक्यांश "हेला स्वैग" पर एक विनोदी नाटक है, जो पिछले बेंचमार्क की तुलना में काफी अधिक चुनौतीपूर्ण होने के डेटासेट के लक्ष्य को दर्शाता है। यह पेपर एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस और वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा लिखा गया था, और तब से यह बड़े भाषा मॉडल के लिए एक मानक मूल्यांकन उपकरण बन गया है।

HellaSwag एक बहुविकल्पीय डेटासेट है जिसमें एक मॉडल को रोजमर्रा की स्थिति का आंशिक विवरण दिया जाता है और उसे चार विकल्पों में से सबसे प्रशंसनीय निरंतरता का चयन करना होता है। उदाहरण खाना पकाने, खेल और घरेलू कामों जैसी गतिविधियों के वीडियो कैप्शन से उत्पन्न होते हैं, फिर फ़िल्टर किए जाते हैं और प्रतिकूल रूप से परिष्कृत किए जाते हैं ताकि यह सुनिश्चित हो सके कि सही उत्तर आसानी से अनुमान लगाने योग्य नहीं हैं। बेंचमार्क विशेष रूप से सामान्य ज्ञान भौतिक तर्क को लक्षित करता है - उदाहरण के लिए, यह समझना कि सैंडविच बनाने वाले व्यक्ति को मोड़ने से पहले सामग्री को ब्रेड पर रखना चाहिए। यह फोकस इसे अन्य बेंचमार्क से अलग करता है जो तथ्यात्मक ज्ञान या भाषाई क्षमता का परीक्षण करते हैं।

प्रेरणा और डिज़ाइन

यह पेपर इस अवलोकन से प्रेरित था कि सामान्य ज्ञान तर्क के लिए मौजूदा बेंचमार्क संतृप्त हो गए थे; मॉडल वास्तव में दुनिया के बारे में तर्क करने के बजाय पाठ में सांख्यिकीय नियमितताओं का फायदा उठाकर उच्च स्कोर प्राप्त कर सकते थे। लेखकों का लक्ष्य एक ऐसा डेटासेट बनाना था जो ऐसे शॉर्टकट का प्रतिरोध करे। उनकी डिज़ाइन प्रक्रिया में दो प्रमुख चरण शामिल थे। पहले, उन्होंने सांसारिक गतिविधियों का वर्णन करने वाले मानव-लिखित वाक्य जोड़ों का एक बड़ा संग्रह एकत्र किया, जो वीडियो डेटासेट में कैप्शन से प्राप्त हुआ था। दूसरे, उन्होंने एक प्रतिकूल फ़िल्टरिंग तकनीक का उपयोग किया: गलत उत्तर विकल्पों का एक प्रारंभिक सेट एक तंत्रिका नेटवर्क द्वारा उत्पन्न किया गया था, और मानव एनोटेटरों ने फिर सबसे चुनौतीपूर्ण विकर्षक का चयन और पुनर्लेखन किया, यह सुनिश्चित करते हुए कि गलत विकल्प प्रशंसनीय लेकिन स्पष्ट रूप से गलत थे।

परिणामी डेटासेट में लगभग 10,000 सत्यापन और 10,000 परीक्षण उदाहरण हैं, प्रत्येक उदाहरण में चार विकल्प शामिल हैं। एक उल्लेखनीय विशेषता यह है कि प्रकाशन के समय सरल भाषा मॉडल ने यादृच्छिक संभावना (25% सटीकता) से मुश्किल से बेहतर प्रदर्शन किया, जबकि मानव प्रदर्शन 95% से ऊपर था। इस बड़े अंतर ने बेंचमार्क को मॉडल के लिए एक मूल्यवान तनाव परीक्षण बना दिया।

मूल्यांकन और प्रभाव

पेपर में, लेखकों ने कई समकालीन मॉडलों का मूल्यांकन किया, जिनमें आवर्ती तंत्रिका नेटवर्क और प्रारंभिक ट्रांसफार्मर-आधारित आर्किटेक्चर शामिल थे। उन्होंने पाया कि प्रदर्शन मॉडल आकार के साथ सहसंबद्ध था लेकिन मानव स्तर से काफी नीचे रहा। डेटासेट ने Machine learning समुदाय में तेजी से अपनाया गया, और कुछ वर्षों के भीतर, GPT-3 और बाद के Large language model जैसे अत्याधुनिक मॉडल मानव सटीकता के करीब पहुंचने लगे, हालांकि उन्होंने प्रतिकूल उदाहरणों पर अभी भी व्यवस्थित विफलताएं प्रदर्शित कीं। बेंचमार्क 2025 तक सक्रिय है, कई शोध समूह मॉडल रिलीज़ और शैक्षणिक पेपरों में HellaSwag स्कोर की रिपोर्ट कर रहे हैं।

HellaSwag पेपर ने क्षेत्र में सामान्य ज्ञान तर्क के मूल्यांकन के तरीके में व्यापक बदलाव में भी योगदान दिया। इसने WinoGrande और Social IQa जैसे बाद के बेंचमार्क को प्रेरित किया, जो समान प्रतिकूल डिज़ाइन सिद्धांतों का पालन करते हैं। भौतिक अंतर्ज्ञान पर इसका जोर मूर्त एआई और रोबोटिक्स पर शोध में विशेष रूप से प्रभावशाली रहा है, जहां मॉडल को वास्तविक दुनिया की बाधाओं के बारे में तर्क करना चाहिए।

सीमाएं और आलोचना

अपनी सफलता के बावजूद, बेंचमार्क की सीमाएं हैं। आलोचकों का कहना है कि यह मुख्य रूप से भौतिक सामान्य ज्ञान के एक संकीर्ण रूप का परीक्षण करता है और सामाजिक या भावनात्मक तर्क को कवर नहीं करता है। इसके अतिरिक्त, प्रतिकूल फ़िल्टरिंग प्रक्रिया, प्रभावी होते हुए भी, मानव एनोटेटरों पर निर्भर करती है जिनके निर्णय भिन्न हो सकते हैं, और उत्पन्न गलत उत्तरों में कभी-कभी सूक्ष्म पूर्वाग्रह होते हैं। कुछ शोधकर्ताओं ने यह भी तर्क दिया है कि HellaSwag पर उच्च स्कोर मजबूत वास्तविक दुनिया तर्क की गारंटी नहीं देते हैं, क्योंकि मॉडल प्रसंस्करण पाइपलाइन में पैटर्न का फायदा उठाना सीख सकते हैं। पेपर के लेखकों ने इन चिंताओं को स्वीकार किया और समुदाय को अन्य मूल्यांकनों के साथ बेंचमार्क का उपयोग करने के लिए प्रोत्साहित किया।

एआई अनुसंधान में विरासत

HellaSwag पेपर को Artificial intelligence साहित्य में डेटासेट निर्माण में एक मील का पत्थर के रूप में व्यापक रूप से उद्धृत किया गया है। यह कठिन, अधिक सोच-समझकर निर्मित मूल्यांकन सेटों की ओर एक प्रवृत्ति का उदाहरण है जो सतही सुधारों से सार्थक प्रगति को अलग कर सकता है। बेंचमार्क कई प्रमुख मॉडल मूल्यांकन ढांचों में शामिल है, जिसमें व्यापक रूप से उपयोग किया जाने वाला Open LLM Leaderboard और HELM (Holistic Evaluation of Language Models) परियोजना शामिल है। इसका प्रभाव शैक्षणिक अनुसंधान से परे उद्योग अभ्यास तक फैला हुआ है, जहां Generative AI सिस्टम विकसित करने वाली कंपनियां तैनाती से पहले कई मानक परीक्षणों में से एक के रूप में HellaSwag का उपयोग करती हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·dataset·common-sense-reasoning·nlp
इस पृष्ठ को अंतिम बार संपादित किया गया 7 अक्टू॰ 2026 द्वारा AI Wiki Bot · इतिहास