HellaSwag 2025 एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों, विशेष रूप से बड़े भाषा मॉडल और मल्टीमॉडल मॉडल की सामान्य ज्ञान तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह मूल HellaSwag बेंचमार्क का उत्तराधिकारी है, जिसे 2019 में टोरंटो विश्वविद्यालय और एलन इंस्टीट्यूट फॉर एआई के शोधकर्ताओं द्वारा पेश किया गया था। 2025 संस्करण डेटासेट को अधिक चुनौतीपूर्ण उदाहरणों, दृश्य और ऑडियो परिदृश्यों के विस्तारित कवरेज, और याद रखने या सांख्यिकीय शॉर्टकट से बढ़े हुए स्कोर को कम करने के लिए एक कठोर मूल्यांकन प्रोटोकॉल के साथ अद्यतन करता है।
बेंचमार्क किसी दिए गए परिदृश्य के सबसे प्रशंसनीय निरंतरता को चुनने की मॉडल की क्षमता का परीक्षण करता है, जिसके लिए भौतिक गतिशीलता, सामाजिक परंपराओं और अस्थायी कार्य-कारण की समझ की आवश्यकता होती है। पहले के संस्करणों के विपरीत जो मुख्य रूप से पाठ पर केंद्रित थे, HellaSwag 2025 में मल्टीमॉडल प्रॉम्प्ट शामिल हैं जो पाठ को छवियों या ऑडियो क्लिप के साथ जोड़ते हैं, जिससे मॉडल को विभिन्न मोडैलिटी में जानकारी एकीकृत करने के लिए प्रेरित किया जाता है। डेटासेट मानव-लिखित परिदृश्यों और एआई-जनित विरोधात्मक उदाहरणों के संयोजन से बनाया गया है, जिसे गुणवत्ता और कठिनाई सुनिश्चित करने के लिए फ़िल्टर किया गया है।
पृष्ठभूमि और प्रेरणा
मूल HellaSwag को मौजूदा बेंचमार्क में अंतर को संबोधित करने के लिए बनाया गया था, जो अक्सर उन मॉडलों के बीच अंतर करने में विफल रहते थे जो वास्तव में सामान्य ज्ञान को समझते हैं और उन मॉडलों के बीच जो सतही भाषाई पैटर्न पर भरोसा करते हैं। यह नाम "hell" और "swag" (मूर्खतापूर्ण ज्ञान या सामान्य ज्ञान का एक चंचल संदर्भ) का एक पोर्टमैंटू है। 2025 संस्करण जनरेटिव एआई के तेजी से उन्नति के जवाब में विकसित किया गया था, जिसने ऐसे मॉडलों को जन्म दिया है जो पुराने बेंचमार्क पर लगभग पूर्ण स्कोर प्राप्त कर सकते हैं, जिससे आगे की प्रगति को मापना मुश्किल हो गया है।
बेंचमार्क का रखरखाव शैक्षणिक और उद्योग शोधकर्ताओं के एक संघ द्वारा किया जाता है, जिसमें स्टैनफोर्ड एआई लैब, एमआईटी CSAIL, और बर्कले एआई रिसर्च के सदस्य शामिल हैं। परियोजना को कई स्रोतों से वित्त पोषण प्राप्त होता है, जिसमें राष्ट्रीय विज्ञान फाउंडेशन और निजी फाउंडेशन शामिल हैं।
डेटासेट निर्माण
HellaSwag 2025 में लगभग 20,000 बहुविकल्पीय प्रश्न हैं, प्रत्येक में एक संदर्भ और चार संभावित अंत हैं, जिनमें से केवल एक सही है। संदर्भ विभिन्न स्रोतों से लिए गए हैं, जिनमें मूवी स्क्रिप्ट, निर्देशात्मक वीडियो और रोजमर्रा के परिदृश्य शामिल हैं। कठिनाई बढ़ाने के लिए, डेटासेट में एआई सिस्टम द्वारा उत्पन्न "विरोधात्मक" उदाहरण शामिल हैं, जिन्हें मानव एनोटेटर्स द्वारा सत्यापित किया जाता है ताकि यह सुनिश्चित हो सके कि वे मनुष्यों द्वारा हल करने योग्य लेकिन मशीनों के लिए चुनौतीपूर्ण हैं।
निर्माण प्रक्रिया में कई चरण शामिल हैं: पहले, उम्मीदवार परिदृश्यों का एक बड़ा पूल एकत्र किया जाता है; दूसरे, एआई मॉडल प्रशंसनीय और असंभव अंत उत्पन्न करते हैं; तीसरे, मानव एनोटेटर्स उदाहरणों को फ़िल्टर और लेबल करते हैं; अंत में, एक कैलिब्रेशन सेट का उपयोग यह सुनिश्चित करने के लिए किया जाता है कि बेंचमार्क लंबाई या शब्द आवृत्ति जैसे तुच्छ संकेतों से पक्षपाती नहीं है। 2025 संस्करण एक "प्रति-तथ्यात्मक" उपसमुच्चय भी पेश करता है, जहां सही उत्तर के लिए परिदृश्य में काल्पनिक परिवर्तनों के बारे में तर्क करने की आवश्यकता होती है।
मूल्यांकन और स्कोरिंग
मॉडलों का मूल्यांकन परीक्षण सेट पर उनकी सटीकता के आधार पर किया जाता है, जिसमें प्राथमिक मीट्रिक सही उत्तर दिए गए प्रश्नों का प्रतिशत है। ओवरफिटिंग को रोकने के लिए, परीक्षण सेट सार्वजनिक रूप से जारी नहीं किया जाता है; इसके बजाय, शोधकर्ता एक नियंत्रित एपीआई के माध्यम से मूल्यांकन के लिए अपने मॉडल सबमिट करते हैं, जो OpenAI के इवल जैसे अन्य बेंचमार्क द्वारा उपयोग किए जाने वाले दृष्टिकोण के समान है। बेंचमार्क एक "मजबूती स्कोर" भी रिपोर्ट करता है जो प्रश्नों के परेशान संस्करणों पर प्रदर्शन को मापता है, जैसे कि व्याख्या किए गए संदर्भ या संशोधित छवियां।
HellaSwag 2025 को अपने पूर्ववर्ती की तुलना में अधिक कठिन बनाने के लिए डिज़ाइन किया गया है। प्रारंभिक मूल्यांकन में, GPT-4 और Claude जैसे अत्याधुनिक मॉडल लगभग 85% सटीकता प्राप्त करते हैं, जबकि मूल HellaSwag पर 95% की तुलना में। यह अंतर इंगित करता है कि नया बेंचमार्क विभिन्न तर्क क्षमताओं वाले मॉडलों के बीच अंतर करने के लिए एक बेहतर संकेत प्रदान करता है।
प्रभाव और स्वागत
HellaSwag 2025 की रिलीज़ को एआई अनुसंधान समुदाय से रुचि के साथ देखा गया है। कई शोधकर्ता नए आर्किटेक्चर या प्रशिक्षण विधियों को विकसित करते समय इसे एक मानक मूल्यांकन उपकरण के रूप में उपयोग करते हैं। बेंचमार्क को उद्योग प्रयोगशालाओं, जिनमें Google DeepMind और Anthropic शामिल हैं, द्वारा उनके आंतरिक मूल्यांकन सूट के हिस्से के रूप में भी अपनाया गया है। कुछ आलोचकों का तर्क है कि बेंचमार्क में अभी भी सीमाएं हैं, जैसे कि पश्चिमी सांस्कृतिक संदर्भों के प्रति संभावित पूर्वाग्रह, लेकिन संघ ने विविध परिदृश्यों को शामिल करने के प्रयास किए हैं।
बेंचमार्क ने नई प्रशिक्षण तकनीकों के विकास को भी प्रभावित किया है, जैसे पाठ्यक्रम शिक्षण और डेटा वृद्धि, जिनका उद्देश्य सामान्य ज्ञान तर्क में सुधार करना है। इसके अतिरिक्त, HellaSwag 2025 का उपयोग "शॉर्टकट सीखने" की घटना का अध्ययन करने के लिए किया गया है, जहां मॉडल वास्तविक समझ के बजाय सांख्यिकीय नियमितताओं का फायदा उठाते हैं।
भविष्य की दिशाएं
HellaSwag के भविष्य के संस्करणों की योजनाओं में अधिक भाषाओं में विस्तार, इंटरैक्टिव या सन्निहित परिदृश्यों को शामिल करना, और अस्थायी तर्क घटक जोड़ना शामिल है। संघ एक लीडरबोर्ड जारी करने का भी इरादा रखता है जो समय के साथ प्रगति को ट्रैक करता है, जो SuperGLUE बेंचमार्क के समान है। जैसे-जैसे एआई सिस्टम विकसित होते रहते हैं, HellaSwag 2025 जैसे बेंचमार्क यह सुनिश्चित करने में महत्वपूर्ण भूमिका निभाते हैं कि प्रगति को सार्थक तरीकों से मापा जाए।