HellaSwag 2023 एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों, विशेष रूप से बड़े भाषा मॉडलों की सामान्य-ज्ञान तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह मूल HellaSwag डेटासेट का एक अद्यतन संस्करण है, जिसे 2019 में वाशिंगटन विश्वविद्यालय और एलन इंस्टीट्यूट फॉर एआई के शोधकर्ताओं द्वारा पेश किया गया था। 2023 का संशोधन सांख्यिकीय पूर्वाग्रहों के प्रभाव को कम करने और वास्तविक तर्क को पैटर्न मिलान के बजाय बेहतर ढंग से मापने के लिए प्रश्नों को अधिक चुनौतीपूर्ण बनाने पर केंद्रित है।
बेंचमार्क में बहुविकल्पीय प्रश्न शामिल हैं जहाँ एक मॉडल को एक रोजमर्रा की स्थिति का वर्णन करने वाला संदर्भ दिया जाता है और उसे चार विकल्पों में से सबसे प्रशंसनीय निरंतरता का चयन करना होता है। मूल HellaSwag में 70,000 प्रश्न शामिल थे, जिनमें से 10,000 सत्यापन और परीक्षण के लिए आरक्षित थे। 2023 का अद्यतन समान संरचना बनाए रखता है लेकिन नए उदाहरण पेश करता है जो विशेष रूप से उन मॉडलों के लिए कठिन बनाए गए हैं जो सतही संकेतों, जैसे शब्द आवृत्ति या वाक्य लंबाई पर निर्भर करते हैं।
उद्देश्य और डिज़ाइन
HellaSwag 2023 का प्राथमिक लक्ष्य यह परीक्षण करना है कि क्या AI मॉडल भौतिक और सामाजिक दुनिया को इतनी अच्छी तरह से समझ पाते हैं कि किसी दिए गए परिदृश्य में आगे क्या होगा इसकी भविष्यवाणी कर सकें। उदाहरण के लिए, एक प्रश्न एक व्यक्ति द्वारा गिलास में पानी डालने का वर्णन कर सकता है और फिर पूछ सकता है कि आगे क्या होता है, जिसमें विकल्प गिलास के छलकने से लेकर व्यक्ति द्वारा पानी पीने तक हो सकते हैं। सही उत्तर के लिए मॉडल को गुरुत्वाकर्षण, आयतन और विशिष्ट मानव व्यवहार के बारे में तर्क करने की आवश्यकता होती है।
डेटासेट मानव-लिखित और मशीन-जनित उदाहरणों के संयोजन का उपयोग करके बनाया गया था। मूल संस्करण में एडवरसैरियल फ़िल्टरिंग नामक एक तकनीक का उपयोग किया गया था, जहाँ एक भाषा मॉडल ने उम्मीदवार निरंतरताएँ उत्पन्न कीं और फिर मानव एनोटेटरों ने उन्हें चुना जो सबसे प्रशंसनीय थे लेकिन अन्य मॉडलों को मूर्ख बनाने की सबसे अधिक संभावना भी रखते थे। 2023 का अद्यतन और भी चुनौतीपूर्ण प्रश्न बनाने के लिए इस प्रक्रिया को परिष्कृत करता है, जिसमें अक्सर लंबे संदर्भ और अधिक सूक्ष्म स्थितियाँ शामिल होती हैं।
मूल्यांकन और स्कोरिंग
मॉडलों का मूल्यांकन सही उत्तर चुनने में उनकी सटीकता के आधार पर किया जाता है। बेंचमार्क सटीकता को प्रतिशत के रूप में रिपोर्ट करता है, जिसमें उच्च स्कोर बेहतर सामान्य-ज्ञान तर्क का संकेत देते हैं। मूल HellaSwag में, अत्याधुनिक मॉडलों ने लगभग 85-90% सटीकता हासिल की, लेकिन 2023 का संस्करण काफी कठिन है, जिसमें कई मॉडल 80% से नीचे स्कोर करते हैं। 2024 की शुरुआत तक, OpenAI और Google DeepMind जैसे सर्वश्रेष्ठ प्रदर्शन करने वाले बड़े भाषा मॉडल लगभग 90% सटीकता प्राप्त करते हैं, जबकि छोटे मॉडल अक्सर 70% से नीचे आते हैं।
बेंचमार्क का व्यापक रूप से कृत्रिम बुद्धिमत्ता अनुसंधान समुदाय में सामान्य-ज्ञान तर्क के लिए एक मानक परीक्षण के रूप में उपयोग किया जाता है। इसे अक्सर लीडरबोर्ड में शामिल किया जाता है जो SuperGLUE और MMLU जैसे अन्य बेंचमार्क के साथ विभिन्न मॉडलों के प्रदर्शन की तुलना करते हैं। शोधकर्ता मॉडलों में कमजोरियों की पहचान करने और नई प्रशिक्षण तकनीकों के विकास का मार्गदर्शन करने के लिए HellaSwag 2023 का उपयोग करते हैं।
अन्य बेंचमार्क से संबंध
HellaSwag 2023 बेंचमार्क के एक व्यापक परिवार का हिस्सा है जो AI क्षमता के विभिन्न पहलुओं का आकलन करता है। जहाँ यह सामान्य-ज्ञान तर्क पर केंद्रित है, वहीं GLUE और SuperGLUE जैसे अन्य बेंचमार्क भाषा समझ का परीक्षण करते हैं, और MMLU कई डोमेन में ज्ञान का परीक्षण करता है। 2023 का अद्यतन विशेष रूप से उल्लेखनीय है क्योंकि इसे उन मॉडलों के खिलाफ अधिक मजबूत बनाने के लिए डिज़ाइन किया गया था जो केवल प्रशिक्षण डेटा को याद करते हैं या सांख्यिकीय नियमितताओं का शोषण करते हैं।
बेंचमार्क Artificial intelligence सुरक्षा की अवधारणा से भी संबंधित है, क्योंकि सामान्य-ज्ञान तर्क को विश्वसनीय और भरोसेमंद AI प्रणालियों के निर्माण के लिए एक महत्वपूर्ण घटक माना जाता है। एक मॉडल जो सामान्य-ज्ञान तर्क में विफल रहता है, वह वास्तविक दुनिया के अनुप्रयोगों, जैसे स्वायत्त ड्राइविंग या चिकित्सा निदान में खतरनाक त्रुटियाँ कर सकता है। परिणामस्वरूप, HellaSwag 2023 का उपयोग अक्सर AI संरेखण और मजबूती पर शोध में किया जाता है।
सीमाएँ और आलोचनाएँ
व्यापक उपयोग के बावजूद, HellaSwag 2023 की कुछ सीमाएँ हैं। आलोचकों का तर्क है कि बेंचमार्क अभी भी कुछ पूर्वाग्रहों के प्रति संवेदनशील हो सकता है, जैसे कि मॉडलों की लंबे या अधिक जटिल उत्तरों को पसंद करने की प्रवृत्ति। इसके अतिरिक्त, सभी प्रश्न अंग्रेजी में हैं और पश्चिमी सांस्कृतिक संदर्भों पर केंद्रित हैं, जो अन्य भाषाओं और संस्कृतियों में इसकी प्रयोज्यता को सीमित कर सकता है।
एक और आलोचना यह है कि बेंचमार्क सामान्य-ज्ञान तर्क के एक संकीर्ण रूप को मापता है, जो भौतिक और सामाजिक परिदृश्यों पर केंद्रित है लेकिन तार्किक या गणितीय तर्क जैसे अन्य प्रकार के तर्क पर नहीं। कुछ शोधकर्ताओं ने इन अंतरालों को संबोधित करने के लिए पूरक बेंचमार्क का प्रस्ताव किया है, लेकिन HellaSwag 2023 एक मानक संदर्भ बिंदु बना हुआ है।
भविष्य की दिशाएँ
HellaSwag 2023 का विकास Machine learning के क्षेत्र में अधिक चुनौतीपूर्ण और यथार्थवादी मूल्यांकन डेटासेट बनाने की दिशा में एक व्यापक प्रवृत्ति को दर्शाता है। जैसे-जैसे मॉडल में सुधार जारी है, बेंचमार्क को गति बनाए रखने के लिए विकसित होना चाहिए। HellaSwag के भविष्य के संस्करणों में अधिक विविध परिदृश्य, बहुभाषी प्रश्न, या इंटरैक्टिव तत्व शामिल हो सकते हैं जिनके लिए मॉडलों को लंबे समय के क्षितिज पर तर्क करने की आवश्यकता होती है।
शोधकर्ता बेंचमार्क को अधिक गतिशील बनाने के तरीकों की भी खोज कर रहे हैं, जहाँ प्रश्न किसी मॉडल की कमजोरियों के आधार पर तुरंत उत्पन्न किए जाते हैं। अनुकूली परीक्षण के रूप में जाना जाने वाला यह दृष्टिकोण किसी मॉडल की क्षमताओं का अधिक सटीक माप प्रदान कर सकता है। 2023 का अद्यतन इस दिशा में एक कदम है, लेकिन नवाचार के लिए अभी भी जगह है।
संक्षेप में, HellaSwag 2023 AI प्रणालियों में सामान्य-ज्ञान तर्क के मूल्यांकन के लिए एक प्रमुख उपकरण है। इसका अद्यतन डिज़ाइन इसे अधिक चुनौतीपूर्ण और कला की वर्तमान स्थिति के लिए अधिक प्रासंगिक बनाता है, और यह Deep learning और Large language model विकास में अनुसंधान को प्रभावित करना जारी रखता है।