HellaSwag 2024 एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों, विशेष रूप से बड़े भाषा मॉडलों की सामान्य ज्ञान तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। यह मूल HellaSwag बेंचमार्क का एक अद्यतन संस्करण है, जिसे 2019 में पेश किया गया था। 2024 का संशोधन पहले के डेटासेट की सीमाओं को संबोधित करने का लक्ष्य रखता है, जैसे कि मॉडलों की वास्तविक रूप से परिदृश्यों को समझने के बजाय सांख्यिकीय नियमितताओं का फायदा उठाने की क्षमता। बेंचमार्क बहुविकल्पीय प्रश्न प्रस्तुत करता है जहाँ एक मॉडल को किसी दी गई स्थिति का सबसे प्रशंसनीय निरंतरता चुनना होता है, जिसके लिए सही उत्तर के लिए भौतिक और सामाजिक सामान्य ज्ञान की समझ की आवश्यकता होती है।
मूल HellaSwag वाशिंगटन विश्वविद्यालय और एलन इंस्टीट्यूट फॉर एआई के शोधकर्ताओं द्वारा बनाया गया था। इसे एक प्रतिकूल फ़िल्टरिंग प्रक्रिया का उपयोग करके निर्मित किया गया था, जहाँ मानव-लिखित अंतों को मशीन-जनित प्रशंसनीय लेकिन गलत अंतों के साथ जोड़ा गया था। 2024 का अद्यतन इस मूल संरचना को बनाए रखता है लेकिन कई सुधार पेश करता है। इनमें प्रश्नों का एक बड़ा सेट, अधिक विविध परिदृश्य, और उत्तर विकल्पों का पुनर्संतुलित वितरण शामिल है ताकि मॉडल स्थिति या लंबाई के आधार पर अनुमान न लगा सकें। स्कोरिंग पद्धति को भी उन मॉडलों के खिलाफ अधिक मजबूत बनाने के लिए संशोधित किया गया था जो ह्यूरिस्टिक्स का उपयोग करते हैं, जैसे कि सबसे लंबा या सबसे जटिल उत्तर चुनना।
डिज़ाइन और निर्माण
HellaSwag 2024 का निर्माण अपने पूर्ववर्ती के समान प्रतिकूल फ़िल्टरिंग दृष्टिकोण का पालन करता है। मानव एनोटेटर्स ने गतिविधि विवरणों के एक सेट के लिए सही अंत लिखे, जबकि गलत अंतों का एक अलग सेट एक भाषा मॉडल द्वारा उत्पन्न किया गया था। गलत अंतों को सतही रूप से प्रशंसनीय लेकिन शब्दार्थ रूप से गलत बनाने के लिए डिज़ाइन किया गया था, जिसमें अक्सर भौतिक नियमों या सामाजिक मानदंडों का सूक्ष्म उल्लंघन शामिल होता है। अंतिम डेटासेट में केवल वे प्रश्न शामिल हैं जहाँ गलत अंत सरल सांख्यिकीय संकेतों द्वारा आसानी से अलग नहीं किए जा सकते थे, यह सुनिश्चित करते हुए कि बेंचमार्क पैटर्न मिलान के बजाय वास्तविक तर्क को मापता है।
2024 संस्करण मूल डेटासेट को लगभग 10,000 प्रश्नों से बढ़ाकर 15,000 से अधिक प्रश्नों तक विस्तारित करता है। परिदृश्य खाना पकाने, खेल, और घरेलू कामों जैसी रोजमर्रा की गतिविधियों की एक विस्तृत श्रृंखला के साथ-साथ सामाजिक संपर्कों से जुड़ी अधिक अमूर्त स्थितियों को कवर करते हैं। प्रत्येक प्रश्न में चार उत्तर विकल्प शामिल हैं, जिनमें से ठीक एक सही है। डेटासेट को प्रशिक्षण, सत्यापन, और परीक्षण सेटों में विभाजित किया गया है, जिसमें परीक्षण सेट को आधिकारिक मूल्यांकन के लिए अलग रखा गया है।
मूल्यांकन और स्कोरिंग
मॉडलों का मूल्यांकन HellaSwag 2024 पर सही उत्तर चुनने में उनकी सटीकता से किया जाता है। प्राथमिक मीट्रिक शीर्ष-1 सटीकता है, जो उन प्रश्नों का प्रतिशत मापता है जहाँ मॉडल सही विकल्प को उच्चतम संभावना प्रदान करता है। उत्तर-लंबाई पूर्वाग्रह के प्रभाव को कम करने के लिए, 2024 अद्यतन एक सामान्यीकृत स्कोरिंग विधि पेश करता है। यह विधि प्रत्येक उत्तर की संभावना को उसकी लंबाई से समायोजित करती है, जिससे मॉडलों को लंबे या अधिक वाचाल उत्तरों का पक्ष लेने से रोका जा सके।
सटीकता के अलावा, बेंचमार्क एक अंशांकन स्कोर भी रिपोर्ट करता है, जो मापता है कि मॉडल का आत्मविश्वास उसकी शुद्धता के साथ कितना संरेखित है। एक अच्छी तरह से अंशांकित मॉडल में सही उत्तरों के लिए उच्च आत्मविश्वास और गलत उत्तरों के लिए कम आत्मविश्वास होना चाहिए। 2024 संशोधन में एक मानव आधार रेखा भी शामिल है, जहाँ प्रश्नों के एक उपसमुच्चय पर मानव प्रदर्शन मापा जाता है, जो मॉडल तुलनाओं के लिए एक संदर्भ बिंदु प्रदान करता है।
वर्तमान मॉडलों का प्रदर्शन
2024 तक, सबसे अच्छा प्रदर्शन करने वाले बड़े भाषा मॉडल, जैसे कि OpenAI, Anthropic, और Google DeepMind द्वारा विकसित, HellaSwag 2024 पर मध्य-90 प्रतिशत सीमा में सटीकता स्कोर प्राप्त करते हैं। यह पहले के मॉडलों की तुलना में एक महत्वपूर्ण सुधार है, जिन्होंने मूल HellaSwag पर लगभग 80% स्कोर किया था। हालाँकि, बेंचमार्क पर मानव प्रदर्शन अभी भी अधिक है, आमतौर पर 95% से ऊपर, जो दर्शाता है कि मशीन और मानव सामान्य ज्ञान तर्क के बीच अभी भी एक अंतर है।
बेंचमार्क Artificial intelligence समुदाय में सामान्य ज्ञान तर्क में प्रगति को ट्रैक करने के लिए एक मानक उपकरण बन गया है। इसका उपयोग अक्सर Winogrande और ARC जैसे अन्य बेंचमार्क के साथ किया जाता है ताकि मॉडल की तर्क क्षमताओं का एक व्यापक मूल्यांकन प्रदान किया जा सके। 2024 अद्यतन को अनुसंधान प्रयोगशालाओं और उद्योग टीमों द्वारा व्यापक रूप से अपनाया गया है, जिसमें Amazon Web Services, Microsoft Azure, और Google Cloud शामिल हैं, उनकी मॉडल मूल्यांकन पाइपलाइनों के हिस्से के रूप में।
सीमाएँ और आलोचनाएँ
अपने सुधारों के बावजूद, HellaSwag 2024 को कुछ आलोचनाओं का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि बेंचमार्क अभी भी भाषा में सांख्यिकीय पैटर्न पर बहुत अधिक निर्भर करता है, और मॉडल लचीले तर्क में संलग्न होने के बजाय सामान्य ज्ञान के तथ्यों को याद करके उच्च स्कोर प्राप्त कर सकते हैं। अन्य बताते हैं कि डेटासेट अंग्रेजी और पश्चिमी सांस्कृतिक संदर्भों के परिदृश्यों तक सीमित है, जो अन्य भाषाओं या संस्कृतियों के लिए सामान्यीकृत नहीं हो सकता है।
एक और सीमा यह है कि बेंचमार्क स्थिर है, जिसका अर्थ है कि एक बार जब किसी मॉडल को परीक्षण सेट पर प्रशिक्षित किया जाता है (जानबूझकर या डेटा संदूषण के माध्यम से), तो उसका प्रदर्शन अब वास्तविक सामान्यीकरण को प्रतिबिंबित नहीं करता है। इसे कम करने के लिए, 2024 संस्करण में एक छिपा हुआ परीक्षण सेट शामिल है जो सार्वजनिक रूप से जारी नहीं किया जाता है, और शोधकर्ताओं को एक सबमिशन प्रणाली के माध्यम से इस छिपे हुए सेट पर मूल्यांकन करने के लिए प्रोत्साहित किया जाता है। हालाँकि, यह दृष्टिकोण अचूक नहीं है, और संदूषण का जोखिम व्यापक क्षेत्र में एक चिंता बना हुआ है।
भविष्य की दिशाएँ
HellaSwag 2024 का विकास Machine learning समुदाय में अधिक चुनौतीपूर्ण और मजबूत मूल्यांकन बेंचमार्क बनाने की दिशा में एक व्यापक प्रवृत्ति को दर्शाता है। भविष्य के अद्यतन गतिशील प्रश्न निर्माण को शामिल कर सकते हैं, जहाँ याद रखने से रोकने के लिए नए प्रश्न तुरंत बनाए जाते हैं। बेंचमार्क को मल्टीमोडल परिदृश्यों को कवर करने के लिए विस्तारित करने में भी रुचि है, जहाँ मॉडलों को पाठ और छवियों दोनों के बारे में तर्क करना होगा, और ऐसे प्रश्नों को शामिल करना होगा जिनके लिए बहु-चरण तर्क या कारण अनुमान की आवश्यकता होती है।
जैसे-जैसे Large language model में सुधार जारी है, HellaSwag 2024 जैसे बेंचमार्क को गति बनाए रखने के लिए विकसित होने की आवश्यकता होगी। लक्ष्य ऐसे मूल्यांकन बनाना है जो न केवल वर्तमान क्षमताओं को मापते हैं बल्कि एआई प्रणालियों में अधिक मानव-समान तर्क के विकास को भी आगे बढ़ाते हैं। 2024 अद्यतन उस दिशा में एक कदम है, जो अपने पूर्ववर्ती की तुलना में सामान्य ज्ञान समझ का अधिक कठोर परीक्षण प्रदान करता है।