HellaSwag एक बेंचमार्क डेटासेट है जिसे कृत्रिम बुद्धिमत्ता प्रणालियों, विशेष रूप से बड़े भाषा मॉडलों की सामान्य ज्ञान तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसे 2019 में रोवन ज़ेलर्स और वाशिंगटन विश्वविद्यालय तथा एलन इंस्टीट्यूट फॉर एआई के सहयोगियों द्वारा प्रस्तुत किया गया था। यह नाम "hell" और "swag" का एक मिश्रित शब्द है, जहाँ "swag" का अर्थ है "Situations With Adversarial Generations" (प्रतिकूल पीढ़ियों वाली स्थितियाँ)। यह बेंचमार्क मॉडलों को दिए गए विकल्पों में से एक कथा का सबसे उपयुक्त निरंतरता चुनने की चुनौती देता है, जो उनकी रोजमर्रा की भौतिक और सामाजिक स्थितियों को समझने की क्षमता का परीक्षण करता है।
डेटासेट में 70,000 से अधिक बहुविकल्पीय प्रश्न शामिल हैं, जिनमें से प्रत्येक वीडियो कैप्शन और कहानी विवरणों से लिया गया है। प्रश्नों को प्रतिकूल बनाने के लिए डिज़ाइन किया गया है, जिसका अर्थ है कि गलत उत्तर विकल्प एक भाषा मॉडल द्वारा उत्पन्न किए जाते हैं ताकि वे सतही रूप से प्रशंसनीय लेकिन अर्थगत रूप से गलत हों। यह डिज़ाइन मॉडलों को सतही भाषाई पैटर्न या सांख्यिकीय शॉर्टकट्स के बजाय वास्तविक सामान्य ज्ञान समझ पर निर्भर रहने के लिए मजबूर करता है।
निर्माण और डिज़ाइन
HellaSwag का निर्माण एक दो-चरणीय प्रक्रिया शामिल करता है। पहले, लेखकों ने वीडियो कैप्शनिंग डेटासेट जैसे ActivityNet और WikiHow से कथा विवरणों का एक बड़ा संग्रह एकत्र किया। ये विवरण प्रत्येक प्रश्न के लिए संदर्भ प्रदान करते हैं। दूसरे, उन्होंने प्रत्येक संदर्भ के लिए उम्मीदवार अंत उत्पन्न करने के लिए एक जनरेटिव भाषा मॉडल का उपयोग किया। मॉडल-जनित अंत, जो अक्सर व्याकरणिक रूप से सही लेकिन परिदृश्य के साथ तार्किक रूप से असंगत होते हैं, विकर्षक विकल्पों के रूप में कार्य करते हैं। सही अंत स्रोत कोरपस से मूल निरंतरता है।
यह प्रतिकूल निर्माण प्रक्रिया HellaSwag की एक प्रमुख विशेषता है। यह सुनिश्चित करती है कि बेंचमार्क शाब्दिक अतिव्यापन या सरल अनुमानों पर निर्भर मॉडलों द्वारा आसानी से खेला न जा सके। लेखकों ने प्रदर्शित किया कि कई मौजूदा मॉडल, जिनमें अन्य बेंचमार्क पर मजबूत प्रदर्शन करने वाले भी शामिल हैं, ने HellaSwag पर खराब प्रदर्शन किया, जिससे सटीकता यादृच्छिक अनुमान से केवल थोड़ी अधिक रही।
मूल्यांकन और प्रभाव
HellaSwag प्राकृतिक भाषा प्रसंस्करण के क्षेत्र में एक मानक मूल्यांकन उपकरण बन गया है। यह प्रमुख मूल्यांकन सूट जैसे कि Open LLM Leaderboard और EleutherAI Language Model Evaluation Harness में शामिल है। शोधकर्ता इसका उपयोग विभिन्न मॉडलों की तर्क क्षमताओं की तुलना करने के लिए करते हैं, जिसमें Transformer (architecture) वास्तुकला और बड़े भाषा मॉडल पर आधारित मॉडल शामिल हैं।
HellaSwag पर प्रारंभिक परिणामों ने मशीन सामान्य ज्ञान तर्क में महत्वपूर्ण अंतराल को उजागर किया। उदाहरण के लिए, मूल पेपर में, उस समय के सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल ने लगभग 48% की सटीकता हासिल की, जबकि मानव प्रदर्शन लगभग 94% था। यह तीव्र अंतर प्रारंभिक गहन शिक्षण प्रणालियों की सूक्ष्म वास्तविक दुनिया के परिदृश्यों को समझने में सीमाओं को रेखांकित करता है।
मॉडल वास्तुकला और प्रशिक्षण डेटा में बाद के सुधारों ने पर्याप्त लाभ प्राप्त किए हैं। आधुनिक बड़े भाषा मॉडल, जैसे कि OpenAI, Anthropic, और Google DeepMind द्वारा विकसित, अब HellaSwag पर 90% से अधिक सटीकता प्राप्त करते हैं। यह प्रगति कृत्रिम बुद्धिमत्ता और मशीन लर्निंग में व्यापक प्रगति को दर्शाती है, विशेष रूप से मॉडलों की सामान्य ज्ञान ज्ञान को पकड़ने और लागू करने की क्षमता में।
सीमाएँ और आलोचनाएँ
व्यापक उपयोग के बावजूद, HellaSwag ने आलोचना का सामना किया है। कुछ शोधकर्ताओं का तर्क है कि बेंचमार्क मॉडलों की तर्क क्षमताओं को अधिक अनुमानित कर सकता है क्योंकि यह बहुविकल्पीय प्रारूप पर निर्भर करता है, जिसे पैटर्न मिलान या प्रशिक्षण डेटा में समान उदाहरणों के स्मरण के माध्यम से हल किया जा सकता है। प्रतिकूल विकर्षक, जबकि शुरू में प्रभावी, बड़े और अधिक विविध कोरपस पर प्रशिक्षित मॉडलों के रूप में कम चुनौतीपूर्ण हो सकते हैं जिनमें समान प्रश्न प्रारूप शामिल हैं।
इसके अतिरिक्त, बेंचमार्क मुख्य रूप से अंग्रेजी में भौतिक और सामाजिक सामान्य ज्ञान का परीक्षण करता है, जो अन्य भाषाओं और सांस्कृतिक संदर्भों पर इसकी प्रयोज्यता को सीमित करता है। बहुभाषी संस्करण बनाने के प्रयास, जैसे X-CSQA और XCOPA डेटासेट, ने इस अंतर को संबोधित करने का प्रयास किया है, लेकिन HellaSwag स्वयं एक अंग्रेजी-केवल संसाधन बना हुआ है।
संबंधित बेंचमार्क
HellaSwag सामान्य ज्ञान तर्क बेंचमार्क के एक परिवार का हिस्सा है जिसमें SWAG (इसका पूर्ववर्ती), COPA, और Winograd Schema Challenge शामिल हैं। ये बेंचमार्क सामूहिक रूप से सामान्य ज्ञान समझ के विभिन्न पहलुओं को मापने का लक्ष्य रखते हैं, भौतिक अंतर्ज्ञान से सामाजिक गतिशीलता तक। इन्हें अक्सर मॉडल मूल्यांकन में एक साथ उपयोग किया जाता है ताकि तर्क क्षमताओं का व्यापक मूल्यांकन प्रदान किया जा सके।
HellaSwag के विकास ने अन्य प्रतिकूल बेंचमार्क के निर्माण को भी प्रभावित किया, जैसे ANLI (Adversarial NLI) और TruthfulQA, जो मजबूती और तथ्यात्मकता का परीक्षण करने के लिए समान निर्माण तकनीकों को लागू करते हैं। ये बेंचमार्क एआई प्रणालियों के पुनरावृत्त सुधार में अभिन्न बन गए हैं, जो तंत्रिका नेटवर्क और जनरेटिव एआई जैसे क्षेत्रों में अनुसंधान का मार्गदर्शन करते हैं।
यह भी देखें
संदर्भ
- Zellers, R., Holtzman, A., Bisk, Y., Farhadi, A., & Choi, Y. (2019). HellaSwag: Can a Machine Really Finish Your Sentence? Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics.