SWAG (Situations With Adversarial Generations) एक बड़े पैमाने का बेंचमार्क डेटासेट है, जिसे रोजमर्रा की स्थितियों के बारे में सामान्य ज्ञान तर्क (commonsense reasoning) करने की कृत्रिम बुद्धिमत्ता प्रणालियों की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। इसे 2018 में वाशिंगटन विश्वविद्यालय और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस के शोधकर्ताओं की एक टीम द्वारा पेश किया गया था, जिसका नेतृत्व रोवन ज़ेलर्स और येजिन चोई ने किया था। डेटासेट को एक बहुविकल्पीय प्राकृतिक भाषा अनुमान कार्य के रूप में निर्मित किया गया है: एक आधार वाक्य (premise) दिया गया है जो एक स्थिति का वर्णन करता है, एक मॉडल को चार विकल्पों में से सबसे उपयुक्त निरंतरता चुननी होती है। SWAG अपनी "प्रतिकूल" (adversarial) निर्माण तकनीकों के लिए उल्लेखनीय है, जो चुनौतीपूर्ण व्याकर्षक (distractors) बनाती हैं जो व्याकरणिक रूप से धाराप्रवाह और शब्दार्थ रूप से प्रशंसनीय लेकिन गलत होते हैं, जिससे सतही भाषा पैटर्न के बजाय गहरे तर्क का परीक्षण होता है।
यह बेंचमार्क प्राकृतिक भाषा प्रसंस्करण और मशीन लर्निंग के क्षेत्र में एक मानक मूल्यांकन उपकरण बन गया है, विशेष रूप से सामान्य ज्ञान तर्क में प्रगति को मापने के लिए। इसका व्यापक रूप से बड़े भाषा मॉडल और अन्य तंत्रिका नेटवर्क आर्किटेक्चर का आकलन करने के लिए उपयोग किया गया है, और इसने बाद के बेंचमार्क विकास को प्रभावित किया है, जैसे कि HellaSwag, जो अधिक जटिल और विविध उदाहरणों के साथ दृष्टिकोण का विस्तार करता है। SWAG का डिज़ाइन AI में प्रतिकूल मूल्यांकन के महत्व पर जोर देता है, मॉडल को सरल पैटर्न मिलान से परे अधिक मजबूत समझ की ओर धकेलता है।
डेटासेट निर्माण
SWAG डेटासेट वीडियो कैप्शन के एक कोष से वाक्य जोड़े एकत्र करके बनाया गया था, विशेष रूप से लार्ज स्केल मूवी डिस्क्रिप्शन चैलेंज (LSMDC) डेटासेट से, जिसमें मूवी दृश्यों के विवरण शामिल हैं। शोधकर्ताओं ने 73,000 प्रशिक्षण उदाहरण, 20,000 सत्यापन उदाहरण और 20,000 परीक्षण उदाहरण निकाले। प्रत्येक आधार वाक्य के लिए, उन्होंने चार संभावित अंत उत्पन्न किए: एक सही अंत (वास्तविक कैप्शन) और तीन गलत अंत। गलत अंत मानव-लिखित टेम्पलेट्स और स्वचालित निर्माण विधियों के संयोजन का उपयोग करके उत्पन्न किए गए थे, जिसमें एक भाषा मॉडल शामिल था जिसे प्रशंसनीय लेकिन गलत निरंतरताएं उत्पन्न करने के लिए प्रशिक्षित किया गया था। यह प्रतिकूल निर्माण प्रक्रिया सुनिश्चित करती है कि व्याकर्षक सरल अनुमानों, जैसे व्याकरणिकता या विषय सुसंगतता, द्वारा आसानी से पहचाने न जा सकें।
SWAG में प्रत्येक उदाहरण एक प्राकृतिक भाषा अनुमान समस्या के रूप में तैयार किया गया है, जहां आधार वाक्य एक स्थिति का संक्षिप्त विवरण है, और कार्य उस अंत की पहचान करना है जो सबसे अधिक संभावना से अनुसरण करता है। डेटासेट रोजमर्रा की गतिविधियों की एक विस्तृत श्रृंखला को कवर करता है, खाना पकाने और ड्राइविंग से लेकर सामाजिक संपर्क तक, जिसके लिए मॉडल को सामान्य विश्व ज्ञान और कारणात्मक तर्क पर आकर्षित करने की आवश्यकता होती है।
मूल्यांकन और महत्व
SWAG का उपयोग कृत्रिम बुद्धिमत्ता और मशीन लर्निंग के क्षेत्र में एक बेंचमार्क के रूप में किया जाता है, विशेष रूप से बड़े भाषा मॉडल और अन्य गहन शिक्षण प्रणालियों का मूल्यांकन करने के लिए। कार्य सही अंत का चयन करने में उच्च सटीकता प्राप्त करना है, जिसमें यादृच्छिक अनुमान 25% सटीकता देता है। प्रारंभिक मॉडल, जिनमें आवर्तक तंत्रिका नेटवर्क और प्रारंभिक ट्रांसफॉर्मर आर्किटेक्चर पर आधारित शामिल थे, 60% सटीकता से अधिक हासिल करने में संघर्ष करते थे, जो सामान्य ज्ञान तर्क की कठिनाई को उजागर करता है। ट्रांसफॉर्मर-आधारित मॉडल, जैसे कि BERT, की शुरूआत ने महत्वपूर्ण सुधार किए, कुछ मॉडलों ने 2019 तक 80% से अधिक सटीकता हासिल की।
यह बेंचमार्क सामान्य ज्ञान तर्क पर शोध को आगे बढ़ाने में सहायक रहा है और कई पत्रों में उद्धृत किया गया है। इसका उपयोग अक्सर GLUE और SuperGLUE जैसे अन्य बेंचमार्क के साथ किया जाता है ताकि मॉडल की भाषा समझ क्षमताओं का व्यापक मूल्यांकन प्रदान किया जा सके। SWAG की प्रतिकूल प्रकृति इसे विशेष रूप से चुनौतीपूर्ण बनाती है, क्योंकि मॉडल को सतही रूप से प्रशंसनीय लेकिन गलत विकल्पों से गुमराह होने से बचना चाहिए।
अन्य बेंचमार्क से संबंध
SWAG ने कई अनुवर्ती बेंचमार्क को प्रेरित किया है, विशेष रूप से HellaSwag, जिसे 2019 में उसी शोध समूह द्वारा पेश किया गया था। HellaSwag एक समान प्रतिकूल निर्माण दृष्टिकोण का उपयोग करता है लेकिन एक बड़े और अधिक विविध डेटासेट के साथ, और यह बड़े भाषा मॉडल का मूल्यांकन करने के लिए एक लोकप्रिय बेंचमार्क बन गया है। अन्य संबंधित बेंचमार्क में विनोग्राड स्कीमा चैलेंज शामिल है, जो कोरफेरेंस रिज़ॉल्यूशन का परीक्षण करता है, और फिजिकल इंटरैक्शन: क्वेश्चन आंसरिंग (PIQA) बेंचमार्क, जो भौतिक सामान्य ज्ञान पर केंद्रित है। SWAG को अक्सर इन बेंचमार्क के साथ समूहीकृत किया जाता है, जो सरल पाठ वर्गीकरण से परे दुनिया की AI प्रणालियों की समझ का मूल्यांकन करने के व्यापक प्रयास का हिस्सा है।
यह बेंचमार्क जनरेटिव AI के संदर्भ में भी उपयोग किया जाता है, जहां मॉडल का मूल्यांकन सुसंगत और संदर्भ-उपयुक्त पाठ उत्पन्न करने की उनकी क्षमता पर किया जाता है। जबकि SWAG एक विभेदक कार्य है (विकल्पों में से चयन करना), यह मॉडल की जनरेटिव क्षमताओं में अंतर्दृष्टि प्रदान करता है, क्योंकि एक मॉडल जो प्रशंसनीय निरंतरताएं उत्पन्न कर सकता है, उसके चयन कार्य पर अच्छा प्रदर्शन करने की संभावना है।
सीमाएं और आलोचनाएं
व्यापक उपयोग के बावजूद, SWAG को कुछ आलोचनाओं का सामना करना पड़ा है। एक सीमा यह है कि डेटासेट मूवी कैप्शन से प्राप्त होता है, जो रोजमर्रा की स्थितियों की विविधता को पूरी तरह से प्रतिनिधित्व नहीं कर सकता है, संभावित रूप से पूर्वाग्रहों को पेश करता है। इसके अतिरिक्त, प्रतिकूल निर्माण प्रक्रिया, जबकि प्रभावी है, कभी-कभी ऐसे व्याकर्षक उत्पन्न कर सकती है जो मॉडल के आधार पर बहुत आसान या बहुत कठिन होते हैं। कुछ शोधकर्ताओं ने नोट किया है कि SWAG पर उच्च प्रदर्शन आवश्यक रूप से वास्तविक दुनिया के अनुप्रयोगों में मजबूत सामान्य ज्ञान तर्क में अनुवाद नहीं करता है, क्योंकि कार्य अभी भी अपेक्षाकृत संकीर्ण है। फिर भी, SWAG प्राकृतिक भाषा समझ में प्रगति को बेंचमार्क करने के लिए एक मूल्यवान उपकरण बना हुआ है और अधिक सक्षम AI प्रणालियों के विकास में महत्वपूर्ण योगदान दिया है।
AI अनुसंधान पर प्रभाव
SWAG का कृत्रिम बुद्धिमत्ता के क्षेत्र पर स्थायी प्रभाव पड़ा है, विशेष रूप से प्राकृतिक भाषा प्रसंस्करण और सामान्य ज्ञान तर्क के क्षेत्रों में। इसका उपयोग प्रारंभिक तंत्रिका नेटवर्क से लेकर अत्याधुनिक बड़े भाषा मॉडल तक, मॉडलों की एक विस्तृत श्रृंखला का मूल्यांकन करने के लिए किया गया है, और विभिन्न आर्किटेक्चर की ताकत और कमजोरियों की पहचान करने में मदद की है। बेंचमार्क ने प्रतिकूल मूल्यांकन तकनीकों के विकास को भी प्रोत्साहित किया है, जो अब मॉडल मजबूती का परीक्षण करने के लिए AI अनुसंधान में व्यापक रूप से उपयोग की जाती हैं। 2025 तक, SWAG अकादमिक साहित्य में संदर्भित किया जाना जारी है और कई मॉडल मूल्यांकन सुइट्स में शामिल है, जो दुनिया के बारे में तर्क करने की AI की क्षमता को समझने और सुधारने के लिए एक आधारभूत उपकरण के रूप में कार्य करता है।
यह भी देखें
- कृत्रिम बुद्धिमत्ता
- मशीन लर्निंग
- गहन शिक्षण
- तंत्रिका नेटवर्क
- बड़ा भाषा मॉडल
- ट्रांसफॉर्मर
- OpenAI
- Google DeepMind
- जनरेटिव AI
- MIT CSAIL
- स्टैनफोर्ड AI लैब
- बर्कले AI अनुसंधान
- कार्नेगी मेलन विश्वविद्यालय
- टोरंटो विश्वविद्यालय
- allen-institute-for-ai
- commonsense-reasoning
- प्राकृतिक भाषा प्रसंस्करण
- बेंचमार्क
- HellaSwag
- winograd-schema-challenge