GSM-Hard एक बेंचमार्क डेटासेट है जो बड़े भाषा मॉडल की गणितीय तर्क क्षमताओं का मूल्यांकन करने के लिए उपयोग किया जाता है। इसे व्यापक रूप से उपयोग किए जाने वाले GSM8K डेटासेट के अधिक चुनौतीपूर्ण संस्करण के रूप में पेश किया गया था, जिसे मूल में एक महत्वपूर्ण दोष को संबोधित करने के लिए डिज़ाइन किया गया था: सतही पैटर्न की उपस्थिति जिनका मॉडल वास्तविक समस्या-समाधान के बिना सही उत्तर प्राप्त करने के लिए शोषण कर सकते थे। इन शॉर्टकट्स को खत्म करने के लिए प्रश्नों को संशोधित करके, GSM-Hard मॉडल की बहु-चरणीय अंकगणित और तार्किक निगमन करने की क्षमता का एक कठोर परीक्षण प्रदान करता है।
यह डेटासेट शोधकर्ताओं द्वारा बनाया गया था, जिन्होंने देखा कि कई अत्याधुनिक मॉडल, GSM8K पर उच्च स्कोर प्राप्त करते हुए, अक्सर किसी समस्या के शब्दों और उसके उत्तर के बीच सांख्यिकीय सहसंबंधों पर निर्भर करते थे। उदाहरण के लिए, एक मॉडल यह सीख सकता है कि "कुल" शब्द वाले प्रश्नों में आमतौर पर जोड़ की आवश्यकता होती है, या लंबी समस्याओं में बड़े संख्यात्मक उत्तर होते हैं। GSM-Hard को इन सहसंबंधों को तोड़ने के लिए बनाया गया था, जिससे मॉडल को पैटर्न-मिलान के बजाय वास्तव में सही परिणाम की गणना करने के लिए मजबूर किया जा सके।
GSM-Hard में प्राथमिक संशोधन में GSM8K समस्याओं में संख्यात्मक मानों को बड़े, कम सहज ज्ञान युक्त संख्याओं से बदलना शामिल है। उदाहरण के लिए, "3 + 5" जैसी सरल जोड़ समस्या "37 + 82" बन सकती है। यह परिवर्तन अकेले मॉडल द्वारा सीखे गए कई अनुमानों को बाधित करता है, जैसे छोटी संख्याओं को सरल संक्रियाओं से जोड़ना। अधिक महत्वपूर्ण बात यह है कि संशोधन इस तरह से डिज़ाइन किए गए हैं कि मूल समस्या का उत्तर अब एक वैध शॉर्टकट नहीं रह गया है। यदि किसी मॉडल ने पहले एक सामान्य संख्या पैटर्न को पहचानकर उत्तर का अनुमान लगाया था, तो वह रास्ता अब बंद है।
निर्माण और डिज़ाइन
GSM-Hard का निर्माण सीधा लेकिन प्रभावी है। मूल GSM8K डेटासेट में 8,500 प्राथमिक-विद्यालय स्तर की गणित समस्याएं हैं, जिनमें से प्रत्येक में एक प्राकृतिक भाषा का प्रश्न और एक अंतिम संख्यात्मक उत्तर शामिल है। GSM-Hard के निर्माताओं ने प्रत्येक समस्या को लिया और व्यवस्थित रूप से संख्याओं को नए से बदल दिया। मुख्य बाधा यह थी कि नई संख्याएं इतनी बड़ी होनी चाहिए कि रटने से रोका जा सके, लेकिन इतनी बड़ी नहीं कि मॉडल के लिए बुनियादी अंकगणित से समस्या को हल करना कम्प्यूटेशनल रूप से असंभव हो जाए। परिणाम एक ऐसा डेटासेट है जो GSM8K के समान भाषाई संरचना और तर्क चरणों को बनाए रखता है, लेकिन पूरी तरह से अलग संख्यात्मक सामग्री के साथ।
यह दृष्टिकोण सुनिश्चित करता है कि कठिनाई अधिक जटिल तार्किक चरणों को जोड़कर नहीं, बल्कि उन सांख्यिकीय नियमितताओं को हटाकर बढ़ाई जाती है जिनका मॉडल अक्सर शोषण करते हैं। समस्याओं के लिए अभी भी संक्रियाओं के समान अनुक्रम की आवश्यकता होती है (जैसे, जोड़, घटाव, गुणा, भाग), लेकिन विशिष्ट मान अपरिचित होते हैं। यह एक मॉडल के लिए काफी कठिन बना देता है जिसे पाठ के एक बड़े कोष पर प्रशिक्षित किया गया है, ताकि वह अपने प्रशिक्षण डेटा से समान समस्या को आसानी से याद कर सके।
मूल्यांकन और प्रभाव
GSM-Hard जल्दी ही कृत्रिम बुद्धिमत्ता अनुसंधान के क्षेत्र में एक मानक मूल्यांकन उपकरण बन गया। जब GSM-Hard पर परीक्षण किया गया, तो कई मॉडल जिन्होंने GSM8K पर अच्छा प्रदर्शन किया था, उनकी सटीकता में भारी गिरावट देखी गई। उदाहरण के लिए, एक मॉडल जिसने GSM8K पर 80% सटीकता हासिल की थी, वह GSM-Hard पर केवल 50% प्राप्त कर सकता था। यह विसंगति उस हद तक उजागर करती है जिस हद तक मॉडल वास्तविक तर्क के बजाय शॉर्टकट पर निर्भर थे।
इस बेंचमार्क का उपयोग विभिन्न मॉडल आर्किटेक्चर के प्रदर्शन की तुलना करने के लिए किया गया है, जिसमें ट्रांसफॉर्मर और विभिन्न रणनीतियों के साथ प्रशिक्षित तंत्रिका नेटवर्क शामिल हैं। यह चेन-ऑफ-थॉट प्रॉम्प्टिंग जैसी तकनीकों के विकास में भी सहायक रहा है, जहां मॉडल को चरण दर चरण अपना काम दिखाने के लिए प्रोत्साहित किया जाता है। शोध से पता चला है कि चेन-ऑफ-थॉट प्रॉम्प्टिंग GSM-Hard पर प्रदर्शन में काफी सुधार कर सकती है, यह सुझाव देते हुए कि यह मॉडल को अधिक जानबूझकर, अनुक्रमिक तर्क में संलग्न होने में मदद करती है।
अन्य बेंचमार्क से संबंध
GSM-Hard तर्क बेंचमार्क के एक व्यापक परिवार का हिस्सा है जिसमें MATH, ARC, और MMLU शामिल हैं। जबकि GSM8K प्राथमिक-विद्यालय अंकगणित पर केंद्रित है, GSM-Hard शॉर्टकट हटाकर मानक बढ़ाता है। अन्य बेंचमार्क, जैसे MATH, में अधिक उन्नत गणितीय समस्याएं होती हैं, लेकिन GSM-Hard लोकप्रिय बना हुआ है क्योंकि यह शॉर्टकट सीखने के विशिष्ट मुद्दे को अलग करता है। इसका उपयोग अक्सर GSM8K के साथ एक युग्मित तुलना प्रदान करने के लिए किया जाता है: एक डेटासेट जिसमें ओवरफिट करना आसान होता है और दूसरा जो अधिक मजबूत होता है।
इस बेंचमार्क ने अन्य डोमेन, जैसे पठन समझ और दृश्य प्रश्न उत्तर, में समान प्रतिकूल डेटासेट के निर्माण को भी प्रभावित किया है। सांख्यिकीय पूर्वाग्रहों को हटाने के लिए डेटासेट को संशोधित करने का सिद्धांत मशीन लर्निंग मूल्यांकन के क्षेत्र में एक सामान्य तकनीक बन गया है।
सीमाएं और आलोचनाएं
अपनी उपयोगिता के बावजूद, GSM-Hard की सीमाएं हैं। कुछ शोधकर्ताओं ने तर्क दिया है कि संख्याओं को बड़े से बदलना सभी शॉर्टकट्स को पूरी तरह से समाप्त नहीं करता है। उदाहरण के लिए, मॉडल अभी भी किसी समस्या की लंबाई को आवश्यक चरणों की संख्या से जोड़ना सीख सकते हैं। इसके अतिरिक्त, बेंचमार्क केवल अंकगणितीय तर्क का परीक्षण करता है और तार्किक या अमूर्त सोच के अन्य रूपों को कवर नहीं करता है। यह भी सवाल है कि क्या संशोधन समस्याओं को कृत्रिम रूप से कठिन बनाते हैं, क्योंकि अंतर्निहित तर्क GSM8K के समान है, बस कम अनुकूल संख्याओं के साथ।
एक और आलोचना यह है कि GSM-Hard इस तथ्य को ध्यान में नहीं रखता है कि मॉडल को डेटासेट पर ही फाइन-ट्यून किया जा सकता है। यदि किसी मॉडल को GSM-Hard के प्रशिक्षण विभाजन पर प्रशिक्षित किया जाता है, तो वह उत्तरों को याद कर सकता है, जिससे उद्देश्य विफल हो जाता है। इसे कम करने के लिए, बेंचमार्क का उपयोग आमतौर पर ज़ीरो-शॉट या फ्यू-शॉट सेटिंग में किया जाता है, जहां मॉडल ने विशिष्ट समस्याओं को पहले नहीं देखा है।
भविष्य की दिशाएं
GSM-Hard के विकास ने अधिक मजबूत बेंचमार्क बनाने के लिए आगे के शोध को प्रेरित किया है। GSM-Plus और MathQA जैसे नए डेटासेट ने अतिरिक्त प्रकार की गड़बड़ी को शामिल किया है, जिसमें शब्दों में परिवर्तन और अप्रासंगिक जानकारी की शुरूआत शामिल है। इन प्रयासों का उद्देश्य मूल्यांकन सेट बनाना है जो वास्तव में शॉर्टकट सीखने के लिए प्रतिरोधी हों, क्षेत्र को पैटर्न मिलान के बजाय वास्तविक समझ प्रदर्शित करने वाले मॉडल की ओर धकेलते हैं।
जैसे-जैसे जनरेटिव एआई आगे बढ़ता जा रहा है, GSM-Hard जैसे बेंचमार्क प्रगति को मापने के लिए महत्वपूर्ण बने रहेंगे। वे एक स्पष्ट संकेत प्रदान करते हैं कि मॉडल प्रदर्शन में सुधार बेहतर तर्क के कारण है या केवल बेहतर रटने के कारण। GSM-Hard की विरासत इसका प्रदर्शन है कि मूल्यांकन उतना ही कठोर होना चाहिए जितना कि परीक्षण किए जा रहे मॉडल।
यह भी देखें
- GSM8K
- चेन-ऑफ-थॉट
- बेंचमार्क
- अंकगणितीय तर्क