GSM8K (Grade School Math 8K) 8,500 उच्च-गुणवत्ता, भाषिक रूप से विविध ग्रेड स्कूल गणित शब्द समस्याओं का एक डेटासेट है, जिसे OpenAI के शोधकर्ताओं द्वारा बनाया गया और 2021 में जारी किया गया। इसे बड़े भाषा मॉडल (LLMs) की बहु-चरणीय गणितीय तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। प्रत्येक समस्या को हल करने के लिए दो से आठ चरणों की आवश्यकता होती है, जिसमें बुनियादी अंकगणितीय संक्रियाएँ और तार्किक निगमन शामिल होते हैं, जिसमें उन्नत गणितीय ज्ञान के बजाय प्राकृतिक भाषा समझ पर ध्यान केंद्रित किया जाता है।
यह बेंचमार्क AI प्रणालियों की तर्क क्षमताओं का आकलन करने के लिए एक मानक परीक्षण बन गया है, विशेष रूप से कृत्रिम बुद्धिमत्ता अनुसंधान के संदर्भ में। इसका नाम डेटासेट के आकार (8,500 समस्याएँ) और ग्रेड स्कूल स्तर के गणित पर इसके फोकस से लिया गया है। समस्याएँ इस तरह लिखी गई हैं कि एक होशियार मिडिल स्कूल छात्र उन्हें हल कर सके, लेकिन उन्हें अक्सर मॉडलों को अनुक्रमिक गणना करने और मध्यवर्ती स्थिति बनाए रखने की आवश्यकता होती है, जो प्रारंभिक तंत्रिका नेटवर्क आर्किटेक्चर के लिए एक महत्वपूर्ण चुनौती पेश करता है।
डेटासेट डिज़ाइन और संरचना
GSM8K डेटासेट एनोटेटरों की एक टीम द्वारा बनाया गया था, जिन्होंने पाठ्यपुस्तकों या मानकीकृत परीक्षणों में पाए जाने वाले वास्तविक दुनिया के गणित प्रश्नों की शैली में समस्याएँ लिखीं। समस्याएँ भिन्न, प्रतिशत, अनुपात और सरल बीजगणित जैसे विषयों को कवर करती हैं, लेकिन उन्हें जानबूझकर ऐसे तरीके से वाक्यांशित किया गया है जो सूत्रबद्ध पैटर्न से बचता है, जिससे मॉडलों को पैटर्न मिलान के बजाय वास्तविक तर्क में संलग्न होने के लिए प्रोत्साहित किया जाता है। डेटासेट को 7,500 समस्याओं के प्रशिक्षण सेट और 1,000 समस्याओं के परीक्षण सेट में विभाजित किया गया है, जिसमें परीक्षण सेट का उपयोग मूल्यांकन के लिए किया जाता है।
GSM8K में प्रत्येक समस्या के साथ एक प्राकृतिक भाषा समाधान होता है जो तर्क को चरणों में विभाजित करता है। ये समाधान केवल अंतिम उत्तर नहीं हैं, बल्कि इसमें मध्यवर्ती गणनाएँ और स्पष्टीकरण शामिल हैं, जो मॉडलों को चरण-दर-चरण तर्क उत्पन्न करने के लिए प्रशिक्षित करने में उपयोगी हैं। डेटासेट में 1,000 समस्याओं का एक अलग सेट भी शामिल है जिसमें अधिक विस्तृत समाधान हैं, जिसे 'चेन-ऑफ-थॉट' संस्करण के रूप में जाना जाता है, जिसका उपयोग बाद में प्रॉम्प्टिंग तकनीकों के प्रभाव का अध्ययन करने के लिए किया गया।
भाषा मॉडल के मूल्यांकन में भूमिका
GSM8K जल्दी ही ट्रांसफॉर्मर-आधारित मॉडलों की तर्क क्षमताओं को मापने के लिए एक प्रमुख बेंचमार्क बन गया। प्रारंभिक गहन शिक्षण मॉडल डेटासेट के साथ संघर्ष करते थे, अक्सर 10 प्रतिशत से कम सटीकता प्राप्त करते थे, क्योंकि वे विश्वसनीय रूप से बहु-चरणीय अंकगणित नहीं कर सकते थे। चेन-ऑफ-थॉट प्रॉम्प्टिंग की शुरुआत, जहाँ मॉडलों को अंतिम उत्तर से पहले मध्यवर्ती तर्क चरण उत्पन्न करने के लिए प्रोत्साहित किया जाता है, ने महत्वपूर्ण सुधार किए, जिसमें GPT-3 जैसे मॉडल और बाद के संस्करणों ने बहुत अधिक स्कोर प्राप्त किए।
बेंचमार्क का उपयोग विभिन्न संगठनों के मॉडलों की तुलना करने के लिए किया गया है, जिसमें Anthropic, Google DeepMind और Meta शामिल हैं। इसका उपयोग गणितीय तर्क में मशीन लर्निंग की सीमाओं का अध्ययन करने के लिए भी किया जाता है, जिसमें शोधकर्ता अंकगणितीय त्रुटियों, समस्या कथनों की गलत व्याख्या और बड़ी संख्याओं को संभालने में असमर्थता जैसे विफलता मोड का विश्लेषण करते हैं।
AI अनुसंधान पर प्रभाव
GSM8K ने LLMs में तर्क सुधारने के लिए तकनीकों के विकास को प्रभावित किया है। यह तंत्रिका नेटवर्क स्केलिंग के मूल्य को प्रदर्शित करने में सहायक था, क्योंकि अधिक डेटा पर प्रशिक्षित बड़े मॉडलों ने बेंचमार्क पर उल्लेखनीय सुधार दिखाए। डेटासेट ने सत्यापन के लिए जनरेटिव AI विधियों पर शोध को भी प्रेरित किया, जैसे समाधानों की शुद्धता की जाँच के लिए अलग मॉडल प्रशिक्षित करना, और सुदृढीकरण शिक्षण दृष्टिकोणों पर जो सही तर्क चरणों को पुरस्कृत करते हैं।
मूल्यांकन उपकरण के रूप में इसके उपयोग के अलावा, GSM8K का उपयोग प्रशिक्षण संसाधन के रूप में किया गया है। कुछ शोधकर्ताओं ने विशेष रूप से गणितीय तर्क के लिए मॉडलों को फाइन-ट्यून करने के लिए प्रशिक्षण सेट का उपयोग किया है, जबकि अन्य ने आगे के प्रशिक्षण के लिए सिंथेटिक डेटा उत्पन्न करने के लिए इसका उपयोग किया है। डेटासेट का डिज़ाइन, प्राकृतिक भाषा और बहु-चरणीय समस्याओं पर इसके जोर के साथ, MATH (एक अधिक उन्नत डेटासेट) और SVAMP (संशोधित समस्याओं वाला एक प्रकार) जैसे अन्य बेंचमार्क के निर्माण को भी सूचित किया है।
सीमाएँ और आलोचनाएँ
अपनी लोकप्रियता के बावजूद, GSM8K की सीमाएँ हैं। आलोचकों का कहना है कि डेटासेट अपेक्षाकृत छोटा है और गणितीय तर्क की पूर्ण जटिलता को पकड़ नहीं सकता है, क्योंकि समस्याएँ ग्रेड स्कूल स्तर तक सीमित हैं। इसके अतिरिक्त, मॉडल कभी-कभी वास्तविक तर्क के बजाय समस्याओं में सांख्यिकीय नियमितताओं का शोषण करके उच्च स्कोर प्राप्त कर सकते हैं, जिसे 'शॉर्टकट लर्निंग' के रूप में जाना जाता है। बेंचमार्क अंकगणित से परे गणितीय अवधारणाओं की समझ का परीक्षण भी नहीं करता है, जैसे ज्यामिति या कैलकुलस।
एक और आलोचना यह है कि डेटासेट की समस्याएँ अंग्रेजी में हैं और पश्चिमी शैक्षिक संदर्भ को दर्शाती हैं, जो अन्य भाषाओं या सांस्कृतिक सेटिंग्स में इसकी प्रयोज्यता को सीमित कर सकती हैं। शोधकर्ताओं ने GSM8K को पूरक करने के लिए अधिक विविध और चुनौतीपूर्ण बेंचमार्क का आह्वान किया है, जिससे MATH और हालिया GSM8K-Sym जैसे डेटासेट का विकास हुआ है, जो मजबूती का परीक्षण करने के लिए प्रतीकात्मक विविधताएँ पेश करता है।
वर्तमान उपयोग और भविष्य की दिशाएँ
2025 तक, GSM8K मशीन लर्निंग समुदाय में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बना हुआ है, जिसे अक्सर नए LLMs के लिए मूल्यांकन सुइट्स में शामिल किया जाता है। यह अक्सर शोध पत्रों में उद्धृत किया जाता है और कंपनियों द्वारा मॉडल प्रदर्शन की रिपोर्ट करने के लिए उपयोग किया जाता है। हालाँकि, जैसे-जैसे मॉडलों में सुधार हुआ है, कई अब परीक्षण सेट पर 90 प्रतिशत से ऊपर सटीकता प्राप्त करते हैं, जिससे कुछ लोग तर्क देते हैं कि बेंचमार्क संतृप्त हो रहा है। इसने GSM8K-Hard जैसे अधिक कठिन संस्करणों के निर्माण को प्रेरित किया है, जो आवश्यक चरणों की संख्या बढ़ाता है, और MMLU और BIG-bench जैसे व्यापक तर्क बेंचमार्क में GSM8K का एकीकरण किया है।
GSM8K का भविष्य संभवतः एक विभेदक के बजाय एक आधार रेखा के रूप में इसके उपयोग को शामिल करता है, जिसमें शोधकर्ता अधिक जटिल तर्क कार्यों पर ध्यान केंद्रित करते हैं। फिर भी, क्षेत्र में इसका योगदान महत्वपूर्ण है, क्योंकि इसने AI में बहु-चरणीय तर्क के लिए तकनीकों के विकास को उत्प्रेरित करने में मदद की, जो अब कृत्रिम बुद्धिमत्ता में कई अनुप्रयोगों के लिए केंद्रीय हैं।