GSM8K 2021 एक बेंचमार्क डेटासेट है जिसमें 8,500 उच्च-गुणवत्ता, भाषाई रूप से विविध प्राथमिक-विद्यालय स्तर के गणित शब्द समस्याएं शामिल हैं। इसे 2021 में OpenAI के शोधकर्ताओं द्वारा बड़े भाषा मॉडल की अंकगणितीय तर्क क्षमताओं का मूल्यांकन करने के लिए पेश किया गया था। डेटासेट को 7,500 प्रशिक्षण समस्याओं और 1,000 परीक्षण समस्याओं में विभाजित किया गया है, जिनमें से प्रत्येक एक प्राकृतिक भाषा समाधान के साथ जोड़ा गया है जो समस्या को कई चरणों में तोड़ता है। यह नाम "ग्रेड स्कूल मैथ 8K" के लिए खड़ा है, जो लक्षित दर्शकों और समस्याओं की अनुमानित संख्या को दर्शाता है।
GSM8K 2021 का प्राथमिक उद्देश्य यह परीक्षण करना है कि क्या मॉडल बहु-चरणीय गणितीय तर्क कर सकते हैं, न कि केवल पैटर्न मिलान। सरल बेंचमार्क के विपरीत जो एकल-चरण अंकगणित पर निर्भर करते हैं, GSM8K के लिए मॉडल को समस्या कथन को समझने, प्रासंगिक मात्राओं की पहचान करने और संचालन का एक क्रम निष्पादित करने की आवश्यकता होती है। समस्याएं एक होशियार मिडिल-स्कूल छात्र द्वारा हल करने योग्य होने के लिए लिखी गई हैं, लेकिन उनमें अक्सर विकर्षक शामिल होते हैं और सावधानीपूर्वक तार्किक निष्कर्ष की आवश्यकता होती है। यह डेटासेट को मशीन लर्निंग और कृत्रिम बुद्धिमत्ता अनुसंधान में प्रगति मापने के लिए एक चुनौतीपूर्ण और व्यापक रूप से उपयोग किया जाने वाला मानक बनाता है।
डेटासेट निर्माण और विशेषताएं
GSM8K 2021 डेटासेट OpenAI में एक टीम द्वारा बनाया गया था, जिसमें jakub-uszkoreit, Lukasz Kaiser, और Niki Parmar जैसे योगदानकर्ता शामिल थे। समस्याएं मानव ठेकेदारों द्वारा लिखी गई थीं, जिन्हें स्पष्ट चरण-दर-चरण समाधान के साथ विविध, प्राकृतिक-ध्वनि वाली शब्द समस्याएं उत्पन्न करने का निर्देश दिया गया था। प्रत्येक समाधान प्राकृतिक भाषा वाक्यों का एक अनुक्रम है, जिसमें मध्यवर्ती गणनाएं स्पष्ट रूप से दिखाई जाती हैं। डेटासेट को विशिष्ट संख्याओं या कीवर्ड पर अत्यधिक निर्भरता जैसे पूर्वाग्रहों को कम करने के लिए डिज़ाइन किया गया था, जिसमें भाषाई सतह रूपों को बदलकर।
GSM8K की एक उल्लेखनीय विशेषता इसकी उच्च अंतर-एनोटेटर सहमति है: निर्माताओं ने बताया कि मानव समाधानकर्ताओं ने परीक्षण सेट पर लगभग पूर्ण सटीकता हासिल की, जिससे अपेक्षित प्रदर्शन के लिए एक मजबूत आधार रेखा स्थापित हुई। समस्याएं अंकगणितीय संचालन की एक श्रृंखला को कवर करती हैं, जिसमें जोड़, घटाव, गुणा, भाग, भिन्न, प्रतिशत और सरल बीजगणित शामिल हैं। औसत समस्या की लंबाई लगभग 30 शब्द है, और औसत समाधान की लंबाई लगभग 8 चरण है, जो इसे एक संक्षिप्त लेकिन मांग वाला तर्क कार्य बनाती है।
मूल्यांकन और भाषा मॉडल पर प्रभाव
GSM8K 2021 जल्दी से तंत्रिका नेटवर्क और ट्रांसफॉर्मर-आधारित मॉडल के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया। प्रारंभिक परिणामों से पता चला कि मानक गहन शिक्षण मॉडल संघर्ष करते थे, कई परीक्षण सेट पर 20% से नीचे सटीकता प्राप्त करते थे। इसने भाषा समझ और गणितीय तर्क के बीच अंतर को उजागर किया। डेटासेट ने पाठ्यक्रम-शिक्षण, एआई फीडबैक से सुदृढीकरण शिक्षण, और चेन-ऑफ-थॉट प्रॉम्प्टिंग जैसी तकनीकों में अनुसंधान को प्रेरित किया, जहां मॉडल को अंतिम उत्तर देने से पहले मध्यवर्ती तर्क चरण उत्पन्न करने के लिए प्रशिक्षित या प्रॉम्प्ट किया जाता है।
2022 तक, बड़े मॉडल और बेहतर प्रशिक्षण विधियों ने काफी अधिक स्कोर हासिल करना शुरू कर दिया। उदाहरण के लिए, सत्यापनकर्ता-आधारित दृष्टिकोणों के साथ ठीक-ट्यून किए गए या स्पष्ट चरण-दर-चरण पर्यवेक्षण के साथ प्रशिक्षित मॉडल 80% से ऊपर सटीकता स्तर तक पहुंच गए। बेंचमार्क का उपयोग कई संगठनों द्वारा किया गया है, जिसमें Google DeepMind, Anthropic, और शैक्षणिक प्रयोगशालाएं शामिल हैं, ताकि मॉडल क्षमताओं की तुलना की जा सके। यह अंकगणितीय तर्क मापने के लिए एक संदर्भ बिंदु बना हुआ है, हालांकि तब से नए और अधिक जटिल बेंचमार्क पेश किए गए हैं।
सीमाएं और आलोचनाएं
अपनी लोकप्रियता के बावजूद, GSM8K 2021 की सीमाएं हैं। वास्तविक दुनिया के गणितीय कार्यों की तुलना में समस्याएं अपेक्षाकृत सरल हैं, और डेटासेट छोटा है, जो मॉडल को सीधे उस पर प्रशिक्षित करने पर अतिअनुकूलन का कारण बन सकता है। आलोचकों ने नोट किया है कि मॉडल कभी-कभी वास्तविक तर्क के बजाय पैटर्न को याद करके या अनुमानी का उपयोग करके उच्च स्कोर प्राप्त कर सकते हैं। इसके अतिरिक्त, डेटासेट केवल अंग्रेजी में है, जो बहुभाषी मूल्यांकन के लिए इसकी प्रयोज्यता को सीमित करता है। शोधकर्ताओं ने यह भी बताया है कि समाधान हमेशा सबसे कुशल नहीं होते हैं, और बेंचमार्क अंकगणित से परे वैचारिक समझ का परीक्षण नहीं करता है।
इनमें से कुछ मुद्दों को संबोधित करने के लिए, अनुवर्ती डेटासेट बनाए गए हैं, जैसे कि अधिक जटिल समस्याओं या विभिन्न भाषाओं के साथ GSM8K संस्करण। हालांकि, GSM8K 2021 क्षेत्र में एक मौलिक उपकरण बना हुआ है, जिसे अक्सर नए मॉडल आर्किटेक्चर और प्रशिक्षण तकनीकों के लिए एक सैनिटी चेक के रूप में उपयोग किया जाता है। इसकी सरलता और स्पष्ट मूल्यांकन मानदंड इसे शोधकर्ताओं के लिए एक सुलभ प्रारंभिक बिंदु बनाते हैं।
विरासत और निरंतर उपयोग
2025 तक, GSM8K 2021 अभी भी बड़े भाषा मॉडल अनुसंधान पत्रों में व्यापक रूप से उद्धृत किया जाता है। यह कई मूल्यांकन सुइट्स में शामिल है, जैसे कि OpenAI और अन्य एआई प्रयोगशालाओं द्वारा उपयोग किए जाने वाले, समय के साथ प्रगति को ट्रैक करने के लिए। डेटासेट का उपयोग मॉडल-प्रूनिंग और डेटा-वर्धन जैसी घटनाओं का अध्ययन करने के लिए भी किया गया है, जहां शोधकर्ता जांच करते हैं कि प्रशिक्षण डेटा या मॉडल संरचना में परिवर्तन तर्क प्रदर्शन को कैसे प्रभावित करते हैं। इसका प्रभाव शिक्षा जगत से परे फैला हुआ है, क्योंकि इसका उपयोग वाणिज्यिक मॉडलों को बेंचमार्क करने और एआई क्षमताओं के बारे में सार्वजनिक चर्चाओं को सूचित करने के लिए किया गया है।
GSM8K 2021 का निर्माण एआई अनुसंधान में अधिक कठोर, कार्य-विशिष्ट बेंचमार्क की ओर एक बदलाव को चिह्नित करता है। इसने जटिल संज्ञानात्मक कौशल का मूल्यांकन करने के लिए उच्च-गुणवत्ता, मानव-एनोटेटेड डेटा के महत्व को प्रदर्शित किया। जबकि नए बेंचमार्क अधिक चुनौतीपूर्ण हो सकते हैं, GSM8K 2021 तंत्रिका मॉडल में अंकगणितीय तर्क के लिए पहले व्यापक रूप से अपनाए गए परीक्षणों में से एक के रूप में एक ऐतिहासिक स्थान रखता है।