अंग्रेज़ी से अनुवादित

GSM8K 2023, GSM8K बेंचमार्क का एक अद्यतन संस्करण है, जो प्राथमिक विद्यालय स्तर के गणित के शब्द समस्याओं का एक डेटासेट है, जिसका उपयोग बड़े भाषा मॉडलों में अंकगणित और तर्क क्षमता का मूल्यांकन करने के लिए किया जाता है।

GSM8K 2023, GSM8K (ग्रेड स्कूल मैथ 8K) डेटासेट का एक संशोधित संस्करण है, जो बड़े भाषा मॉडलों की गणितीय तर्क क्षमताओं का मूल्यांकन करने के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क है। मूल GSM8K, जिसे 2021 में OpenAI के शोधकर्ताओं द्वारा पेश किया गया था, में 8,500 उच्च-गुणवत्ता वाली ग्रेड-स्कूल-स्तरीय गणित शब्द समस्याएं शामिल हैं, जिनमें से प्रत्येक को हल करने के लिए बहु-चरणीय तर्क की आवश्यकता होती है। 2023 अपडेट में डेटासेट में परिशोधन शामिल हैं, जिसमें अतिरिक्त समस्या विविधताएं, अद्यतन उत्तर प्रारूप और संशोधित मूल्यांकन प्रोटोकॉल शामिल हैं, ताकि मॉडल की मजबूती और सामान्यीकरण का बेहतर आकलन किया जा सके।

यह बेंचमार्क मॉडल की अंकगणितीय संचालन करने, तार्किक निगमन लागू करने और चरण-दर-चरण समाधान उत्पन्न करने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है। प्रत्येक समस्या के साथ एक प्राकृतिक भाषा समाधान होता है जो तर्क प्रक्रिया को तोड़ता है, जिससे स्वचालित और मानवीय दोनों मूल्यांकन संभव होते हैं। GSM8K 2023 मूल संरचना को बरकरार रखता है, लेकिन डेटा लीकेज को कम करने और प्रदर्शन मेट्रिक्स की विश्वसनीयता में सुधार करने के उद्देश्य से परिवर्तन पेश करता है।

पृष्ठभूमि और प्रेरणा

मूल GSM8K को Artificial intelligence प्रणालियों में गणितीय तर्क के लिए एक चुनौतीपूर्ण फिर भी सुलभ बेंचमार्क की आवश्यकता को पूरा करने के लिए बनाया गया था। पिछले बेंचमार्क में अक्सर या तो सरल अंकगणित या उन्नत प्रतियोगिता-स्तरीय समस्याएं होती थीं, जिससे उन कार्यों के लिए एक अंतर रह जाता था जिनमें अत्यधिक डोमेन ज्ञान के बिना बहु-चरणीय तर्क की आवश्यकता होती है। GSM8K ने उन समस्याओं को प्रदान करके इस अंतर को भर दिया जो बुनियादी अंकगणितीय कौशल वाले मनुष्यों द्वारा हल करने योग्य हैं, लेकिन अक्सर Large language model के लिए कठिन साबित होती हैं, विशेष रूप से विशेष प्रशिक्षण के बिना।

2023 अपडेट उन टिप्पणियों से प्रेरित था कि डेटासेट के पुराने संस्करणों पर प्रशिक्षित मॉडल विशिष्ट पैटर्न पर अति-फिट हो सकते हैं, जिससे प्रदर्शन स्कोर बढ़ जाते हैं। नए समस्या उदाहरण पेश करके और मौजूदा को संशोधित करके, अद्यतन बेंचमार्क का उद्देश्य मॉडल की वास्तविक तर्क क्षमता का अधिक सटीक माप प्रदान करना है।

डेटासेट संरचना और विशेषताएं

GSM8K 2023 में 8,500 समस्याएं शामिल हैं, जो 7,500 समस्याओं के प्रशिक्षण सेट और 1,000 समस्याओं के परीक्षण सेट में विभाजित हैं। प्रत्येक समस्या एक छोटी शब्द समस्या है, आमतौर पर 2-4 वाक्य, जिसमें हल करने के लिए 2 से 8 अंकगणितीय चरणों की आवश्यकता होती है। समाधान प्राकृतिक भाषा में लिखे गए हैं, एक श्रृंखला-विचार प्रारूप का पालन करते हुए जो मानवीय तर्क को दर्शाता है। यह संरचना शोधकर्ताओं को न केवल अंतिम उत्तर बल्कि मध्यवर्ती तर्क चरणों का भी मूल्यांकन करने की अनुमति देती है।

डेटासेट में जोड़, घटाव, गुणा, भाग, भिन्न, प्रतिशत और बुनियादी बीजगणित सहित कई विषयों को शामिल किया गया है। समस्याओं को ग्रेड-स्कूल स्तर के लिए डिज़ाइन किया गया है, लेकिन बहु-चरणीय प्रकृति उन्हें कई Machine learning मॉडलों के लिए गैर-तुच्छ बनाती है। 2023 संस्करण में अतिरिक्त एनोटेशन शामिल हैं, जैसे समस्या कठिनाई रेटिंग और वैकल्पिक समाधान विधियां, जो अधिक सूक्ष्म विश्लेषण का समर्थन करती हैं।

मूल्यांकन पद्धति

GSM8K 2023 पर मूल्यांकन में आमतौर पर प्रत्येक परीक्षण समस्या के लिए एक समाधान उत्पन्न करना और अंतिम उत्तर की तुलना ग्राउंड ट्रुथ से करना शामिल है। प्राथमिक मीट्रिक सटीकता है, जिसे उन समस्याओं के प्रतिशत के रूप में परिभाषित किया गया है जहां मॉडल का अंतिम उत्तर अपेक्षित परिणाम से मेल खाता है। हालांकि, क्योंकि मॉडल दोषपूर्ण तर्क के माध्यम से सही उत्तर उत्पन्न कर सकते हैं, शोधकर्ता प्रक्रिया-आधारित मेट्रिक्स का भी उपयोग करते हैं जो मध्यवर्ती चरणों की वैधता का आकलन करते हैं।

यादृच्छिक अनुमान के प्रभाव को कम करने के लिए, मॉडल का मूल्यांकन अक्सर लालची डिकोडिंग रणनीति का उपयोग करके किया जाता है, हालांकि बहुमत वोटिंग (आत्म-संगति) के साथ नमूनाकरण-आधारित दृष्टिकोण प्रदर्शन में सुधार करने के लिए दिखाए गए हैं। 2023 अपडेट ने सख्त उत्तर स्वरूपण आवश्यकताओं को पेश किया, जैसे कि अंतिम उत्तर से पहले एक विशिष्ट मार्कर की आवश्यकता, पार्सिंग त्रुटियों को कम करने और मूल्यांकन स्थिरता में सुधार करने के लिए।

प्रभाव और अनुप्रयोग

GSM8K 2023 Deep learning और Generative AI के क्षेत्र में एक मानक बेंचमार्क बन गया है, विशेष रूप से Transformer (architecture)-आधारित मॉडलों की तर्क क्षमताओं का आकलन करने के लिए। इसका उपयोग अक्सर अनुसंधान प्रयोगशालाओं और कंपनियों द्वारा किया जाता है, जिसमें OpenAI, Anthropic और Google DeepMind शामिल हैं, मॉडल प्रदर्शन की तुलना करने और मॉडल विकास का मार्गदर्शन करने के लिए। यह बेंचमार्क चेन-ऑफ-थॉट प्रॉम्प्टिंग जैसी तकनीकों को आगे बढ़ाने में भी सहायक रहा है, जो मॉडलों को अंतिम उत्तर पर पहुंचने से पहले मध्यवर्ती तर्क चरण उत्पन्न करने के लिए प्रोत्साहित करती है।

शैक्षणिक अनुसंधान से परे, GSM8K 2023 शैक्षिक सेटिंग्स, ट्यूशन अनुप्रयोगों और अन्य डोमेन में तैनात AI प्रणालियों की गणितीय क्षमता का मूल्यांकन करने के लिए एक व्यावहारिक उपकरण के रूप में कार्य करता है जहां संख्यात्मक तर्क महत्वपूर्ण है। इसकी सरलता और स्पष्टता इसे छात्रों से लेकर उद्योग पेशेवरों तक, अभ्यासकर्ताओं की एक विस्तृत श्रृंखला के लिए सुलभ बनाती है।

सीमाएं और आलोचनाएं

अपनी लोकप्रियता के बावजूद, GSM8K 2023 को आलोचना का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि डेटासेट का अंकगणितीय शब्द समस्याओं पर ध्यान गणितीय तर्क की पूरी जटिलता को नहीं पकड़ता है, जिसमें अक्सर अमूर्त अवधारणाएं और प्रमाण-आधारित तर्क शामिल होते हैं। इसके अतिरिक्त, बेंचमार्क अति-फिटिंग के लिए अतिसंवेदनशील हो सकता है, क्योंकि मॉडल सामान्य तर्क कौशल सीखने के बजाय प्रशिक्षण सेट में पैटर्न को याद कर सकते हैं।

2023 अपडेट अधिक विविध समस्या प्रकारों को पेश करके और याद रखने की संभावना को कम करके इन चिंताओं को दूर करने का प्रयास करता है। हालांकि, किसी भी बेंचमार्क के साथ, GSM8K 2023 बुद्धि का एक आदर्श माप नहीं है, और परिणामों की व्याख्या अन्य मूल्यांकनों के साथ की जानी चाहिए।

भविष्य की दिशाएं

GSM8K का विकास Artificial intelligence में अधिक कठोर और यथार्थवादी बेंचमार्क की ओर एक व्यापक प्रवृत्ति को दर्शाता है। भविष्य के पुनरावृत्तियों में वास्तविक दुनिया के तर्क कार्यों को बेहतर ढंग से अनुकरण करने के लिए गतिशील समस्या निर्माण, अनुकूली कठिनाई और बहु-मोडल इनपुट शामिल हो सकते हैं। जैसे-जैसे Large language model में सुधार जारी है, GSM8K 2023 जैसे बेंचमार्क प्रगति को ट्रैक करने और उन क्षेत्रों की पहचान करने के लिए आवश्यक रहेंगे जहां मॉडल अभी भी मानव-स्तरीय तर्क से कम हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·mathematical-reasoning·dataset·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास