Math23K मशीन लर्निंग और कृत्रिम बुद्धिमत्ता के क्षेत्र में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है, जिसे विशेष रूप से गणितीय शब्द समस्याओं को हल करने के कार्य के लिए डिज़ाइन किया गया है। इस डेटासेट में 23,162 चीनी भाषा के प्राथमिक विद्यालय स्तर की गणित समस्याएं शामिल हैं, जिनमें से प्रत्येक के साथ उसका संबंधित समीकरण या उत्तर जोड़ा गया है। इसे गणितीय तर्क के लिए बड़े पैमाने पर गैर-अंग्रेजी डेटासेट की कमी को दूर करने के लिए पेश किया गया था, जो पहले अंग्रेजी संसाधनों द्वारा प्रभुत्व में था। शोधकर्ता Math23K का उपयोग ऐसे मॉडल विकसित करने और परीक्षण करने के लिए करते हैं जो प्राकृतिक भाषा को पार्स कर सकें, संख्यात्मक संबंधों को निकाल सकें, और सही गणितीय अभिव्यक्तियाँ उत्पन्न कर सकें।
यह डेटासेट चीनी विज्ञान अकादमी की एक टीम द्वारा बनाया गया था और पहली बार 2017 के एक पेपर में प्रस्तुत किया गया था जिसका शीर्षक था "A Goal-Driven Tree-Structured Neural Model for Math Word Problems." समस्याएं जोड़, घटाव, गुणा और भाग सहित अंकगणितीय संक्रियाओं की एक श्रृंखला को कवर करती हैं, जिनमें अक्सर खरीदारी, यात्रा और आयु गणना जैसे वास्तविक दुनिया के परिदृश्य शामिल होते हैं। प्रत्येक समस्या को एक लक्ष्य समीकरण टेम्पलेट के साथ एनोटेट किया गया है, जिससे मॉडल को पर्यवेक्षित तरीके से प्रशिक्षित किया जा सके। Math23K चीनी गणित शब्द समस्या समाधानकर्ताओं के लिए एक मानक मूल्यांकन सेट बन गया है, जो MAWPS और ASDiv डेटासेट जैसे अंग्रेजी बेंचमार्क का पूरक है।
Dataset Structure and Annotation
Math23K में 23,162 समस्याएं हैं, जो प्रशिक्षण, सत्यापन और परीक्षण सेटों में विभाजित हैं। अधिकांश प्रकाशित शोध में उपयोग किया जाने वाला मानक विभाजन प्रशिक्षण के लिए 21,162 समस्याएं, सत्यापन के लिए 1,000 और परीक्षण के लिए 1,000 आवंटित करता है। प्रत्येक समस्या एक छोटा चीनी वाक्य या अनुच्छेद है, जो आमतौर पर 20 से 50 वर्णों की लंबाई का होता है, जिसके बाद एक स्वर्ण-मानक समीकरण होता है। उदाहरण के लिए, एक समस्या में कहा जा सकता है: "小明有5个苹果,小红给了他3个,他一共有多少个?" (श्याओ मिंग के पास 5 सेब हैं, श्याओ होंग उसे 3 देता है, उसके पास कुल कितने हैं?), समीकरण "5+3=8" के साथ।
एनोटेशन को एक विहित रूप में सामान्यीकृत किया जाता है, जहां संख्याओं को प्लेसहोल्डर (जैसे, "n1", "n2") से बदल दिया जाता है ताकि समीकरण टेम्पलेट बनाए जा सकें। यह डिज़ाइन मॉडल को विशिष्ट संख्यात्मक मानों से स्वतंत्र संरचनात्मक पैटर्न सीखने में सक्षम बनाता है, जिससे सामान्यीकरण में सुधार होता है। डेटासेट में कुछ संस्करणों में बहुविकल्पीय उत्तर भी शामिल हैं, लेकिन प्राथमिक प्रारूप खुला-अंत समीकरण निर्माण है।
Model Architectures and Approaches
अपनी रिलीज़ के बाद से, Math23K का उपयोग विभिन्न तंत्रिका नेटवर्क आर्किटेक्चर को बेंचमार्क करने के लिए किया गया है। प्रारंभिक दृष्टिकोण अनुक्रम-से-अनुक्रम मॉडल पर निर्भर थे जिनमें एनकोडर-डिकोडर संरचनाएं थीं, जो समस्या को पाठ से समीकरणों में अनुवाद कार्य के रूप में मानते थे। इन्हें बाद में शब्दों को संख्याओं के साथ बेहतर ढंग से संरेखित करने के लिए ध्यान तंत्र और बहु-शीर्ष ध्यान के साथ बढ़ाया गया। एक उल्लेखनीय सफलता पेड़-संरचित मॉडल के साथ आई जो अंकगणितीय अभिव्यक्तियों की पदानुक्रमित प्रकृति को स्पष्ट रूप से दर्शाते हैं, जैसे कि मूल पेपर से लक्ष्य-संचालित पेड़-संरचित तंत्रिका मॉडल।
हाल के कार्यों ने ट्रांसफॉर्मर-आधारित मॉडल लागू किए हैं, जिनमें Math23K पर फाइन-ट्यून किए गए बड़े भाषा मॉडल शामिल हैं। ये मॉडल चीनी कोरपोरा से पूर्व-प्रशिक्षित प्रतिनिधित्व का लाभ उठाते हैं और परीक्षण सेट पर 80% से अधिक की सटीकता के साथ अत्याधुनिक प्रदर्शन प्राप्त करते हैं। हालांकि, डेटासेट अपनी विविध समस्या प्रकारों और बहु-चरणीय तर्क की आवश्यकता के कारण चुनौतीपूर्ण बना हुआ है। शोधकर्ताओं ने मजबूती में सुधार के लिए पाठ्यक्रम-आधारित शिक्षण और डेटा संवर्धन तकनीकों का भी पता लगाया है।
Evaluation Metrics and Challenges
Math23K के लिए प्राथमिक मीट्रिक समीकरण सटीकता है, जो उन समस्याओं के प्रतिशत को मापता है जहां उत्पन्न समीकरण स्वर्ण-मानक समीकरण से बिल्कुल मेल खाता है। कुछ अध्ययन उत्तर सटीकता भी रिपोर्ट करते हैं, जो अंतिम संख्यात्मक परिणाम पर विचार करता है। डेटासेट की कठिनाई कई कारकों से उत्पन्न होती है: अस्पष्ट भाषा, निहित संक्रियाएं, और संदर्भ से मात्राओं का अनुमान लगाने की आवश्यकता। उदाहरण के लिए, समस्याएं जोड़ या घटाव को इंगित करने के लिए "多" (अधिक) या "少" (कम) जैसे शब्दों का उपयोग कर सकती हैं, लेकिन सटीक संक्रिया वाक्य संरचना पर निर्भर करती है।
एक और चुनौती अप्रासंगिक या अनावश्यक जानकारी की उपस्थिति है, जो मॉडल को गुमराह कर सकती है। इसके अतिरिक्त, Math23K में कई मान्य समीकरणों वाली समस्याएं शामिल हैं, लेकिन स्वर्ण मानक केवल एक प्रदान करता है, जिससे सटीक-मिलान मूल्यांकन कठोर हो जाता है। परिणामस्वरूप, सही उत्तर लेकिन अलग समीकरण रूप उत्पन्न करने वाले मॉडल को दंडित किया जाता है, जिससे शोधकर्ताओं को अधिक लचीले मूल्यांकन तरीके विकसित करने के लिए प्रेरित किया जाता है।
Impact and Applications
Math23K ने गहन शिक्षण के भीतर गणितीय तर्क अनुसंधान को महत्वपूर्ण रूप से प्रभावित किया है। इसका उपयोग विभिन्न समस्या प्रकारों में मॉडल की सामान्यीकरण क्षमताओं का अध्ययन करने और विभिन्न प्रशिक्षण रणनीतियों की प्रभावशीलता की तुलना करने के लिए किया गया है। डेटासेट को बड़े बेंचमार्क, जैसे चीनी गणित शब्द समस्या कोरपस में भी एकीकृत किया गया है, और इसने अंग्रेजी और जापानी सहित अन्य भाषाओं में समान डेटासेट को प्रेरित किया है।
व्यावहारिक अनुप्रयोगों में, Math23K पर प्रशिक्षित मॉडल शैक्षिक प्रौद्योगिकी में उपयोग किए जाते हैं, जैसे बुद्धिमान ट्यूटरिंग सिस्टम और स्वचालित होमवर्क ग्रेडिंग। अलीबाबा क्लाउड जैसी कंपनियों और शोध संस्थानों ने इन मॉडलों को वास्तविक दुनिया की कक्षाओं में तैनात करने का पता लगाया है। हालांकि, प्राथमिक स्तर के अंकगणित पर डेटासेट का ध्यान उन्नत गणित के लिए इसकी प्रयोज्यता को सीमित करता है, और अधिक जटिल डेटासेट बनाने के प्रयास चल रहे हैं।
Limitations and Future Directions
अपनी लोकप्रियता के बावजूद, Math23K में ज्ञात सीमाएं हैं। समस्याएं अपेक्षाकृत सरल हैं, जिनमें अधिकतम दो या तीन संक्रियाएं शामिल हैं, और वास्तविक दुनिया के गणितीय तर्क की जटिलता का अभाव है। चीनी भाषा भी विशिष्ट भाषाई चुनौतियां पेश करती है, जैसे माप शब्दों का उपयोग और लचीला शब्द क्रम, जो अन्य भाषाओं में स्थानांतरित नहीं हो सकते हैं। इसके अलावा, डेटासेट में दृश्य या बहु-मोडल जानकारी शामिल नहीं है, जो पाठ और आरेखों को संयोजित करने वाले कार्यों में इसके उपयोग को प्रतिबंधित करती है।
भविष्य के शोध का उद्देश्य Math23K को अधिक विविध समस्या प्रकारों, समृद्ध एनोटेशन और बहु-चरणीय तर्क श्रृंखलाओं के साथ विस्तारित करना है। कुछ प्रयास इसे बड़े भाषा मॉडल के साथ एकीकृत कर रहे हैं ताकि फ्यू-शॉट और जीरो-शॉट शिक्षण का पता लगाया जा सके, जहां मॉडल को फाइन-ट्यूनिंग के बजाय कुछ उदाहरणों के साथ प्रॉम्प्ट किया जाता है। 2025 तक, Math23K एक मानक आधार रेखा बना हुआ है, लेकिन Math23K-v2 और चीनी MathQA जैसे नए डेटासेट इसकी कमियों को दूर करने के लिए उभर रहे हैं।