अंग्रेज़ी से अनुवादित

C-Eval एक व्यापक चीनी मूल्यांकन बेंचमार्क है, जो 52 विषयों में बड़े भाषा मॉडलों का आकलन करने के लिए डिज़ाइन किया गया है, जिसमें बुनियादी से लेकर उन्नत शिक्षा स्तर तक शामिल हैं, और इसमें 13,948 बहुविकल्पीय प्रश्न हैं।

C-Eval एक व्यापक मूल्यांकन बेंचमार्क है जिसे चीनी भाषा में ज्ञान और तर्क कार्यों की एक विस्तृत श्रृंखला पर बड़े भाषा मॉडल (LLMs) की क्षमताओं का आकलन करने के लिए डिज़ाइन किया गया है। सिंघुआ विश्वविद्यालय और अन्य संस्थानों के शोधकर्ताओं द्वारा विकसित, इसे 2023 में पेश किया गया था ताकि एक मजबूत, चीनी-भाषा बेंचमार्क की आवश्यकता को संबोधित किया जा सके जो MMLU जैसे अंग्रेजी-केंद्रित बेंचमार्क के तुलनीय तरीके से LLMs के प्रदर्शन को माप सके। बेंचमार्क में 13,948 बहुविकल्पीय प्रश्न शामिल हैं जो 52 अलग-अलग विषयों में फैले हुए हैं, जो मिडिल स्कूल से लेकर पेशेवर और स्नातक स्तर तक हैं, और इसका व्यापक रूप से चीनी भाषा के संदर्भ में मॉडलों की सामान्य ज्ञान और तर्क क्षमताओं का आकलन करने के लिए उपयोग किया जाता है।

C-Eval का निर्माण इस अवलोकन से प्रेरित था कि अधिकांश मौजूदा मूल्यांकन बेंचमार्क मुख्य रूप से अंग्रेजी में थे, जिसने अन्य भाषाओं में प्रशिक्षित या तैनात मॉडलों के लिए उनकी प्रयोज्यता को सीमित कर दिया। जैसे-जैसे ओपनएआई, एंथ्रोपिक, और गूगल-डीपमाइंड जैसे बड़े भाषा मॉडल प्रभावशाली क्षमताएं दिखाने लगे, सांस्कृतिक और भाषाई रूप से उपयुक्त मूल्यांकन उपकरणों की आवश्यकता स्पष्ट हो गई। C-Eval मानविकी, सामाजिक विज्ञान, STEM क्षेत्रों और अधिक सहित विषयों के एक व्यापक स्पेक्ट्रम को कवर करने वाला एक मानकीकृत परीक्षण प्रदान करके इस अंतर को भरता है, जो सभी चीनी में प्रस्तुत किए गए हैं। इसका डिज़ाइन तथ्यात्मक स्मरण और बहु-चरणीय तर्क दोनों के आकलन की अनुमति देता है, जिससे यह कृत्रिम-बुद्धिमत्ता के क्षेत्र में शोधकर्ताओं और डेवलपर्स के लिए एक मूल्यवान उपकरण बन जाता है।

संरचना और सामग्री

C-Eval चार कठिनाई स्तरों में व्यवस्थित है: मिडिल स्कूल, हाई स्कूल, कॉलेज, और पेशेवर। प्रश्न मानकीकृत चीनी परीक्षाओं और पेशेवर प्रमाणन परीक्षणों से प्राप्त किए गए हैं, जिससे उच्च स्तर की गुणवत्ता और प्रासंगिकता सुनिश्चित होती है। 52 विषयों में गणित, भौतिकी, रसायन विज्ञान, जीव विज्ञान, इतिहास, भूगोल, कानून, चिकित्सा, और कंप्यूटर विज्ञान जैसे क्षेत्र शामिल हैं। प्रत्येक प्रश्न चार विकल्पों के साथ बहुविकल्पीय प्रारूप में है, और बेंचमार्क शून्य-शॉट और कुछ-शॉट दोनों मूल्यांकन सेटिंग्स प्रदान करता है, जिससे मॉडल प्रदर्शन के लचीले परीक्षण की अनुमति मिलती है।

बेंचमार्क के निर्माण में प्रशिक्षण डेटा के साथ संदूषण से बचने के लिए सावधानीपूर्वक क्यूरेशन शामिल था, जो LLM मूल्यांकन में एक सामान्य मुद्दा है। प्रश्न सार्वजनिक रूप से उपलब्ध परीक्षा सामग्री से एकत्र किए गए थे और फिर यह सुनिश्चित करने के लिए फ़िल्टर किए गए थे कि वे सामान्य प्रशिक्षण कॉर्पोरा में मौजूद नहीं थे। डेटा स्वच्छता पर यह ध्यान C-Eval को केवल याद रखने के बजाय मॉडल की वास्तविक सामान्यीकरण क्षमता का एक विश्वसनीय संकेतक बनाता है। बेंचमार्क में एक सत्यापन सेट और एक परीक्षण सेट भी शामिल है, जिसमें परीक्षण सेट के उत्तर ओवरफिटिंग को रोकने के लिए बाहर रखे गए हैं।

मूल्यांकन पद्धति

C-Eval पर एक मॉडल का मूल्यांकन करने के लिए, शोधकर्ता आमतौर पर कुछ-शॉट प्रॉम्प्टिंग दृष्टिकोण का उपयोग करते हैं, जहां मॉडल को परीक्षण सेट से प्रश्नों का उत्तर देने से पहले सत्यापन सेट से कुछ उदाहरण प्रदान किए जाते हैं। मॉडल का प्रदर्शन सही उत्तर का चयन करने में इसकी सटीकता से मापा जाता है। बेंचमार्क पीढ़ी-आधारित और पेरप्लेक्सिटी-आधारित दोनों मूल्यांकन विधियों का समर्थन करता है, हालांकि पूर्व अधिक सामान्य है। पीढ़ी-आधारित मूल्यांकन में, मॉडल को सीधे उत्तर आउटपुट करने के लिए प्रॉम्प्ट किया जाता है, और प्रतिक्रिया की तुलना ग्राउंड ट्रुथ से की जाती है।

C-Eval चीनी AI समुदाय में एक मानक बेंचमार्क बन गया है, जिसमें कई मॉडल डेवलपर्स अपने स्कोर की रिपोर्ट करते हैं। उदाहरण के लिए, अलीबाबा-क्लाउड के Qwen श्रृंखला और अन्य चीनी LLMs जैसे मॉडलों का C-Eval पर मूल्यांकन किया गया है, और परिणाम अक्सर तकनीकी रिपोर्टों और शोध पत्रों में उद्धृत किए जाते हैं। बेंचमार्क की लोकप्रियता इसके व्यापक कवरेज और इस तथ्य से उपजी है कि यह चीनी में एक मॉडल के ज्ञान का एक स्पष्ट, मात्रात्मक माप प्रदान करता है, जो चीनी-भाषी उपयोगकर्ताओं को लक्षित करने वाले अनुप्रयोगों के लिए महत्वपूर्ण है।

महत्व और प्रभाव

C-Eval की शुरूआत का LLMs के विकास और मूल्यांकन पर महत्वपूर्ण प्रभाव पड़ा है, विशेष रूप से चीनी बाजार को लक्षित करने वाले मॉडलों पर। इसने बैदू और टेनसेंट जैसे विभिन्न संगठनों के मॉडलों के बीच तुलना की सुविधा प्रदान की है और मॉडल प्रशिक्षण और फाइन-ट्यूनिंग में सुधार को प्रेरित किया है। उन क्षेत्रों को उजागर करके जहां मॉडल कम प्रदर्शन करते हैं, C-Eval विशिष्ट ज्ञान अंतराल या तर्क कमियों को संबोधित करने की दिशा में शोध प्रयासों को मार्गदर्शन करने में मदद करता है।

इसके अलावा, C-Eval ने AI मूल्यांकन पर व्यापक प्रवचन में योगदान दिया है, बहुभाषी बेंचमार्क के महत्व को रेखांकित किया है। इसने अन्य भाषाओं में समान बेंचमार्क के निर्माण को प्रेरित किया है और अधिक सांस्कृतिक रूप से जागरूक मूल्यांकन उपकरणों के विकास के लिए एक संदर्भ बिंदु के रूप में उपयोग किया गया है। बेंचमार्क खुले तौर पर उपलब्ध है, और इसकी लीडरबोर्ड सार्वजनिक रूप से बनाए रखी जाती है, जिससे शोधकर्ताओं और चिकित्सकों को चीनी-भाषा AI में अत्याधुनिक स्थिति को ट्रैक करने की अनुमति मिलती है।

सीमाएं और आलोचनाएं

इसके व्यापक उपयोग के बावजूद, C-Eval सीमाओं से रहित नहीं है। आलोचकों ने बताया है कि बेंचमार्क मुख्य रूप से तथ्यात्मक ज्ञान और बुनियादी तर्क का परीक्षण करता है, जो उन्नत LLMs की सूक्ष्म क्षमताओं को पूरी तरह से कैप्चर नहीं कर सकता है, जैसे कि रचनात्मकता, सामान्य-ज्ञान तर्क, या जटिल निर्देशों का पालन करने की क्षमता। इसके अतिरिक्त, बहुविकल्पीय प्रारूप कभी-कभी उन मॉडलों द्वारा खेला जा सकता है जो विकल्पों में सांख्यिकीय पैटर्न का शोषण करते हैं, हालांकि बेंचमार्क का डिज़ाइन कुछ हद तक इसे कम करता है।

एक और चिंता डेटा संदूषण की संभावना है, क्योंकि नए मॉडलों को उस डेटा पर प्रशिक्षित किया जा सकता है जिसमें C-Eval प्रश्न शामिल हैं, जिससे फुलाए गए स्कोर हो सकते हैं। इसे संबोधित करने के लिए, बेंचमार्क अनुरक्षक समय-समय पर परीक्षण सेट को अपडेट करते हैं, लेकिन जोखिम बना रहता है। इसके अलावा, C-Eval का चीनी पर ध्यान मुख्य रूप से अंग्रेजी-केंद्रित मॉडलों के लिए इसकी प्रयोज्यता को सीमित कर सकता है, हालांकि यह MMLU जैसे अंग्रेजी बेंचमार्क के लिए एक मूल्यवान पूरक के रूप में कार्य करता है।

भविष्य की दिशाएं

जैसे-जैसे बड़े-भाषा-मॉडल का क्षेत्र विकसित होता रहता है, C-Eval जैसे बेंचमार्क को गति बनाए रखने के लिए अनुकूलित करने की आवश्यकता होगी। भविष्य के संस्करणों में अधिक गतिशील प्रश्न निर्माण, खुले-अंत कार्यों को शामिल करना, या अतिरिक्त भाषाओं और डोमेन को कवर करने के लिए विस्तार शामिल हो सकता है। C-Eval की सफलता ने डोमेन-विशिष्ट मूल्यांकन के मूल्य का प्रदर्शन किया है, और यह संभावना है कि अन्य भाषाओं और विशेष क्षेत्रों के लिए समान बेंचमार्क उभरेंगे। अभी के लिए, C-Eval चीनी-भाषा AI मॉडल के मूल्यांकन में एक आधारशिला बना हुआ है, जो उनकी क्षमताओं का एक कठोर और व्यापक रूप से स्वीकृत माप प्रदान करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·evaluation·chinese-language·large-language-model
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास