अंग्रेज़ी से अनुवादित

एक एआई बेंचमार्क एक मानकीकृत डेटासेट और कार्य है जिसका उपयोग एआई मॉडल के प्रदर्शन को मापने और तुलना करने के लिए किया जाता है, जो क्षमता प्रगति को मापने का प्राथमिक तरीका बनाता है, हालांकि बेंचमार्क को संतृप्ति और डेटा संदूषण की आवर्ती समस्याओं का सामना करना पड़ता है।

एक एआई बेंचमार्क एक मानकीकृत डेटासेट, कार्य, या कार्यों का समूह है जिसका उपयोग एआई प्रणालियों के प्रदर्शन को मापने और तुलना करने के लिए किया जाता है, जो एक सामान्य पैमाना प्रदान करता है जिससे शोधकर्ता और जनता विभिन्न प्रयोगशालाओं और समय के साथ मॉडलों की तुलना कर सकते हैं। बेंचमार्क ने कम से कम ImageNet प्रतियोगिता के बाद से एआई प्रगति में केंद्रीय भूमिका निभाई है, जिसने गहन शिक्षण युग को उत्प्रेरित करने में मदद की, और आज भी एलएलएम मूल्यांकन में उपयोग किया जाने वाला प्राथमिक उपकरण बना हुआ है।

बेंचमार्क के प्रकार

बेंचमार्क इस आधार पर व्यापक रूप से भिन्न होते हैं कि वे क्या मापते हैं। ज्ञान और तर्क बेंचमार्क, जैसे MMLU, शैक्षणिक विषयों में व्यापक तथ्यात्मक और तर्क क्षमता का परीक्षण करते हैं। कोडिंग बेंचमार्क, जैसे HumanEval और SWE-bench, किसी मॉडल की कोड लिखने या ठीक करने की क्षमता को मापते हैं। अमूर्त तर्क बेंचमार्क जैसे ARC-AGI का उद्देश्य स्मरण के बजाय नई पहेली-समाधान का परीक्षण करके स्मरण-प्रतिरोध करना है। मल्टीमॉडल बेंचमार्क छवि या वीडियो समझ का परीक्षण करते हैं, और सुरक्षा बेंचमार्क हानिकारक आउटपुट, जेलब्रेक संवेदनशीलता, या पूर्वाग्रह की जांच करते हैं। स्थिर डेटासेट से परे, LMArena जैसे मानव-वरीयता प्लेटफार्म निश्चित परीक्षण सेटों के बजाय क्राउडसोर्स्ड जोड़ीवार तुलनाओं के माध्यम से मॉडलों को रैंक करते हैं।

संतृप्ति

एक आवर्ती पैटर्न बेंचमार्क संतृप्ति है: जैसे-जैसे मॉडलों में सुधार होता है, किसी दिए गए बेंचमार्क पर प्रदर्शन छत की ओर बढ़ता है, अक्सर अच्छी तरह से कैलिब्रेटेड मानव प्रदर्शन से अधिक हो जाता है, जिस बिंदु पर बेंचमार्क मॉडलों के बीच उपयोगी रूप से अंतर करना बंद कर देता है। 2020 में पेश किया गया MMLU, कुछ वर्षों के भीतर अग्रणी मॉडलों को 90% से अधिक सटीकता तक पहुंचते हुए देखा, जिससे कठिन उत्तराधिकारियों का निर्माण हुआ। यह चक्र - एक बेंचमार्क का पेश किया जाना, व्यापक रूप से अपनाया जाना, संतृप्त होना, और फिर प्रतिस्थापित होना - लगभग हर प्रमुख क्षमता क्षेत्र में दोहराया गया है, और यह एक कारण है कि बेंचमार्क सूट को अक्सर ताज़ा किया जाता है या कठिन वेरिएंट के साथ पूरक किया जाता है।

संदूषण

एक संबंधित और गंभीर समस्या डेटा संदूषण है: क्योंकि बड़े भाषा मॉडल इंटरनेट के विशाल स्क्रैप पर प्रशिक्षित होते हैं, जिसमें कॉमन क्रॉल शामिल है, बेंचमार्क प्रश्न और उत्तर प्रशिक्षण डेटा में लीक हो सकते हैं, या तो सीधे या ऑनलाइन बेंचमार्क की चर्चा के माध्यम से, जिससे वास्तविक क्षमता को प्रतिबिंबित किए बिना मॉडल का मापा प्रदर्शन बढ़ जाता है। संदूषण का पता लगाना कठिन है, और कुछ बेंचमार्क, जिनमें ARC-AGI शामिल है, विशेष रूप से इसका प्रतिरोध करने के लिए नई समस्या निर्माण के साथ डिजाइन किए गए थे। संदूषण की चिंताओं ने क्षेत्र के कुछ लोगों को स्वतंत्र सत्यापन के बिना प्रयोगशालाओं से स्व-रिपोर्ट किए गए बेंचमार्क स्कोर के प्रति संदेहपूर्ण बना दिया है।

अन्य आलोचनाएं

बेंचमार्क को सीधे खेला या अनुकूलित भी किया जा सकता है, जो व्यापक विकास प्रक्रिया में पुरस्कार हैकिंग का एक रूप है, जहां एक प्रयोगशाला वास्तविक दुनिया की उपयोगिता में आनुपातिक लाभ के बिना लोकप्रिय बेंचमार्क पर अच्छा प्रदर्शन करने के लिए एक मॉडल को ट्यून करती है। स्थिर बेंचमार्क वास्तविक उपयोग के लिए प्रासंगिक एजेंटिक, बहु-चरणीय, या लंबी-क्षितिज क्षमताओं को पकड़ने में भी विफल हो सकते हैं, जो अधिक गतिशील और कार्य-आधारित मूल्यांकनों की ओर बदलाव को प्रेरित करता है, जिसमें SWE-bench का वास्तविक GitHub मुद्दों का उपयोग शामिल है, और कठिन होल्ड-आउट समस्या सेटों पर मूल्यांकित परीक्षण-समय कंप्यूट-भारी तर्क मॉडल की ओर भी।

क्षेत्र में भूमिका

अपनी सीमाओं के बावजूद, बेंचमार्क एआई प्रगति की रिपोर्टिंग, विपणन और बहस के केंद्र में बने हुए हैं, जो लगभग हर मॉडल रिलीज़ घोषणा और क्षमता सीमाओं की नीति चर्चाओं में दिखाई देते हैं। उनकी सीमाओं ने पूरक मूल्यांकन विधियों में बढ़ती रुचि को जन्म दिया है, जिसमें मानव वरीयता प्लेटफार्म, एलएलएम-एज़-जज दृष्टिकोण, और संकीर्ण, विशेषज्ञ-क्यूरेटेड मूल्यांकन शामिल हैं जो संदूषण और संतृप्ति के प्रति कम संवेदनशील हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-evaluation·industry
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास