एक एआई बेंचमार्क एक मानकीकृत डेटासेट, कार्य, या कार्यों का समूह है जिसका उपयोग एआई प्रणालियों के प्रदर्शन को मापने और तुलना करने के लिए किया जाता है, जो एक सामान्य पैमाना प्रदान करता है जिससे शोधकर्ता और जनता विभिन्न प्रयोगशालाओं और समय के साथ मॉडलों की तुलना कर सकते हैं। बेंचमार्क ने कम से कम ImageNet प्रतियोगिता के बाद से एआई प्रगति में केंद्रीय भूमिका निभाई है, जिसने गहन शिक्षण युग को उत्प्रेरित करने में मदद की, और आज भी एलएलएम मूल्यांकन में उपयोग किया जाने वाला प्राथमिक उपकरण बना हुआ है।
बेंचमार्क के प्रकार
बेंचमार्क इस आधार पर व्यापक रूप से भिन्न होते हैं कि वे क्या मापते हैं। ज्ञान और तर्क बेंचमार्क, जैसे MMLU, शैक्षणिक विषयों में व्यापक तथ्यात्मक और तर्क क्षमता का परीक्षण करते हैं। कोडिंग बेंचमार्क, जैसे HumanEval और SWE-bench, किसी मॉडल की कोड लिखने या ठीक करने की क्षमता को मापते हैं। अमूर्त तर्क बेंचमार्क जैसे ARC-AGI का उद्देश्य स्मरण के बजाय नई पहेली-समाधान का परीक्षण करके स्मरण-प्रतिरोध करना है। मल्टीमॉडल बेंचमार्क छवि या वीडियो समझ का परीक्षण करते हैं, और सुरक्षा बेंचमार्क हानिकारक आउटपुट, जेलब्रेक संवेदनशीलता, या पूर्वाग्रह की जांच करते हैं। स्थिर डेटासेट से परे, LMArena जैसे मानव-वरीयता प्लेटफार्म निश्चित परीक्षण सेटों के बजाय क्राउडसोर्स्ड जोड़ीवार तुलनाओं के माध्यम से मॉडलों को रैंक करते हैं।
संतृप्ति
एक आवर्ती पैटर्न बेंचमार्क संतृप्ति है: जैसे-जैसे मॉडलों में सुधार होता है, किसी दिए गए बेंचमार्क पर प्रदर्शन छत की ओर बढ़ता है, अक्सर अच्छी तरह से कैलिब्रेटेड मानव प्रदर्शन से अधिक हो जाता है, जिस बिंदु पर बेंचमार्क मॉडलों के बीच उपयोगी रूप से अंतर करना बंद कर देता है। 2020 में पेश किया गया MMLU, कुछ वर्षों के भीतर अग्रणी मॉडलों को 90% से अधिक सटीकता तक पहुंचते हुए देखा, जिससे कठिन उत्तराधिकारियों का निर्माण हुआ। यह चक्र - एक बेंचमार्क का पेश किया जाना, व्यापक रूप से अपनाया जाना, संतृप्त होना, और फिर प्रतिस्थापित होना - लगभग हर प्रमुख क्षमता क्षेत्र में दोहराया गया है, और यह एक कारण है कि बेंचमार्क सूट को अक्सर ताज़ा किया जाता है या कठिन वेरिएंट के साथ पूरक किया जाता है।
संदूषण
एक संबंधित और गंभीर समस्या डेटा संदूषण है: क्योंकि बड़े भाषा मॉडल इंटरनेट के विशाल स्क्रैप पर प्रशिक्षित होते हैं, जिसमें कॉमन क्रॉल शामिल है, बेंचमार्क प्रश्न और उत्तर प्रशिक्षण डेटा में लीक हो सकते हैं, या तो सीधे या ऑनलाइन बेंचमार्क की चर्चा के माध्यम से, जिससे वास्तविक क्षमता को प्रतिबिंबित किए बिना मॉडल का मापा प्रदर्शन बढ़ जाता है। संदूषण का पता लगाना कठिन है, और कुछ बेंचमार्क, जिनमें ARC-AGI शामिल है, विशेष रूप से इसका प्रतिरोध करने के लिए नई समस्या निर्माण के साथ डिजाइन किए गए थे। संदूषण की चिंताओं ने क्षेत्र के कुछ लोगों को स्वतंत्र सत्यापन के बिना प्रयोगशालाओं से स्व-रिपोर्ट किए गए बेंचमार्क स्कोर के प्रति संदेहपूर्ण बना दिया है।
अन्य आलोचनाएं
बेंचमार्क को सीधे खेला या अनुकूलित भी किया जा सकता है, जो व्यापक विकास प्रक्रिया में पुरस्कार हैकिंग का एक रूप है, जहां एक प्रयोगशाला वास्तविक दुनिया की उपयोगिता में आनुपातिक लाभ के बिना लोकप्रिय बेंचमार्क पर अच्छा प्रदर्शन करने के लिए एक मॉडल को ट्यून करती है। स्थिर बेंचमार्क वास्तविक उपयोग के लिए प्रासंगिक एजेंटिक, बहु-चरणीय, या लंबी-क्षितिज क्षमताओं को पकड़ने में भी विफल हो सकते हैं, जो अधिक गतिशील और कार्य-आधारित मूल्यांकनों की ओर बदलाव को प्रेरित करता है, जिसमें SWE-bench का वास्तविक GitHub मुद्दों का उपयोग शामिल है, और कठिन होल्ड-आउट समस्या सेटों पर मूल्यांकित परीक्षण-समय कंप्यूट-भारी तर्क मॉडल की ओर भी।
क्षेत्र में भूमिका
अपनी सीमाओं के बावजूद, बेंचमार्क एआई प्रगति की रिपोर्टिंग, विपणन और बहस के केंद्र में बने हुए हैं, जो लगभग हर मॉडल रिलीज़ घोषणा और क्षमता सीमाओं की नीति चर्चाओं में दिखाई देते हैं। उनकी सीमाओं ने पूरक मूल्यांकन विधियों में बढ़ती रुचि को जन्म दिया है, जिसमें मानव वरीयता प्लेटफार्म, एलएलएम-एज़-जज दृष्टिकोण, और संकीर्ण, विशेषज्ञ-क्यूरेटेड मूल्यांकन शामिल हैं जो संदूषण और संतृप्ति के प्रति कम संवेदनशील हैं।