एलएलएम मूल्यांकन, जिसे आमतौर पर इवेल्स कहा जाता है, उन विधियों और बुनियादी ढांचे को संदर्भित करता है जिनका उपयोग बड़े भाषा मॉडल की क्षमता, गुणवत्ता, विश्वसनीयता और सुरक्षा को मापने के लिए किया जाता है। जैसे-जैसे एलएलएम को कार्यों की एक व्यापक श्रृंखला पर लागू किया गया है, मूल्यांकन एक संकीर्ण शैक्षणिक अभ्यास से एआई प्रयोगशालाओं के भीतर एक प्रमुख व्यावहारिक अनुशासन में विकसित हुआ है, क्योंकि इवेल्स यह निर्धारित करते हैं कि सार्वजनिक रूप से क्या रिपोर्ट किया जाता है, डेवलपर्स द्वारा मॉडल चयन का मार्गदर्शन क्या करता है, और तेजी से प्रशिक्षण में ही क्या वापस फीड करता है।
स्थैतिक बेंचमार्क सूट
मूल्यांकन का सबसे पारंपरिक रूप एक निश्चित बेंचमार्क डेटासेट के खिलाफ एक मॉडल चलाता है जिसमें ज्ञात सही उत्तर होते हैं, जैसे ज्ञान के लिए एमएमएलयू, कोडिंग के लिए ह्यूमनईवल या एसडब्ल्यूई-बेंच, और अमूर्त तर्क के लिए एआरसी-एजीआई। ये सूट बार-बार चलाने के लिए सस्ते होते हैं और सीधी संख्यात्मक तुलना की अनुमति देते हैं, लेकिन बेंचमार्क संतृप्ति और प्रशिक्षण डेटा संदूषण से ग्रस्त होते हैं क्योंकि मॉडल तेजी से बड़े वेब स्क्रैप पर प्रशिक्षित होते हैं जो परीक्षण सेट के साथ ओवरलैप हो सकते हैं।
मानव प्राथमिकता क्षेत्र
क्योंकि कई मूल्यवान एलएलएम गुण, जैसे सहायकता, लेखन गुणवत्ता, या स्वर, सरल शुद्धता स्कोरिंग का विरोध करते हैं, एलएमएरीना जैसे प्लेटफॉर्म, जो पहले चैटबॉट एरीना था, मॉडल आउटपुट के बीच बड़ी मात्रा में अंधा, आमने-सामने मानव तुलना एकत्र करते हैं और एलो-शैली रैंकिंग की गणना करते हैं। यह दृष्टिकोण कुल मानव प्राथमिकता को अच्छी तरह से पकड़ता है लेकिन शैलीगत लक्षणों, जैसे वाचालता या सहमतता, को पुरस्कृत करने के लिए आलोचना की गई है, जो जरूरी नहीं कि गहरी क्षमता या शुद्धता को ट्रैक करते हैं, और प्लेटफॉर्म के उपयोगकर्ता वितरण की ओर विशेष रूप से एक मॉडल को ट्यून करके खेलना संभव होने के लिए।
एलएलएम-एज़-जज
एक नया दृष्टिकोण दूसरे के आउटपुट का मूल्यांकन करने के लिए एक एलएलएम का उपयोग करता है, शुद्धता, सहायकता, या एक रूब्रिक के पालन के लिए प्रतिक्रियाओं को स्कोर करता है, क्योंकि मानव मूल्यांकन पैमाने पर धीमा और महंगा है। एलएलएम-एज़-जज विधियां कई कार्यों पर मानव निर्णय को काफी अच्छी तरह से अनुमानित कर सकती हैं और मूल्यांकन को मानव रेटर्स की तुलना में कहीं अधिक उदाहरणों तक विस्तारित करने की अनुमति देती हैं, लेकिन अपने स्वयं के मॉडल के पूर्वाग्रहों और अंध स्थानों को विरासत में लेती हैं, जिसमें लंबे या अधिक आत्मविश्वास से शब्दों वाले उत्तरों का पक्ष लेने की प्रवृत्ति शामिल है, और यदि मूल्यांकन किया जा रहा मॉडल वास्तव में सुधारने के बजाय जज को खेलने वाले आउटपुट उत्पन्न करना सीखता है, तो इसका शोषण किया जा सकता है।
डोमेन-विशिष्ट और सुरक्षा इवेल्स
सामान्य क्षमता से परे, मूल्यांकन तेजी से संकीर्ण गुणों को कवर करता है: तथ्यात्मक प्रश्नों पर मतिभ्रम दर, जेलब्रेक और प्रॉम्प्ट इंजेक्शन के प्रति संवेदनशीलता, जनसांख्यिकीय समूहों में पूर्वाग्रह, और खतरनाक-क्षमता मूल्यांकन जो एआई सुरक्षा से संबंधित हैं, जैसे कि क्या एक मॉडल साइबर हमलों या बायोवेपन संश्लेषण में सार्थक रूप से सहायता कर सकता है। एंथ्रोपिक और ओपनएआई सहित प्रयोगशालाएं अपनी जिम्मेदार स्केलिंग प्रतिबद्धताओं से जुड़े पूर्व-तैनाती परीक्षण के हिस्से के रूप में ऐसे मूल्यांकन चलाती हैं, और तीसरे पक्ष के निकाय, जिनमें ब्लेचली घोषणा के बाद गठित सरकारी एआई सुरक्षा संस्थान शामिल हैं, फ्रंटियर रिलीज के स्वतंत्र मूल्यांकन करते हैं।
चुनौतियां
मूल्यांकन को लगातार कठिनाइयों का सामना करना पड़ता है: बेंचमार्क और क्षेत्रों को खेला जा सकता है जब एक प्रयोगशाला को पता होता है कि क्या मापा जा रहा है, मॉडल विकास पर लागू गुडहार्ट के नियम का एक संस्करण; संदूषण स्थैतिक स्कोर की वैधता को कमजोर करता है; और कोई एक संख्या उन कई, कभी-कभी परस्पर विरोधी, गुणों को पकड़ नहीं पाती है जिनकी उपयोगकर्ता परवाह करते हैं, जैसे सहायकता, ईमानदारी और हानिरहितता। इसने क्षेत्र को कई तरीकों के संयोजन वाले मूल्यांकन पोर्टफोलियो, अपने प्रश्नों को ताज़ा करने वाले चल रहे "लिविंग बेंचमार्क", और वास्तविक दुनिया, कार्य-आधारित, और एजेंटिक मूल्यांकन पर अधिक जोर देने की दिशा में धकेल दिया है जो अलग-अलग प्रश्न-उत्तर की तुलना में तैनात उपयोग को बेहतर ढंग से दर्शाते हैं।
महत्व
क्योंकि इवेल्स आकार देते हैं कि कौन से मॉडल को सर्वश्रेष्ठ माना जाता है, और तेजी से आरएलएचएफ और पुरस्कार मॉडलिंग जैसी तकनीकों के माध्यम से सीधे प्रशिक्षण में फीड करते हैं, मूल्यांकन पद्धति का डिजाइन एक महत्वपूर्ण, यदि कम दिखाई देने वाला, चालक बन गया है कि क्षेत्र के अग्रणी मॉडल वास्तव में कैसे व्यवहार करते हैं।