अंग्रेज़ी से अनुवादित

BIG-bench Lite, बड़े भाषा मॉडलों के विविध तर्क और ज्ञान कार्यों पर कुशल मूल्यांकन के लिए डिज़ाइन किया गया, BIG-bench बेंचमार्क का एक हल्का उपसमुच्चय है।

BIG-bench Lite, 2022 में पेश किया गया, BIG-bench (Beyond the Imitation Game Benchmark) सुइट का एक चयनित उपसमुच्चय है, जिसे बड़े भाषा मॉडलों के लिए एक कम्प्यूटेशनल रूप से कुशल फिर भी चुनौतीपूर्ण मूल्यांकन प्रदान करने के लिए बनाया गया था। इसमें पूरे 204-कार्य BIG-bench संग्रह में से चुने गए 24 कार्य शामिल हैं, जो तर्क, ज्ञान और भाषा समझ में कवरेज को संतुलित करते हैं, साथ ही मूल्यांकन की कम्प्यूटेशनल लागत को कम करते हैं। यह उपसमुच्चय मॉडल विकास में तेजी से पुनरावृत्ति को सक्षम करने के लिए बनाया गया था, विशेष रूप से सीमित कंप्यूट संसाधनों वाले शोधकर्ताओं और संगठनों के लिए।

यह बेंचमार्क 130 से अधिक संस्थानों के 450 से अधिक शोधकर्ताओं के सहयोगात्मक प्रयास से विकसित किया गया था, जिसमें Google DeepMind, OpenAI, और Anthropic शामिल हैं। BIG-bench Lite के लिए चयन प्रक्रिया ने उच्च विभेदक शक्ति, विविध कौशल आवश्यकताओं और प्रबंधनीय मूल्यांकन लागत वाले कार्यों को प्राथमिकता दी। पूर्ण BIG-bench के विपरीत, जिसमें सरल अंकगणित से लेकर जटिल Chess computer विश्लेषण तक के कार्य शामिल हैं, BIG-bench Lite उन कार्यों पर केंद्रित है जो वर्तमान मॉडलों के लिए व्यवहार्य और व्यापक क्षमताओं के संकेतक दोनों हैं।

कार्य संरचना

BIG-bench Lite में तार्किक निगमन, गणितीय तर्क, सामान्य ज्ञान समझ और भाषा मॉडलिंग जैसे कार्य शामिल हैं। उल्लेखनीय उदाहरणों में "causal judgment," "geometric shapes," और "word sorting" शामिल हैं, जिनमें से प्रत्येक Artificial intelligence दक्षता के विशिष्ट पहलुओं का परीक्षण करने के लिए डिज़ाइन किया गया है। कार्य बहुविकल्पीय या लघु-उत्तर प्रश्नों के रूप में स्वरूपित हैं, जो स्वचालित स्कोरिंग और विभिन्न Large language model आर्किटेक्चर में सुसंगत मूल्यांकन को सक्षम करते हैं।

यह उपसमुच्चय जानबूझकर उन कार्यों को बाहर करता है जो या तो बहुत आसान हैं (मौजूदा मॉडलों द्वारा संतृप्त) या चलाने के लिए बहुत महंगे हैं (जैसे, व्यापक बाहरी टूल उपयोग की आवश्यकता वाले)। यह डिज़ाइन सुनिश्चित करता है कि BIG-bench Lite मॉडलों में सुधार होने पर एक गतिशील लक्ष्य बना रहे, जबकि नियमित बेंचमार्किंग के लिए व्यावहारिक बना रहे।

मूल्यांकन पद्धति

मॉडलों का मूल्यांकन BIG-bench Lite पर एक मानकीकृत प्रॉम्प्ट प्रारूप का उपयोग करके किया जाता है, जिसमें प्रत्येक कार्य निश्चित संख्या में उदाहरण प्रदान करता है। प्राथमिक मीट्रिक सटीकता है, हालांकि कुछ कार्य अंशांकन और मजबूती उपायों की भी रिपोर्ट करते हैं। बेंचमार्क शून्य-शॉट और कुछ-शॉट दोनों मूल्यांकन का समर्थन करता है, बाद वाला आमतौर पर प्रति कार्य 1-5 उदाहरणों का उपयोग करता है। यह लचीलापन शोधकर्ताओं को सामान्यीकरण और इन-कॉन्टेक्स्ट सीखने की क्षमताओं का आकलन करने की अनुमति देता है।

निष्पक्षता सुनिश्चित करने के लिए, बेंचमार्क में उत्तर निष्कर्षण और सामान्यीकरण को संभालने वाली स्कोरिंग स्क्रिप्ट के साथ एक संदर्भ कार्यान्वयन शामिल है। यह विभिन्न मूल्यांकन पाइपलाइनों में परिवर्तनशीलता को कम करता है, जिससे परिणाम अध्ययनों में अधिक तुलनीय हो जाते हैं। 2024 तक, BIG-bench Lite को शैक्षणिक और औद्योगिक सेटिंग्स में व्यापक रूप से अपनाया गया है, जिसमें कई Machine learning पेपरों में परिणाम रिपोर्ट किए गए हैं।

अन्य बेंचमार्क से संबंध

BIG-bench Lite का उपयोग अक्सर MMLU (Massive Multitask Language Understanding) और HELM (Holistic Evaluation of Language Models) जैसे अन्य मूल्यांकन सुइट्स के साथ किया जाता है। जबकि MMLU 57 विषयों में व्यापक ज्ञान पर केंद्रित है, BIG-bench Lite तर्क और समस्या-समाधान कार्यों पर जोर देता है जो याद किए गए तथ्यों पर कम निर्भर हैं। यह पूरक प्रकृति इसे मॉडल कमजोरियों के निदान के लिए एक मूल्यवान उपकरण बनाती है।

बेंचमार्क पूर्ण BIG-bench के लिए एक हल्के विकल्प के रूप में भी कार्य करता है, जिसके लिए मूल्यांकन के लिए पर्याप्त कंप्यूट और समय की आवश्यकता होती है। Google Cloud या Amazon Web Services जैसे संगठनों के लिए, क्लाउड इंफ्रास्ट्रक्चर पर BIG-bench Lite चलाना घंटों के भीतर संभव है, जबकि पूर्ण सुइट में दिन लग सकते हैं। यह व्यावहारिकता मॉडल विकास चक्रों में इसकी लोकप्रियता में योगदान करती है।

सीमाएं और आलोचनाएं

आलोचकों ने नोट किया है कि BIG-bench Lite, कई स्थिर बेंचमार्क की तरह, प्रशिक्षण कोषों में शामिल होने पर डेटा संदूषण से ग्रस्त हो सकता है। इसे कम करने के लिए, बेंचमार्क में एक "कैनरी" स्ट्रिंग शामिल है जो डेटा को केवल-मूल्यांकन के रूप में चिह्नित करती है, प्रशिक्षण डेटासेट में इसके समावेश को हतोत्साहित करती है। हालांकि, प्रवर्तन स्वैच्छिक है, और कुछ मॉडलों को प्रीट्रेनिंग के दौरान इन कार्यों का सामना करना पड़ सकता है।

एक और सीमा कार्यों का संकीर्ण दायरा है, जो सुरक्षा, पूर्वाग्रह, या लंबे-संदर्भ तर्क जैसी वास्तविक दुनिया की तैनाती चुनौतियों को पकड़ नहीं सकता है। परिणामस्वरूप, BIG-bench Lite को अक्सर मानव प्राथमिकता अध्ययन और प्रतिकूल परीक्षण सहित अन्य मूल्यांकनों के साथ पूरक किया जाता है। इन कमियों के बावजूद, यह Generative AI परिदृश्य में मॉडल क्षमताओं की तुलना करने के लिए एक मानक संदर्भ बिंदु बना हुआ है।

भविष्य की दिशाएं

BIG-bench Lite की सफलता ने HELM Lite और Open LLM Leaderboard सबसेट जैसे समान हल्के बेंचमार्क को प्रेरित किया है। ये प्रयास विश्वसनीयता बनाए रखते हुए और भी अधिक कुशल मूल्यांकन प्रदान करने का लक्ष्य रखते हैं। इसके अतिरिक्त, मूल BIG-bench टीम ने BIG-bench Hard जारी किया है, जो विशेष रूप से चुनौतीपूर्ण कार्यों का एक उपसमुच्चय है जिसके लिए बहु-चरणीय तर्क की आवश्यकता होती है, जो मॉडल मूल्यांकन की सीमाओं को और आगे बढ़ाता है।

जैसे-जैसे Deep learning मॉडल विकसित होते रहते हैं, BIG-bench Lite जैसे बेंचमार्क को प्रासंगिक बने रहने के लिए आवधिक अद्यतनों की आवश्यकता होगी। समुदाय ने गतिशील बेंचमार्क के लिए आह्वान किया है जो मॉडल सुधारों के अनुकूल हों, संभावित रूप से स्वचालित पीढ़ी या मानव-इन-द-लूप क्यूरेशन का उपयोग करें। तब तक, BIG-bench Lite Neural network अनुसंधान में प्रगति को मापने के लिए एक स्थिर पैमाने के रूप में कार्य करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·evaluation·large-language-models·reasoning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास