अंग्रेज़ी से अनुवादित

बीआईजी-बेंच हार्ड (BBH) बीआईजी-बेंच बेंचमार्क का 23 कठिन कार्यों का एक उपसमूह है, जिसे बड़े भाषा मॉडलों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, विशेष रूप से उन तर्क कार्यों पर जहां मानक मॉडल कम प्रदर्शन करते हैं। यह बहु-चरणीय तर्क, अंकगणित और सामान्य ज्ञान की आवश्यकता वाले कार्यों पर केंद्रित है।

BIG-Bench Hard (BBH) बड़े BIG-Bench बेंचमार्क से 23 कार्यों का एक चयनित उपसमुच्चय है, जिसे 2022 में Google और अन्य संस्थानों के शोधकर्ताओं द्वारा पेश किया गया था। यह उपसमुच्चय उन कार्यों पर ध्यान केंद्रित करने के लिए बनाया गया था जो बड़े भाषा मॉडल के लिए विशेष रूप से चुनौतीपूर्ण हैं, विशेष रूप से वे जहां 12 बिलियन से कम पैरामीटर वाले मॉडल खराब प्रदर्शन करते हैं। BBH को एक मॉडल की जटिल तर्क, बहु-चरणीय समस्या-समाधान, और सरल पैटर्न मिलान से परे गहरी समझ की आवश्यकता वाले कार्यों को संभालने की क्षमता को मापने के लिए डिज़ाइन किया गया है।

यह बेंचमार्क व्यापक BIG-Bench प्रयास से उभरा, जिसमें 130 संस्थानों में 450 से अधिक शोधकर्ताओं द्वारा योगदान किए गए 200 से अधिक कार्य शामिल थे। BBH के लिए चयन प्रक्रिया में उन कार्यों की पहचान करना शामिल था जहां छोटे और बड़े मॉडल के बीच प्रदर्शन का अंतर महत्वपूर्ण था, और जहां मानव मूल्यांकनकर्ताओं ने कार्यों को पर्याप्त तर्क की आवश्यकता के रूप में दर्जा दिया था। अंतिम 23 कार्यों के सेट में बूलियन अभिव्यक्ति, कारण निर्णय, तिथि समझ, असंदिग्धीकरण, और ज्यामितीय आकृतियों जैसे क्षेत्रों में समस्याएं शामिल हैं।

कार्य चयन और विशेषताएँ

BBH में 23 कार्यों को दो प्राथमिक मानदंडों के आधार पर चुना गया था: उन्हें ऐसे कार्य होने थे जहां उस समय के सर्वश्रेष्ठ उपलब्ध मॉडलों ने एक निश्चित सीमा से नीचे स्कोर किया (विशेष रूप से, औसत मानव मूल्यांकनकर्ता प्रदर्शन से नीचे), और उन्हें ऐसे कार्य होने थे जो सरल अनुमानों द्वारा आसानी से हल नहीं हो सकते थे। इस चयन प्रक्रिया के परिणामस्वरूप एक ऐसा बेंचमार्क बना जो पूर्ण BIG-Bench सूट की तुलना में काफी अधिक कठिन है, जिसमें अकेले BBH पर मूल्यांकन करने पर औसत मॉडल प्रदर्शन में काफी गिरावट आती है।

BBH में प्रत्येक कार्य एक विशिष्ट संज्ञानात्मक कौशल का परीक्षण करने के लिए डिज़ाइन किया गया है। उदाहरण के लिए, 'बूलियन अभिव्यक्ति' कार्य के लिए जटिल तार्किक कथनों का मूल्यांकन करना आवश्यक है, जबकि 'कारण निर्णय' मॉडल से काल्पनिक परिदृश्यों में कारण-और-प्रभाव संबंधों को निर्धारित करने के लिए कहता है। अन्य कार्यों में 'हाइपरबेटन' (व्याकरणिक रूप से सही वाक्यों की पहचान), 'तार्किक निगमन' (बहु-चरणीय तर्क पहेली को हल करना), और 'शब्द छँटाई' (बाधाओं के तहत शब्दों को वर्णानुक्रम में व्यवस्थित करना) शामिल हैं।

मूल्यांकन पद्धति

BBH का मूल्यांकन आमतौर पर कुछ-शॉट प्रॉम्प्टिंग दृष्टिकोण का उपयोग करके किया जाता है, जहां मॉडल को नई समस्याओं को हल करने के लिए कहने से पहले कुछ उदाहरण (आमतौर पर तीन से पांच) दिए जाते हैं। बेंचमार्क में विशिष्ट प्रॉम्प्ट और मूल्यांकन स्क्रिप्ट शामिल हैं जो परीक्षण प्रक्रिया को मानकीकृत करते हैं। मूल पेपर में, लेखकों ने Google और OpenAI सहित कई बड़े भाषा मॉडलों का मूल्यांकन किया और पाया कि सबसे बड़े मॉडल भी कई कार्यों में संघर्ष करते हैं।

एक उल्लेखनीय खोज यह थी कि चेन-ऑफ-थॉट प्रॉम्प्टिंग का उपयोग करना, जहां मॉडल को अपने तर्क चरणों को दिखाने के लिए प्रोत्साहित किया जाता है, ने BBH कार्यों पर प्रदर्शन में काफी सुधार किया। यह तकनीक, जो BBH के साथ-साथ विकसित की गई थी, ने मॉडल को जटिल समस्याओं को छोटे, अधिक प्रबंधनीय चरणों में तोड़ने की अनुमति दी। BBH और चेन-ऑफ-थॉट प्रॉम्प्टिंग का संयोजन बाद के मॉडलों में तर्क क्षमताओं का आकलन करने के लिए एक मानक मूल्यांकन विधि बन गया।

प्रभाव और उपयोग

BBH Large language model अनुसंधान समुदाय में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बन गया है। नए मॉडल या प्रशिक्षण तकनीकों को पेश करने वाले पेपरों में अक्सर इसका उल्लेख किया जाता है, जो सरल भाषा समझ से परे मॉडल की तर्क क्षमताओं के माप के रूप में कार्य करता है। यह बेंचमार्क मॉडल विकास में प्रगति को ट्रैक करने के लिए विशेष रूप से उपयोगी रहा है, क्योंकि BBH स्कोर में सुधार अक्सर अन्य तर्क-भारी कार्यों में सुधार के साथ सहसंबंधित होते हैं।

कई प्रमुख AI अनुसंधान संगठनों, जिनमें OpenAI और Google DeepMind शामिल हैं, ने अपने आंतरिक मूल्यांकन सुइट्स के हिस्से के रूप में BBH का उपयोग किया है। बेंचमार्क को व्यापक मूल्यांकन ढांचे, जैसे कि HELM (होलिस्टिक इवैल्यूएशन ऑफ लैंग्वेज मॉडल्स) परियोजना में भी शामिल किया गया है, जो मॉडल क्षमताओं का व्यापक दृश्य प्रदान करने के लिए कई बेंचमार्क को एकत्रित करता है। 2025 तक, BBH विभिन्न मॉडल आर्किटेक्चर और आकारों में तर्क प्रदर्शन की तुलना करने के लिए एक मानक संदर्भ बिंदु बना हुआ है।

सीमाएँ और आलोचनाएँ

अपनी लोकप्रियता के बावजूद, BBH को कुछ आलोचनाओं का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि बेंचमार्क वास्तविक दुनिया के तर्क को पूरी तरह से पकड़ नहीं सकता है, क्योंकि कार्य अक्सर अमूर्त और व्यावहारिक अनुप्रयोगों से अलग होते हैं। दूसरों ने ध्यान दिया है कि मॉडल कभी-कभी प्रशिक्षण डेटा से पैटर्न को याद करके बेंचमार्क को 'गेम' कर सकते हैं, हालांकि BBH के लेखकों ने उन कार्यों का उपयोग करके इसे कम करने के लिए कदम उठाए जो ऑनलाइन व्यापक रूप से उपलब्ध नहीं थे।

इसके अतिरिक्त, बेंचमार्क का अंग्रेजी-भाषा कार्यों पर ध्यान केंद्रित करना बहुभाषी मॉडलों पर इसकी प्रयोज्यता को सीमित करता है। जबकि मूल BIG-Bench में कुछ बहुभाषी कार्य शामिल थे, BBH विशेष रूप से अंग्रेजी में है, जो मुख्य रूप से अन्य भाषाओं में प्रशिक्षित मॉडल को नुकसान पहुंचा सकता है। इन सीमाओं के बावजूद, BBH वर्तमान AI प्रणालियों की क्षमताओं और सीमाओं को समझने के लिए एक मूल्यवान उपकरण बना हुआ है।

संबंधित बेंचमार्क और भविष्य की दिशाएँ

BBH के विकास ने MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) बेंचमार्क और ARC (AI2 रीजनिंग चैलेंज) जैसे समान प्रयासों को प्रेरित किया है। ये बेंचमार्क, BBH के साथ, परीक्षणों का एक सूट बनाते हैं जो सामूहिक रूप से एक मॉडल के ज्ञान, तर्क और समस्या-समाधान क्षमताओं का आकलन करते हैं। जैसे-जैसे मॉडल में सुधार जारी है, सर्वश्रेष्ठ प्रदर्शन करने वाली प्रणालियों के बीच अंतर करने के लिए और भी चुनौतीपूर्ण बेंचमार्क बनाने के लिए चल रहे काम हैं।

BBH के भविष्य के संस्करणों में अधिक गतिशील कार्य शामिल हो सकते हैं, जहां समस्याएं याद रखने को रोकने के लिए मौके पर उत्पन्न की जाती हैं। बहुविध तर्क को कवर करने के लिए BBH का विस्तार करने में भी रुचि है, जहां मॉडल को पाठ, छवियों और अन्य डेटा प्रकारों से जानकारी को एकीकृत करना होगा। ये विकास संभवतः BBH को प्रासंगिक बनाए रखेंगे क्योंकि Artificial intelligence का क्षेत्र विकसित हो रहा है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·reasoning·evaluation·large-language-models
इस पृष्ठ को अंतिम बार संपादित किया गया 8 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास