अंग्रेज़ी से अनुवादित

BBH 2025, BIG-Bench Hard का नवीनतम संस्करण है, जो 23 चुनौतीपूर्ण कार्यों का एक बेंचमार्क समूह है, जो मानक क्षमताओं से परे तर्क करने के लिए बड़े भाषा मॉडलों का मूल्यांकन करता है। यह 2022 के मूल सेट को संशोधित प्रॉम्प्ट और स्कोरिंग के साथ अद्यतन करता है।

BBH 2025, BIG-Bench Hard (BBH) का नवीनतम संस्करण है, जो एक बेंचमार्क सूट है जिसे बड़े भाषा मॉडल (LLMs) की तर्क क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो उन कार्यों पर केंद्रित है जो मॉडलों के लिए कठिन हैं लेकिन मनुष्यों के लिए अपेक्षाकृत आसान हैं। मूल रूप से 2022 में व्यापक BIG-Bench प्रयास के एक उपसमुच्चय के रूप में पेश किया गया, BBH में 23 कार्य शामिल हैं जिन्हें इसलिए चुना गया क्योंकि मानक भाषा मॉडल ने औसत मानव मूल्यांकनकर्ताओं के स्तर पर या उससे नीचे प्रदर्शन किया। 2025 संस्करण मूल बेंचमार्क को अद्यतन निर्देशों, उत्तर प्रारूपों और मूल्यांकन प्रक्रियाओं के साथ परिष्कृत करता है ताकि बड़े भाषा मॉडल की वर्तमान स्थिति को बेहतर ढंग से प्रतिबिंबित किया जा सके और स्कोरिंग में संभावित पूर्वाग्रहों को कम किया जा सके।

बेंचमार्क उन कार्यों पर केंद्रित है जिनके लिए बहु-चरणीय तर्क, सामान्य ज्ञान समझ और प्रतीकात्मक हेरफेर की आवश्यकता होती है, न कि सरल तथ्यात्मक स्मरण की। उदाहरणों में "नेविगेट" (स्थानिक निर्देशों का पालन करना), "शब्द छंटाई" (किसी दिए गए मानदंड के अनुसार शब्दों को छांटना), और "कारण निर्णय" (कारण-प्रभाव संबंधों की पहचान करना) जैसे कार्य शामिल हैं। BBH 2025 मूल के समान मुख्य कार्य सेट को बनाए रखता है लेकिन स्पष्ट संकेत और अधिक मजबूत स्कोरिंग विधियों का परिचय देता है, जिससे यह विभिन्न आर्किटेक्चर और प्रशिक्षण व्यवस्थाओं में मॉडल प्रदर्शन की तुलना करने के लिए एक अधिक विश्वसनीय उपकरण बन जाता है।

उद्देश्य और डिज़ाइन

BBH 2025 को वर्तमान AI प्रणालियों की सीमाओं का परीक्षण करने के लिए डिज़ाइन किया गया है, विशेष रूप से ट्रांसफॉर्मर और आधुनिक LLMs में उपयोग किए जाने वाले अन्य तंत्रिका नेटवर्क आर्किटेक्चर। कार्यों को जानबूझकर सरल पैटर्न मिलान की पहुंच से परे चुना गया है, जिसके लिए मॉडलों को तार्किक निगमन, अंकगणितीय संचालन और नए संदर्भों में भाषा समझ करने की आवश्यकता होती है। बेंचमार्क की कठिनाई सुनिश्चित करती है कि अत्याधुनिक मॉडल भी मापने योग्य अंतराल दिखाते हैं, जो नए प्रशिक्षण तकनीकों या मॉडल आर्किटेक्चर विकसित करने वाले शोधकर्ताओं के लिए एक उपयोगी संकेत प्रदान करता है।

मूल BIG-Bench परियोजना, जिसमें सैकड़ों कार्य शामिल थे, कई संस्थानों के शोधकर्ताओं से जुड़ा एक सहयोगात्मक प्रयास था। BBH को उन कार्यों का चयन करके बनाया गया था जहां मानव प्रदर्शन उस समय के सर्वश्रेष्ठ मॉडलों से अधिक था, यह सुनिश्चित करते हुए कि बेंचमार्क कई वर्षों तक चुनौतीपूर्ण बना रहे। 2025 अद्यतन शोध समुदाय से प्रतिक्रिया को दर्शाता है और GPT-4 और Claude जैसे मॉडलों के मूल्यांकन से सीखे गए पाठों को शामिल करता है, जो 2022 के बाद से काफी सुधार हुए हैं।

मूल्यांकन पद्धति

BBH 2025 एक मानकीकृत मूल्यांकन प्रोटोकॉल का उपयोग करता है। प्रत्येक कार्य में बहुविकल्पीय या मुक्त-रूप प्रश्नों का एक सेट शामिल होता है, और मॉडलों को सटीक मिलान या तर्क चरणों के लिए आंशिक क्रेडिट के आधार पर स्कोर किया जाता है। 2025 संस्करण प्रत्येक कार्य के लिए अधिक विस्तृत निर्देश प्रस्तुत करता है, जिससे अस्पष्टता कम होती है जो झूठी विफलताओं का कारण बन सकती है। इसके अतिरिक्त, स्कोरिंग अब मॉडल आत्मविश्वास को ध्यान में रखती है और प्रति-कार्य विवरण प्रदान करती है, जिससे शोधकर्ताओं को विशिष्ट शक्तियों और कमजोरियों की पहचान करने की अनुमति मिलती है।

निष्पक्षता सुनिश्चित करने के लिए, बेंचमार्क को मॉडल-अज्ञेयवादी बनाया गया है, जिसका अर्थ है कि यह किसी विशेष आर्किटेक्चर या प्रशिक्षण दृष्टिकोण का पक्ष नहीं लेता है। इसका उपयोग प्रमुख डेवलपर्स के मॉडलों का मूल्यांकन करने के लिए किया गया है, जिनमें OpenAI, Anthropic, और Google DeepMind शामिल हैं, साथ ही ओपन-सोर्स मॉडल भी। BBH 2025 के परिणाम अक्सर MMLU और GSM8K जैसे अन्य बेंचमार्क के साथ रिपोर्ट किए जाते हैं ताकि मॉडल क्षमताओं का एक व्यापक दृश्य प्रदान किया जा सके।

अन्य बेंचमार्क से संबंध

BBH 2025 कृत्रिम बुद्धिमत्ता के क्षेत्र में अन्य मूल्यांकन सूटों का पूरक है। जबकि MMLU जैसे बेंचमार्क कई विषयों में व्यापक ज्ञान पर केंद्रित हैं, BBH बाधाओं के तहत तर्क और समस्या-समाधान पर जोर देता है। यह बड़े मॉडलों की "उभरती क्षमताओं" का आकलन करने के लिए विशेष रूप से उपयोगी है, जहां जटिल कार्यों पर प्रदर्शन पैमाने के साथ असमान रूप से सुधरता है। बेंचमार्क चेन-ऑफ-थॉट प्रॉम्प्टिंग और AI प्रतिक्रिया से सुदृढीकरण सीखना जैसी तकनीकों के लिए एक तनाव परीक्षण के रूप में भी कार्य करता है, जो तर्क को बढ़ाने के लिए डिज़ाइन की गई हैं।

पहले के संस्करणों की तुलना में, BBH 2025 में अद्यतन उत्तर कुंजियाँ शामिल हैं और किनारे के मामलों को स्पष्ट करता है, जिससे मॉडलों द्वारा मूल्यांकन में हेरफेर करने का जोखिम कम होता है। यह एक सार्वजनिक लीडरबोर्ड भी प्रदान करता है जहां डेवलपर्स परिणाम प्रस्तुत कर सकते हैं, पारदर्शिता और प्रतिस्पर्धा को बढ़ावा देते हैं। यह इसे शैक्षणिक अनुसंधान और उद्योग विकास के लिए एक मानक संदर्भ बिंदु बनाता है, जैसे ImageNet ने कंप्यूटर विज़न के लिए कार्य किया।

सीमाएँ और आलोचनाएँ

अपनी उपयोगिता के बावजूद, BBH 2025 की सीमाएँ हैं। कुछ आलोचकों का तर्क है कि कार्य, चुनौतीपूर्ण होते हुए भी, वास्तविक दुनिया के तर्क को पूरी तरह से पकड़ नहीं सकते हैं, जिसमें अक्सर खुले-अंत वाले प्रश्न और अपूर्ण जानकारी शामिल होती है। बेंचमार्क का बहुविकल्पीय प्रारूप उन मॉडलों द्वारा भी हेरफेर किया जा सकता है जो उत्तर विकल्पों में सांख्यिकीय नियमितताओं का शोषण करते हैं। इसके अतिरिक्त, जैसे-जैसे मॉडल सुधरते हैं, बेंचमार्क संतृप्त हो सकता है, जिसके लिए आवधिक अद्यतन या नए कार्यों के निर्माण की आवश्यकता होती है।

एक और चिंता यह है कि BBH 2025, कई बेंचमार्क की तरह, अनजाने में अपने निर्माण में पूर्वाग्रहों को प्रतिबिंबित कर सकता है, जैसे भाषा कार्यों में सांस्कृतिक धारणाएँ। शोधकर्ताओं ने अधिक विविध कार्य सेटों और मॉडल स्कोरों को संदर्भित करने के लिए मानव प्रदर्शन आधार रेखाओं को शामिल करने का आह्वान किया है। 2025 अद्यतन अधिक विस्तृत कार्य विवरण प्रदान करके और मानव मूल्यांकन को प्रोत्साहित करके इनमें से कुछ मुद्दों को संबोधित करने का प्रयास करता है, लेकिन ये प्रयास जारी हैं।

भविष्य की दिशाएँ

BBH 2025 का विकास AI में अधिक कठोर और गतिशील मूल्यांकन की ओर एक व्यापक प्रवृत्ति का हिस्सा है। भविष्य के संस्करण अनुकूली परीक्षण को शामिल कर सकते हैं, जहां मॉडल प्रदर्शन के आधार पर कार्य उत्पन्न होते हैं, या बाहरी उपकरणों के साथ बातचीत की आवश्यकता वाले कार्य शामिल हो सकते हैं। बेंचमार्क के अनुरक्षकों ने जनरेटिव AI प्रणालियों की बढ़ती क्षमताओं को दर्शाते हुए, पाठ और छवियों दोनों को शामिल करने वाले मल्टीमॉडल कार्यों तक कवरेज का विस्तार करने में भी रुचि व्यक्त की है।

जैसे-जैसे मशीन लर्निंग आगे बढ़ता रहता है, BBH 2025 जैसे बेंचमार्क को प्रासंगिक बने रहने के लिए विकसित होने की आवश्यकता होगी। 2025 संस्करण यह सुनिश्चित करने में एक कदम आगे का प्रतिनिधित्व करता है कि मूल्यांकन चुनौतीपूर्ण और निष्पक्ष दोनों हों, जो अधिक सामान्य कृत्रिम बुद्धिमत्ता की ओर प्रगति को मापने के लिए एक आधार प्रदान करता है। शोधकर्ताओं और डेवलपर्स को BBH 2025 को एक मानक उपकरण के रूप में उपयोग करने के लिए प्रोत्साहित किया जाता है, साथ ही सामुदायिक प्रतिक्रिया और नए कार्य प्रस्तावों के माध्यम से इसके सुधार में योगदान करने के लिए भी।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·evaluation·reasoning·large-language-models
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास