अंग्रेज़ी से अनुवादित

BBH 2024, बिग-बेंच हार्ड बेंचमार्क का एक अद्यतन संस्करण है, जिसे 2024 में बड़े भाषा मॉडलों का मूल्यांकन करने के लिए पेश किया गया था, जिसमें संशोधित प्रॉम्प्ट और स्कोरिंग के साथ चुनौतीपूर्ण तर्क कार्यों पर ध्यान केंद्रित किया गया है।

BBH 2024 बड़े भाषा मॉडलों (LLMs) का मूल्यांकन करने के लिए एक बेंचमार्क है, जो चुनौतीपूर्ण तर्क कार्यों के एक समूह पर आधारित है। यह BIG-Bench Hard (BBH) बेंचमार्क का एक और अद्यतन संस्करण है, जो स्वयं बड़े BIG-Bench सूट का एक चयनित उपसमुच्चय था। BBH 2024 को 2024 में मूल BBH की सीमाओं को संबोधित करने के लिए जारी किया गया था, विशेष रूप से नए मॉडलों द्वारा प्रदर्शन की संतृप्ति और अधिक मजबूत मूल्यांकन प्रोटोकॉल की आवश्यकता।

बेंचमार्क में BIG-Bench से चयनित 23 कार्य शामिल हैं, जिन्हें भाषा मॉडलों के लिए विशेष रूप से कठिन पहचाना गया था। ये कार्य कई तर्क क्षमताओं को कवर करते हैं, जिनमें कारण निर्णय, तिथि समझ, अस्पष्टता समाधान और तार्किक निगमन शामिल हैं। BBH 2024 में संशोधित प्रॉम्प्ट, अद्यतन उत्तर प्रारूप और एक नई स्कोरिंग पद्धति शामिल है, जो आंशिक रूप से सही उत्तरों को मूल BBH की तुलना में अधिक सख्ती से दंडित करती है। अद्यतन बेंचमार्क का उद्देश्य AI अनुसंधान की सीमा पर मॉडल क्षमताओं का अधिक विश्वसनीय माप प्रदान करना है।

कार्य संरचना और चयन

BBH 2024 के 23 कार्य मूल BBH के समान हैं, लेकिन महत्वपूर्ण संशोधनों के साथ। उदाहरण के लिए, 'कारण निर्णय' कार्य में अब 100 अतिरिक्त प्रतितथ्यात्मक परिदृश्य शामिल हैं, और 'तिथि समझ' कार्य को कैलेंडर प्रारूपों की एक व्यापक श्रेणी को कवर करने के लिए विस्तारित किया गया है। 'तार्किक निगमन' कार्य में अब मॉडलों को केवल अंतिम उत्तर के बजाय तर्क चरणों का एक अनुक्रम आउटपुट करना आवश्यक है। ये परिवर्तन सरल पैटर्न मिलान की प्रभावशीलता को कम करने और वास्तविक तर्क को प्रोत्साहित करने के लिए किए गए थे।

प्रत्येक कार्य में मूल BBH की तरह 3 से 5 उदाहरणों के साथ एक फ्यू-शॉट प्रॉम्प्ट शामिल है। हालांकि, BBH 2024 अद्यतन उदाहरण प्रदान करता है जो अधिक हालिया भाषा उपयोग को दर्शाते हैं और सही उत्तरों के लिए स्पष्टीकरण शामिल करते हैं। बेंचमार्क एक 'चेन-ऑफ-थॉट' मूल्यांकन मोड भी पेश करता है, जहां मॉडलों को अंतिम उत्तर से पहले मध्यवर्ती तर्क चरण उत्पन्न करने के लिए प्रेरित किया जाता है, और एक 'प्रत्यक्ष' मोड जिसमें ऐसा प्रॉम्प्टिंग नहीं होता है।

स्कोरिंग और मूल्यांकन

BBH 2024 एक स्कोरिंग प्रणाली का उपयोग करता है जो ग्राउंड ट्रुथ उत्तर के साथ सटीक मिलान के लिए ही पूर्ण अंक देती है। आंशिक अंक उन उत्तरों के लिए दिए जाते हैं जिनमें सही अंतिम उत्तर शामिल होता है लेकिन अतिरिक्त पाठ भी होता है। बेंचमार्क कार्यों में औसत सटीकता और मानक विचलन दोनों की रिपोर्ट करता है। चेन-ऑफ-थॉट मोड के लिए, सटीकता तर्क चरणों के बाद अंतिम उत्तर पर गणना की जाती है, और एक अलग मीट्रिक, 'तर्क सुसंगतता', उत्पन्न चरणों की तार्किक स्थिरता का आकलन करने के लिए पेश किया जाता है।

मूल BBH में, GPT-3 जैसे मॉडलों ने कार्यों पर लगभग 40% की औसत सटीकता हासिल की थी। 2024 तक, GPT-4 और Claude 3 जैसे अत्याधुनिक मॉडलों ने मूल BBH पर 80% से अधिक पार कर लिया था, जिससे एक अधिक चुनौतीपूर्ण संस्करण की आवश्यकता उत्पन्न हुई। BBH 2024 में एक नया 'हार्ड मोड' शामिल है जहां प्रॉम्प्ट को प्रतिकूल रूप से परेशान किया जाता है, और बेंचमार्क मानक और हार्ड दोनों मोड के लिए परिणाम रिपोर्ट करता है।

मॉडल प्रदर्शन और संतृप्ति

मध्य 2024 में जारी BBH 2024 पर प्रारंभिक परिणाम दिखाते हैं कि सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल, जिनमें GPT-4 Turbo और Claude 3 Opus शामिल हैं, मानक मोड पर लगभग 70% औसत सटीकता और हार्ड मोड पर लगभग 50% प्राप्त करते हैं। यह मूल BBH पर उनकी लगभग संतृप्ति से एक महत्वपूर्ण गिरावट है, जो दर्शाता है कि अद्यतन बेंचमार्क एक अधिक विभेदक मूल्यांकन प्रदान करता है। बेंचमार्क को कई AI अनुसंधान प्रयोगशालाओं द्वारा अपनाया गया है, जिनमें OpenAI, Anthropic और Google DeepMind शामिल हैं, उनके मॉडलों के लिए एक मानक मूल्यांकन उपकरण के रूप में।

BBH 2024 में एक 'मानव आधार रेखा' अध्ययन भी शामिल है, जहां क्राउडसोर्सिंग प्लेटफॉर्म के माध्यम से 100 मानव प्रतिभागियों को भर्ती किया गया था। मानक मोड पर मानव आधार रेखा सटीकता 85% है, और हार्ड मोड पर 75% है, जो दर्शाता है कि बेंचमार्क में अभी भी AI प्रणालियों में सुधार की गुंजाइश है।

अन्य बेंचमार्क से संबंध

BBH 2024 AI बेंचमार्क के व्यापक पारिस्थितिकी तंत्र का हिस्सा है। यह MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) और HellaSwag जैसे अन्य सूटों का पूरक है, लेकिन विशेष रूप से उन कार्यों पर केंद्रित है जिनके लिए बहु-चरणीय तर्क की आवश्यकता होती है। MMLU के विपरीत, जो ज्ञान डोमेन की एक विस्तृत श्रृंखला को कवर करता है, BBH 2024 उन कार्यों पर जोर देता है जो मनुष्यों के लिए आसान लेकिन AI के लिए कठिन हैं, जैसा कि मूल रूप से BIG-Bench द्वारा परिभाषित किया गया था। अद्यतन संस्करण इस दर्शन को बनाए रखता है जबकि मूल्यांकन की कठिनाई और मजबूती को बढ़ाता है।

बेंचमार्क GitHub पर सार्वजनिक रूप से उपलब्ध है, और लेखक विभिन्न मॉडलों के परिणामों के साथ एक लीडरबोर्ड प्रदान करते हैं। लीडरबोर्ड नियमित रूप से अद्यतन किया जाता है, और देर 2024 तक, शीर्ष प्रविष्टि Google DeepMind का एक मॉडल है जिसकी मानक मोड पर औसत सटीकता 72.3% है।

भविष्य की दिशाएं

BBH 2024 के निर्माताओं ने संकेत दिया है कि वे मॉडल सुधारों के साथ तालमेल रखने के लिए वार्षिक अद्यतन जारी करने की योजना बना रहे हैं। वे बहु-मोडल तर्क की आवश्यकता वाले कार्यों को शामिल करने की भी खोज कर रहे हैं, जैसे चार्ट और आरेखों की व्याख्या। बेंचमार्क से आने वाले समय में बड़े भाषा मॉडलों में तर्क क्षमताओं का मूल्यांकन करने के लिए एक प्रमुख संदर्भ बिंदु बने रहने की उम्मीद है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·large-language-models·reasoning·evaluation
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास