अंग्रेज़ी से अनुवादित

BIG-bench 2023, बियॉन्ड द इमिटेशन गेम बेंचमार्क का एक अद्यतन संस्करण है, जो मानक परीक्षणों से परे क्षमताओं पर बड़े भाषा मॉडलों का मूल्यांकन करने के लिए 204+ कार्यों का एक सहयोगी सेट है। यह नए कार्य, परिष्कृत मेट्रिक्स, और व्यापक मॉडल कवरेज जोड़ता है, ताकि AI तर्क, ज्ञान, और सामाजिक पूर्वाग्रह में प्रगति को ट्रैक किया जा सके।

BIG-bench 2023, Beyond the Imitation Game बेंचमार्क का संशोधित संस्करण है, जो 2021 में शुरू किया गया एक सहयोगात्मक प्रयास है, जिसका उद्देश्य बड़े भाषा मॉडलों की क्षमताओं और सीमाओं का मूल्यांकन करना है। मूल BIG-bench में 130 संस्थानों के 450 से अधिक शोधकर्ताओं द्वारा योगदान किए गए 204 कार्य शामिल थे, जो उन कौशलों की जांच करने के लिए डिज़ाइन किए गए थे जिन्हें मानक बेंचमार्क अक्सर अनदेखा कर देते हैं, जैसे कारण तर्क, सामान्य ज्ञान, और गणितीय समस्या-समाधान। 2023 का अपडेट, जो 2023 की शुरुआत में जारी किया गया था, इस आधार पर नए कार्यों को जोड़कर, मूल्यांकन मेट्रिक्स को परिष्कृत करके, और परीक्षण किए गए मॉडलों की सूची का विस्तार करके, विशेष रूप से जनरेटिव AI प्रणालियों के तेजी से विकसित होते परिदृश्य पर ध्यान केंद्रित करता है।

बेंचमार्क का प्राथमिक उद्देश्य कृत्रिम बुद्धिमत्ता, विशेष रूप से बड़े भाषा मॉडलों में प्रगति को मापने के लिए एक कठोर, मानकीकृत पैमाना प्रदान करना है। पहले के बेंचमार्क के विपरीत, जो प्रश्न उत्तर या भावना विश्लेषण जैसे संकीर्ण कार्यों पर केंद्रित थे, BIG-bench 2023 में ऐसे कार्य शामिल हैं जिनके लिए बहु-चरणीय तर्क, विश्व ज्ञान, और यहां तक कि रचनात्मक लेखन की आवश्यकता होती है। यह मॉडल अंशांकन (कैलिब्रेशन) को मापने पर भी जोर देता है (कितनी अच्छी तरह आत्मविश्वास सटीकता से मेल खाता है) और प्रतिकूल इनपुट के प्रति मजबूती। 2023 संस्करण ने "BIG-bench Hard" (BBH) के रूप में नामित कार्यों का एक उपसमूह पेश किया, जो 23 कार्य हैं जहां पिछले मॉडलों ने औसत मानव मूल्यांकनकर्ताओं के स्तर पर या उससे नीचे प्रदर्शन किया, जो भविष्य के विकास के लिए एक चुनौतीपूर्ण बाधा के रूप में कार्य करता है।

संरचना और कार्य श्रेणियाँ

BIG-bench 2023 अपने कार्यों को कई व्यापक श्रेणियों में व्यवस्थित करता है, जिनमें से प्रत्येक मॉडल क्षमता के विभिन्न पहलुओं को लक्षित करता है। इनमें शामिल हैं:

  • तर्क: तार्किक निगमन, कारण अनुमान, और बहु-चरणीय अंकगणित से जुड़े कार्य। उदाहरणों में "causal_judgement" और "logical_deduction" (तीन से पांच वस्तुओं के साथ) शामिल हैं।
  • ज्ञान: तथ्यात्मक विश्व ज्ञान की जांच करने वाले प्रश्न, जैसे "periodic_elements" या "international_phonetic_alphabet_transliterate"।
  • सामाजिक पूर्वाग्रह और निष्पक्षता: "bbq_lite" और "gender_bias" जैसे कार्य जो आकलन करते हैं कि क्या मॉडल हानिकारक रूढ़ियों को प्रदर्शित करते हैं।
  • भाषा समझ: शब्दार्थ, वाक्य रचना, और व्यावहारिकता पर कार्य, जैसे "linguistics_puzzles" और "novel_concepts"।
  • गणित: प्रतीकात्मक हेरफेर और अंकगणित की आवश्यकता वाली समस्याएं, जिनमें "mathematical_induction" और "number_sequence" शामिल हैं।
  • सामान्य ज्ञान: "physical_intuition" और "social_support" जैसे कार्य जो रोजमर्रा के तर्क का परीक्षण करते हैं।

प्रत्येक कार्य में एक प्रॉम्प्ट, संभावित उत्तरों का एक सेट, और एक स्कोरिंग मेट्रिक (आमतौर पर सटीक मिलान या बहुविकल्पीय सटीकता) शामिल होता है। 2023 अपडेट ने कोड जनरेशन और बहुभाषी समझ जैसे क्षेत्रों में कई नए कार्य जोड़े, जो वास्तविक दुनिया के अनुप्रयोगों में इन कौशलों के बढ़ते महत्व को दर्शाता है।

मूल्यांकन पद्धति और मेट्रिक्स

BIG-bench 2023 मॉडलों में तुलना सुनिश्चित करने के लिए एक मानकीकृत मूल्यांकन प्रोटोकॉल का उपयोग करता है। मॉडलों को प्रत्येक कार्य के इनपुट के साथ प्रॉम्प्ट किया जाता है, और उनके आउटपुट को कार्य-विशिष्ट मेट्रिक्स का उपयोग करके स्कोर किया जाता है। प्राथमिक समग्र मेट्रिक सभी कार्यों में औसत सामान्यीकृत सटीकता है, जहां प्रत्येक कार्य का स्कोर सामान्यीकृत होता है ताकि यादृच्छिक अनुमान 0 दे और पूर्ण प्रदर्शन 1 दे। यह एक एकल संख्या की अनुमति देता है जो समग्र क्षमता का सारांश प्रस्तुत करती है।

2023 संस्करण ने "लक्षित" मूल्यांकन भी पेश किए, जहां मॉडलों का परीक्षण कार्यों के उपसमूहों पर किया जाता है जो विशेष रूप से कठिन या विशिष्ट क्षमताओं के लिए प्रासंगिक होते हैं। उदाहरण के लिए, BBH उपसमूह का उपयोग उन कार्यों पर प्रगति को ट्रैक करने के लिए किया जाता है जो पहले अनसुलझे थे। इसके अतिरिक्त, बेंचमार्क में "फ्यू-शॉट" सेटिंग्स (आमतौर पर 0-शॉट, 1-शॉट, और 5-शॉट) शामिल हैं ताकि संदर्भ-में-सीखने की क्षमता को मापा जा सके, और यह अंशांकन त्रुटि की रिपोर्ट करता है, जो इंगित करता है कि मॉडल की अनुमानित संभावनाएं वास्तविक शुद्धता के साथ कितनी अच्छी तरह संरेखित होती हैं।

मॉडल कवरेज और परिणाम

BIG-bench 2023 में विभिन्न प्रकार के मॉडलों के परिणाम शामिल हैं, जिनमें Google DeepMind और Anthropic जैसे ओपन-सोर्स प्रयासों से लेकर OpenAI और अन्य के मालिकाना सिस्टम शामिल हैं। बेंचमार्क का उपयोग विभिन्न आकारों के मॉडलों का मूल्यांकन करने के लिए किया गया है, जिसमें लाखों मापदंडों वाले छोटे ट्रांसफॉर्मर से लेकर सैकड़ों अरबों वाले बड़े भाषा मॉडल शामिल हैं। उल्लेखनीय निष्कर्षों में यह शामिल है कि प्रदर्शन आम तौर पर मॉडल पैमाने के साथ बेहतर होता है, लेकिन कुछ कार्य सबसे बड़े मॉडलों के लिए भी चुनौतीपूर्ण बने रहते हैं, जैसे कि गहन तार्किक तर्क या दुर्लभ तथ्यात्मक ज्ञान की आवश्यकता वाले।

उदाहरण के लिए, BBH उपसमूह पर, 2023 में कई मॉडलों ने अभी भी 50% से नीचे सामान्यीकृत सटीकता स्कोर किया, जो सुधार के लिए महत्वपूर्ण गुंजाइश दर्शाता है। बेंचमार्क ने यह भी उजागर किया कि मॉडल अक्सर अति-आत्मविश्वास प्रदर्शित करते हैं, कठिन कार्यों पर अंशांकन त्रुटियां अधिक होती हैं। इन परिणामों ने Reinforcement Learning from AI Feedback (RLAIF) (एआई फीडबैक से सुदृढीकरण सीखना) और बेहतर प्रशिक्षण डेटा क्यूरेशन जैसी तकनीकों में अनुसंधान को सूचित किया है।

प्रभाव और स्वागत

2023 अपडेट को एआई अनुसंधान समुदाय द्वारा एक मानक मूल्यांकन सूट के रूप में व्यापक रूप से अपनाया गया है। इसे सैकड़ों पेपरों में उद्धृत किया गया है और प्रमुख प्रयोगशालाओं द्वारा अपने मॉडलों की तुलना करने के लिए उपयोग किया गया है। BIG-bench की सहयोगात्मक प्रकृति, जिसमें MIT CSAIL, Stanford AI Lab, और BAIR (Berkeley AI Research) जैसी संस्थाओं का योगदान है, ने खुले बेंचमार्किंग की संस्कृति को बढ़ावा दिया है। आलोचकों ने नोट किया है कि बेंचमार्क के कार्य स्थिर हैं और समय के साथ संतृप्त हो सकते हैं, लेकिन 2023 संस्करण में नए कार्यों और BBH उपसमूह का समावेश इस चिंता को कम करता है।

BIG-bench 2023 ने HELM और MMLU जैसे समान बेंचमार्क के विकास को भी प्रभावित किया है, और बड़े भाषा मॉडलों में उभरती क्षमताओं का अध्ययन करने के लिए उपयोग किया गया है। इसके परिणाम GPT-4 और Claude (AI model family) जैसी प्रणालियों की क्षमताओं और सीमाओं को समझने में सहायक रहे हैं, और यह कृत्रिम बुद्धिमत्ता में प्रगति को मापने के लिए एक संदर्भ बिंदु के रूप में कार्य करना जारी रखता है।

भविष्य की दिशाएँ

2023 तक, BIG-bench टीम ने आगे के अपडेट की योजनाओं की घोषणा की है, जिसमें गतिशील कार्य जनरेशन और अधिक इंटरैक्टिव मूल्यांकन प्रारूप शामिल हैं। लक्ष्य बेंचमार्क को प्रासंगिक रखना है क्योंकि मॉडल विकसित होते हैं, संभावित रूप से ऐसे कार्यों को शामिल करना जिनके लिए टूल उपयोग या बहु-मोड़ संवाद की आवश्यकता होती है। 2023 संस्करण उस समय एआई क्षमताओं का एक स्नैपशॉट बना हुआ है, लेकिन इसकी पद्धति और अंतर्दृष्टि संभवतः आने वाले वर्षों में भविष्य के बेंचमार्किंग प्रयासों को प्रभावित करेगी।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·evaluation·large-language-models·ai-research
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास