अंग्रेज़ी से अनुवादित

BIG-bench (Beyond the Imitation Game benchmark) एक सहयोगी बेंचमार्क है जो सैकड़ों विविध कार्यों में बड़े भाषा मॉडलों का मूल्यांकन करने के लिए है, जिसे 2021 में पेश किया गया था।

BIG-bench, जिसका पूर्ण रूप Beyond the Imitation Game benchmark है, एक सहयोगात्मक बेंचमार्क है जिसे बड़े भाषा मॉडलों की क्षमताओं और सीमाओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2021 में पेश किया गया, इसे 130 से अधिक संस्थानों के 450 से अधिक शोधकर्ताओं की एक अंतरराष्ट्रीय टीम ने बनाया था, ताकि सरल स्केलिंग मेट्रिक्स से परे मॉडल प्रदर्शन के अधिक व्यापक और चुनौतीपूर्ण परीक्षणों की आवश्यकता को संबोधित किया जा सके। यह बेंचमार्क विशेष रूप से Google Research द्वारा होस्ट किया गया था और इसमें OpenAI, Anthropic, Google DeepMind, और Stanford AI Lab सहित कई अन्य संगठनों के योगदान शामिल थे।

परियोजना का नाम एलन पर्लिस द्वारा लोकप्रिय "अनुकरण खेल" अवधारणा को संदर्भित करता है, लेकिन अधिक सीधे रूप से मशीन बुद्धिमत्ता के लिए एलन ट्यूरिंग के मूल प्रस्ताव से संबंधित है। बेंचमार्क का आधार यह है कि उस समय की कई मौजूदा मूल्यांकन विधियाँ केवल पाठ वर्गीकरण या प्रश्नोत्तर जैसे संकीर्ण कार्यों को मापती थीं, जबकि तर्क, गणितीय समस्या-समाधान और सामान्य ज्ञान समझ जैसी गहरी संज्ञानात्मक क्षमताओं की जाँच करने में विफल रहती थीं। BIG-bench को एक व्यापक, मानकीकृत परीक्षण मैदान प्रदान करने के लिए डिज़ाइन किया गया था जो ज्ञान और तर्क के कई क्षेत्रों में प्रगति को ट्रैक कर सके।

कार्य विविधता और डिज़ाइन

BIG-bench में 200 से अधिक व्यक्तिगत कार्य शामिल हैं, जिनमें से प्रत्येक को विभिन्न शोध समूहों द्वारा बनाया गया है। कार्य सरल अंकगणित और सूची क्रमबद्धता से लेकर कारणात्मक तर्क, कोड समझ और प्राकृतिक भाषा अनुमान जैसी अधिक जटिल समस्याओं तक होते हैं। विशेष रूप से, बेंचमार्क में ऐसे कार्य शामिल हैं जो मॉडल की सीमाओं को चुनौती देते हैं, जिनमें बहु-चरणीय तर्क, विशेष डोमेन का ज्ञान और तार्किक बाधाओं का पालन शामिल है। प्रत्येक कार्य एक मानक JSON प्रारूप का पालन करता है, जो स्कोरिंग के लिए आसान सबमिशन और प्रोसेसिंग सक्षम बनाता है।

बेंचमार्क को दो प्राथमिक उपसमुच्चयों में व्यवस्थित किया गया है: BIG-bench (पूर्ण सूट) और BIG-bench Lite, जो तेज़ मूल्यांकन के लिए 24 कार्यों का एक छोटा, कम्प्यूटेशनल रूप से सस्ता सेट है। यह डिज़ाइन व्यापक विश्लेषण और शोध समुदाय द्वारा व्यावहारिक अपनाने दोनों की अनुमति देता है। कार्य स्वयं एक few-shot सेटिंग लागू करते हैं, जहाँ मॉडल अतिरिक्त फाइन-ट्यूनिंग के बिना आदेशित उदाहरणों से भविष्यवाणियाँ उत्पन्न करते हैं, जिससे विभिन्न आर्किटेक्चर में सुसंगत तुलना सुनिश्चित होती है।

प्रमुख निष्कर्ष और विश्लेषण

बेंचमार्क परिणामों के प्रारंभिक विमोचन में, आयोजकों ने देखा कि समग्र मॉडल प्रदर्शन अक्सर सभी कार्यों में मॉडल पैमाने के साथ सहसंबद्ध नहीं था, और कुछ कार्यों ने वह दिखाया जिसे उन्होंने "उभरती क्षमताएँ" कहा - मॉडल का आकार एक निश्चित पैमाने से अधिक होने पर अचानक और महत्वपूर्ण प्रदर्शन लाभ। यह अंतर्दृष्टि विवादास्पद थी, और बाद में जोशुआ टेनेनबाम और अन्य द्वारा उभरती घटनाओं की प्रकृति के बारे में चर्चा की गई। अध्ययन ने यह भी उजागर किया कि प्राकृतिक भाषा समझ की आवश्यकता वाले कुछ कार्यों ने मॉडल आकार के साथ स्थिर स्केलिंग दिखाई, जबकि कुछ तार्किक या स्थानिक तर्क कार्यों ने परीक्षण किए गए सबसे बड़े मॉडलों के लिए भी चुनौतियाँ पेश कीं, जिनमें OpenAI के GPT-3 श्रृंखला के मॉडल शामिल थे।

बेंचमार्क पेपर, जिसे बाद में दूसरे संस्करण में संशोधित किया गया, में मानव प्रदर्शन आधार रेखाएँ शामिल थीं, जो दर्शाती हैं कि मॉडल अक्सर विश्व ज्ञान या सामान्य ज्ञान की आवश्यकता वाले कार्यों में पीछे रह जाते हैं और कभी-कभी अस्पष्ट तथ्यात्मक प्रश्नों या वाक्य-विन्यास-समृद्ध तर्क कार्यों में मनुष्यों से बेहतर प्रदर्शन करते हैं। विशेष रूप से, BIG-bench ने कम-डेटा या few-shot स्थिति में सटीकता मापने की अनुमति दी, जिससे यह जोखिम मूल्यांकन और मॉडल चयन के लिए एक मूल्यवान उपकरण बन गया।

प्रभाव और अपनाना

मशीन-लर्निंग समुदाय में BIG-bench का प्रभाव महत्वपूर्ण रहा है। इसने स्टैनफोर्ड से HELM फ्रेमवर्क और समुदाय के भीतर गहन जाँच के लिए उपयोग किए जाने वाले बड़े पैमाने के BIG-bench Hard या `BBH` जैसे समान मूल्यांकन सूट के निर्माण को प्रेरित किया। इसके विमोचन ने केवल कार्य-विशिष्ट प्रदर्शन नहीं, बल्कि नैतिक और मजबूती परीक्षण को प्रोत्साहित किया। 2022 में, Google के T5-शैली कार्य और OpenAI के निजी मॉडल अक्सर सूट का उपयोग करके सटीकता एक्सट्रपोलेशन का लक्ष्य रखते थे, और बेंचमार्क में सबमिशन अनुदैर्ध्य अध्ययन के लिए संग्रहीत किए गए हैं।

OpenAI, Google DeepMind और Anthropic ने प्रत्येक ने अपनी प्रकाशित मॉडल मूल्यांकन रिपोर्टों में से एक या अधिक में BIG-bench का उपयोग किया है। इसके जवाब में, बेंचमार्क के निर्माताओं ने इस बात पर भी जोर दिया कि विषम कार्यों का यह संग्रह शक्ति-नियम संबंधों को प्रकट कर सकता है: त्रुटि दरें कंप्यूट और मापदंडों की वृद्धि के साथ रैखिक गिरावट का पालन करती हैं, लेकिन लगातार अपवादों के बिना नहीं।

सीमाएँ और आलोचना

मेलानी मिशेल और ब्रेंडन लेक जैसे शोधकर्ताओं सहित आलोचकों ने तर्क दिया है कि BIG-bench के कार्य याद किए गए पैटर्न या सामान्य ज्ञान पर अत्यधिक निर्भर हो सकते हैं, जिसमें मानव बचपन में प्राप्त अनुभव की कमी होती है। परीक्षण में सरल प्राकृतिक भाषा व्याख्या अभी भी धोखा दी जा सकती है, और तार्किक असंगति की अनिश्चित घटनाएँ होती हैं। बेंचमार्क की प्रति-कार्य परीक्षण उदाहरणों की कम औसत संख्या (अक्सर 1000 से कम) के लिए भी आलोचना की गई, जो सांख्यिकीय शक्ति को सीमित करती है।

एक और सीमा अंग्रेजी-केंद्रित कार्यों से उत्पन्न होती है, बहुराष्ट्रीय योगदानकर्ताओं के काम के बावजूद क्रॉस-भाषाई कवरेज के साथ बहुत कम। जबकि BIG-bench Lite कम्प्यूटेशन को कम करता है, कार्य लंबी-पूंछ वाले बने रहते हैं। 2023 में, `BIG-bench Hard` (या BBH) नामक एक अनुवर्ती परियोजना पेश की गई थी जिसने GPT-4 और Claude जैसे अधिक हाल के मॉडलों की सीमाओं का परीक्षण करने के लिए कार्य जोड़े, हालाँकि मूल सबमिशन के बाहर।

विरासत

BIG-bench उन पहले लोगों में से था जिसने पूरी दुनिया के लिए अपने स्वयं के कार्य समस्याओं को मूल्यांकन के लिए प्रस्तुत करने के लिए एक मंच बनाया। मानव स्कोरिंग और मेटा-विश्लेषण का इसका ढांचा इस बात को आकार दे चुका है कि MMLU या SuperGLUE जैसे बाद के सामान्य-उद्देश्य बेंचमार्क कैसे बनाए जाते हैं, और यह नींव मॉडल प्रसार में नीति के लिए पेपरों के घटाव का पूरक है। नैतिक स्तर पर, इसने मॉडल मूल्यांकन में सावधानीपूर्वक जोखिम डिज़ाइन का भी आह्वान किया। वर्तमान में सूचीबद्ध बिंदु जब कृत्रिम बुद्धिमत्ता के विकास के लिए मॉडल अवधि मौजूद है, BIG-bench बेंचमार्क के लिए एक संदर्भ बना हुआ है कि कैसे बेंचमार्क कई दिमागों का प्रतिनिधित्व कर सकते हैं।

संक्षेप में, BIG-bench ने AI मूल्यांकन में मौलिक दृष्टिकोण स्थापित किए हैं, डेवलपर्स को पाठ की नकल से परे बड़े मॉडलों के व्यापक और अधिक कठोर परीक्षण की ओर दबाव डाला है। शोधकर्ताओं की एक बड़े पैमाने पर स्वैच्छिक प्रतिबद्धता और संभवतः इसके बड़ी संख्या में विभाजकों का उपयोग इसे अधिक पारदर्शी प्रगति के लिए उत्प्रेरक के रूप में अलग बनाता है।

(नोट: "Beyond the Imitation Game: Measuring and extrapolating capabilities in large language models" शीर्षक वाला मूल आधार पेपर, वर्षों के समय के बाद 2022 में प्रकाशित हुआ था।)

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·machine-learning·large-language-models·evaluation
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास