अंग्रेज़ी से अनुवादित

Arena.ai是一个通过公开、众包的对抗性评测来评估和比较大型语言模型的平台。它基于用户投票提供AI模型性能的排行榜和分析数据。

Arena.ai एक वेब-आधारित प्लेटफ़ॉर्म है जो बड़े भाषा मॉडल (LLM) के मूल्यांकन और तुलना को क्राउडसोर्स्ड, टूर्नामेंट-शैली प्रणाली के माध्यम से सुविधाजनक बनाता है। यह उपयोगकर्ताओं को दो अनाम मॉडलों को प्रॉम्प्ट सबमिट करने और यह वोट करने की अनुमति देता है कि कौन सा उत्तर बेहतर है, जिससे मॉडल प्रदर्शन की एक सार्वजनिक लीडरबोर्ड तैयार होती है। यह प्लेटफ़ॉर्म शोधकर्ताओं, डेवलपर्स और AI उत्साही लोगों द्वारा विभिन्न AI प्रणालियों की सापेक्ष क्षमताओं को वास्तविक-विश्व, उपयोगकर्ता-संचालित संदर्भ में मापने के लिए व्यापक रूप से उपयोग किया जाता है।

यह सेवा प्रत्यक्ष तुलना के सिद्धांत पर काम करती है, जो केवल मानकीकृत बेंचमार्क पर निर्भर रहने के बजाय अपने उपयोगकर्ता आधार के सामूहिक निर्णय पर आधारित है। यह दृष्टिकोण मॉडल गुणवत्ता का एक गतिशील और निरंतर अद्यतन मूल्यांकन प्रदान करता है, जो उपयोगकर्ता की प्राथमिकताओं और व्यावहारिक उपयोगिता को दर्शाता है। Arena.ai AI समुदाय में मॉडल क्षमताओं के तेज़ी से विकास को ट्रैक करने के लिए एक महत्वपूर्ण संदर्भ बिंदु बन गया है।

उत्पत्ति और विकास

Arena.ai को मई 2023 में LMSYS (लार्ज मॉडल सिस्टम्स) संगठन द्वारा लॉन्च किया गया था, जो कैलिफोर्निया विश्वविद्यालय, बर्कले, स्टैनफोर्ड विश्वविद्यालय, और कैलिफोर्निया विश्वविद्यालय, सैन डिएगो के शोधकर्ताओं से जुड़ा एक सहयोगी शैक्षणिक परियोजना है। प्रारंभिक लक्ष्य LLM के मूल्यांकन के लिए एक अधिक जैविक और स्केलेबल विधि बनाना था, जो स्थिर बेंचमार्क से आगे बढ़े जो खेले जा सकते थे या पुराने हो सकते थे। यह प्लेटफ़ॉर्म शुरू में चैटबॉट एरेना के रूप में जाना जाता था, जो संवादात्मक AI पर इसके फोकस को दर्शाता है।

इस परियोजना का नेतृत्व वेई-लिन चियांग, लियानमिन झेंग, और अन्य शोधकर्ताओं ने किया, जिन्होंने मूल्यांकन प्रक्रिया में ही मशीन लर्निंग सिद्धांतों को लागू करने की मांग की। 'एरेना' नाम मूल्यांकन की प्रतिस्पर्धात्मक, आमने-सामने की प्रकृति को उजागर करने के लिए चुना गया था। प्लेटफ़ॉर्म ने तेज़ी से लोकप्रियता हासिल की, लॉन्च के कुछ हफ्तों के भीतर हजारों उपयोगकर्ताओं ने भाग लिया।

पद्धति और मूल्यांकन

Arena.ai मॉडलों को जोड़ीवार तुलनाओं के आधार पर रैंक करने के लिए शतरंज में उपयोग किए जाने वाले एलो रेटिंग प्रणाली का उपयोग करता है। उपयोगकर्ताओं को दो अनाम मॉडल प्रस्तुत किए जाते हैं, जिन्हें केवल 'मॉडल A' और 'मॉडल B' के रूप में पहचाना जाता है। वे एक प्रॉम्प्ट सबमिट करते हैं, दोनों से प्रतिक्रियाएँ प्राप्त करते हैं, और फिर बेहतर उत्तर के लिए वोट करते हैं, या टाई घोषित करते हैं। एलो एल्गोरिदम परिणाम के आधार पर दोनों मॉडलों की रेटिंग को अद्यतन करता है, जिसमें परिवर्तन का परिमाण अपेक्षित बनाम वास्तविक परिणाम पर निर्भर करता है।

सांख्यिकीय मजबूती सुनिश्चित करने के लिए, प्लेटफ़ॉर्म प्रत्येक मॉडल की रेटिंग के लिए विश्वास अंतराल की गणना करने के लिए बूटस्ट्रैप विधि का उपयोग करता है। मॉडलों को केवल न्यूनतम संख्या में वोट (आमतौर पर लगभग 1,000) के बाद रैंक किया जाता है ताकि शोर कम हो सके। सिस्टम मॉडलों की जोड़ी बनाने के प्रबंधन के लिए एक 'बैटल' कतार भी लागू करता है, यह सुनिश्चित करते हुए कि लोकप्रिय और कम-ज्ञात मॉडलों का उचित रूप से मिलान हो। प्लेटफ़ॉर्म की पद्धति को शैक्षणिक पत्रों में वर्णित किया गया है, जिसमें 'चैटबॉट एरेना: एन ओपन प्लेटफ़ॉर्म फॉर इवैल्यूएटिंग LLMs बाय ह्यूमन प्रेफरेंस' शामिल है, जो तकनीकी कार्यान्वयन और सांख्यिकीय विश्लेषण का विवरण देता है।

लीडरबोर्ड और श्रेणियाँ

Arena.ai का प्राथमिक आउटपुट इसका सार्वजनिक लीडरबोर्ड है, जो मॉडलों को उनके एलो स्कोर द्वारा रैंक करता है। लीडरबोर्ड को अधिक सूक्ष्म जानकारी प्रदान करने के लिए कई श्रेणियों में विभाजित किया गया है:

  • समग्र: सभी मॉडलों और प्रॉम्प्टों में मुख्य रैंकिंग।
  • कोडिंग: प्रोग्रामिंग और कोड जनरेशन से संबंधित प्रॉम्प्टों के लिए वोटों पर आधारित रैंकिंग।
  • कठिन प्रॉम्प्ट: उन प्रॉम्प्टों के लिए रैंकिंग जो चुनौतीपूर्ण या प्रतिकूल माने जाते हैं।
  • रचनात्मक लेखन: उन प्रॉम्प्टों के लिए रैंकिंग जिनमें कल्पनाशील या शैलीगत आउटपुट की आवश्यकता होती है।
  • लंबी क्वेरी: उन प्रॉम्प्टों के लिए रैंकिंग जो लंबे और अधिक जटिल होते हैं।
  • विज़न: मल्टीमॉडल मॉडलों के लिए रैंकिंग जो छवियों को संसाधित कर सकते हैं।
  • गणित: गणितीय तर्क से जुड़े प्रॉम्प्टों के लिए रैंकिंग।
  • निर्देश पालन: उन प्रॉम्प्टों के लिए रैंकिंग जो विशिष्ट निर्देशों के पालन का परीक्षण करते हैं।

प्रत्येक श्रेणी की अपनी एलो रेटिंग और विश्वास अंतराल होते हैं, जिससे उपयोगकर्ता देख सकते हैं कि कौन से मॉडल विशिष्ट डोमेन में उत्कृष्ट हैं। लीडरबोर्ड को रोलिंग आधार पर अद्यतन किया जाता है, नए मॉडल जारी होते ही जोड़े जाते हैं। 2024 के अंत तक, लीडरबोर्ड में विभिन्न डेवलपर्स के 100 से अधिक मॉडल शामिल थे, जिनमें OpenAI, Anthropic, Google DeepMind, और Meta AI शामिल हैं।

समुदाय और भागीदारी

Arena.ai समुदाय की भागीदारी के आसपास बनाया गया है। उपयोगकर्ता खाता बनाए बिना वोट कर सकते हैं, हालांकि पंजीकृत उपयोगकर्ता अपने वोटिंग इतिहास को ट्रैक कर सकते हैं और 'बैटल' कतार में योगदान कर सकते हैं। प्लेटफ़ॉर्म समय-समय पर 'एरेना' इवेंट भी आयोजित करता है, जैसे 'एरेना ऑफ़ द मंथ' या थीम आधारित प्रतियोगिताएँ, विशिष्ट क्षमताओं या नए रिलीज़ को उजागर करने के लिए। सामुदायिक पहलू महत्वपूर्ण है, क्योंकि प्लेटफ़ॉर्म का मूल्य सांख्यिकीय रूप से सार्थक परिणाम प्रदान करने के लिए एक बड़े और विविध उपयोगकर्ता आधार पर निर्भर करता है।

प्लेटफ़ॉर्म उपयोगकर्ताओं को अपने स्वयं के मॉडल मूल्यांकन के लिए सबमिट करने की भी अनुमति देता है, बशर्ते वे कुछ मानदंडों को पूरा करते हों, जैसे सार्वजनिक API या ओपन-सोर्स होना। इसने Arena.ai को छोटे प्रयोगशालाओं और स्वतंत्र डेवलपर्स के लिए उद्योग के दिग्गजों के खिलाफ अपने मॉडलों को बेंचमार्क करने के लिए एक लोकप्रिय स्थान बना दिया है। वोटिंग के दौरान मॉडलों की अनामता पूर्वाग्रह को कम करने में मदद करती है, हालांकि उपयोगकर्ता प्रतिक्रिया शैली के आधार पर मॉडलों की पहचान का अनुमान लगाने का प्रयास कर सकते हैं।

प्रभाव और स्वागत

Arena.ai का जनरेटिव AI परिदृश्य पर महत्वपूर्ण प्रभाव पड़ा है। इसे अक्सर शैक्षणिक पत्रों और उद्योग रिपोर्टों में मॉडल तुलना डेटा के प्राथमिक स्रोत के रूप में उद्धृत किया जाता है। लीडरबोर्ड को अक्सर समाचार लेखों में और डेवलपर्स द्वारा अत्याधुनिक तकनीक पर चर्चा करते समय संदर्भित किया जाता है। प्लेटफ़ॉर्म की रैंकिंग का उपयोग उत्पादन प्रणालियों में तैनात करने के लिए कौन से मॉडल चुनने के बारे में निर्णय लेने के लिए किया गया है, और इसकी पद्धति को अन्य मूल्यांकन प्रयासों द्वारा अपनाया या अनुकूलित किया गया है।

आलोचकों ने संभावित सीमाओं पर ध्यान दिया है, जैसे उपयोगकर्ता पूर्वाग्रह का प्रभाव, लंबे-रूप या सूक्ष्म प्रतिक्रियाओं का मूल्यांकन करने की कठिनाई, और डेवलपर्स द्वारा मॉडलों को 'गेम' करने की संभावना जो प्लेटफ़ॉर्म के वोटिंग पैटर्न के लिए अनुकूलित करते हैं। हालांकि, प्लेटफ़ॉर्म की पारदर्शिता और इसके डेटा संग्रह का पैमाना आम तौर पर ताकत के रूप में देखा जाता है। बर्कले AI रिसर्च प्रयोगशाला, जो LMSYS सहयोग का हिस्सा है, ने कई शोध परियोजनाओं में Arena.ai डेटा का उपयोग किया है।

तकनीकी बुनियादी ढाँचा

प्लेटफ़ॉर्म एक स्केलेबल वेब आर्किटेक्चर पर बनाया गया है, जिसमें एक बैकएंड है जो बैटल की कतार, वोटों के भंडारण और एलो रेटिंग की गणना को संभालता है। फ्रंटएंड एक सरल, सुलभ वेब इंटरफ़ेस है जो डेस्कटॉप और मोबाइल दोनों उपकरणों पर काम करता है। सिस्टम वर्कलोड को प्रबंधित करने के लिए क्लाउड सेवाओं और ओपन-सोर्स टूल्स के संयोजन का उपयोग करता है, जो प्रमुख मॉडल रिलीज़ के दौरान काफी बढ़ सकता है।

Arena.ai डेवलपर्स और शोधकर्ताओं के लिए बैटल डेटा और लीडरबोर्ड आँकड़ों तक प्रोग्रामेटिक रूप से पहुँचने के लिए एक API भी प्रदान करता है। इसने बाहरी विश्लेषण और तृतीय-पक्ष टूल के निर्माण की सुविधा प्रदान की है जो प्लेटफ़ॉर्म के डेटा को विज़ुअलाइज़ या विस्तारित करते हैं। मूल्यांकन पाइपलाइन के लिए कोडबेस आंशिक रूप से ओपन-सोर्स है, जिसमें कोर एलो गणना और डेटा प्रोसेसिंग स्क्रिप्ट GitHub पर उपलब्ध हैं।

भविष्य की दिशाएँ

2024 तक, LMSYS टीम Arena.ai का विकास जारी रखती है, नई विधाओं, जैसे ऑडियो और वीडियो मूल्यांकन में विस्तार करने की योजना के साथ, और रैंकिंग के लिए उपयोग की जाने वाली सांख्यिकीय विधियों को परिष्कृत करने की योजना बना रही है। वोटिंग प्रक्रिया में पूर्वाग्रहों को कम करने और सरल जीत/हार परिणामों से परे जाने वाले अधिक परिष्कृत मीट्रिक विकसित करने पर चल रहे शोध हैं। प्लेटफ़ॉर्म मानव प्राथमिकताओं के साथ अधिक उद्देश्यपूर्ण बेंचमार्क को एकीकृत करने के तरीकों की भी खोज कर रहा है, ताकि मॉडल क्षमताओं का अधिक व्यापक दृष्टिकोण प्रदान किया जा सके।

Arena.ai का उदय AI समुदाय में समुदाय-संचालित, गतिशील मूल्यांकन विधियों की ओर एक व्यापक प्रवृत्ति को दर्शाता है। इसकी सफलता ने हगिंग फेस से ओपन LLM लीडरबोर्ड जैसे समान प्लेटफ़ॉर्म को प्रेरित किया है, हालांकि Arena.ai सबसे प्रमुख और व्यापक रूप से उपयोग किया जाने वाला बना हुआ है। प्लेटफ़ॉर्म का निरंतर विकास संभवतः आने वाले वर्षों में AI मॉडलों का मूल्यांकन और तुलना कैसे की जाती है, इसे आकार देता रहेगा।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:ai-evaluation·large-language-models·crowdsourcing·benchmarking
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास