LMArena, जिसे मूल रूप से Chatbot Arena के रूप में शुरू किया गया था, एक क्राउडसोर्स्ड मूल्यांकन मंच है जो बड़े भाषा मॉडल और अन्य जनरेटिव मॉडल को अंधे, जोड़ीवार तुलनाओं के माध्यम से रैंक करता है, जिन पर जनता द्वारा मतदान किया जाता है। उपयोगकर्ता एक प्रॉम्प्ट प्रस्तुत करते हैं, दो अनाम मॉडलों से प्रतिक्रियाएँ प्राप्त करते हैं, और बेहतर उत्तर के लिए वोट करते हैं; ये वोट एक Elo-शैली रेटिंग प्रणाली को फीड करते हैं जो लगातार अद्यतन लीडरबोर्ड उत्पन्न करती है। यह परियोजना कैलिफोर्निया विश्वविद्यालय, बर्कले में उसी शोध समूह से उत्पन्न हुई जो Vicuna ओपन-वेट मॉडल के पीछे था, और बाद में एक स्वतंत्र कंपनी के रूप में अलग हो गई।
इतिहास
Chatbot Arena को 2023 में निर्देश-ट्यून किए गए चैट मॉडल की तुलना करने के लिए एक शोध उपकरण के रूप में लॉन्च किया गया था, ऐसे समय में जब बेंचमार्क जैसे MMLU को तेजी से संतृप्त या प्रशिक्षण डेटा संदूषण के प्रति संवेदनशील माना जा रहा था। चूंकि एरेना स्थिर परीक्षण सेटों के बजाय लाइव मानव प्राथमिकता पर निर्भर करता है, इसे ओपन-सोर्स डेवलपर्स और प्रमुख प्रयोगशालाओं दोनों द्वारा तेजी से अपनाया गया, जिन्होंने नए मॉडल की घोषणा करते समय औपचारिक बेंचमार्क स्कोर के साथ एरेना रैंकिंग का हवाला देना शुरू कर दिया। यह परियोजना 2025 में LMArena के रूप में पुनः ब्रांडेड हुई क्योंकि यह टेक्स्ट चैट से आगे बढ़कर छवि, वीडियो और कोडिंग-विशिष्ट एरेना में विस्तारित हुई, और जब इसके बर्कले-संबद्ध संस्थापकों ने मंच को स्वतंत्र रूप से संचालित करने के लिए एक कंपनी बनाई, जबकि लीडरबोर्ड को स्वतंत्र रूप से सुलभ रखा।
पद्धति और प्रभाव
LMArena की रैंकिंग प्रणाली शतरंज और अन्य प्रतिस्पर्धी-रेटिंग संदर्भों से अनुकूलित एक Elo सूत्र का उपयोग करती है, जो नए वोट आने पर अद्यतन होती है, साथ ही प्रतिक्रिया शैली और लंबाई जैसे कारकों के लिए सांख्यिकीय नियंत्रण भी शामिल करती है, जिन्हें आलोचकों ने नोट किया कि सहीता की परवाह किए बिना मानव रेटर्स को अधिक वाचाल या शैलीगत रूप से आत्मविश्वासी उत्तरों की ओर पक्षपाती कर सकते हैं। इस समस्या को हल करने के लिए लीडरबोर्ड के शैली-नियंत्रण संस्करण पेश किए गए। OpenAI, Google DeepMind, Anthropic, xAI, और DeepSeek सहित प्रयोगशालाएँ सभी लीडरबोर्ड पर प्रमुखता से दिखाई दी हैं, और एक मजबूत एरेना रैंकिंग नए मॉडल लॉन्च जैसे Gemini, Grok, और DeepSeek-R1 के लिए एक विपणन बिंदु बन गई।
आलोचना
LMArena को इस आलोचना का सामना करना पड़ा है कि प्रयोगशालाएँ सार्वजनिक रिलीज़ से पहले सर्वश्रेष्ठ-प्रदर्शन करने वाले चेकपॉइंट का चयन करने के लिए मॉडल के कई अप्रकाशित संस्करण एरेना में प्रस्तुत कर सकती हैं, प्रभावी रूप से सामान्य गुणवत्ता के बजाय परीक्षण के लिए अनुकूलन कर सकती हैं - एक आरोप जो 2025 में Meta के Llama 4 लॉन्च के आसपास प्रमुखता से सामने आया। शोधकर्ताओं ने यह भी सवाल उठाया है कि क्या क्राउडसोर्स्ड सौंदर्य प्राथमिकता, जो उत्साही मतदाताओं के स्व-चयनित समूह द्वारा प्रभुत्व में है, SWE-bench या HumanEval जैसे बेंचमार्क द्वारा मापे गए वास्तविक दुनिया के कार्य प्रदर्शन के साथ अच्छी तरह से सहसंबंधित होती है। इन आलोचनाओं के बावजूद, LMArena उद्योग भर में मॉडल गुणवत्ता की तुलना के लिए सबसे व्यापक रूप से उद्धृत सार्वजनिक संदर्भ बिंदुओं में से एक बना हुआ है।