LMArena, ursprünglich als Chatbot Arena gestartet, ist eine Crowdsourcing-Plattform zur Bewertung, die große Sprachmodelle und andere generative Modelle durch blinde, paarweise Vergleiche einordnet, über die die Öffentlichkeit abstimmt. Nutzer geben eine Eingabeaufforderung ein, erhalten Antworten von zwei anonymisierten Modellen und stimmen für die bessere Antwort ab; diese Stimmen fließen in ein Elo-basiertes Bewertungssystem ein, das eine kontinuierlich aktualisierte Rangliste erzeugt. Das Projekt entstand an der University of California, Berkeley, in derselben Forschungsgruppe, die hinter dem Open-Weights-Modell Vicuna steht, und wurde später als unabhängiges Unternehmen ausgegründet.
Geschichte
Chatbot Arena wurde 2023 als Forschungswerkzeug zum Vergleich von instruktionsoptimierten Chatmodellen eingeführt, zu einer Zeit, als Standard-Benchmarks wie MMLU zunehmend als gesättigt oder anfällig für Kontamination durch Trainingsdaten galten. Da die Arena auf lebendigen menschlichen Präferenzen und nicht auf statischen Testsätzen beruht, wurde sie schnell von Open-Source-Entwicklern und großen Laboren übernommen, die bei der Ankündigung neuer Modelle neben formellen Benchmark-Ergebnissen auf Arena-Rankings verwiesen. Das Projekt wurde 2025 in LMArena umbenannt, als es sich über den Text-Chat hinaus auf Bild-, Video- und codierungsspezifische Arenen ausweitete und die in Berkeley ansässigen Gründer ein Unternehmen gründeten, um die Plattform unabhängig zu betreiben, während die Rangliste weiterhin frei zugänglich blieb.
Methodik und Einfluss
Das Rangsystem von LMArena verwendet eine Elo-Formel, die vom Schach und anderen Wettbewerbskontexten übernommen wurde und mit jedem neuen Votum aktualisiert wird, sowie statistische Kontrollen für Faktoren wie Antwortstil und -länge, von denen Kritiker anmerkten, dass sie menschliche Bewerter unabhängig von der Korrektheit zu wortreicheren oder stilistisch selbstbewussteren Antworten verleiten könnten. Stilkontrollierte Varianten der Rangliste wurden eingeführt, um dieses Problem zu beheben. Labore wie OpenAI, Google DeepMind, Anthropic, xAI und DeepSeek waren alle prominent auf der Rangliste vertreten, und eine starke Arena-Platzierung wurde zu einem Marketingpunkt für neue Modellveröffentlichungen wie Gemini, Grok und DeepSeek-R1.
Kritik
LMArena wurde dafür kritisiert, dass Labore mehrere unveröffentlichte Varianten eines Modells in der Arena einreichen können, um das am besten abschneidende Kontrollzentrum vor der öffentlichen Veröffentlichung auszuwählen, was effektiv eine Optimierung für den Test statt für die allgemeine Qualität darstellt - ein Vorwurf, der insbesondere beim Start von Metas Llama 4 im Jahr 2025 laut wurde. Forscher haben außerdem infrage gestellt, ob die Crowd-basierte ästhetische Präferenz, die von einer selbstselektierten Gruppe von Enthusiasten dominiert wird, gut mit der realen Aufgabenleistung korreliert, die durch Benchmarks wie SWE-bench oder HumanEval gemessen wird. Trotz dieser Kritik bleibt LMArena einer der am häufigsten zitierten öffentlichen Bezugspunkte für den Vergleich der Modellqualität in der gesamten Branche.