LMArena, initialement lancée sous le nom de Chatbot Arena, est une plateforme d'évaluation participative qui classe les grands modèles de langage et d'autres modèles génératifs grâce à des comparaisons par paires en aveugle, soumises au vote du public. Les utilisateurs soumettent une invite, reçoivent des réponses de deux modèles anonymisés et votent pour la meilleure réponse ; ces votes alimentent un système de classement de type Elo qui produit un classement mis à jour en continu. Le projet est né à l'Université de Californie à Berkeley, au sein du même groupe de recherche à l'origine du modèle open-weights Vicuna, avant de devenir une entreprise indépendante.
Histoire
Chatbot Arena a été lancée en 2023 comme outil de recherche pour comparer les modèles de discussion ajustés par instructions, à une époque où les références standard comme MMLU étaient de plus en plus considérées comme saturées ou vulnérables à la contamination des données d'entraînement. Parce que l'arène repose sur les préférences humaines en direct plutôt que sur des ensembles de test statiques, elle a été rapidement adoptée par les développeurs open-source et les grands laboratoires, qui ont commencé à citer les classements de l'arène en plus des scores de référence formels lors de l'annonce de nouveaux modèles. Le projet a été rebaptisé LMArena en 2025, alors qu'il s'étendait au-delà du texte pour inclure des arènes dédiées à l'image, à la vidéo et au codage, et que ses fondateurs affiliés à Berkeley créaient une entreprise pour gérer la plateforme de manière indépendante, tout en maintenant le classement librement accessible.
Méthodologie et influence
Le système de classement de LMArena utilise une formule Elo adaptée des échecs et d'autres contextes de classement compétitif, mise à jour à mesure que de nouveaux votes arrivent, ainsi que des contrôles statistiques pour des facteurs tels que le style de réponse et la longueur, que les critiques ont noté comme pouvant biaiser les évaluateurs humains vers des réponses plus verbeuses ou stylistiquement plus assurées, indépendamment de leur exactitude. Des variantes du classement avec contrôle du style ont été introduites pour remédier à ce problème. Des laboratoires comme OpenAI, Google DeepMind, Anthropic, xAI et DeepSeek ont tous figuré en bonne place dans le classement, et un bon classement dans l'arène est devenu un argument marketing pour le lancement de nouveaux modèles comme Gemini, Grok et DeepSeek-R1.
Critiques
LMArena a été critiquée pour le fait que les laboratoires peuvent soumettre plusieurs variantes non publiées d'un modèle à l'arène afin de sélectionner le meilleur point de contrôle avant la sortie publique, optimisant ainsi le test plutôt que la qualité générale, une accusation qui a refait surface lors du lancement de Llama 4 de Meta en 2025. Les chercheurs ont également remis en question le fait que les préférences esthétiques participatives, dominées par un bassin autosélectionné de passionnés, corrèlent bien avec les performances réelles mesurées par des références comme SWE-bench ou HumanEval. Malgré ces critiques, LMArena reste l'un des points de référence publics les plus cités pour comparer la qualité des modèles à travers l'industrie.