Traduzido do inglês

LMArena (anteriormente Chatbot Arena) é uma plataforma de crowdsourcing, originária da UC Berkeley, que classifica modelos de linguagem e imagem de IA usando comparações humanas pareadas às cegas e um sistema de classificação estilo Elo.

LMArena, originalmente lançado como Chatbot Arena, é uma plataforma de avaliação crowdsourced que classifica modelos de linguagem de grande porte e outros modelos generativos por meio de comparações cegas em pares, votadas pelo público. Os usuários enviam um prompt, recebem respostas de dois modelos anonimizados,e votam na melhor resposta; esses votos alimentam um sistema de classificação estilo Elo que produz um ranking continuamente atualizado. O projeto se originou na Universidade da Califórnia, Berkeley, do mesmo grupo de pesquisa por trás do modelo de pesos abertos Vicuna,e posteriormente se desmembrou como uma empresa independente

História

O Chatbot Arena foi lançado em 2023 como uma ferramenta de pesquisa para comparar modelos de chat ajustados por instruções, em uma época em que benchmarks padrão como MMLU eram cada vez mais vistos como saturados ou vulneráveis à contaminação de dados de treinamento. Como a arena depende de preferência humana ao vivo em vez de conjuntos de teste estáticos, foi adotada rapidamente tanto por desenvolvedores de código aberto quanto por grandes laboratórios, que começaram a citar classificações da arena junto com pontuações formais de benchmark ao anunciar novos modelos. O projeto foi renomeado para LMArena em 2025, à medida que se expandiu além do chat de texto para arenas específicas de imagem, vídeo,e codificação,e como seus fundadores afiliados a Berkeley formaram uma empresa para operar a plataforma de forma independente, mantendo o ranking livremente acessível

Metodologia e influência

O sistema de classificação da LMArena usa uma fórmula Elo adaptada do xadrez e de outros contextos de classificação competitiva, atualizada conforme novos votos chegam, juntamente com controles estatísticos para fatores como estilo e comprimento de resposta, que críticos notaram poder enviesar avaliadores humanos em direção a respostas mais verbosas ou estilisticamente confiantes, independentemente da correção. Variantes de controle de estilo do ranking foram introduzidas para abordar isso. Laboratórios incluindo OpenAI, Google DeepMind, Anthropic, xAI,e DeepSeek têm todos se destacado no ranking,e uma forte classificação na arena se tornou um ponto de marketing para lançamentos de novos modelos como Gemini, Grok,e DeepSeek-R1.

Críticas

A LMArena tem enfrentado críticas de que laboratórios podem enviar múltiplas variantes não lançadas de um modelo para a arena, a fim de selecionar o checkpoint de melhor desempenho antes do lançamento público, efetivamente otimizando para o teste em vez de para qualidade geral, uma acusação que veio à tona de forma proeminente em torno do lançamento do Llama 4 da Meta em 2025. Pesquisadores também questionaram se a preferência estética crowdsourced, dominada por um pool auto-selecionado de votantes entusiastas, correlaciona-se bem com o desempenho em tarefas do mundo real medido por benchmarks como SWE-bench ou HumanEval. Apesar dessas críticas, a LMArena permanece um dos pontos de referência públicos mais amplamente citados para comparar a qualidade de modelos em toda a indústria.

Categorias:evaluation·benchmarks·industry
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico