Blog›Guides

Introduzindo os Benchmarks de LLM da Wikiprompt: Leaderboards ao Vivo, Com Recibos

O Wikiprompt agora monitora rankings de LLMs em dez arenas, com capturas diárias para que as mudanças de classificação fiquem registradas. Com fontes da LMArena e OpenRouter, citadas como referências da Wikipédia, em sete idiomas.

Introduzindo os Benchmarks de LLM da Wikiprompt: Leaderboards ao Vivo, Com Recibos

Apresentando os Benchmarks LLM da Wikiprompt: Rankings ao Vivo, Com Comprovantes

A Wikiprompt agora tem uma seção de benchmarks: wikiprompt.org/benchmarks. Rankings ao vivo para grandes modelos de linguagem e IA generativa, cobrindo dez arenas: texto, desenvolvimento web, visão, texto para imagem, edição de imagem, texto para vídeo, edição de vídeo, busca, agentes e documentos. Grátis, em sete idiomas, e atualizados todos os dias.

Por que outro site de rankings?

Porque os números dos benchmarks mudam silenciosamente. Um modelo sobe três posições, uma pontuação é recalculada, o líder de ontem cai para o quarto lugar, e geralmente não há registro de que algo mudou. Tratamos os benchmarks como a Wikipedia trata os artigos: todos os dias a Wikiprompt armazena um snapshot completo dos rankings, e a página mostra mudanças recentes em relação ao snapshot anterior. O histórico fica registrado.

A segunda razão é a fonte. Nossas tabelas citam de onde vem cada número, como referências da Wikipedia:

  • Classificações Elo, intervalos de confiança e contagens de votos vêm da LMArena, as batalhas de modelos frente a frente com crowdsourcing, publicadas como um conjunto de dados aberto.
  • Preços, janelas de contexto e cortes de conhecimento vêm da API pública do OpenRouter.
  • Não realizamos avaliações proprietárias e não editorializamos as pontuações. Agregamos dados abertos e orientados pela comunidade, citamos as fontes e mantemos os comprovantes.

    O que as arenas dizem agora

    Alguns líderes atuais, direto do snapshot de hoje:

  • Texto: claude-opus-4-6-high lidera com um Elo em torno de 1527 em mais de 45.000 votos da comunidade.
  • Texto para imagem: gpt-image-2 (medium) lidera a arena com aproximadamente 69.000 votos; também lidera em edição de imagem com quase 200.000.
  • Texto para vídeo: gemini-omni-flash ocupa o primeiro lugar.
  • Edição de vídeo: dreamina-seedance-2.5 é o modelo a ser batido.
  • Busca: claude-opus-4-6-search lidera com mais de 112.000 votos.
  • Isso vai mudar. Esse é o ponto: quando mudar, o movimento aparece na seção de Mudanças recentes em vez de desaparecer.

    Como isso se conecta à enciclopédia de prompts

    A Wikiprompt já cataloga dezenas de milhares de prompts etiquetados por modelo. A seção de benchmarks fecha o ciclo: veja qual modelo lidera uma arena e depois pule para prompts reais para esse modelo para colocá-lo em uso. Guias de modelos como Os Melhores Prompts de Imagem GPT e a comparação da família Nano Banana ficam ao lado dos rankings.

    Aberto, como tudo aqui

    A página de benchmarks segue os mesmos princípios do resto da Wikiprompt: a compilação é CC BY-SA, as fontes são conjuntos de dados abertos e APIs públicas, e todo o catálogo de prompts pode ser baixado como um único arquivo. Se você quiser os dados dos benchmarks em si, as fontes que citamos estão a um clique de distância.

    Confira as classificações atuais em wikiprompt.org/benchmarks. Elas estarão diferentes na próxima semana, e você poderá ver exatamente como.

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art