Blog›Guides

Présentation des benchmarks LLM de Wikiprompt : classements en direct, avec preuves à l'appui

Wikiprompt suit désormais les classements de LLM dans dix arènes, avec des instantanés quotidiens pour que les changements de classement restent documentés. Les données proviennent de LMArena et OpenRouter, citées comme des références Wikipédia, en sept langues.

Présentation des benchmarks LLM de Wikiprompt : classements en direct, avec preuves à l'appui

Présentation des benchmarks LLM de Wikiprompt : classements en direct, avec preuves à l'appui

Wikiprompt dispose désormais d'une section benchmarks : wikiprompt.org/benchmarks. Classements en direct pour les grands modèles de langage et l'IA générative, couvrant dix arènes : texte, développement web, vision, texte vers image, édition d'images, texte vers vidéo, édition vidéo, recherche, agents et documents. Gratuit, en sept langues, et mis à jour chaque jour.

Pourquoi un autre site de classements ?

Parce que les chiffres des benchmarks évoluent en silence. Un modèle grimpe de trois places, un score est recalculé, le leader d'hier glisse à la quatrième position, et il n'y a généralement aucune trace de ce qui a changé. Nous traitons les benchmarks comme Wikipédia traite les articles : chaque jour, Wikiprompt stocke un instantané complet des classements, et la page affiche les modifications récentes par rapport à l'instantané précédent. L'historique reste consigné.

La deuxième raison concerne les sources. Nos tableaux citent d'où provient chaque chiffre, comme les références de Wikipédia :

  • Les classements Elo, les intervalles de confiance et les comptes de votes proviennent de LMArena, les batailles de modèles en tête-à-tête issues du crowdsourcing, publiées comme jeu de données ouvert.
  • Les prix, les fenêtres de contexte et les dates limites de connaissances proviennent de l'API publique OpenRouter.
  • Nous ne menons aucune évaluation propriétaire et nous n'éditorialisons pas les scores. Nous agrégeons des données ouvertes issues de la communauté, nous les citons, et nous conservons les preuves.

    Ce que disent les arènes actuellement

    Quelques leaders actuels, directement issus de l'instantané d'aujourd'hui :

  • Texte : claude-opus-4-6-high mène avec un Elo autour de 1527 sur plus de 45 000 votes communautaires.
  • Texte vers image : gpt-image-2 (medium) domine l'arène avec environ 69 000 votes ; il mène également l'édition d'images avec près de 200 000.
  • Texte vers vidéo : gemini-omni-flash occupe la première place.
  • Édition vidéo : dreamina-seedance-2.5 est le modèle à battre.
  • Recherche : claude-opus-4-6-search mène avec plus de 112 000 votes.
  • Cela va changer. C'est le but : quand cela arrivera, le mouvement apparaîtra dans la section Modifications récentes au lieu de disparaître.

    Comment cela se connecte à l'encyclopédie de prompts

    Wikiprompt catalogue déjà des dizaines de milliers de prompts étiquetés par modèle. La section benchmarks boucle la boucle : voyez quel modèle mène une arène, puis passez aux vrais prompts pour ce modèle pour le mettre en pratique. Les guides de modèles comme Les meilleurs prompts GPT Image et la comparaison de la famille Nano Banana côtoient les classements.

    Ouvert, comme tout le reste ici

    La page benchmarks suit les mêmes principes que le reste de Wikiprompt : la compilation est sous CC BY-SA, les sources sont des jeux de données ouverts et des API publiques, et tout le catalogue de prompts est téléchargeable sous forme de fichier unique. Si vous voulez les données de benchmark elles-mêmes, les sources que nous citons sont à un clic.

    Consultez les classements actuels sur wikiprompt.org/benchmarks. Ils seront différents la semaine prochaine, et vous pourrez voir exactement comment.

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art