Tous les benchmarks

Arene vision

De Wikiprompt, l’encyclopedie libre des prompts

Classement Elo communautaire, agrege chaque jour depuis les duels LMArena. L’arene generale d’abord, puis le detail par categorie.

Derniere mise a jour: 2026-08-24 · 147 modeles

RangModeleOrganisationScore Elo
1claude-fable-5anthropic1,328
2claude-opus-5-highanthropic1,323
3claude-opus-4-7anthropic1,317
4claude-opus-4-7-highanthropic1,316
5qwen3.8-maxalibaba1,315
6claude-opus-4-6-highanthropic1,315
7gemini-3.5-flash-highgoogle1,313
8claude-opus-4-6anthropic1,311
9gemini-3.5-flash-mediumgoogle1,308
10muse-sparkmeta1,306
11gemini-3-progoogle1,305
12muse-spark-1.2 (xHigh)meta1,304
13gemini-3.6-flash-highgoogle1,302
14gpt-5.4-highopenai1,297
15gpt-5.5openai1,295
16muse-spark-1.1meta1,295
17gemini-3.1-pro-previewgoogle1,294
18claude-opus-4-8-highanthropic1,293
19gpt-5.5-highopenai1,293
20gpt-5.4openai1,293
21grok-4.5xai1,291
22claude-opus-4-8anthropic1,287
23gemini-3-flashgoogle1,283
24claude-sonnet-4-6anthropic1,281
25claude-sonnet-5-highanthropic1,281
26kimi-k2.6moonshot1,281
27qwen3.8-27balibaba1,281
28qwen3.7-plusalibaba1,281
29gpt-5.6-sol-xhighopenai1,275
30dola-seed-2.0-probytedance1,275
31gemma-4-31bgoogle1,275
32gemini-3.5-flash-litegoogle1,272
33gpt-5.6-terra-xhighopenai1,269
34gpt-5.2-chat-latest-20260210openai1,267
35kimi-k2.5-thinkingmoonshot1,267
36gemini-3-flash (thinking-minimal)google1,265
37qwen3.5-397b-a17balibaba1,265
38glm-5v-turbozai1,264
39grok-4.20-beta-0309-reasoningxai1,264
40gemini-2.5-progoogle1,262
41grok-4.20-multi-agent-beta-0309xai1,261
42gemma-4-26b-a4bgoogle1,259
43minimax-m3minimax1,255
44kimi-k2.5-instantmoonshot1,255
45gpt-5.6-luna-xhighopenai1,254
46gpt-5.5-instantopenai1,251
47gemini-2.5-flash-preview-09-2025google1,249
48gpt-5.1-highopenai1,249
49mimo-v2.5xiaomi1,249
50ernie-5.0-preview-1220baidu1,248
51qwen3-vl-235b-a22b-instructalibaba1,247
52gpt-5.2-highopenai1,247
53qwen3.5-122b-a10balibaba1,246
54gpt-5.4-mini-highopenai1,245
55chatgpt-4o-latest-20250326openai1,245
56qwen3.5-27balibaba1,241
57gemini-3.1-flash-lite-previewgoogle1,240
58gemini-2.5-flashgoogle1,236
59Inkling Smallthinky1,233
60gpt-5.1openai1,233
61gpt-5-chatopenai1,232
62gpt-5.2openai1,230
63mimo-v2-omnixiaomi1,229
64grok-4.3xai1,228
65mistral-large-3mistral1,225
66mistral-medium-3.5mistral1,222
67o3-2025-04-16openai1,216
68qwen-vl-max-2025-08-13alibaba1,214
69gpt-5-highopenai1,211
70gpt-4.1-2025-04-14openai1,210
71grok-4-0709xai1,209
72qwen3-vl-235b-a22b-thinkingalibaba1,208
73gpt-5-mini-highopenai1,203
74grok-4-1-fast-reasoningxai1,200
75gemini-2.5-flash-lite-preview-09-2025-no-thinkinggoogle1,199
76gpt-5.4-nano-highopenai1,198
77gpt-4.5-preview-2025-02-27openai1,195
78o4-mini-2025-04-16openai1,195
79claude-sonnet-4-20250514-thinking-32kanthropic1,193
80claude-opus-4-20250514-thinking-16kanthropic1,191
81gemini-2.5-flash-lite-preview-06-17-thinkinggoogle1,188
82step-1o-turbo-202506stepfun1,187
83hunyuan-large-visiontencent1,183
84hunyuan-vision-1.5-thinkingtencent1,183
85gpt-4.1-mini-2025-04-14openai1,182
86step-3stepfun1,177
87claude-sonnet-4-20250514anthropic1,176
88claude-opus-4-20250514anthropic1,175
89mistral-medium-2508mistral1,172
90claude-3-7-sonnet-20250219-thinking-32kanthropic1,171
91o1-2024-12-17openai1,169
92glm-4.6vzai1,166
93gemma-3-27b-itgoogle1,165
94gpt-5-nano-highopenai1,162
95gemini-1.5-pro-002google1,162
96gemini-2.0-flash-001google1,159
97mistral-medium-2505mistral1,158
98glm-4.5vzai1,156
99qwen2.5-vl-32b-instructalibaba1,153
100claude-3-7-sonnet-20250219anthropic1,151

Par categorie

Ocr

RangModeleOrganisationScore Elo
1claude-fable-5anthropic1,339
2claude-opus-5-highanthropic1,333
3claude-opus-4-7anthropic1,326
4claude-opus-4-6-highanthropic1,326
5claude-opus-4-6anthropic1,325
6qwen3.8-maxalibaba1,324
7claude-opus-4-7-highanthropic1,323
8gemini-3.5-flash-mediumgoogle1,316
9gemini-3.6-flash-highgoogle1,315
10gemini-3.5-flash-highgoogle1,314
11muse-spark-1.2 (xHigh)meta1,314
12gemini-3-progoogle1,311
13gpt-5.4-highopenai1,307
14muse-sparkmeta1,307
15claude-opus-4-8-highanthropic1,305

English

RangModeleOrganisationScore Elo
1claude-fable-5anthropic1,329
2claude-opus-4-7anthropic1,321
3claude-opus-4-7-highanthropic1,320
4claude-opus-4-6-highanthropic1,319
5claude-opus-5-highanthropic1,319
6claude-opus-4-6anthropic1,316
7qwen3.8-maxalibaba1,310
8gemini-3.5-flash-highgoogle1,305
9muse-sparkmeta1,302
10muse-spark-1.1meta1,301
11gemini-3.5-flash-mediumgoogle1,301
12gemini-3.6-flash-highgoogle1,297
13claude-sonnet-4-6anthropic1,297
14gpt-5.4-highopenai1,295
15gpt-5.5openai1,294

Diagram

RangModeleOrganisationScore Elo
1claude-fable-5anthropic1,366
2claude-opus-5-highanthropic1,348
3claude-opus-4-6anthropic1,340
4claude-opus-4-7-highanthropic1,338
5claude-opus-4-7anthropic1,337
6qwen3.8-maxalibaba1,332
7claude-opus-4-6-highanthropic1,331
8gpt-5.5openai1,324
9gpt-5.4-highopenai1,322
10gemini-3.5-flash-highgoogle1,320
11grok-4.5xai1,319
12muse-spark-1.2 (xHigh)meta1,319
13gpt-5.4openai1,319
14claude-opus-4-8-highanthropic1,317
15gemini-3.5-flash-mediumgoogle1,317

Homework

RangModeleOrganisationScore Elo
1claude-fable-5anthropic1,356
2claude-opus-5-highanthropic1,342
3gemini-3.6-flash-highgoogle1,341
4claude-opus-4-8-highanthropic1,340
5qwen3.8-maxalibaba1,338
6claude-opus-4-7-highanthropic1,337
7claude-opus-4-7anthropic1,336
8gpt-5.5-highopenai1,336
9claude-opus-4-6-highanthropic1,335
10gpt-5.4-highopenai1,335
11gemini-3.5-flash-mediumgoogle1,330
12gpt-5.5openai1,329
13claude-opus-4-6anthropic1,328
14claude-opus-4-8anthropic1,327
15grok-4.5xai1,324

Chinese

RangModeleOrganisationScore Elo
1claude-opus-5-highanthropic1,410
2gemini-3.5-flash-highgoogle1,388
3gemini-3.5-flash-mediumgoogle1,388
4claude-fable-5anthropic1,386
5claude-opus-4-6anthropic1,381
6gemini-3-progoogle1,378
7gpt-5.6-terra-xhighopenai1,374
8claude-opus-4-6-highanthropic1,373
9claude-opus-4-7anthropic1,369
10gemini-3.1-pro-previewgoogle1,367
11muse-spark-1.1meta1,365
12claude-opus-4-7-highanthropic1,359
13gpt-5.4-highopenai1,357
14gpt-5.5-highopenai1,356
15muse-sparkmeta1,356

Creative writing vision

RangModeleOrganisationScore Elo
1gemini-3-progoogle1,348
2claude-fable-5anthropic1,340
3claude-opus-4-6-highanthropic1,332
4muse-sparkmeta1,331
5claude-opus-4-7-highanthropic1,323
6gemini-3.1-pro-previewgoogle1,322
7claude-opus-4-6anthropic1,317
8qwen3.8-maxalibaba1,315
9claude-opus-4-7anthropic1,311
10claude-opus-4-8-highanthropic1,308
11gemini-3.5-flash-mediumgoogle1,304
12gpt-5.5-highopenai1,299
13gemini-3-flashgoogle1,298
14claude-opus-5-highanthropic1,295
15gemini-3.5-flash-highgoogle1,291

Humor

RangModeleOrganisationScore Elo
1muse-sparkmeta1,346
2gemini-3-progoogle1,338
3claude-fable-5anthropic1,330
4gemini-3.1-pro-previewgoogle1,326
5claude-opus-4-6anthropic1,319
6claude-opus-4-7-highanthropic1,309
7claude-opus-4-6-highanthropic1,309
8gemini-3.5-flash-highgoogle1,309
9gemini-3.5-flash-mediumgoogle1,304
10claude-opus-4-7anthropic1,303
11qwen3.8-maxalibaba1,294
12claude-opus-4-8-highanthropic1,292
13gpt-5.5-highopenai1,292
14claude-opus-5-highanthropic1,289
15qwen3.7-plusalibaba1,288

Creative writing

RangModeleOrganisationScore Elo
1gemini-3-progoogle1,391
2ernie-5.0-preview-1220baidu1,336
3gemini-3-flashgoogle1,306
4gpt-5.1openai1,291
5gemini-2.5-flash-preview-09-2025google1,289
6gpt-5.1-highopenai1,282
7gemini-2.5-progoogle1,277
8grok-4-0709xai1,265
9claude-opus-4-20250514anthropic1,253
10gemini-2.5-flashgoogle1,253
11chatgpt-4o-latest-20250326openai1,248
12gpt-5-chatopenai1,239
13qwen3-vl-235b-a22b-thinkingalibaba1,230
14qwen3-vl-235b-a22b-instructalibaba1,225
15mistral-medium-2508mistral1,223

Entity recognition

RangModeleOrganisationScore Elo
1gemini-3-progoogle1,354
2gemini-3-flashgoogle1,334
3gemini-3.1-pro-previewgoogle1,327
4gemini-3-flash (thinking-minimal)google1,312
5gemini-3.1-flash-lite-previewgoogle1,307
6grok-4-0709xai1,288
7grok-4.20-beta-0309-reasoningxai1,287
8kimi-k2.5-thinkingmoonshot1,284
9gemini-2.5-progoogle1,283
10claude-opus-4-6-highanthropic1,278
11qwen3.5-397b-a17balibaba1,278
12grok-4.20-multi-agent-beta-0309xai1,264
13claude-opus-4-7-highanthropic1,263
14gpt-5-highopenai1,260
15gpt-5.4openai1,259

Captioning

RangModeleOrganisationScore Elo
1gemini-3.1-pro-previewgoogle1,336
2gemini-3-progoogle1,318
3gemini-2.5-progoogle1,302
4gemma-4-26b-a4bgoogle1,285
5qwen3-vl-235b-a22b-instructalibaba1,278
6gemini-2.5-flashgoogle1,278
7gpt-5.2-highopenai1,275
8gemini-3-flashgoogle1,274
9gemini-3.1-flash-lite-previewgoogle1,272
10glm-5v-turbozai1,269
11kimi-k2.5-thinkingmoonshot1,253
12gpt-5.1-highopenai1,243
13grok-4-0709xai1,243
14gemini-3-flash (thinking-minimal)google1,240
15chatgpt-4o-latest-20250326openai1,223

Voir aussi

Sources et methodologie

Les classements sont agreges depuis des evaluations communautaires ouvertes. Les scores Elo, intervalles de confiance et votes proviennent de LMArena (duels de modeles votes par la communaute, publies en dataset ouvert). Les prix et metadonnees de contexte proviennent de l’API publique OpenRouter. Wikiprompt prend un instantane quotidien et preserve l’historique ; nous ne menons aucune evaluation proprietaire.

  1. LMArena leaderboard dataset (Hugging Face)
  2. LMArena leaderboard