Wikiprompt

โ† All benchmarks

Vision arena

From Wikiprompt, the free prompt encyclopedia

Community Elo leaderboard, aggregated daily from LMArena head-to-head battles. Overall arena first, then per-category breakdowns.

Last updated: 2026-08-24 ยท 147 models

RankModelOrganizationElo score
1claude-fable-5anthropic1,328
2claude-opus-5-highanthropic1,323
3claude-opus-4-7anthropic1,317
4claude-opus-4-7-highanthropic1,316
5qwen3.8-maxalibaba1,315
6claude-opus-4-6-highanthropic1,315
7gemini-3.5-flash-highgoogle1,313
8claude-opus-4-6anthropic1,311
9gemini-3.5-flash-mediumgoogle1,308
10muse-sparkmeta1,306
11gemini-3-progoogle1,305
12muse-spark-1.2 (xHigh)meta1,304
13gemini-3.6-flash-highgoogle1,302
14gpt-5.4-highopenai1,297
15gpt-5.5openai1,295
16muse-spark-1.1meta1,295
17gemini-3.1-pro-previewgoogle1,294
18claude-opus-4-8-highanthropic1,293
19gpt-5.5-highopenai1,293
20gpt-5.4openai1,293
21grok-4.5xai1,291
22claude-opus-4-8anthropic1,287
23gemini-3-flashgoogle1,283
24claude-sonnet-4-6anthropic1,281
25claude-sonnet-5-highanthropic1,281
26kimi-k2.6moonshot1,281
27qwen3.8-27balibaba1,281
28qwen3.7-plusalibaba1,281
29gpt-5.6-sol-xhighopenai1,275
30dola-seed-2.0-probytedance1,275
31gemma-4-31bgoogle1,275
32gemini-3.5-flash-litegoogle1,272
33gpt-5.6-terra-xhighopenai1,269
34gpt-5.2-chat-latest-20260210openai1,267
35kimi-k2.5-thinkingmoonshot1,267
36gemini-3-flash (thinking-minimal)google1,265
37qwen3.5-397b-a17balibaba1,265
38glm-5v-turbozai1,264
39grok-4.20-beta-0309-reasoningxai1,264
40gemini-2.5-progoogle1,262
41grok-4.20-multi-agent-beta-0309xai1,261
42gemma-4-26b-a4bgoogle1,259
43minimax-m3minimax1,255
44kimi-k2.5-instantmoonshot1,255
45gpt-5.6-luna-xhighopenai1,254
46gpt-5.5-instantopenai1,251
47gemini-2.5-flash-preview-09-2025google1,249
48gpt-5.1-highopenai1,249
49mimo-v2.5xiaomi1,249
50ernie-5.0-preview-1220baidu1,248
51qwen3-vl-235b-a22b-instructalibaba1,247
52gpt-5.2-highopenai1,247
53qwen3.5-122b-a10balibaba1,246
54gpt-5.4-mini-highopenai1,245
55chatgpt-4o-latest-20250326openai1,245
56qwen3.5-27balibaba1,241
57gemini-3.1-flash-lite-previewgoogle1,240
58gemini-2.5-flashgoogle1,236
59Inkling Smallthinky1,233
60gpt-5.1openai1,233
61gpt-5-chatopenai1,232
62gpt-5.2openai1,230
63mimo-v2-omnixiaomi1,229
64grok-4.3xai1,228
65mistral-large-3mistral1,225
66mistral-medium-3.5mistral1,222
67o3-2025-04-16openai1,216
68qwen-vl-max-2025-08-13alibaba1,214
69gpt-5-highopenai1,211
70gpt-4.1-2025-04-14openai1,210
71grok-4-0709xai1,209
72qwen3-vl-235b-a22b-thinkingalibaba1,208
73gpt-5-mini-highopenai1,203
74grok-4-1-fast-reasoningxai1,200
75gemini-2.5-flash-lite-preview-09-2025-no-thinkinggoogle1,199
76gpt-5.4-nano-highopenai1,198
77gpt-4.5-preview-2025-02-27openai1,195
78o4-mini-2025-04-16openai1,195
79claude-sonnet-4-20250514-thinking-32kanthropic1,193
80claude-opus-4-20250514-thinking-16kanthropic1,191
81gemini-2.5-flash-lite-preview-06-17-thinkinggoogle1,188
82step-1o-turbo-202506stepfun1,187
83hunyuan-large-visiontencent1,183
84hunyuan-vision-1.5-thinkingtencent1,183
85gpt-4.1-mini-2025-04-14openai1,182
86step-3stepfun1,177
87claude-sonnet-4-20250514anthropic1,176
88claude-opus-4-20250514anthropic1,175
89mistral-medium-2508mistral1,172
90claude-3-7-sonnet-20250219-thinking-32kanthropic1,171
91o1-2024-12-17openai1,169
92glm-4.6vzai1,166
93gemma-3-27b-itgoogle1,165
94gpt-5-nano-highopenai1,162
95gemini-1.5-pro-002google1,162
96gemini-2.0-flash-001google1,159
97mistral-medium-2505mistral1,158
98glm-4.5vzai1,156
99qwen2.5-vl-32b-instructalibaba1,153
100claude-3-7-sonnet-20250219anthropic1,151

By category

Ocr

RankModelOrganizationElo score
1claude-fable-5anthropic1,339
2claude-opus-5-highanthropic1,333
3claude-opus-4-7anthropic1,326
4claude-opus-4-6-highanthropic1,326
5claude-opus-4-6anthropic1,325
6qwen3.8-maxalibaba1,324
7claude-opus-4-7-highanthropic1,323
8gemini-3.5-flash-mediumgoogle1,316
9gemini-3.6-flash-highgoogle1,315
10gemini-3.5-flash-highgoogle1,314
11muse-spark-1.2 (xHigh)meta1,314
12gemini-3-progoogle1,311
13gpt-5.4-highopenai1,307
14muse-sparkmeta1,307
15claude-opus-4-8-highanthropic1,305

English

RankModelOrganizationElo score
1claude-fable-5anthropic1,329
2claude-opus-4-7anthropic1,321
3claude-opus-4-7-highanthropic1,320
4claude-opus-4-6-highanthropic1,319
5claude-opus-5-highanthropic1,319
6claude-opus-4-6anthropic1,316
7qwen3.8-maxalibaba1,310
8gemini-3.5-flash-highgoogle1,305
9muse-sparkmeta1,302
10muse-spark-1.1meta1,301
11gemini-3.5-flash-mediumgoogle1,301
12gemini-3.6-flash-highgoogle1,297
13claude-sonnet-4-6anthropic1,297
14gpt-5.4-highopenai1,295
15gpt-5.5openai1,294

Diagram

RankModelOrganizationElo score
1claude-fable-5anthropic1,366
2claude-opus-5-highanthropic1,348
3claude-opus-4-6anthropic1,340
4claude-opus-4-7-highanthropic1,338
5claude-opus-4-7anthropic1,337
6qwen3.8-maxalibaba1,332
7claude-opus-4-6-highanthropic1,331
8gpt-5.5openai1,324
9gpt-5.4-highopenai1,322
10gemini-3.5-flash-highgoogle1,320
11grok-4.5xai1,319
12muse-spark-1.2 (xHigh)meta1,319
13gpt-5.4openai1,319
14claude-opus-4-8-highanthropic1,317
15gemini-3.5-flash-mediumgoogle1,317

Homework

RankModelOrganizationElo score
1claude-fable-5anthropic1,356
2claude-opus-5-highanthropic1,342
3gemini-3.6-flash-highgoogle1,341
4claude-opus-4-8-highanthropic1,340
5qwen3.8-maxalibaba1,338
6claude-opus-4-7-highanthropic1,337
7claude-opus-4-7anthropic1,336
8gpt-5.5-highopenai1,336
9claude-opus-4-6-highanthropic1,335
10gpt-5.4-highopenai1,335
11gemini-3.5-flash-mediumgoogle1,330
12gpt-5.5openai1,329
13claude-opus-4-6anthropic1,328
14claude-opus-4-8anthropic1,327
15grok-4.5xai1,324

Chinese

RankModelOrganizationElo score
1claude-opus-5-highanthropic1,410
2gemini-3.5-flash-highgoogle1,388
3gemini-3.5-flash-mediumgoogle1,388
4claude-fable-5anthropic1,386
5claude-opus-4-6anthropic1,381
6gemini-3-progoogle1,378
7gpt-5.6-terra-xhighopenai1,374
8claude-opus-4-6-highanthropic1,373
9claude-opus-4-7anthropic1,369
10gemini-3.1-pro-previewgoogle1,367
11muse-spark-1.1meta1,365
12claude-opus-4-7-highanthropic1,359
13gpt-5.4-highopenai1,357
14gpt-5.5-highopenai1,356
15muse-sparkmeta1,356

Creative writing vision

RankModelOrganizationElo score
1gemini-3-progoogle1,348
2claude-fable-5anthropic1,340
3claude-opus-4-6-highanthropic1,332
4muse-sparkmeta1,331
5claude-opus-4-7-highanthropic1,323
6gemini-3.1-pro-previewgoogle1,322
7claude-opus-4-6anthropic1,317
8qwen3.8-maxalibaba1,315
9claude-opus-4-7anthropic1,311
10claude-opus-4-8-highanthropic1,308
11gemini-3.5-flash-mediumgoogle1,304
12gpt-5.5-highopenai1,299
13gemini-3-flashgoogle1,298
14claude-opus-5-highanthropic1,295
15gemini-3.5-flash-highgoogle1,291

Humor

RankModelOrganizationElo score
1muse-sparkmeta1,346
2gemini-3-progoogle1,338
3claude-fable-5anthropic1,330
4gemini-3.1-pro-previewgoogle1,326
5claude-opus-4-6anthropic1,319
6claude-opus-4-7-highanthropic1,309
7claude-opus-4-6-highanthropic1,309
8gemini-3.5-flash-highgoogle1,309
9gemini-3.5-flash-mediumgoogle1,304
10claude-opus-4-7anthropic1,303
11qwen3.8-maxalibaba1,294
12claude-opus-4-8-highanthropic1,292
13gpt-5.5-highopenai1,292
14claude-opus-5-highanthropic1,289
15qwen3.7-plusalibaba1,288

Creative writing

RankModelOrganizationElo score
1gemini-3-progoogle1,391
2ernie-5.0-preview-1220baidu1,336
3gemini-3-flashgoogle1,306
4gpt-5.1openai1,291
5gemini-2.5-flash-preview-09-2025google1,289
6gpt-5.1-highopenai1,282
7gemini-2.5-progoogle1,277
8grok-4-0709xai1,265
9claude-opus-4-20250514anthropic1,253
10gemini-2.5-flashgoogle1,253
11chatgpt-4o-latest-20250326openai1,248
12gpt-5-chatopenai1,239
13qwen3-vl-235b-a22b-thinkingalibaba1,230
14qwen3-vl-235b-a22b-instructalibaba1,225
15mistral-medium-2508mistral1,223

Entity recognition

RankModelOrganizationElo score
1gemini-3-progoogle1,354
2gemini-3-flashgoogle1,334
3gemini-3.1-pro-previewgoogle1,327
4gemini-3-flash (thinking-minimal)google1,312
5gemini-3.1-flash-lite-previewgoogle1,307
6grok-4-0709xai1,288
7grok-4.20-beta-0309-reasoningxai1,287
8kimi-k2.5-thinkingmoonshot1,284
9gemini-2.5-progoogle1,283
10claude-opus-4-6-highanthropic1,278
11qwen3.5-397b-a17balibaba1,278
12grok-4.20-multi-agent-beta-0309xai1,264
13claude-opus-4-7-highanthropic1,263
14gpt-5-highopenai1,260
15gpt-5.4openai1,259

Captioning

RankModelOrganizationElo score
1gemini-3.1-pro-previewgoogle1,336
2gemini-3-progoogle1,318
3gemini-2.5-progoogle1,302
4gemma-4-26b-a4bgoogle1,285
5qwen3-vl-235b-a22b-instructalibaba1,278
6gemini-2.5-flashgoogle1,278
7gpt-5.2-highopenai1,275
8gemini-3-flashgoogle1,274
9gemini-3.1-flash-lite-previewgoogle1,272
10glm-5v-turbozai1,269
11kimi-k2.5-thinkingmoonshot1,253
12gpt-5.1-highopenai1,243
13grok-4-0709xai1,243
14gemini-3-flash (thinking-minimal)google1,240
15chatgpt-4o-latest-20250326openai1,223

See also

Sources and methodology

Rankings above are aggregated from open community evaluations. Elo ratings, confidence intervals and vote counts come from LMArena (crowdsourced head-to-head model battles, published as an open dataset). Model pricing and context metadata come from the public OpenRouter API. Wikiprompt snapshots these sources daily and preserves the history; we run no proprietary evaluations of our own.

  1. LMArena leaderboard dataset (Hugging Face)
  2. LMArena leaderboard