← All snapshotsView the live leaderboard

Benchmark snapshot: 2026-09-05

From Wikiprompt, the free prompt encyclopedia

Frozen photo of the rankings on this date. The live leaderboard is at /benchmarks.

← 2026-09-042026-09-06 →

Text arena

RankModelOrganizationElo score
2claude-opus-5-highanthropic1,504
3claude-opus-4-6-highanthropic1,503
4claude-opus-4-6anthropic1,498
5claude-fable-5anthropic1,494
7claude-opus-4-7-highanthropic1,490
9gemini-3.5-flash-highgoogle1,484
10claude-opus-4-7anthropic1,483
11gemini-3.1-pro-previewgoogle1,480
13gemini-3-progoogle1,480
14muse-spark-1.1meta1,479
15gemini-3.6-flash-highgoogle1,476
17gemini-3.5-flash-mediumgoogle1,476
21gpt-5.5-highopenai1,472
22qwen3.5-max-previewalibaba1,471
24gpt-5.4-highopenai1,470

Web development arena

RankModelOrganizationElo score
1qwen3.8-max-0902alibaba1,691
2claude-opus-5-maxanthropic1,688
3kimi-k3-maxmoonshot1,674
4qwen3.8-maxalibaba1,669
5claude-opus-5-highanthropic1,661
6hy4-previewtencent1,629
7grok-4.6-highxai1,629
8claude-fable-5anthropic1,628
9qwen3.8-flash-nextalibaba1,620
10gpt-5.6-sol-xhigh (codex-harness)openai1,616
11glm-5.3-maxzai1,608
12glm-5.3-flashzai1,604
13qwen3.8-27balibaba1,599
14gemini-3.7-flash-highgoogle1,587
15glm-5.2-maxzai1,585

Vision arena

RankModelOrganizationElo score
1claude-fable-5anthropic1,329
2claude-opus-5-highanthropic1,322
3claude-opus-4-7anthropic1,317
4claude-opus-4-7-highanthropic1,316
5claude-opus-4-6-highanthropic1,315
6qwen3.8-maxalibaba1,313
7claude-opus-4-6anthropic1,311
8gemini-3.5-flash-highgoogle1,311
9muse-sparkmeta1,306
10gemini-3.5-flash-mediumgoogle1,306
11gemini-3-progoogle1,304
12muse-spark-1.2 (xHigh)meta1,304
13gemini-3.6-flash-highgoogle1,302
14gpt-5.4-highopenai1,298
15glm-5.3-flashzai1,296

Text to image arena

RankModelOrganizationElo score
1gpt-image-2 (medium)openai1,380
2reve-2.1reve1,302
3muse-imagemeta1,283
4reve-2.0reve1,270
5gemini-3.1-flash-image (nano-banana-2) [web-search]google1,263
6qwen-image-3.0-proalibaba1,258
7seedream-5.0-probytedance1,257
8mai-image-2.5microsoft-ai1,256
9gemini-3.1-flash-lite-image (nano-banana-2-lite)google1,251
10gemini-3-pro-image-2k (nano-banana-pro)google1,246
11gpt-image-1.5-high-fidelityopenai1,239
12gemini-3-pro-image-preview (nano-banana-pro)google1,232
13grok-imagine-image-qualityxai1,228
14ideogram-4.0-qualityideogram1,206
15qwen-image-2.0-pro-2026-06-22alibaba1,191

Image editing arena

RankModelOrganizationElo score
1gpt-image-2 (medium)openai1,463
2grok-imagine-image-2.0 (low)xai1,439
3mai-image-2.6-previewmicrosoft-ai1,420
4muse-imagemeta1,406
5mai-image-2.5microsoft-ai1,401
6seedream-5.0-probytedance1,394
7grok-imagine-image-quality (20260519)xai1,390
8gemini-3-pro-image-2k (nano-banana-pro)google1,390
9chatgpt-image-latest-high-fidelity (20251216)openai1,389
10gemini-3.1-flash-image (nano-banana-2) [web-search]google1,386
11gemini-3-pro-image-preview (nano-banana-pro)google1,385
12reve-2.1reve1,375
13gpt-image-1.5-high-fidelityopenai1,370
14reve-2.0reve1,358
15uni-1.1-maxluma-ai1,334

Text to video arena

RankModelOrganizationElo score
1gemini-omni-1.1-flashgoogle1,515
2gemini-omni-flashgoogle1,512
3flux-3-videobfl1,495
4dreamina-seedance-2.0-720pbytedance1,479
5dreamina-seedance-2.5-720pbytedance1,476
6minimax-h3minimax1,460
7muse-videometa1,457
8happyhorse-1.0aorizon1,428
9sora-2-proopenai1,365
10veo-3.1-audiogoogle1,364
11veo-3.1-audio-1080pgoogle1,363
12veo-3.1-fast-audiogoogle1,361
13veo-3.1-fast-audio-1080pgoogle1,358
14veo-3-fast-audiogoogle1,347
15wan2.7-t2vwan1,344

Video editing arena

RankModelOrganizationElo score
1wan3.0alibaba1,414
2dreamina-seedance-2.5-720pbytedance1,410
3minimax-h3minimax1,392
4gemini-omni-flashgoogle1,367
5dreamina-seedance-2.0-720pbytedance1,365
6happyhorse-1.0aorizon1,307
7grok-imagine-videoxai1,258
8kling-o3-prokling1,255
9kling-o1-prokling1,197
10runway-gen4-alephrunway1,182

Search arena

RankModelOrganizationElo score
1gpt-5.6-sol-xhighopenai1,257
2claude-opus-4-6-searchanthropic1,253
3gpt-5.5-searchopenai1,242
4claude-opus-4-7anthropic1,233
5claude-fable-5anthropic1,230
6ernie-5.1baidu1,227
7claude-sonnet-4-6-searchanthropic1,221
8grok-4.5xai1,213
9gemini-3.1-pro-groundinggoogle1,210
10gemini-3-pro-groundinggoogle1,207
11gpt-5.2-searchopenai1,207
12claude-opus-4-8anthropic1,204
13grok-4.20-multi-agent-beta-0309xai1,204
14gpt-5.1-searchopenai1,199
15gemini-3-flash-groundinggoogle1,198

Agentic arena

RankModelOrganizationElo score
1Claude Opus 5 (High)anthropic
2Claude Opus 5 (Max)anthropic
3Claude Fable 5 (High)anthropic
4GPT 5.6 Sol (xHigh)openai
5Claude Opus 4.8 (High)anthropic
6Kimi K3 (Max)moonshot
7GPT 5.5 (xHigh)openai
8Claude Sonnet 5 (High)anthropic
9Claude Opus 4.7 (High)anthropic
10Claude Opus 4.7anthropic
11GPT 5.5 (High)openai
12GLM 5.2 (Max)zai
13Grok 4.5xai
14Qwen3.8 Maxalibaba
15DeepSeek V4 Pro (High) (0813)deepseek

Document arena

RankModelOrganizationElo score
1claude-opus-5-highanthropic1,520
2claude-opus-4-6anthropic1,510
3claude-opus-4-6-thinkinganthropic1,506
4claude-fable-5anthropic1,504
5claude-opus-4-7anthropic1,498
6claude-opus-4-7-thinkinganthropic1,497
7gpt-5.5-highopenai1,485
8claude-sonnet-4-6anthropic1,483
9gpt-5.5openai1,480
10gpt-5.6-terra-xhighopenai1,479
11gpt-5.6-sol-xhighopenai1,479
12claude-opus-4-8-thinkinganthropic1,475
13muse-spark-1.1meta1,472
14claude-sonnet-5-highanthropic1,470
15gpt-5.4openai1,470

Other leaderboards

Aider polyglot (coding)

Metric: pass rate 2 (%) · aider.chat/docs/leaderboards/

RankModelOrganizationScore
1gpt-5 (high)88
2gpt-5 (medium)86.7
3o3-pro (high)84.9
4gemini-2.5-pro-preview-06-05 (32k think)83.1
5o3 (high)81.3
6gpt-5 (low)81.3
7grok-4 (high)79.6
8gemini-2.5-pro-preview-06-05 (default think)79.1
9o3 (high) + gpt-4.178.2
10Gemini 2.5 Pro Preview 05-0676.9
11o376.9
12DeepSeek-V3.2-Exp (Reasoner)74.2
13Gemini 2.5 Pro Preview 03-2572.9
14o4-mini (high)72
15claude-opus-4-20250514 (32k thinking)72

LiveBench

Metric: average score (0-100) · livebench.ai

RankModelOrganizationScore
1claude-fable-5-1-max-effort83.8
2claude-fable-5-max-effort83.4
3gpt-6-astra-max83.1
4muse-spark-1.3-xhigh82.4
5gpt-5.6-sol-max81.7
6gpt-5.5-xhigh80.8
7claude-opus-5-max-effort80.5
8gemini-3.7-flash-high79.9
9smaug-agentic79.7
10qwen3.8-max79.5
11kimi-k379.5
12grok-4.679
13muse-spark-1.2-xhigh78.9
14gpt-5.4-xhigh78.8
15gpt-5.6-terra-max78.6

BenchLM

Metric: aggregated display score · benchlm.ai

RankModelOrganizationScore
1Claude Fable 5.1Anthropic83
2GPT-6 AstraOpenAI81.1
3Claude Fable 5Anthropic80.9
4Claude Opus 5Anthropic80.7
5GPT-5.6 SolOpenAI79.7
6Gemini 3.8 FlashGoogle78.4
7Kimi K3Moonshot AI74.9
8GPT-5.5OpenAI73.3
9Qwen3.8 MaxAlibaba72.4
10Claude Opus 4.8Anthropic72.3
11Muse Spark 1.2Meta71.9
12Muse Spark 1.1Meta71.8
13GPT-5.6 TerraOpenAI71.4
14GPT-5.4OpenAI71
15Claude Sonnet 5Anthropic70.8

Artificial Analysis (Intelligence Index)

Metric: AA Intelligence Index (0-100) · artificialanalysis.ai

RankModelOrganizationScore
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic56.8
2GPT-6 Astra (max)OpenAI54.7
3GPT-6 Astra (xhigh)OpenAI54.3
4Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic54.1
5Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic53.8
6GPT-6 Astra (high)OpenAI53.4
7Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic53.4
8Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic53.2
9Muse Spark 1.3 (max)Meta53
10GPT-6 Astra (medium)OpenAI52.2
11Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic52
12Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic51.7
13Muse Spark 1.3 (xhigh)Meta51.6
14GPT-5.6 Sol (max)OpenAI51.3
15Grok 4.6 (high)SpaceXAI50.6

Sources and methodology

Rankings above are aggregated from open community evaluations. Elo ratings, confidence intervals and vote counts come from LMArena (crowdsourced head-to-head model battles, published as an open dataset). Model pricing and context metadata come from the public OpenRouter API. Wikiprompt snapshots these sources daily and preserves the history; we run no proprietary evaluations of our own.