All snapshotsView the live leaderboard

Benchmark snapshot: 2026-09-03

From Wikiprompt, the free prompt encyclopedia

Frozen photo of the rankings on this date. The live leaderboard is at /benchmarks.

2026-09-02

Text arena

RankModelOrganizationElo score
2claude-opus-5-highanthropic1,504
3claude-opus-4-6-highanthropic1,503
4claude-opus-4-6anthropic1,498
5claude-fable-5anthropic1,494
7claude-opus-4-7-highanthropic1,490
9gemini-3.5-flash-highgoogle1,484
10claude-opus-4-7anthropic1,483
11gemini-3.1-pro-previewgoogle1,480
13gemini-3-progoogle1,480
14muse-spark-1.1meta1,479
15gemini-3.6-flash-highgoogle1,476
17gemini-3.5-flash-mediumgoogle1,476
21gpt-5.5-highopenai1,472
22qwen3.5-max-previewalibaba1,471
24gpt-5.4-highopenai1,470

Web development arena

RankModelOrganizationElo score
1qwen3.8-max-0902alibaba1,691
2claude-opus-5-maxanthropic1,688
3kimi-k3-maxmoonshot1,674
4qwen3.8-maxalibaba1,669
5claude-opus-5-highanthropic1,661
6hy4-previewtencent1,629
7grok-4.6-highxai1,629
8claude-fable-5anthropic1,628
9qwen3.8-flash-nextalibaba1,620
10gpt-5.6-sol-xhigh (codex-harness)openai1,616
11glm-5.3-maxzai1,608
12glm-5.3-flashzai1,604
13qwen3.8-27balibaba1,599
14gemini-3.7-flash-highgoogle1,587
15glm-5.2-maxzai1,585

Vision arena

RankModelOrganizationElo score
1claude-fable-5anthropic1,329
2claude-opus-5-highanthropic1,322
3claude-opus-4-7anthropic1,317
4claude-opus-4-7-highanthropic1,316
5claude-opus-4-6-highanthropic1,315
6qwen3.8-maxalibaba1,313
7claude-opus-4-6anthropic1,311
8gemini-3.5-flash-highgoogle1,311
9muse-sparkmeta1,306
10gemini-3.5-flash-mediumgoogle1,306
11gemini-3-progoogle1,304
12muse-spark-1.2 (xHigh)meta1,304
13gemini-3.6-flash-highgoogle1,302
14gpt-5.4-highopenai1,298
15glm-5.3-flashzai1,296

Text to image arena

RankModelOrganizationElo score
1gpt-image-2 (medium)openai1,380
2reve-2.1reve1,302
3muse-imagemeta1,283
4reve-2.0reve1,270
5gemini-3.1-flash-image (nano-banana-2) [web-search]google1,263
6qwen-image-3.0-proalibaba1,258
7seedream-5.0-probytedance1,257
8mai-image-2.5microsoft-ai1,256
9gemini-3.1-flash-lite-image (nano-banana-2-lite)google1,251
10gemini-3-pro-image-2k (nano-banana-pro)google1,246
11gpt-image-1.5-high-fidelityopenai1,239
12gemini-3-pro-image-preview (nano-banana-pro)google1,232
13grok-imagine-image-qualityxai1,228
14ideogram-4.0-qualityideogram1,206
15qwen-image-2.0-pro-2026-06-22alibaba1,191

Image editing arena

RankModelOrganizationElo score
1gpt-image-2 (medium)openai1,463
2grok-imagine-image-2.0 (low)xai1,439
3mai-image-2.6-previewmicrosoft-ai1,420
4muse-imagemeta1,406
5mai-image-2.5microsoft-ai1,401
6seedream-5.0-probytedance1,394
7grok-imagine-image-quality (20260519)xai1,390
8gemini-3-pro-image-2k (nano-banana-pro)google1,390
9chatgpt-image-latest-high-fidelity (20251216)openai1,389
10gemini-3.1-flash-image (nano-banana-2) [web-search]google1,386
11gemini-3-pro-image-preview (nano-banana-pro)google1,385
12reve-2.1reve1,375
13gpt-image-1.5-high-fidelityopenai1,370
14reve-2.0reve1,358
15uni-1.1-maxluma-ai1,334

Text to video arena

RankModelOrganizationElo score
1gemini-omni-1.1-flashgoogle1,515
2gemini-omni-flashgoogle1,512
3flux-3-videobfl1,495
4dreamina-seedance-2.0-720pbytedance1,479
5dreamina-seedance-2.5-720pbytedance1,476
6minimax-h3minimax1,460
7muse-videometa1,457
8happyhorse-1.0aorizon1,428
9sora-2-proopenai1,365
10veo-3.1-audiogoogle1,364
11veo-3.1-audio-1080pgoogle1,363
12veo-3.1-fast-audiogoogle1,361
13veo-3.1-fast-audio-1080pgoogle1,358
14veo-3-fast-audiogoogle1,347
15wan2.7-t2vwan1,344

Video editing arena

RankModelOrganizationElo score
1wan3.0alibaba1,414
2dreamina-seedance-2.5-720pbytedance1,410
3minimax-h3minimax1,392
4gemini-omni-flashgoogle1,367
5dreamina-seedance-2.0-720pbytedance1,365
6happyhorse-1.0aorizon1,307
7grok-imagine-videoxai1,258
8kling-o3-prokling1,255
9kling-o1-prokling1,197
10runway-gen4-alephrunway1,182

Search arena

RankModelOrganizationElo score
1gpt-5.6-sol-xhighopenai1,257
2claude-opus-4-6-searchanthropic1,253
3gpt-5.5-searchopenai1,242
4claude-opus-4-7anthropic1,233
5claude-fable-5anthropic1,230
6ernie-5.1baidu1,227
7claude-sonnet-4-6-searchanthropic1,221
8grok-4.5xai1,213
9gemini-3.1-pro-groundinggoogle1,210
10gemini-3-pro-groundinggoogle1,207
11gpt-5.2-searchopenai1,207
12claude-opus-4-8anthropic1,204
13grok-4.20-multi-agent-beta-0309xai1,204
14gpt-5.1-searchopenai1,199
15gemini-3-flash-groundinggoogle1,198

Agentic arena

RankModelOrganizationElo score
1Claude Opus 5 (High)anthropic
2Claude Opus 5 (Max)anthropic
3Claude Fable 5 (High)anthropic
4GPT 5.6 Sol (xHigh)openai
5Claude Opus 4.8 (High)anthropic
6Kimi K3 (Max)moonshot
7GPT 5.5 (xHigh)openai
8Claude Sonnet 5 (High)anthropic
9Claude Opus 4.7 (High)anthropic
10Claude Opus 4.7anthropic
11GPT 5.5 (High)openai
12GLM 5.2 (Max)zai
13Grok 4.5xai
14Qwen3.8 Maxalibaba
15DeepSeek V4 Pro (High) (0813)deepseek

Document arena

RankModelOrganizationElo score
1claude-opus-5-highanthropic1,520
2claude-opus-4-6anthropic1,510
3claude-opus-4-6-thinkinganthropic1,506
4claude-fable-5anthropic1,504
5claude-opus-4-7anthropic1,498
6claude-opus-4-7-thinkinganthropic1,497
7gpt-5.5-highopenai1,485
8claude-sonnet-4-6anthropic1,483
9gpt-5.5openai1,480
10gpt-5.6-terra-xhighopenai1,479
11gpt-5.6-sol-xhighopenai1,479
12claude-opus-4-8-thinkinganthropic1,475
13muse-spark-1.1meta1,472
14claude-sonnet-5-highanthropic1,470
15gpt-5.4openai1,470

Other leaderboards

Artificial Analysis (Intelligence Index)

Metric: AA Intelligence Index (0-100) · artificialanalysis.ai

RankModelOrganizationScore
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic65.7
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic64.8
3Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic63.1
4Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic62.5
5Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic62.5
6Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic62.1
7Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic61.5
8GPT-5.6 Sol (max)OpenAI60.9
9Grok 4.6 (high)SpaceXAI60.9
10Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic60.5
11Grok 4.6 (xhigh)SpaceXAI60
12Kimi K3 (max)Kimi59.7
13GLM-5.3 (max)Z AI59.5
14GPT-5.6 Sol (xhigh)OpenAI59
15Grok 4.6 (medium)SpaceXAI59

Aider polyglot (coding)

Metric: pass rate 2 (%) · aider.chat/docs/leaderboards/

RankModelOrganizationScore
1gpt-5 (high)88
2gpt-5 (medium)86.7
3o3-pro (high)84.9
4gemini-2.5-pro-preview-06-05 (32k think)83.1
5o3 (high)81.3
6gpt-5 (low)81.3
7grok-4 (high)79.6
8gemini-2.5-pro-preview-06-05 (default think)79.1
9o3 (high) + gpt-4.178.2
10Gemini 2.5 Pro Preview 05-0676.9
11o376.9
12DeepSeek-V3.2-Exp (Reasoner)74.2
13Gemini 2.5 Pro Preview 03-2572.9
14o4-mini (high)72
15claude-opus-4-20250514 (32k thinking)72

LiveBench

Metric: average score (0-100) · livebench.ai

RankModelOrganizationScore
1claude-fable-5-1-max-effort83.8
2claude-fable-5-max-effort83.4
3muse-spark-1.3-xhigh82.4
4gpt-5.6-sol-max81.7
5gpt-5.5-xhigh80.8
6claude-opus-5-max-effort80.5
7gemini-3.7-flash-high79.9
8smaug-agentic79.7
9qwen3.8-max79.5
10kimi-k379.5
11grok-4.679
12muse-spark-1.2-xhigh78.9
13gpt-5.4-xhigh78.8
14gpt-5.6-terra-max78.6
15deepseek-v4-pro-081378.2

BenchLM

Metric: aggregated display score · benchlm.ai

RankModelOrganizationScore
1Claude Fable 5.1Anthropic83
2Claude Fable 5Anthropic82.6
3Claude Opus 5Anthropic82.4
4GPT-5.6 SolOpenAI81.8
5Kimi K3Moonshot AI80
6Qwen3.8 MaxAlibaba78.7
7Hy4 previewTencent78.3
8Muse Spark 1.2Meta76.8
9Muse Spark 1.1Meta76.7
10Claude Opus 4.8Anthropic76.1
11Gemini 3.8 FlashGoogle75.4
12Gemini 3.7 FlashGoogle75.3
13Grok 4.6xAI75.2
14Gemini 3.6 FlashGoogle75.2
15Grok 4.5xAI75.1

Sources and methodology

Rankings above are aggregated from open community evaluations. Elo ratings, confidence intervals and vote counts come from LMArena (crowdsourced head-to-head model battles, published as an open dataset). Model pricing and context metadata come from the public OpenRouter API. Wikiprompt snapshots these sources daily and preserves the history; we run no proprietary evaluations of our own.