← All snapshotsView the live leaderboard

Benchmark snapshot: 2026-09-06

From Wikiprompt, the free prompt encyclopedia

Frozen photo of the rankings on this date. The live leaderboard is at /benchmarks.

← 2026-09-052026-09-07 →

Text arena

RankModelOrganizationElo score
2claude-opus-5-highanthropic1,505
4claude-opus-4-6-highanthropic1,503
5claude-opus-4-6anthropic1,498
7claude-fable-5anthropic1,494
9claude-opus-4-7-highanthropic1,490
11gemini-3.5-flash-highgoogle1,484
12claude-opus-4-7anthropic1,483
13gemini-3.1-pro-previewgoogle1,480
15gemini-3-progoogle1,479
16muse-spark-1.1meta1,479
17gemini-3.5-flash-mediumgoogle1,477
18gemini-3.6-flash-highgoogle1,476
23qwen3.5-max-previewalibaba1,471
24gpt-5.5-highopenai1,471
26gpt-5.4-highopenai1,470

Web development arena

RankModelOrganizationElo score
1gpt-6-astra-maxopenai1,797
2claude-fable-5.1-maxanthropic1,762
3claude-opus-5-maxanthropic1,688
4qwen3.8-max-0902alibaba1,686
5kimi-k3-maxmoonshot1,674
6qwen3.8-maxalibaba1,670
7claude-opus-5-highanthropic1,661
8claude-fable-5anthropic1,629
9qwen3.8-flash-nextalibaba1,626
10grok-4.6-highxai1,625
11muse-spark-1.3 (xHigh)meta1,622
12hy4-previewtencent1,621
13gpt-5.6-sol-xhigh (codex-harness)openai1,617
14glm-5.3-maxzai1,609
15glm-5.3-flashzai1,605

Vision arena

RankModelOrganizationElo score
1claude-fable-5anthropic1,329
2claude-opus-5-highanthropic1,322
3claude-opus-4-7anthropic1,317
4claude-opus-4-7-highanthropic1,316
5claude-opus-4-6-highanthropic1,315
6qwen3.8-maxalibaba1,313
7claude-opus-4-6anthropic1,311
8gemini-3.5-flash-highgoogle1,311
9muse-sparkmeta1,306
10gemini-3.5-flash-mediumgoogle1,306
11gemini-3-progoogle1,304
12muse-spark-1.2 (xHigh)meta1,304
13gemini-3.6-flash-highgoogle1,302
14gpt-5.4-highopenai1,298
15glm-5.3-flashzai1,296

Text to image arena

RankModelOrganizationElo score
1gpt-image-2 (medium)openai1,382
2mai-image-2.6microsoft-ai1,332
3grok-imagine-image-2.0 (low)xai1,315
4reve-2.1reve1,301
5muse-imagemeta1,279
6reve-2.0reve1,270
7gemini-3.1-flash-image (nano-banana-2) [web-search]google1,261
8seedream-5.0-probytedance1,258
9qwen-image-3.0-proalibaba1,254
10mai-image-2.5microsoft-ai1,254
11gemini-3.1-flash-lite-image (nano-banana-2-lite)google1,250
12gemini-3-pro-image-2k (nano-banana-pro)google1,246
13gpt-image-1.5-high-fidelityopenai1,239
14gemini-3-pro-image-preview (nano-banana-pro)google1,232
15ideogram-4.0-qualityideogram1,204

Image editing arena

RankModelOrganizationElo score
1gpt-image-2 (medium)openai1,461
2mai-image-2.6microsoft-ai1,439
3grok-imagine-image-2.0 (low)xai1,439
4muse-imagemeta1,403
5mai-image-2.5microsoft-ai1,400
6seedream-5.0-probytedance1,394
7chatgpt-image-latest-high-fidelity (20251216)openai1,390
8grok-imagine-image-quality (20260519)xai1,390
9gemini-3-pro-image-2k (nano-banana-pro)google1,390
10gemini-3.1-flash-image (nano-banana-2) [web-search]google1,388
11gemini-3-pro-image-preview (nano-banana-pro)google1,385
12reve-2.1reve1,375
13gpt-image-1.5-high-fidelityopenai1,370
14reve-2.0reve1,358
15uni-1.1-maxluma-ai1,333

Text to video arena

RankModelOrganizationElo score
1gemini-omni-1.1-flashgoogle1,515
2gemini-omni-flashgoogle1,511
3wan3.0alibaba1,494
4flux-3-videobfl1,494
5grok-imagine-video-1.5-agentxai1,491
6dreamina-seedance-2.5-720pbytedance1,482
7dreamina-seedance-2.0-720pbytedance1,479
8minimax-h3minimax1,462
9muse-videometa1,456
10happyhorse-1.0aorizon1,427
11sora-2-proopenai1,367
12veo-3.1-audiogoogle1,364
13veo-3.1-audio-1080pgoogle1,363
14veo-3.1-fast-audiogoogle1,362
15veo-3.1-fast-audio-1080pgoogle1,358

Video editing arena

RankModelOrganizationElo score
1wan3.0alibaba1,414
2dreamina-seedance-2.5-720pbytedance1,410
3minimax-h3minimax1,392
4gemini-omni-flashgoogle1,367
5dreamina-seedance-2.0-720pbytedance1,365
6happyhorse-1.0aorizon1,307
7grok-imagine-videoxai1,258
8kling-o3-prokling1,255
9kling-o1-prokling1,197
10runway-gen4-alephrunway1,182

Search arena

RankModelOrganizationElo score
1gpt-5.6-sol-xhighopenai1,257
2claude-opus-4-6-searchanthropic1,253
3gpt-5.5-searchopenai1,242
4claude-opus-4-7anthropic1,233
5claude-fable-5anthropic1,230
6ernie-5.1baidu1,227
7claude-sonnet-4-6-searchanthropic1,221
8grok-4.5xai1,213
9gemini-3.1-pro-groundinggoogle1,210
10gemini-3-pro-groundinggoogle1,207
11gpt-5.2-searchopenai1,207
12claude-opus-4-8anthropic1,204
13grok-4.20-multi-agent-beta-0309xai1,204
14gpt-5.1-searchopenai1,199
15gemini-3-flash-groundinggoogle1,198

Agentic arena

RankModelOrganizationElo score
1Claude Fable 5.1 (Max)anthropic
2Claude Opus 5 (High)anthropic
3Claude Opus 5 (Max)anthropic
4Claude Fable 5 (High)anthropic
5GPT 5.6 Sol (xHigh)openai
6Claude Opus 4.8 (High)anthropic
7Kimi K3 (Max)moonshot
8Claude Sonnet 5 (High)anthropic
9GPT 5.5 (xHigh)openai
10Hy4 previewtencent
11Claude Opus 4.7 (High)anthropic
12GLM 5.2 (Max)zai
13Grok 4.5xai
14Claude Opus 4.7anthropic
15GPT 5.5 (High)openai

Document arena

RankModelOrganizationElo score
1claude-opus-5-highanthropic1,520
2claude-opus-4-6anthropic1,510
3claude-opus-4-6-thinkinganthropic1,506
4claude-fable-5anthropic1,504
5claude-opus-4-7anthropic1,498
6claude-opus-4-7-thinkinganthropic1,497
7gpt-5.5-highopenai1,485
8claude-sonnet-4-6anthropic1,483
9gpt-5.5openai1,480
10gpt-5.6-terra-xhighopenai1,479
11gpt-5.6-sol-xhighopenai1,479
12claude-opus-4-8-thinkinganthropic1,475
13muse-spark-1.1meta1,472
14claude-sonnet-5-highanthropic1,470
15gpt-5.4openai1,470

Other leaderboards

BenchLM

Metric: aggregated display score · benchlm.ai

RankModelOrganizationScore
1Claude Fable 5.1Anthropic83
2GPT-6 AstraOpenAI81.1
3Claude Fable 5Anthropic80.9
4Claude Opus 5Anthropic80.7
5GPT-5.6 SolOpenAI79.6
6Gemini 3.8 FlashGoogle78.4
7Kimi K3Moonshot AI74.9
8GPT-5.5OpenAI73.3
9Qwen3.8 MaxAlibaba72.4
10Claude Opus 4.8Anthropic72.3
11Muse Spark 1.2Meta71.9
12Muse Spark 1.1Meta71.8
13GPT-5.6 TerraOpenAI71.4
14GPT-5.4OpenAI71
15Claude Sonnet 5Anthropic70.8

LiveBench

Metric: average score (0-100) · livebench.ai

RankModelOrganizationScore
1claude-fable-5-1-max-effort83.8
2claude-fable-5-max-effort83.4
3gpt-6-astra-max83.1
4muse-spark-1.3-xhigh82.4
5gpt-5.6-sol-max81.7
6gpt-5.5-xhigh80.8
7claude-opus-5-max-effort80.5
8gemini-3.7-flash-high79.9
9smaug-agentic79.7
10qwen3.8-max79.5
11kimi-k379.5
12grok-4.679
13muse-spark-1.2-xhigh78.9
14gpt-5.4-xhigh78.8
15gpt-5.6-terra-max78.6

Aider polyglot (coding)

Metric: pass rate 2 (%) · aider.chat/docs/leaderboards/

RankModelOrganizationScore
1gpt-5 (high)88
2gpt-5 (medium)86.7
3o3-pro (high)84.9
4gemini-2.5-pro-preview-06-05 (32k think)83.1
5o3 (high)81.3
6gpt-5 (low)81.3
7grok-4 (high)79.6
8gemini-2.5-pro-preview-06-05 (default think)79.1
9o3 (high) + gpt-4.178.2
10Gemini 2.5 Pro Preview 05-0676.9
11o376.9
12DeepSeek-V3.2-Exp (Reasoner)74.2
13Gemini 2.5 Pro Preview 03-2572.9
14o4-mini (high)72
15claude-opus-4-20250514 (32k thinking)72

Artificial Analysis (Intelligence Index)

Metric: AA Intelligence Index (0-100) · artificialanalysis.ai

RankModelOrganizationScore
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic56.8
2GPT-6 Astra (max)OpenAI54.7
3GPT-6 Astra (xhigh)OpenAI54.3
4Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic54.1
5Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic53.8
6GPT-6 Astra (high)OpenAI53.4
7Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic53.4
8Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic53.2
9Muse Spark 1.3 (max)Meta53
10GPT-6 Astra (medium)OpenAI52.2
11Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic52
12Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic51.7
13Muse Spark 1.3 (xhigh)Meta51.6
14GPT-5.6 Sol (max)OpenAI51.3
15Grok 4.6 (high)SpaceXAI50.6

Sources and methodology

Rankings above are aggregated from open community evaluations. Elo ratings, confidence intervals and vote counts come from LMArena (crowdsourced head-to-head model battles, published as an open dataset). Model pricing and context metadata come from the public OpenRouter API. Wikiprompt snapshots these sources daily and preserves the history; we run no proprietary evaluations of our own.