← All snapshotsView the live leaderboard

Benchmark snapshot: 2026-09-09

From Wikiprompt, the free prompt encyclopedia

Frozen photo of the rankings on this date. The live leaderboard is at /benchmarks.

← 2026-09-082026-09-10 →

Text arena

RankModelOrganizationElo score
2claude-opus-5-highanthropic1,505
4claude-opus-4-6-highanthropic1,503
5claude-opus-4-6anthropic1,498
7claude-fable-5anthropic1,494
9claude-opus-4-7-highanthropic1,490
11gemini-3.5-flash-highgoogle1,484
12claude-opus-4-7anthropic1,483
13gemini-3.1-pro-previewgoogle1,480
15gemini-3-progoogle1,479
16muse-spark-1.1meta1,479
17gemini-3.5-flash-mediumgoogle1,477
18gemini-3.6-flash-highgoogle1,476
23qwen3.5-max-previewalibaba1,471
24gpt-5.5-highopenai1,471
26gpt-5.4-highopenai1,470

Web development arena

RankModelOrganizationElo score
1gpt-6-astra-maxopenai1,796
2claude-fable-5.1-maxanthropic1,764
3claude-opus-5-maxanthropic1,688
4qwen3.8-max-0902alibaba1,685
5kimi-k3-maxmoonshot1,674
6qwen3.8-maxalibaba1,670
7claude-opus-5-highanthropic1,661
8muse-spark-1.3-maxmeta1,650
9qwen3.8-flash-nextalibaba1,631
10claude-fable-5anthropic1,628
11muse-spark-1.3 (xHigh)meta1,625
12grok-4.6-highxai1,624
13hy4-previewtencent1,623
14gpt-5.6-sol-xhigh (codex-harness)openai1,617
15glm-5.3-maxzai1,613

Vision arena

RankModelOrganizationElo score
1claude-fable-5anthropic1,329
2claude-opus-5-highanthropic1,322
3claude-opus-4-7anthropic1,317
4claude-opus-4-7-highanthropic1,316
5claude-opus-4-6-highanthropic1,315
6qwen3.8-maxalibaba1,313
7claude-opus-4-6anthropic1,311
8gemini-3.5-flash-highgoogle1,311
9muse-sparkmeta1,306
10gemini-3.5-flash-mediumgoogle1,306
11gemini-3-progoogle1,304
12muse-spark-1.2 (xHigh)meta1,304
13gemini-3.6-flash-highgoogle1,302
14gpt-5.4-highopenai1,298
15glm-5.3-flashzai1,296

Text to image arena

RankModelOrganizationElo score
1gpt-image-2.5-sunburstopenai1,421
2gpt-image-2.5-flareopenai1,399
3gpt-image-2 (medium)openai1,381
4mai-image-2.6microsoft-ai1,331
5grok-imagine-image-2.0 (low)xai1,315
6reve-2.1reve1,301
7muse-imagemeta1,277
8reve-2.0reve1,270
9gemini-3.1-flash-image (nano-banana-2) [web-search]google1,261
10seedream-5.0-probytedance1,257
11qwen-image-3.0-proalibaba1,254
12mai-image-2.5microsoft-ai1,254
13gemini-3.1-flash-lite-image (nano-banana-2-lite)google1,250
14gemini-3-pro-image-2k (nano-banana-pro)google1,246
15gpt-image-1.5-high-fidelityopenai1,239

Image editing arena

RankModelOrganizationElo score
1gpt-image-2.5-sunburstopenai1,520
2gpt-image-2.5-flareopenai1,491
3gpt-image-2 (medium)openai1,461
4grok-imagine-image-2.0 (low)xai1,439
5mai-image-2.6microsoft-ai1,434
6muse-imagemeta1,403
7mai-image-2.5microsoft-ai1,400
8seedream-5.0-probytedance1,394
9gemini-3-pro-image-2k (nano-banana-pro)google1,390
10grok-imagine-image-quality (20260519)xai1,390
11chatgpt-image-latest-high-fidelity (20251216)openai1,389
12gemini-3.1-flash-image (nano-banana-2) [web-search]google1,387
13gemini-3-pro-image-preview (nano-banana-pro)google1,385
14reve-2.1reve1,375
15gpt-image-1.5-high-fidelityopenai1,370

Text to video arena

RankModelOrganizationElo score
1gemini-omni-1.1-flashgoogle1,515
2gemini-omni-flashgoogle1,511
3wan3.0alibaba1,494
4flux-3-videobfl1,494
5grok-imagine-video-1.5-agentxai1,491
6dreamina-seedance-2.5-720pbytedance1,482
7dreamina-seedance-2.0-720pbytedance1,479
8minimax-h3minimax1,462
9muse-videometa1,456
10happyhorse-1.0aorizon1,427
11sora-2-proopenai1,367
12veo-3.1-audiogoogle1,364
13veo-3.1-audio-1080pgoogle1,363
14veo-3.1-fast-audiogoogle1,362
15veo-3.1-fast-audio-1080pgoogle1,358

Video editing arena

RankModelOrganizationElo score
1wan3.0alibaba1,414
2dreamina-seedance-2.5-720pbytedance1,410
3minimax-h3minimax1,392
4gemini-omni-flashgoogle1,367
5dreamina-seedance-2.0-720pbytedance1,365
6happyhorse-1.0aorizon1,307
7grok-imagine-videoxai1,258
8kling-o3-prokling1,255
9kling-o1-prokling1,197
10runway-gen4-alephrunway1,182

Search arena

RankModelOrganizationElo score
1gpt-5.6-sol-xhighopenai1,257
2claude-opus-4-6-searchanthropic1,253
3gpt-5.5-searchopenai1,242
4claude-opus-4-7anthropic1,233
5claude-fable-5anthropic1,230
6ernie-5.1baidu1,227
7claude-sonnet-4-6-searchanthropic1,221
8grok-4.5xai1,213
9gemini-3.1-pro-groundinggoogle1,210
10gemini-3-pro-groundinggoogle1,207
11gpt-5.2-searchopenai1,207
12claude-opus-4-8anthropic1,204
13grok-4.20-multi-agent-beta-0309xai1,204
14gpt-5.1-searchopenai1,199
15gemini-3-flash-groundinggoogle1,198

Agentic arena

RankModelOrganizationElo score
1Claude Fable 5.1 (Max)anthropic
2GPT 6 Astra (Max)openai
3Claude Opus 5 (High)anthropic
4Claude Opus 5 (Max)anthropic
5Claude Fable 5 (High)anthropic
6GPT 5.6 Sol (xHigh)openai
7Claude Opus 4.8 (High)anthropic
8Kimi K3 (Max)moonshot
9Claude Sonnet 5 (High)anthropic
10Hy4 previewtencent
11GPT 5.5 (xHigh)openai
12GLM 5.2 (Max)zai
13DeepSeek V4 Pro (High) (0813)deepseek
14Gemini 3.8 Flash (High)google
15Grok 4.5xai

Document arena

RankModelOrganizationElo score
1claude-opus-5-highanthropic1,520
2claude-opus-4-6anthropic1,510
3claude-opus-4-6-thinkinganthropic1,506
4claude-fable-5anthropic1,504
5claude-opus-4-7anthropic1,498
6claude-opus-4-7-thinkinganthropic1,497
7gpt-5.5-highopenai1,485
8claude-sonnet-4-6anthropic1,483
9gpt-5.5openai1,480
10gpt-5.6-terra-xhighopenai1,479
11gpt-5.6-sol-xhighopenai1,479
12claude-opus-4-8-thinkinganthropic1,475
13muse-spark-1.1meta1,472
14claude-sonnet-5-highanthropic1,470
15gpt-5.4openai1,470

Other leaderboards

Artificial Analysis (Intelligence Index)

Metric: AA Intelligence Index (0-100) · artificialanalysis.ai

RankModelOrganizationScore
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic53.4
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic53.2
3GPT-6 Astra (max)OpenAI52.8
4GPT-6 Astra (xhigh)OpenAI52.5
5Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic51.2
6GPT-6 Astra (high)OpenAI51
7Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic50.7
8GPT-6 Astra (medium)OpenAI49.7
9Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic49.7
10Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic49.7
11Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic49.1
12Muse Spark 1.3 (max)Meta48.2
13Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic48.2
14GPT-5.6 Sol (max)OpenAI47.1
15Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic47

LiveBench

Metric: average score (0-100) · livebench.ai

RankModelOrganizationScore
1claude-fable-5-1-max-effort83.8
2claude-fable-5-max-effort83.4
3gpt-6-astra-max83.1
4muse-spark-1.3-xhigh82.4
5gpt-5.6-sol-max81.7
6gpt-5.5-xhigh80.8
7claude-opus-5-max-effort80.5
8gemini-3.7-flash-high79.9
9smaug-agentic79.7
10qwen3.8-max79.5
11kimi-k379.5
12grok-4.679
13muse-spark-1.2-xhigh78.9
14gpt-5.4-xhigh78.8
15gpt-5.6-terra-max78.6

BenchLM

Metric: aggregated display score · benchlm.ai

RankModelOrganizationScore
1Claude Fable 5.1Anthropic84.4
2GPT-6 AstraOpenAI84.1
3Claude Opus 5Anthropic81.6
4Claude Fable 5Anthropic81.3
5GPT-5.6 SolOpenAI80.5
6Gemini 3.8 FlashGoogle77.8
7Kimi K3Moonshot AI74.8
8Claude Opus 4.8Anthropic72.2
9GPT-5.5OpenAI72
10Qwen3.8 MaxAlibaba71.6
11GPT-5.6 TerraOpenAI71.2
12GPT-5.4OpenAI70.8
13Muse Spark 1.2Meta70.5
14Muse Spark 1.1Meta70.4
15Claude Opus 4.7Anthropic70.3

Aider polyglot (coding)

Metric: pass rate 2 (%) · aider.chat/docs/leaderboards/

RankModelOrganizationScore
1gpt-5 (high)88
2gpt-5 (medium)86.7
3o3-pro (high)84.9
4gemini-2.5-pro-preview-06-05 (32k think)83.1
5o3 (high)81.3
6gpt-5 (low)81.3
7grok-4 (high)79.6
8gemini-2.5-pro-preview-06-05 (default think)79.1
9o3 (high) + gpt-4.178.2
10Gemini 2.5 Pro Preview 05-0676.9
11o376.9
12DeepSeek-V3.2-Exp (Reasoner)74.2
13Gemini 2.5 Pro Preview 03-2572.9
14o4-mini (high)72
15claude-opus-4-20250514 (32k thinking)72

Sources and methodology

Rankings above are aggregated from open community evaluations. Elo ratings, confidence intervals and vote counts come from LMArena (crowdsourced head-to-head model battles, published as an open dataset). Model pricing and context metadata come from the public OpenRouter API. Wikiprompt snapshots these sources daily and preserves the history; we run no proprietary evaluations of our own.