← All snapshotsView the live leaderboard

Benchmark snapshot: 2026-09-13

From Wikiprompt, the free prompt encyclopedia

Frozen photo of the rankings on this date. The live leaderboard is at /benchmarks.

← 2026-09-122026-09-14 →

Text arena

RankModelOrganizationElo score
2claude-opus-5-highanthropic1,505
3claude-opus-5-maxanthropic1,504
4claude-opus-4-6-highanthropic1,503
5claude-opus-4-6anthropic1,498
7claude-fable-5anthropic1,492
9claude-opus-4-7-highanthropic1,490
11claude-opus-4-7anthropic1,483
12gemini-3.5-flash-highgoogle1,483
13muse-spark-1.1meta1,481
15gemini-3.1-pro-previewgoogle1,480
16gemini-3-progoogle1,479
18gemini-3.5-flash-mediumgoogle1,476
19gemini-3.6-flash-highgoogle1,475
22kimi-k3-maxmoonshot1,472
24gpt-5.5-highopenai1,471

Web development arena

RankModelOrganizationElo score
1gpt-6-astra-maxopenai1,800
2claude-fable-5.1-maxanthropic1,758
3claude-opus-5-maxanthropic1,687
4qwen3.8-max-0902alibaba1,681
5kimi-k3-maxmoonshot1,674
6qwen3.8-maxalibaba1,671
7claude-opus-5-highanthropic1,660
8muse-spark-1.3-maxmeta1,652
9qwen3.8-flash-nextalibaba1,635
10claude-fable-5anthropic1,628
11hy4-previewtencent1,624
12muse-spark-1.3 (xHigh)meta1,623
13grok-4.6-highxai1,618
14gpt-5.6-sol-xhigh (codex-harness)openai1,617
15glm-5.3-maxzai1,614

Vision arena

RankModelOrganizationElo score
1claude-fable-5anthropic1,329
2claude-opus-5-highanthropic1,322
3claude-opus-4-7anthropic1,317
4claude-opus-4-7-highanthropic1,316
5claude-opus-4-6-highanthropic1,315
6qwen3.8-maxalibaba1,313
7claude-opus-4-6anthropic1,311
8gemini-3.5-flash-highgoogle1,311
9muse-sparkmeta1,306
10gemini-3.5-flash-mediumgoogle1,306
11gemini-3-progoogle1,304
12muse-spark-1.2 (xHigh)meta1,304
13gemini-3.6-flash-highgoogle1,302
14gpt-5.4-highopenai1,298
15glm-5.3-flashzai1,296

Text to image arena

RankModelOrganizationElo score
1gpt-image-2.5-sunburstopenai1,421
2gpt-image-2.5-flareopenai1,399
3gpt-image-2 (medium)openai1,381
4mai-image-2.6microsoft-ai1,331
5grok-imagine-image-2.0 (low)xai1,315
6reve-2.1reve1,301
7muse-imagemeta1,277
8reve-2.0reve1,270
9gemini-3.1-flash-image (nano-banana-2) [web-search]google1,261
10seedream-5.0-probytedance1,257
11qwen-image-3.0-proalibaba1,254
12mai-image-2.5microsoft-ai1,254
13gemini-3.1-flash-lite-image (nano-banana-2-lite)google1,250
14gemini-3-pro-image-2k (nano-banana-pro)google1,246
15gpt-image-1.5-high-fidelityopenai1,239

Image editing arena

RankModelOrganizationElo score
1gpt-image-2.5-sunburstopenai1,520
2gpt-image-2.5-flareopenai1,491
3gpt-image-2 (medium)openai1,461
4grok-imagine-image-2.0 (low)xai1,439
5mai-image-2.6microsoft-ai1,434
6muse-imagemeta1,403
7mai-image-2.5microsoft-ai1,400
8seedream-5.0-probytedance1,394
9gemini-3-pro-image-2k (nano-banana-pro)google1,390
10grok-imagine-image-quality (20260519)xai1,390
11chatgpt-image-latest-high-fidelity (20251216)openai1,389
12gemini-3.1-flash-image (nano-banana-2) [web-search]google1,387
13gemini-3-pro-image-preview (nano-banana-pro)google1,385
14reve-2.1reve1,375
15gpt-image-1.5-high-fidelityopenai1,370

Text to video arena

RankModelOrganizationElo score
1gemini-omni-1.1-flashgoogle1,515
2gemini-omni-flashgoogle1,511
3wan3.0alibaba1,494
4flux-3-videobfl1,494
5grok-imagine-video-1.5-agentxai1,491
6dreamina-seedance-2.5-720pbytedance1,482
7dreamina-seedance-2.0-720pbytedance1,479
8minimax-h3minimax1,462
9muse-videometa1,456
10happyhorse-1.0aorizon1,427
11sora-2-proopenai1,367
12veo-3.1-audiogoogle1,364
13veo-3.1-audio-1080pgoogle1,363
14veo-3.1-fast-audiogoogle1,362
15veo-3.1-fast-audio-1080pgoogle1,358

Video editing arena

RankModelOrganizationElo score
1wan3.0alibaba1,414
2dreamina-seedance-2.5-720pbytedance1,410
3minimax-h3minimax1,392
4gemini-omni-flashgoogle1,367
5dreamina-seedance-2.0-720pbytedance1,365
6happyhorse-1.0aorizon1,307
7grok-imagine-videoxai1,258
8kling-o3-prokling1,255
9kling-o1-prokling1,197
10runway-gen4-alephrunway1,182

Search arena

RankModelOrganizationElo score
1gpt-5.6-sol-xhighopenai1,257
2claude-opus-4-6-searchanthropic1,253
3gpt-5.5-searchopenai1,242
4claude-opus-4-7anthropic1,233
5claude-fable-5anthropic1,230
6ernie-5.1baidu1,227
7claude-sonnet-4-6-searchanthropic1,221
8grok-4.5xai1,213
9gemini-3.1-pro-groundinggoogle1,210
10gemini-3-pro-groundinggoogle1,207
11gpt-5.2-searchopenai1,207
12claude-opus-4-8anthropic1,204
13grok-4.20-multi-agent-beta-0309xai1,204
14gpt-5.1-searchopenai1,199
15gemini-3-flash-groundinggoogle1,198

Agentic arena

RankModelOrganizationElo score
1Claude Fable 5.1 (Max)anthropic
2GPT 6 Astra (Max)openai
3Claude Opus 5 (High)anthropic
4Claude Opus 5 (Max)anthropic
5Claude Fable 5 (High)anthropic
6Claude Opus 4.8 (High)anthropic
7GPT 5.6 Sol (xHigh)openai
8Kimi K3 (Max)moonshot
9Claude Sonnet 5 (High)anthropic
10Hy4 previewtencent
11GPT 5.5 (xHigh)openai
12GLM 5.2 (Max)zai
13Muse Spark 1.3 (Max)meta
14DeepSeek V4 Pro (High) (0813)deepseek
15Qwen3.8 Maxalibaba

Document arena

RankModelOrganizationElo score
1claude-opus-5-highanthropic1,520
2claude-opus-4-6anthropic1,510
3claude-opus-4-6-thinkinganthropic1,506
4claude-fable-5anthropic1,504
5claude-opus-4-7anthropic1,498
6claude-opus-4-7-thinkinganthropic1,497
7gpt-5.5-highopenai1,485
8claude-sonnet-4-6anthropic1,483
9gpt-5.5openai1,480
10gpt-5.6-terra-xhighopenai1,479
11gpt-5.6-sol-xhighopenai1,479
12claude-opus-4-8-thinkinganthropic1,475
13muse-spark-1.1meta1,472
14claude-sonnet-5-highanthropic1,470
15gpt-5.4openai1,470

Other leaderboards

Aider polyglot (coding)

Metric: pass rate 2 (%) · aider.chat/docs/leaderboards/

RankModelOrganizationScore
1gpt-5 (high)88
2gpt-5 (medium)86.7
3o3-pro (high)84.9
4gemini-2.5-pro-preview-06-05 (32k think)83.1
5o3 (high)81.3
6gpt-5 (low)81.3
7grok-4 (high)79.6
8gemini-2.5-pro-preview-06-05 (default think)79.1
9o3 (high) + gpt-4.178.2
10Gemini 2.5 Pro Preview 05-0676.9
11o376.9
12DeepSeek-V3.2-Exp (Reasoner)74.2
13Gemini 2.5 Pro Preview 03-2572.9
14o4-mini (high)72
15claude-opus-4-20250514 (32k thinking)72

LiveBench

Metric: average score (0-100) · livebench.ai

RankModelOrganizationScore
1claude-fable-5-1-max-effort83.8
2claude-fable-5-max-effort83.4
3gpt-6-astra-max83.1
4muse-spark-1.3-xhigh82.4
5gpt-5.6-sol-max81.7
6deepseek-v4.1-flash-max81.5
7gpt-5.5-xhigh80.8
8claude-opus-5-max-effort80.5
9gemini-3.7-flash-high79.9
10smaug-agentic79.7
11qwen3.8-max79.5
12kimi-k379.5
13grok-4.679
14muse-spark-1.2-xhigh78.9
15gpt-5.4-xhigh78.8

Artificial Analysis (Intelligence Index)

Metric: AA Intelligence Index (0-100) · artificialanalysis.ai

RankModelOrganizationScore
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic53.4
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic53.2
3GPT-6 Astra (max)OpenAI52.8
4GPT-6 Astra (xhigh)OpenAI52.5
5Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic51.2
6GPT-6 Astra (high)OpenAI51
7Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic50.7
8Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic49.7
9GPT-6 Astra (medium)OpenAI49.7
10Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic49.7
11Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic49.1
12Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic48.2
13Muse Spark 1.3 (max)Meta48.2
14GPT-5.6 Sol (max)OpenAI47.1
15Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic47

BenchLM

Metric: aggregated display score · benchlm.ai

RankModelOrganizationScore
1Claude Fable 5.1Anthropic84.6
2GPT-6 AstraOpenAI84.1
3Claude Opus 5Anthropic82
4Claude Fable 5Anthropic81.4
5GPT-5.6 SolOpenAI80.6
6Gemini 3.8 FlashGoogle75.6
7Kimi K3Moonshot AI74.8
8Claude Opus 4.8Anthropic72.2
9GPT-5.5OpenAI72.1
10Qwen3.8 MaxAlibaba71.6
11GPT-5.6 TerraOpenAI71.1
12GPT-5.4OpenAI70.9
13Muse Spark 1.2Meta70.5
14Muse Spark 1.1Meta70.4
15Claude Opus 4.7Anthropic70.3

Sources and methodology

Rankings above are aggregated from open community evaluations. Elo ratings, confidence intervals and vote counts come from LMArena (crowdsourced head-to-head model battles, published as an open dataset). Model pricing and context metadata come from the public OpenRouter API. Wikiprompt snapshots these sources daily and preserves the history; we run no proprietary evaluations of our own.