← All snapshotsView the live leaderboard

Benchmark snapshot: 2026-09-22

From Wikiprompt, the free prompt encyclopedia

Frozen photo of the rankings on this date. The live leaderboard is at /benchmarks.

← 2026-09-20

Text arena

RankModelOrganizationElo score
2claude-opus-5-maxanthropic1,505
3claude-opus-5-highanthropic1,505
4claude-opus-4-6-highanthropic1,503
5claude-opus-4-6anthropic1,498
7claude-fable-5anthropic1,493
9claude-opus-4-7-highanthropic1,490
12claude-opus-4-7anthropic1,483
13gemini-3.5-flash-highgoogle1,482
15muse-spark-1.1meta1,480
16gemini-3.1-pro-previewgoogle1,480
17gemini-3-progoogle1,479
18gemini-3.6-flash-highgoogle1,476
19gemini-3.5-flash-mediumgoogle1,476
23kimi-k3-maxmoonshot1,472
25qwen3.5-max-previewalibaba1,471

Web development arena

RankModelOrganizationElo score
1gpt-6-astra-maxopenai1,800
2claude-fable-5.1-maxanthropic1,758
3claude-opus-5-maxanthropic1,687
4qwen3.8-max-0902alibaba1,681
5kimi-k3-maxmoonshot1,674
6qwen3.8-maxalibaba1,671
7claude-opus-5-highanthropic1,660
8muse-spark-1.3-maxmeta1,652
9qwen3.8-flash-nextalibaba1,635
10claude-fable-5anthropic1,628
11hy4-previewtencent1,624
12muse-spark-1.3 (xHigh)meta1,623
13grok-4.6-highxai1,618
14gpt-5.6-sol-xhigh (codex-harness)openai1,617
15glm-5.3-maxzai1,614

Vision arena

RankModelOrganizationElo score
1claude-fable-5anthropic1,326
2claude-fable-5.1-maxanthropic1,322
3claude-opus-5-highanthropic1,321
4claude-opus-4-7anthropic1,318
5claude-opus-4-7-highanthropic1,316
6qwen3.8-maxalibaba1,315
7claude-opus-4-6-highanthropic1,315
8muse-spark-1.3-maxmeta1,315
9claude-opus-4-6anthropic1,312
10gemini-3.5-flash-highgoogle1,310
11gemini-3.5-flash-mediumgoogle1,307
12muse-sparkmeta1,306
13gemini-3-progoogle1,304
14muse-spark-1.2 (xHigh)meta1,304
15gpt-5.4-highopenai1,302

Text to image arena

RankModelOrganizationElo score
1gpt-image-2.5-sunburstopenai1,421
2gpt-image-2.5-flareopenai1,399
3gpt-image-2 (medium)openai1,381
4mai-image-2.6microsoft-ai1,331
5grok-imagine-image-2.0 (low)xai1,315
6reve-2.1reve1,301
7muse-imagemeta1,277
8reve-2.0reve1,270
9gemini-3.1-flash-image (nano-banana-2) [web-search]google1,261
10seedream-5.0-probytedance1,257
11qwen-image-3.0-proalibaba1,254
12mai-image-2.5microsoft-ai1,254
13gemini-3.1-flash-lite-image (nano-banana-2-lite)google1,250
14gemini-3-pro-image-2k (nano-banana-pro)google1,246
15gpt-image-1.5-high-fidelityopenai1,239

Image editing arena

RankModelOrganizationElo score
1gpt-image-2.5-sunburstopenai1,520
2gpt-image-2.5-flareopenai1,491
3gpt-image-2 (medium)openai1,461
4grok-imagine-image-2.0 (low)xai1,439
5mai-image-2.6microsoft-ai1,434
6muse-imagemeta1,403
7mai-image-2.5microsoft-ai1,400
8seedream-5.0-probytedance1,394
9gemini-3-pro-image-2k (nano-banana-pro)google1,390
10grok-imagine-image-quality (20260519)xai1,390
11chatgpt-image-latest-high-fidelity (20251216)openai1,389
12gemini-3.1-flash-image (nano-banana-2) [web-search]google1,387
13gemini-3-pro-image-preview (nano-banana-pro)google1,385
14reve-2.1reve1,375
15gpt-image-1.5-high-fidelityopenai1,370

Text to video arena

RankModelOrganizationElo score
1gemini-omni-1.1-flashgoogle1,515
2gemini-omni-flashgoogle1,511
3wan3.0alibaba1,494
4flux-3-videobfl1,494
5grok-imagine-video-1.5-agentxai1,491
6dreamina-seedance-2.5-720pbytedance1,482
7dreamina-seedance-2.0-720pbytedance1,479
8minimax-h3minimax1,462
9muse-videometa1,456
10happyhorse-1.0aorizon1,427
11sora-2-proopenai1,367
12veo-3.1-audiogoogle1,364
13veo-3.1-audio-1080pgoogle1,363
14veo-3.1-fast-audiogoogle1,362
15veo-3.1-fast-audio-1080pgoogle1,358

Video editing arena

RankModelOrganizationElo score
1wan3.0alibaba1,414
2dreamina-seedance-2.5-720pbytedance1,410
3minimax-h3minimax1,392
4gemini-omni-flashgoogle1,367
5dreamina-seedance-2.0-720pbytedance1,365
6happyhorse-1.0aorizon1,307
7grok-imagine-videoxai1,258
8kling-o3-prokling1,255
9kling-o1-prokling1,197
10runway-gen4-alephrunway1,182

Search arena

RankModelOrganizationElo score
1gpt-5.6-sol-xhighopenai1,257
2claude-opus-4-6-searchanthropic1,253
3gpt-5.5-searchopenai1,242
4claude-opus-4-7anthropic1,233
5claude-fable-5anthropic1,230
6ernie-5.1baidu1,227
7claude-sonnet-4-6-searchanthropic1,221
8grok-4.5xai1,213
9gemini-3.1-pro-groundinggoogle1,210
10gemini-3-pro-groundinggoogle1,207
11gpt-5.2-searchopenai1,207
12claude-opus-4-8anthropic1,204
13grok-4.20-multi-agent-beta-0309xai1,204
14gpt-5.1-searchopenai1,199
15gemini-3-flash-groundinggoogle1,198

Agentic arena

RankModelOrganizationElo score
1Claude Fable 5.1 (Max)anthropic
2GPT 6 Astra (Max)openai
3Claude Opus 5 (High)anthropic
4Claude Opus 5 (Max)anthropic
5Claude Fable 5 (High)anthropic
6Claude Opus 4.8 (High)anthropic
7GPT 5.6 Sol (xHigh)openai
8Kimi K3 (Max)moonshot
9Claude Sonnet 5 (High)anthropic
10GPT 5.5 (xHigh)openai
11Hy4 previewtencent
12Deepseek V4.1 Flash (Max)deepseek
13Gemini 3.8 Flash (High)google
14GLM 5.2 (Max)zai
15Muse Spark 1.3 (Max)meta

Document arena

RankModelOrganizationElo score
1claude-opus-5-highanthropic1,516
2claude-fable-5.1-maxanthropic1,513
3claude-opus-4-6-highanthropic1,507
4claude-opus-4-6anthropic1,507
5claude-fable-5anthropic1,496
6claude-opus-4-7anthropic1,495
7claude-opus-4-7-highanthropic1,495
8gpt-5.5openai1,486
9gpt-5.5-highopenai1,484
10gpt-5.6-sol-xhighopenai1,483
11claude-sonnet-4-6anthropic1,482
12claude-opus-4-8-highanthropic1,475
13gpt-5.6-terra-xhighopenai1,472
14gpt-5.4openai1,471
15muse-spark-1.3-maxmeta1,471

Other leaderboards

LiveBench

Metric: average score (0-100) · livebench.ai

RankModelOrganizationScore
1claude-fable-5-1-max-effort83.8
2claude-fable-5-max-effort83.4
3gpt-6-astra-max83.1
4muse-spark-1.3-xhigh82.4
5gpt-5.6-sol-max81.7
6deepseek-v4.1-flash-max81.5
7gpt-5.5-xhigh80.8
8claude-opus-5-max-effort80.5
9gemini-3.7-flash-high79.9
10smaug-agentic79.7
11qwen3.8-max79.5
12kimi-k379.5
13grok-4.679
14muse-spark-1.2-xhigh78.9
15gpt-5.4-xhigh78.8

Artificial Analysis (Intelligence Index)

Metric: AA Intelligence Index (0-100) · artificialanalysis.ai

RankModelOrganizationScore
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic53.4
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic53.2
3GPT-6 Astra (max)OpenAI52.7
4GPT-6 Astra (xhigh)OpenAI52.4
5Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic51.2
6GPT-6 Astra (high)OpenAI50.9
7Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic50.8
8Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic49.7
9Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic49.6
10GPT-6 Astra (medium)OpenAI49.6
11Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic48.9
12Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic48.1
13Muse Spark 1.3 (max)Meta48.1
14GPT-5.6 Sol (max)OpenAI47
15Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic46.8

BenchLM

Metric: aggregated display score · benchlm.ai

RankModelOrganizationScore
1Claude Fable 5.1Anthropic84.6
2GPT-6 AstraOpenAI83.8
3Claude Opus 5Anthropic81.9
4Claude Fable 5Anthropic81.7
5GPT-5.6 SolOpenAI80.7
6Gemini 3.8 FlashGoogle75.8
7Kimi K3Moonshot AI74.4
8Qwen3.8 MaxAlibaba73.3
9Claude Opus 4.8Anthropic72.2
10GPT-5.5OpenAI71.9
11GPT-5.6 TerraOpenAI71.4
12GPT-5.4OpenAI71.2
13Claude Opus 4.7Anthropic70.9
14Gemini 3.1 ProGoogle70.5
15Muse Spark 1.2Meta70.3

Aider polyglot (coding)

Metric: pass rate 2 (%) · aider.chat/docs/leaderboards/

RankModelOrganizationScore
1gpt-5 (high)88
2gpt-5 (medium)86.7
3o3-pro (high)84.9
4gemini-2.5-pro-preview-06-05 (32k think)83.1
5o3 (high)81.3
6gpt-5 (low)81.3
7grok-4 (high)79.6
8gemini-2.5-pro-preview-06-05 (default think)79.1
9o3 (high) + gpt-4.178.2
10Gemini 2.5 Pro Preview 05-0676.9
11o376.9
12DeepSeek-V3.2-Exp (Reasoner)74.2
13Gemini 2.5 Pro Preview 03-2572.9
14o4-mini (high)72
15claude-opus-4-20250514 (32k thinking)72

Sources and methodology

Rankings above are aggregated from open community evaluations. Elo ratings, confidence intervals and vote counts come from LMArena (crowdsourced head-to-head model battles, published as an open dataset). Model pricing and context metadata come from the public OpenRouter API. Wikiprompt snapshots these sources daily and preserves the history; we run no proprietary evaluations of our own.