← All snapshotsView the live leaderboard

Benchmark snapshot: 2026-09-17

From Wikiprompt, the free prompt encyclopedia

Frozen photo of the rankings on this date. The live leaderboard is at /benchmarks.

← 2026-09-152026-09-18 →

Text arena

RankModelOrganizationElo score
2claude-opus-5-maxanthropic1,505
3claude-opus-5-highanthropic1,505
4claude-opus-4-6-highanthropic1,503
5claude-opus-4-6anthropic1,498
7claude-fable-5anthropic1,493
9claude-opus-4-7-highanthropic1,490
12claude-opus-4-7anthropic1,483
13gemini-3.5-flash-highgoogle1,482
15muse-spark-1.1meta1,480
16gemini-3.1-pro-previewgoogle1,480
17gemini-3-progoogle1,479
18gemini-3.6-flash-highgoogle1,476
19gemini-3.5-flash-mediumgoogle1,476
23kimi-k3-maxmoonshot1,472
25qwen3.5-max-previewalibaba1,471

Web development arena

RankModelOrganizationElo score
1gpt-6-astra-maxopenai1,800
2claude-fable-5.1-maxanthropic1,758
3claude-opus-5-maxanthropic1,687
4qwen3.8-max-0902alibaba1,681
5kimi-k3-maxmoonshot1,674
6qwen3.8-maxalibaba1,671
7claude-opus-5-highanthropic1,660
8muse-spark-1.3-maxmeta1,652
9qwen3.8-flash-nextalibaba1,635
10claude-fable-5anthropic1,628
11hy4-previewtencent1,624
12muse-spark-1.3 (xHigh)meta1,623
13grok-4.6-highxai1,618
14gpt-5.6-sol-xhigh (codex-harness)openai1,617
15glm-5.3-maxzai1,614

Vision arena

RankModelOrganizationElo score
1claude-fable-5anthropic1,326
2claude-fable-5.1-maxanthropic1,322
3claude-opus-5-highanthropic1,321
4claude-opus-4-7anthropic1,318
5claude-opus-4-7-highanthropic1,316
6qwen3.8-maxalibaba1,315
7claude-opus-4-6-highanthropic1,315
8muse-spark-1.3-maxmeta1,315
9claude-opus-4-6anthropic1,312
10gemini-3.5-flash-highgoogle1,310
11gemini-3.5-flash-mediumgoogle1,307
12muse-sparkmeta1,306
13gemini-3-progoogle1,304
14muse-spark-1.2 (xHigh)meta1,304
15gpt-5.4-highopenai1,302

Text to image arena

RankModelOrganizationElo score
1gpt-image-2.5-sunburstopenai1,421
2gpt-image-2.5-flareopenai1,399
3gpt-image-2 (medium)openai1,381
4mai-image-2.6microsoft-ai1,331
5grok-imagine-image-2.0 (low)xai1,315
6reve-2.1reve1,301
7muse-imagemeta1,277
8reve-2.0reve1,270
9gemini-3.1-flash-image (nano-banana-2) [web-search]google1,261
10seedream-5.0-probytedance1,257
11qwen-image-3.0-proalibaba1,254
12mai-image-2.5microsoft-ai1,254
13gemini-3.1-flash-lite-image (nano-banana-2-lite)google1,250
14gemini-3-pro-image-2k (nano-banana-pro)google1,246
15gpt-image-1.5-high-fidelityopenai1,239

Image editing arena

RankModelOrganizationElo score
1gpt-image-2.5-sunburstopenai1,520
2gpt-image-2.5-flareopenai1,491
3gpt-image-2 (medium)openai1,461
4grok-imagine-image-2.0 (low)xai1,439
5mai-image-2.6microsoft-ai1,434
6muse-imagemeta1,403
7mai-image-2.5microsoft-ai1,400
8seedream-5.0-probytedance1,394
9gemini-3-pro-image-2k (nano-banana-pro)google1,390
10grok-imagine-image-quality (20260519)xai1,390
11chatgpt-image-latest-high-fidelity (20251216)openai1,389
12gemini-3.1-flash-image (nano-banana-2) [web-search]google1,387
13gemini-3-pro-image-preview (nano-banana-pro)google1,385
14reve-2.1reve1,375
15gpt-image-1.5-high-fidelityopenai1,370

Text to video arena

RankModelOrganizationElo score
1gemini-omni-1.1-flashgoogle1,515
2gemini-omni-flashgoogle1,511
3wan3.0alibaba1,494
4flux-3-videobfl1,494
5grok-imagine-video-1.5-agentxai1,491
6dreamina-seedance-2.5-720pbytedance1,482
7dreamina-seedance-2.0-720pbytedance1,479
8minimax-h3minimax1,462
9muse-videometa1,456
10happyhorse-1.0aorizon1,427
11sora-2-proopenai1,367
12veo-3.1-audiogoogle1,364
13veo-3.1-audio-1080pgoogle1,363
14veo-3.1-fast-audiogoogle1,362
15veo-3.1-fast-audio-1080pgoogle1,358

Video editing arena

RankModelOrganizationElo score
1wan3.0alibaba1,414
2dreamina-seedance-2.5-720pbytedance1,410
3minimax-h3minimax1,392
4gemini-omni-flashgoogle1,367
5dreamina-seedance-2.0-720pbytedance1,365
6happyhorse-1.0aorizon1,307
7grok-imagine-videoxai1,258
8kling-o3-prokling1,255
9kling-o1-prokling1,197
10runway-gen4-alephrunway1,182

Search arena

RankModelOrganizationElo score
1gpt-5.6-sol-xhighopenai1,257
2claude-opus-4-6-searchanthropic1,253
3gpt-5.5-searchopenai1,242
4claude-opus-4-7anthropic1,233
5claude-fable-5anthropic1,230
6ernie-5.1baidu1,227
7claude-sonnet-4-6-searchanthropic1,221
8grok-4.5xai1,213
9gemini-3.1-pro-groundinggoogle1,210
10gemini-3-pro-groundinggoogle1,207
11gpt-5.2-searchopenai1,207
12claude-opus-4-8anthropic1,204
13grok-4.20-multi-agent-beta-0309xai1,204
14gpt-5.1-searchopenai1,199
15gemini-3-flash-groundinggoogle1,198

Agentic arena

RankModelOrganizationElo score
1Claude Fable 5.1 (Max)anthropic
2GPT 6 Astra (Max)openai
3Claude Opus 5 (High)anthropic
4Claude Opus 5 (Max)anthropic
5Claude Fable 5 (High)anthropic
6Claude Opus 4.8 (High)anthropic
7GPT 5.6 Sol (xHigh)openai
8Kimi K3 (Max)moonshot
9Claude Sonnet 5 (High)anthropic
10GPT 5.5 (xHigh)openai
11Hy4 previewtencent
12Deepseek V4.1 Flash (Max)deepseek
13Gemini 3.8 Flash (High)google
14GLM 5.2 (Max)zai
15Muse Spark 1.3 (Max)meta

Document arena

RankModelOrganizationElo score
1claude-opus-5-highanthropic1,516
2claude-fable-5.1-maxanthropic1,513
3claude-opus-4-6-highanthropic1,507
4claude-opus-4-6anthropic1,507
5claude-fable-5anthropic1,496
6claude-opus-4-7anthropic1,495
7claude-opus-4-7-highanthropic1,495
8gpt-5.5openai1,486
9gpt-5.5-highopenai1,484
10gpt-5.6-sol-xhighopenai1,483
11claude-sonnet-4-6anthropic1,482
12claude-opus-4-8-highanthropic1,475
13gpt-5.6-terra-xhighopenai1,472
14gpt-5.4openai1,471
15muse-spark-1.3-maxmeta1,471

Other leaderboards

Artificial Analysis (Intelligence Index)

Metric: AA Intelligence Index (0-100) · artificialanalysis.ai

RankModelOrganizationScore
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic53.4
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic53.2
3GPT-6 Astra (max)OpenAI52.8
4GPT-6 Astra (xhigh)OpenAI52.5
5Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic51.2
6GPT-6 Astra (high)OpenAI51
7Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic50.7
8Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic49.7
9GPT-6 Astra (medium)OpenAI49.7
10Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic49.7
11Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic49.1
12Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic48.2
13Muse Spark 1.3 (max)Meta48.2
14GPT-5.6 Sol (max)OpenAI47.1
15Claude Fable 5.1 (Adaptive Reasoning, Low Effort, Default Fallback)Anthropic47

Aider polyglot (coding)

Metric: pass rate 2 (%) · aider.chat/docs/leaderboards/

RankModelOrganizationScore
1gpt-5 (high)88
2gpt-5 (medium)86.7
3o3-pro (high)84.9
4gemini-2.5-pro-preview-06-05 (32k think)83.1
5o3 (high)81.3
6gpt-5 (low)81.3
7grok-4 (high)79.6
8gemini-2.5-pro-preview-06-05 (default think)79.1
9o3 (high) + gpt-4.178.2
10Gemini 2.5 Pro Preview 05-0676.9
11o376.9
12DeepSeek-V3.2-Exp (Reasoner)74.2
13Gemini 2.5 Pro Preview 03-2572.9
14o4-mini (high)72
15claude-opus-4-20250514 (32k thinking)72

LiveBench

Metric: average score (0-100) · livebench.ai

RankModelOrganizationScore
1claude-fable-5-1-max-effort83.8
2claude-fable-5-max-effort83.4
3gpt-6-astra-max83.1
4muse-spark-1.3-xhigh82.4
5gpt-5.6-sol-max81.7
6deepseek-v4.1-flash-max81.5
7gpt-5.5-xhigh80.8
8claude-opus-5-max-effort80.5
9gemini-3.7-flash-high79.9
10smaug-agentic79.7
11qwen3.8-max79.5
12kimi-k379.5
13grok-4.679
14muse-spark-1.2-xhigh78.9
15gpt-5.4-xhigh78.8

BenchLM

Metric: aggregated display score · benchlm.ai

RankModelOrganizationScore
1Claude Fable 5.1Anthropic84.8
2GPT-6 AstraOpenAI82.9
3Claude Opus 5Anthropic81.8
4Claude Fable 5Anthropic81.4
5GPT-5.6 SolOpenAI80.7
6Gemini 3.8 FlashGoogle75.5
7Kimi K3Moonshot AI74.6
8Claude Opus 4.8Anthropic72.3
9GPT-5.5OpenAI72.1
10Qwen3.8 MaxAlibaba71.8
11GPT-5.6 TerraOpenAI71.1
12GPT-5.4OpenAI71
13Claude Opus 4.7Anthropic70.6
14Muse Spark 1.2Meta70.4
15Muse Spark 1.1Meta70.3

Sources and methodology

Rankings above are aggregated from open community evaluations. Elo ratings, confidence intervals and vote counts come from LMArena (crowdsourced head-to-head model battles, published as an open dataset). Model pricing and context metadata come from the public OpenRouter API. Wikiprompt snapshots these sources daily and preserves the history; we run no proprietary evaluations of our own.