← All snapshotsView the live leaderboard

Benchmark snapshot: 2026-08-29

From Wikiprompt, the free prompt encyclopedia

Frozen photo of the rankings on this date. The live leaderboard is at /benchmarks.

← 2026-08-282026-08-30 β†’

Text arena

RankModelOrganizationElo score
2claude-opus-5-highanthropic1,504
3claude-opus-4-6-highanthropic1,503
4claude-opus-4-6anthropic1,497
5claude-fable-5anthropic1,495
7claude-opus-4-7-highanthropic1,490
9gemini-3.5-flash-highgoogle1,483
10claude-opus-4-7anthropic1,483
11gemini-3.1-pro-previewgoogle1,480
13gemini-3-progoogle1,480
14muse-spark-1.1meta1,478
15gemini-3.6-flash-highgoogle1,477
17gemini-3.5-flash-mediumgoogle1,475
21gpt-5.5-highopenai1,471
22qwen3.5-max-previewalibaba1,471
23gpt-5.4-highopenai1,470

Web development arena

RankModelOrganizationElo score
1claude-opus-5-maxanthropic1,691
2kimi-k3-maxmoonshot1,674
3qwen3.8-maxalibaba1,669
4claude-opus-5-highanthropic1,663
5grok-4.6-highxai1,629
6claude-fable-5anthropic1,626
7gpt-5.6-sol-xhigh (codex-harness)openai1,619
8glm-5.3-maxzai1,599
9qwen3.8-27balibaba1,595
10gemini-3.7-flash-highgoogle1,587
11glm-5.2-maxzai1,582
12deepseek-v4-pro-high-20260813deepseek1,582
13deepseek-v4-flash-highdeepseek1,579
14claude-opus-4-8-highanthropic1,563
15claude-opus-4-7anthropic1,558

Vision arena

RankModelOrganizationElo score
1claude-fable-5anthropic1,329
2claude-opus-5-highanthropic1,322
3claude-opus-4-7anthropic1,317
4claude-opus-4-7-highanthropic1,316
5claude-opus-4-6-highanthropic1,315
6qwen3.8-maxalibaba1,313
7claude-opus-4-6anthropic1,311
8gemini-3.5-flash-highgoogle1,311
9muse-sparkmeta1,306
10gemini-3.5-flash-mediumgoogle1,306
11gemini-3-progoogle1,304
12muse-spark-1.2 (xHigh)meta1,304
13gemini-3.6-flash-highgoogle1,302
14gpt-5.4-highopenai1,298
15glm-5.3-flashzai1,296

Text to image arena

RankModelOrganizationElo score
1gpt-image-2 (medium)openai1,380
2reve-2.1reve1,302
3muse-imagemeta1,283
4reve-2.0reve1,270
5gemini-3.1-flash-image (nano-banana-2) [web-search]google1,263
6qwen-image-3.0-proalibaba1,258
7seedream-5.0-probytedance1,257
8mai-image-2.5microsoft-ai1,256
9gemini-3.1-flash-lite-image (nano-banana-2-lite)google1,251
10gemini-3-pro-image-2k (nano-banana-pro)google1,246
11gpt-image-1.5-high-fidelityopenai1,239
12gemini-3-pro-image-preview (nano-banana-pro)google1,232
13grok-imagine-image-qualityxai1,228
14ideogram-4.0-qualityideogram1,206
15qwen-image-2.0-pro-2026-06-22alibaba1,191

Image editing arena

RankModelOrganizationElo score
1gpt-image-2 (medium)openai1,463
2grok-imagine-image-2.0 (low)xai1,439
3mai-image-2.6-previewmicrosoft-ai1,420
4muse-imagemeta1,406
5mai-image-2.5microsoft-ai1,401
6seedream-5.0-probytedance1,394
7grok-imagine-image-quality (20260519)xai1,390
8gemini-3-pro-image-2k (nano-banana-pro)google1,390
9chatgpt-image-latest-high-fidelity (20251216)openai1,389
10gemini-3.1-flash-image (nano-banana-2) [web-search]google1,386
11gemini-3-pro-image-preview (nano-banana-pro)google1,385
12reve-2.1reve1,375
13gpt-image-1.5-high-fidelityopenai1,370
14reve-2.0reve1,358
15uni-1.1-maxluma-ai1,334

Text to video arena

RankModelOrganizationElo score
1gemini-omni-1.1-flashgoogle1,515
2gemini-omni-flashgoogle1,512
3flux-3-videobfl1,495
4dreamina-seedance-2.0-720pbytedance1,479
5dreamina-seedance-2.5-720pbytedance1,476
6minimax-h3minimax1,460
7muse-videometa1,457
8happyhorse-1.0aorizon1,428
9sora-2-proopenai1,365
10veo-3.1-audiogoogle1,364
11veo-3.1-audio-1080pgoogle1,363
12veo-3.1-fast-audiogoogle1,361
13veo-3.1-fast-audio-1080pgoogle1,358
14veo-3-fast-audiogoogle1,347
15wan2.7-t2vwan1,344

Video editing arena

RankModelOrganizationElo score
1wan3.0alibaba1,414
2dreamina-seedance-2.5-720pbytedance1,410
3minimax-h3minimax1,392
4gemini-omni-flashgoogle1,367
5dreamina-seedance-2.0-720pbytedance1,365
6happyhorse-1.0aorizon1,307
7grok-imagine-videoxai1,258
8kling-o3-prokling1,255
9kling-o1-prokling1,197
10runway-gen4-alephrunway1,182

Search arena

RankModelOrganizationElo score
1gpt-5.6-sol-xhighopenai1,257
2claude-opus-4-6-searchanthropic1,253
3gpt-5.5-searchopenai1,242
4claude-opus-4-7anthropic1,233
5claude-fable-5anthropic1,230
6ernie-5.1baidu1,227
7claude-sonnet-4-6-searchanthropic1,221
8grok-4.5xai1,213
9gemini-3.1-pro-groundinggoogle1,210
10gemini-3-pro-groundinggoogle1,207
11gpt-5.2-searchopenai1,207
12claude-opus-4-8anthropic1,204
13grok-4.20-multi-agent-beta-0309xai1,204
14gpt-5.1-searchopenai1,199
15gemini-3-flash-groundinggoogle1,198

Agentic arena

RankModelOrganizationElo score
1Claude Opus 5 (High)anthropic
2Claude Opus 5 (Max)anthropic
3Claude Fable 5 (High)anthropic
4GPT 5.6 Sol (xHigh)openai
5Claude Opus 4.8 (High)anthropic
6Kimi K3 (Max)moonshot
7GPT 5.5 (xHigh)openai
8Claude Sonnet 5 (High)anthropic
9Claude Opus 4.7 (High)anthropic
10Claude Opus 4.7anthropic
11Qwen3.8 Maxalibaba
12DeepSeek V4 Pro (High) (0813)deepseek
13GPT 5.5 (High)openai
14Grok 4.5xai
15Grok 4.6 (xHigh)xai

Document arena

RankModelOrganizationElo score
1claude-opus-5-highanthropic1,520
2claude-opus-4-6anthropic1,510
3claude-opus-4-6-thinkinganthropic1,506
4claude-fable-5anthropic1,504
5claude-opus-4-7anthropic1,498
6claude-opus-4-7-thinkinganthropic1,497
7gpt-5.5-highopenai1,485
8claude-sonnet-4-6anthropic1,483
9gpt-5.5openai1,480
10gpt-5.6-terra-xhighopenai1,479
11gpt-5.6-sol-xhighopenai1,479
12claude-opus-4-8-thinkinganthropic1,475
13muse-spark-1.1meta1,472
14claude-sonnet-5-highanthropic1,470
15gpt-5.4openai1,470

Other leaderboards

LiveBench

Metric: average score (0-100) Β· livebench.ai

RankModelOrganizationScore
1claude-fable-5-max-effort83.4
2gpt-5.6-sol-max81.7
3gpt-5.5-xhigh80.8
4claude-opus-5-max-effort80.5
5gemini-3.7-flash-high79.9
6smaug-agentic79.7
7qwen3.8-max79.5
8kimi-k379.5
9grok-4.679
10muse-spark-1.2-xhigh78.9
11gpt-5.4-xhigh78.8
12gpt-5.6-terra-max78.6
13deepseek-v4-pro-081378.2
14gemini-3.1-pro-preview-high78
15deepseek-v4-flash-vision-exp77.7

Aider polyglot (coding)

Metric: pass rate 2 (%) Β· aider.chat/docs/leaderboards/

RankModelOrganizationScore
1gpt-5 (high)88
2gpt-5 (medium)86.7
3o3-pro (high)84.9
4gemini-2.5-pro-preview-06-05 (32k think)83.1
5o3 (high)81.3
6gpt-5 (low)81.3
7grok-4 (high)79.6
8gemini-2.5-pro-preview-06-05 (default think)79.1
9o3 (high) + gpt-4.178.2
10Gemini 2.5 Pro Preview 05-0676.9
11o376.9
12DeepSeek-V3.2-Exp (Reasoner)74.2
13Gemini 2.5 Pro Preview 03-2572.9
14o4-mini (high)72
15claude-opus-4-20250514 (32k thinking)72

Sources and methodology

Rankings above are aggregated from open community evaluations. Elo ratings, confidence intervals and vote counts come from LMArena (crowdsourced head-to-head model battles, published as an open dataset). Model pricing and context metadata come from the public OpenRouter API. Wikiprompt snapshots these sources daily and preserves the history; we run no proprietary evaluations of our own.