모든 벤치마크

텍스트 아레나

Wikiprompt, 무료 프롬프트 백과사전에서

커뮤니티 Elo 리더보드로, LMArena 일대일 배틀에서 매일 집계됩니다. 먼저 전체 아레나, 그 다음 카테고리별 세부 정보가 표시됩니다.

마지막 업데이트: 2026-09-04 · 213 모델

순위모델조직Elo 점수
2claude-opus-5-highanthropic1,504
3claude-opus-4-6-highanthropic1,503
4claude-opus-4-6anthropic1,498
5claude-fable-5anthropic1,494
7claude-opus-4-7-highanthropic1,490
9gemini-3.5-flash-highgoogle1,484
10claude-opus-4-7anthropic1,483
11gemini-3.1-pro-previewgoogle1,480
13gemini-3-progoogle1,480
14muse-spark-1.1meta1,479
15gemini-3.6-flash-highgoogle1,476
17gemini-3.5-flash-mediumgoogle1,476
21gpt-5.5-highopenai1,472
22qwen3.5-max-previewalibaba1,471
24gpt-5.4-highopenai1,470
25ernie-5.1baidu1,468
26glm-5.2-maxzai1,467
27gpt-5.5openai1,467
28gemini-3-flashgoogle1,467
29mimo-v2.5-proxiaomi1,466
30glm-5.1zai1,463
31claude-opus-4-8-highanthropic1,461
32claude-sonnet-4-6anthropic1,458
33gemini-2.5-progoogle1,458
34kimi-k2.6moonshot1,455
35gpt-5.6-sol-xhighopenai1,455
36qwen3.7-plusalibaba1,454
37gpt-5.4openai1,453
38claude-opus-4-8anthropic1,452
39grok-4.5xai1,452
40grok-4.20-beta-0309-reasoningxai1,451
41deepseek-v4-prodeepseek1,451
42claude-opus-4-5-20251101anthropic1,450
43grok-4.20-multi-agent-beta-0309xai1,450
44dola-seed-2.0-probytedance1,448
46claude-opus-4-5-20251101-high-32kanthropic1,447
47gpt-5.6-terra-xhighopenai1,447
48glm-5zai1,446
50kimi-k2.5-thinkingmoonshot1,446
51deepseek-v4-pro-high-previewdeepseek1,445
53grok-4.20-beta1xai1,444
54ernie-5.0-0110baidu1,444
56claude-sonnet-5-highanthropic1,443
58gemini-3-flash (thinking-minimal)google1,442
59gpt-5.1-highopenai1,442
61glm-4.6zai1,440
64qwen3-max-previewalibaba1,439
65gpt-5.2-chat-latest-20260210openai1,439
66claude-sonnet-4-5-20250929anthropic1,438
67inklingthinky1,438
68qwen3.5-397b-a17balibaba1,438
70grok-4.1-thinkingxai1,437
71qwen3.6-plusalibaba1,437
73mimo-v2-proxiaomi1,436
74gemini-3.5-flash-litegoogle1,436
75grok-4.1xai1,436
77minimax-m3minimax1,435
79claude-sonnet-4-5-20250929-high-32kanthropic1,434
80deepseek-v4-flashdeepseek1,432
82gpt-5.6-luna-xhighopenai1,430
83glm-4.5zai1,430
84chatgpt-4o-latest-20250326openai1,429
85mistral-large-3mistral1,428
86mimo-v2.5xiaomi1,427
88longcat-flash-chat-2602-expmeituan1,426
89grok-3-preview-02-24xai1,425
91deepseek-v3.2deepseek1,425
92mistral-medium-2508mistral1,425
93deepseek-v4-flash-high-previewdeepseek1,424
96gpt-5.1openai1,422
97mimo-v2-omnixiaomi1,422
102deepseek-v3.2-thinkingdeepseek1,420
103qwen3-235b-a22b-instruct-2507alibaba1,420
105gpt-5.5-instantopenai1,420
107claude-opus-4-1-20250805-thinking-16kanthropic1,419
108qwen3.5-122b-a10balibaba1,418
109claude-opus-4-1-20250805anthropic1,418
110qwen3-next-80b-a3b-instructalibaba1,417
111gemini-2.5-flashgoogle1,417
114gpt-5.2-highopenai1,417
116amazon-nova-experimental-chat-11-10amazon1,416
117gemini-3.1-flash-lite-previewgoogle1,415
119kimi-k2-thinking-turbomoonshot1,414
122gpt-5.2openai1,412
123gpt-5.4-mini-highopenai1,412
124grok-4-0709xai1,411
125mimo-v2-flash (non-thinking)xiaomi1,411
126o3-2025-04-16openai1,410
127qwen3.5-27balibaba1,408
128grok-4-1-fast-reasoningxai1,408
129gemini-2.5-flash-preview-09-2025google1,407
132gpt-5-highopenai1,406
134minimax-m2.7minimax1,405
135step-3.5-flashstepfun1,404
136gpt-5-chatopenai1,404
141grok-4.3xai1,398
142qwen3.5-flashalibaba1,398
143qwen3.5-35b-a3balibaba1,396
144claude-haiku-4-5-20251001anthropic1,395
147qwen3-235b-a22b-no-thinkingalibaba1,394

카테고리별

Exclude ties

순위모델조직Elo 점수
2claude-opus-5-highanthropic1,519
3claude-opus-4-6-highanthropic1,519
4claude-opus-4-6anthropic1,513
5claude-fable-5anthropic1,508
7claude-opus-4-7-highanthropic1,502
9gemini-3.5-flash-highgoogle1,492
10claude-opus-4-7anthropic1,492
11gemini-3-progoogle1,491
12gemini-3.1-pro-previewgoogle1,490
17gemini-3.5-flash-mediumgoogle1,483
22gpt-5.5-highopenai1,477
23gemini-3-flashgoogle1,475
25gpt-5.4-highopenai1,474
26ernie-5.1baidu1,472
27glm-5.2-maxzai1,471

Non english

순위모델조직Elo 점수
2claude-opus-5-highanthropic1,501
3claude-opus-4-6-highanthropic1,490
6claude-opus-4-6anthropic1,486
7claude-opus-4-7-highanthropic1,482
9gemini-3.5-flash-highgoogle1,479
10gemini-3.1-pro-previewgoogle1,477
11claude-opus-4-7anthropic1,475
12gemini-3-progoogle1,474
18gpt-5.5-highopenai1,467
21gpt-5.4-highopenai1,465
24gpt-5.5openai1,460
27ernie-5.1baidu1,455
28glm-5.2-maxzai1,455
29claude-opus-4-8-highanthropic1,453
30gemini-2.5-progoogle1,451

English

순위모델조직Elo 점수
1claude-opus-4-6-highanthropic1,512
2claude-opus-4-6anthropic1,506
6claude-opus-4-7-highanthropic1,495
11claude-opus-4-7anthropic1,486
16mimo-v2.5-proxiaomi1,479
19gemini-3.1-pro-previewgoogle1,477
23glm-5.1zai1,474
24claude-sonnet-4-6anthropic1,473
28gpt-5.5-highopenai1,470
30gpt-5.4-highopenai1,468
31gpt-5.5openai1,468
32claude-opus-4-8-highanthropic1,465
33claude-opus-4-5-20251101anthropic1,460
35deepseek-v4-prodeepseek1,459
37gemini-2.5-progoogle1,459

Hard prompts

순위모델조직Elo 점수
1claude-opus-4-6-highanthropic1,527
3claude-opus-5-highanthropic1,523
4claude-opus-4-6anthropic1,523
6claude-opus-4-7-highanthropic1,506
7claude-opus-4-7anthropic1,499
13gemini-3.5-flash-highgoogle1,491
14gpt-5.5-highopenai1,489
16mimo-v2.5-proxiaomi1,488
18gpt-5.4-highopenai1,486
19claude-sonnet-4-6anthropic1,485
21gpt-5.5openai1,485
22gemini-3.1-pro-previewgoogle1,484
24claude-opus-4-8-highanthropic1,483
26gemini-3-progoogle1,482
27gemini-3.5-flash-mediumgoogle1,481

Industry software and it services

순위모델조직Elo 점수
1claude-opus-4-6-highanthropic1,529
3claude-opus-4-6anthropic1,528
5claude-opus-4-7-highanthropic1,516
7claude-opus-4-7anthropic1,506
16mimo-v2.5-proxiaomi1,494
18gpt-5.5-highopenai1,493
21claude-sonnet-4-6anthropic1,492
22gpt-5.4-highopenai1,491
23claude-opus-4-8-highanthropic1,488
26gemini-3.1-pro-previewgoogle1,485
28gpt-5.5openai1,485
33claude-opus-4-5-20251101anthropic1,482
36claude-opus-4-8anthropic1,480
41gpt-5.4openai1,475
44dola-seed-2.0-probytedance1,474

Instruction following

순위모델조직Elo 점수
1claude-opus-4-6-highanthropic1,523
4claude-opus-4-6anthropic1,511
6claude-opus-4-7-highanthropic1,498
7claude-opus-4-7anthropic1,488
12gpt-5.5-highopenai1,478
13mimo-v2.5-proxiaomi1,478
16claude-sonnet-4-6anthropic1,477
18gpt-5.5openai1,473
19claude-opus-4-5-20251101anthropic1,473
21gpt-5.4-highopenai1,470
25gemini-3.1-pro-previewgoogle1,466
30claude-sonnet-4-5-20250929anthropic1,459
34claude-sonnet-4-5-20250929-high-32kanthropic1,458
36gpt-5.4openai1,455
53gemini-2.5-progoogle1,437

Longer query

순위모델조직Elo 점수
1claude-opus-4-6-highanthropic1,520
2claude-opus-4-6anthropic1,517
6claude-opus-4-7-highanthropic1,505
7claude-opus-4-7anthropic1,498
14gpt-5.5-highopenai1,485
16gemini-3.1-pro-previewgoogle1,483
17claude-opus-4-8-highanthropic1,482
18mimo-v2.5-proxiaomi1,482
20claude-sonnet-4-6anthropic1,480
21claude-opus-4-8anthropic1,480
22gpt-5.5openai1,480
23claude-opus-4-5-20251101anthropic1,479
27claude-sonnet-4-5-20250929anthropic1,476
29claude-sonnet-4-5-20250929-high-32kanthropic1,476
30gpt-5.4-highopenai1,475

Hard prompts english

순위모델조직Elo 점수
1claude-opus-4-6-highanthropic1,531
2claude-opus-4-6anthropic1,527
7claude-opus-4-7-highanthropic1,506
9claude-opus-4-7anthropic1,501
12claude-sonnet-4-6anthropic1,493
19gpt-5.5-highopenai1,483
22gpt-5.5openai1,482
27gemini-3.1-pro-previewgoogle1,479
37claude-sonnet-4-5-20250929-high-32kanthropic1,472
38claude-sonnet-4-5-20250929anthropic1,471
43gpt-5.4openai1,464
50kimi-k2.5-thinkingmoonshot1,460
59grok-4.20-beta-0309-reasoningxai1,455
64gemini-2.5-progoogle1,453
71qwen3.5-397b-a17balibaba1,450

Industry writing and literature and language

순위모델조직Elo 점수
8gemini-3.1-pro-previewgoogle1,480
30gemini-2.5-progoogle1,453
47gemini-3-flash (thinking-minimal)google1,437
90gemini-2.5-flashgoogle1,406
107mistral-medium-2508mistral1,396
111gpt-5.2openai1,392
115qwen3-235b-a22b-instruct-2507alibaba1,390
123claude-haiku-4-5-20251001anthropic1,387
198claude-3-5-sonnet-20241022anthropic1,313
214gpt-4o-2024-05-13openai1,297
226gemini-1.5-pro-001google1,288
235claude-3-5-sonnet-20240620anthropic1,280
237gpt-4-turbo-2024-04-09openai1,278
250claude-3-opus-20240229anthropic1,268
252gpt-4-1106-previewopenai1,264

Coding

순위모델조직Elo 점수
2claude-opus-4-6anthropic1,534
27claude-sonnet-4-5-20250929-high-32kanthropic1,489
32claude-sonnet-4-5-20250929anthropic1,485
38gemini-3.1-pro-previewgoogle1,483
49kimi-k2.5-thinkingmoonshot1,474
54dola-seed-2.0-probytedance1,472
65qwen3.5-397b-a17balibaba1,464
85gemini-2.5-progoogle1,453
86claude-haiku-4-5-20251001anthropic1,453
93qwen3-235b-a22b-instruct-2507alibaba1,445
106gemini-3-flash (thinking-minimal)google1,437
112mistral-medium-2508mistral1,434
116gpt-5.2openai1,432
128gemini-2.5-flashgoogle1,424
241gpt-4o-2024-05-13openai1,298

Industry life and physical and social science

순위모델조직Elo 점수
25gemini-2.5-progoogle1,480
102gemini-2.5-flashgoogle1,434
147claude-haiku-4-5-20251001anthropic1,404
241gpt-4o-2024-05-13openai1,295
273claude-3-opus-20240229anthropic1,254
291llama-3-70b-instructmeta1,226
297claude-3-sonnet-20240229anthropic1,209
307claude-3-haiku-20240307anthropic1,178

Multi turn

순위모델조직Elo 점수
50gemini-2.5-progoogle1,453
124claude-haiku-4-5-20251001anthropic1,408
125gemini-2.5-flashgoogle1,408
225gpt-4o-2024-05-13openai1,302
251claude-3-opus-20240229anthropic1,276
282llama-3-70b-instructmeta1,223
298claude-3-haiku-20240307anthropic1,190

Industry entertainment and sports and media

순위모델조직Elo 점수
10gemini-3.1-pro-previewgoogle1,462
29gemini-2.5-progoogle1,440
94gemini-2.5-flashgoogle1,394
125claude-haiku-4-5-20251001anthropic1,370
273claude-3-opus-20240229anthropic1,220
285llama-3-70b-instructmeta1,195

Industry business and management and financial operations

순위모델조직Elo 점수
26gemini-3.1-pro-previewgoogle1,459
46gemini-2.5-progoogle1,440
117gemini-2.5-flashgoogle1,404
125claude-haiku-4-5-20251001anthropic1,399
276claude-3-opus-20240229anthropic1,222

Creative writing

순위모델조직Elo 점수
125claude-haiku-4-5-20251001anthropic1,372
267claude-3-opus-20240229anthropic1,235
282llama-3-70b-instructmeta1,210

Math

순위모델조직Elo 점수
239claude-3-opus-20240229anthropic1,273
277llama-3-70b-instructmeta1,218

Chinese

순위모델조직Elo 점수
248claude-3-opus-20240229anthropic1,248

Industry mathematical

순위모델조직Elo 점수
251claude-3-opus-20240229anthropic1,264

Russian

순위모델조직Elo 점수
231claude-3-opus-20240229anthropic1,279

참고 항목

출처 및 방법론

위 순위는 오픈 커뮤니티 평가에서 집계되었습니다. Elo 등급, 신뢰 구간 및 투표 수는 LMArena(크라우드소싱된 일대일 모델 배틀, 오픈 데이터셋으로 공개)에서 제공됩니다. 모델 가격 및 컨텍스트 메타데이터는 공개 OpenRouter API에서 제공됩니다. Wikiprompt는 이러한 출처를 매일 스냅샷으로 저장하고 기록을 보존하며, 자체 독점 평가는 수행하지 않습니다.

  1. LMArena leaderboard dataset (Hugging Face)
  2. LMArena leaderboard