LLM 벤치마크

Wikiprompt, 무료 프롬프트 백과사전에서

대규모 언어 모델 및 생성형 AI를 위한 실시간 리더보드로, 오픈 커뮤니티 평가에서 매일 집계됩니다. 모든 표는 출처를 명시하며, Wikiprompt는 매일 스냅샷을 저장하므로 순위 변동이 기록에 남습니다.

마지막 업데이트: 2026-09-04 · 실시간 리더보드입니다. 날짜별 스냅샷은 모든 과거 순위를 보존합니다. 기록

대화형 탐색기

아레나, 조직 또는 라이선스로 필터링하고, 모델을 검색하고, 테이블을 정렬하고, 비용 대비 성능 차트를 확인하세요. 아래의 서버 테이블은 인용 가능한 기준입니다.

현재 보는 중
LMArena · 텍스트 아레나

LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.

가격 및 컨텍스트: OpenRouter (이름 기준 매칭)

텍스트 아레나

행 또는 차트 포인트를 클릭하여 모델을 고정하고 해당 모델만 비교하세요.

비용 대비 성능

출력 가격 (USD / 1M 토큰, OpenRouter 기준) vs 커뮤니티 Elo (LMArena). 왼쪽 위 = 최고 가치.

가장 매력적인 사분면파레토 라인스케일:

선별된 하위 집합 표시 중 (조직별 상위 모델). 모델을 선택하거나 '모두 표시'를 선택하세요.

140014501500$0.1$1$10$100출력 가격 (USD / 1M 토큰)커뮤니티 EloWikipromptclaude-opus-5-highclaude-opus-4-6-highclaude-opus-4-6claude-fable-5claude-opus-4-7-highgemini-3.5-flash-highclaude-opus-4-7gemini-3.1-pro-previewgemini-3-promuse-spark-1.1gemini-3.6-flash-highgemini-3.5-flash-mediumgpt-5.5-highgpt-5.4-highglm-5.2-maxmimo-v2.5-prokimi-k2.6grok-4.5deepseek-v4-proinklingminimax-m3mistral-large-3step-3.5-flash

일일 및 주간 스냅샷이 누적되면 기록 차트가 채워집니다.

순위모델조직Elo 점수투표 수입력 $/1M출력 $/1M컨텍스트
2claude-opus-5-highanthropic1,50434,617$5$251,000,000
3claude-opus-4-6-highanthropic1,50372,110$5$251,000,000
4claude-opus-4-6anthropic1,49876,032$5$251,000,000
5claude-fable-5anthropic1,49426,977$10$501,000,000
7claude-opus-4-7-highanthropic1,49060,123$5$251,000,000
9gemini-3.5-flash-highgoogle1,48433,874$1.5$91,048,576
10claude-opus-4-7anthropic1,48361,256$5$251,000,000
11gemini-3.1-pro-previewgoogle1,480102,763$2$121,048,576
13gemini-3-progoogle1,48040,675$2$12131,072
14muse-spark-1.1meta1,47923,768$1.25$4.251,048,576
15gemini-3.6-flash-highgoogle1,47622,009$0.75$3.751,048,576
17gemini-3.5-flash-mediumgoogle1,47632,274$1.5$91,048,576
21gpt-5.5-highopenai1,47263,265$5$301,050,000
22qwen3.5-max-previewalibaba1,47121,487
24gpt-5.4-highopenai1,47060,657$2.5$151,050,000
25ernie-5.1baidu1,46837,137
26glm-5.2-maxzai1,46733,758$0.97$3.041,048,576
29mimo-v2.5-proxiaomi1,46657,416$0.44$0.871,050,000
34kimi-k2.6moonshot1,45537,573$0.95$4262,144
39grok-4.5xai1,45225,873$2$6500,000
41deepseek-v4-prodeepseek1,45154,243$0.99$1.981,048,576
44dola-seed-2.0-probytedance1,44874,291
67inklingthinky1,43821,973$1$4.051,048,576
77minimax-m3minimax1,43544,544$0.3$1.21,048,576
85mistral-large-3mistral1,42865,336$0.5$1.5262,144
88longcat-flash-chat-2602-expmeituan1,42627,991
116amazon-nova-experimental-chat-11-10amazon1,41625,099
135step-3.5-flashstepfun1,40457,225$0.1$0.3262,144

가격은 정규화된 모델 이름 기준으로 가장 가까운 OpenRouter 목록과 매칭됩니다. 추론 강화 변형은 기본 모델 가격을 공유합니다.

핵심 요점
  • 현재 텍스트 아레나 리더: claude-opus-5-high (anthropic, Elo 1504)
  • 최고 가치 (달러당 Elo, $2/1M 출력 미만): mimo-v2.5-pro (Elo 1466, $0.87/1M)
  • 가장 강력한 오픈 라이선스 모델: glm-5.2-max (MIT, #26)
  • 코딩 리더 (Aider 통과율): gpt-5 (high) (88%)

텍스트 아레나25 모델전체 리더보드

출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.

순위모델조직Elo 점수
2claude-opus-5-highanthropic1,504
3claude-opus-4-6-highanthropic1,503
4claude-opus-4-6anthropic1,498
5claude-fable-5anthropic1,494
7claude-opus-4-7-highanthropic1,490
9gemini-3.5-flash-highgoogle1,484
10claude-opus-4-7anthropic1,483
11gemini-3.1-pro-previewgoogle1,480
13gemini-3-progoogle1,480
14muse-spark-1.1meta1,479
15gemini-3.6-flash-highgoogle1,476
17gemini-3.5-flash-mediumgoogle1,476
21gpt-5.5-highopenai1,472
22qwen3.5-max-previewalibaba1,471
24gpt-5.4-highopenai1,470
25ernie-5.1baidu1,468
26glm-5.2-maxzai1,467
27gpt-5.5openai1,467
28gemini-3-flashgoogle1,467
29mimo-v2.5-proxiaomi1,466
30glm-5.1zai1,463
31claude-opus-4-8-highanthropic1,461
32claude-sonnet-4-6anthropic1,458
33gemini-2.5-progoogle1,458
34kimi-k2.6moonshot1,455

웹 개발 아레나25 모델전체 리더보드

출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.

순위모델조직Elo 점수
1qwen3.8-max-0902alibaba1,691
2claude-opus-5-maxanthropic1,688
3kimi-k3-maxmoonshot1,674
4qwen3.8-maxalibaba1,669
5claude-opus-5-highanthropic1,661
6hy4-previewtencent1,629
7grok-4.6-highxai1,629
8claude-fable-5anthropic1,628
9qwen3.8-flash-nextalibaba1,620
10gpt-5.6-sol-xhigh (codex-harness)openai1,616
11glm-5.3-maxzai1,608
12glm-5.3-flashzai1,604
13qwen3.8-27balibaba1,599
14gemini-3.7-flash-highgoogle1,587
15glm-5.2-maxzai1,585
16deepseek-v4-pro-high-20260813deepseek1,584
17deepseek-v4-flash-highdeepseek1,581
18claude-opus-4-8-highanthropic1,563
19claude-opus-4-7anthropic1,557
20claude-opus-4-7-highanthropic1,556
21grok-4.5xai1,555
22claude-opus-4-6-highanthropic1,546
23claude-opus-4-8anthropic1,540
24muse-spark-1.1meta1,540
25gemini-3.6-flash-highgoogle1,538

비전 아레나25 모델전체 리더보드

출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.

순위모델조직Elo 점수
1claude-fable-5anthropic1,329
2claude-opus-5-highanthropic1,322
3claude-opus-4-7anthropic1,317
4claude-opus-4-7-highanthropic1,316
5claude-opus-4-6-highanthropic1,315
6qwen3.8-maxalibaba1,313
7claude-opus-4-6anthropic1,311
8gemini-3.5-flash-highgoogle1,311
9muse-sparkmeta1,306
10gemini-3.5-flash-mediumgoogle1,306
11gemini-3-progoogle1,304
12muse-spark-1.2 (xHigh)meta1,304
13gemini-3.6-flash-highgoogle1,302
14gpt-5.4-highopenai1,298
15glm-5.3-flashzai1,296
16gpt-5.5openai1,296
17gemini-3.1-pro-previewgoogle1,295
18gpt-5.5-highopenai1,294
19claude-opus-4-8-highanthropic1,294
20gpt-5.4openai1,293
21muse-spark-1.1meta1,293
22grok-4.5xai1,291
23claude-opus-4-8anthropic1,289
24gemini-3-flashgoogle1,285
25claude-sonnet-4-6anthropic1,282

텍스트-이미지 아레나25 모델전체 리더보드

출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.

순위모델조직Elo 점수
1gpt-image-2 (medium)openai1,380
2reve-2.1reve1,302
3muse-imagemeta1,283
4reve-2.0reve1,270
5gemini-3.1-flash-image (nano-banana-2) [web-search]google1,263
6qwen-image-3.0-proalibaba1,258
7seedream-5.0-probytedance1,257
8mai-image-2.5microsoft-ai1,256
9gemini-3.1-flash-lite-image (nano-banana-2-lite)google1,251
10gemini-3-pro-image-2k (nano-banana-pro)google1,246
11gpt-image-1.5-high-fidelityopenai1,239
12gemini-3-pro-image-preview (nano-banana-pro)google1,232
13grok-imagine-image-qualityxai1,228
14ideogram-4.0-qualityideogram1,206
15qwen-image-2.0-pro-2026-06-22alibaba1,191
16uni-1.1-maxluma-ai1,188
17mai-image-2microsoft-ai1,182
18Cosmos3-Super-Text2Image (Agentic)nvidia1,181
19uni-1.1luma-ai1,180
20grok-imagine-imagexai1,172
21recraft-v4.1-utility-prorecraft1,169
22flux-2-maxbfl1,162
23grok-imagine-image-proxai1,161
24Cosmos3-Super-Text2Imagenvidia1,158
25flux-2-flexbfl1,156

이미지 편집 아레나25 모델전체 리더보드

출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.

순위모델조직Elo 점수
1gpt-image-2 (medium)openai1,463
2grok-imagine-image-2.0 (low)xai1,439
3mai-image-2.6-previewmicrosoft-ai1,420
4muse-imagemeta1,406
5mai-image-2.5microsoft-ai1,401
6seedream-5.0-probytedance1,394
7grok-imagine-image-quality (20260519)xai1,390
8gemini-3-pro-image-2k (nano-banana-pro)google1,390
9chatgpt-image-latest-high-fidelity (20251216)openai1,389
10gemini-3.1-flash-image (nano-banana-2) [web-search]google1,386
11gemini-3-pro-image-preview (nano-banana-pro)google1,385
12reve-2.1reve1,375
13gpt-image-1.5-high-fidelityopenai1,370
14reve-2.0reve1,358
15uni-1.1-maxluma-ai1,334
16grok-imagine-imagexai1,330
17gemini-3.1-flash-lite-image (nano-banana-2-lite)google1,314
18uni-1.1luma-ai1,312
19qwen-image-2.0-pro-2026-06-22alibaba1,304
20hunyuan-image-3.0-instructtencent1,303
21wan2.7-image-proalibaba1,302
22seedream-4.5bytedance1,302
23wan2.7-imagealibaba1,301
24gemini-2.5-flash-image-preview (nano-banana)google1,293
25seedream-5.0-litebytedance1,293

텍스트-비디오 아레나25 모델전체 리더보드

출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.

순위모델조직Elo 점수
1gemini-omni-1.1-flashgoogle1,515
2gemini-omni-flashgoogle1,512
3flux-3-videobfl1,495
4dreamina-seedance-2.0-720pbytedance1,479
5dreamina-seedance-2.5-720pbytedance1,476
6minimax-h3minimax1,460
7muse-videometa1,457
8happyhorse-1.0aorizon1,428
9sora-2-proopenai1,365
10veo-3.1-audiogoogle1,364
11veo-3.1-audio-1080pgoogle1,363
12veo-3.1-fast-audiogoogle1,361
13veo-3.1-fast-audio-1080pgoogle1,358
14veo-3-fast-audiogoogle1,347
15wan2.7-t2vwan1,344
16grok-imagine-video-720pxai1,344
17sora-2openai1,341
18veo-3-audiogoogle1,340
19wan2.6-t2valibaba1,329
20seedance-v1.5-probytedance1,256
21veo-3google1,253
22veo-3-fastgoogle1,248
23wan2.5-t2v-previewalibaba1,247
24pixverse-v5.61,240
25runway-gen-4.5runway1,224

비디오 편집 아레나10 모델전체 리더보드

출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.

순위모델조직Elo 점수
1wan3.0alibaba1,414
2dreamina-seedance-2.5-720pbytedance1,410
3minimax-h3minimax1,392
4gemini-omni-flashgoogle1,367
5dreamina-seedance-2.0-720pbytedance1,365
6happyhorse-1.0aorizon1,307
7grok-imagine-videoxai1,258
8kling-o3-prokling1,255
9kling-o1-prokling1,197
10runway-gen4-alephrunway1,182

에이전트 아레나25 모델전체 리더보드

출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.

순위모델조직Elo 점수
1Claude Opus 5 (High)anthropic
2Claude Opus 5 (Max)anthropic
3Claude Fable 5 (High)anthropic
4GPT 5.6 Sol (xHigh)openai
5Claude Opus 4.8 (High)anthropic
6Kimi K3 (Max)moonshot
7GPT 5.5 (xHigh)openai
8Claude Sonnet 5 (High)anthropic
9Claude Opus 4.7 (High)anthropic
10Claude Opus 4.7anthropic
11GPT 5.5 (High)openai
12GLM 5.2 (Max)zai
13Grok 4.5xai
14Qwen3.8 Maxalibaba
15DeepSeek V4 Pro (High) (0813)deepseek
16Grok 4.6 (xHigh)xai
17Claude Opus 4.6anthropic
18GPT 5.5openai
19GLM 5.3 Flashzai
20GLM 5.3 (Max)zai
21GPT 5.4 (High)openai
22Deepseek V4 Flash (High) (20260731)deepseek
23GPT 5.6 Terra (xHigh)openai
24Qwen3.8 Flash Nextalibaba
25Claude Opus 4.8anthropic

문서 아레나25 모델전체 리더보드

출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.

순위모델조직Elo 점수
1claude-opus-5-highanthropic1,520
2claude-opus-4-6anthropic1,510
3claude-opus-4-6-thinkinganthropic1,506
4claude-fable-5anthropic1,504
5claude-opus-4-7anthropic1,498
6claude-opus-4-7-thinkinganthropic1,497
7gpt-5.5-highopenai1,485
8claude-sonnet-4-6anthropic1,483
9gpt-5.5openai1,480
10gpt-5.6-terra-xhighopenai1,479
11gpt-5.6-sol-xhighopenai1,479
12claude-opus-4-8-thinkinganthropic1,475
13muse-spark-1.1meta1,472
14claude-sonnet-5-highanthropic1,470
15gpt-5.4openai1,470
16claude-opus-4-8anthropic1,469
17gemini-3.5-flash-mediumgoogle1,465
18gpt-5.6-luna-xhighopenai1,462
19claude-opus-4-5-20251101anthropic1,462
20grok-4.5xai1,454
21kimi-k2.6moonshot1,451
22claude-sonnet-4-5-20250929anthropic1,446
23gemini-3.1-pro-previewgoogle1,445
24muse-sparkmeta1,443
25qwen3.7-plusalibaba1,440

다른 리더보드

LiveBench

지표: average score (0-100) · livebench.ai

순위모델조직점수
1claude-fable-5-1-max-effort83.8
2claude-fable-5-max-effort83.4
3gpt-6-astra-max83.1
4muse-spark-1.3-xhigh82.4
5gpt-5.6-sol-max81.7
6gpt-5.5-xhigh80.8
7claude-opus-5-max-effort80.5
8gemini-3.7-flash-high79.9
9smaug-agentic79.7
10qwen3.8-max79.5
11kimi-k379.5
12grok-4.679
13muse-spark-1.2-xhigh78.9
14gpt-5.4-xhigh78.8
15gpt-5.6-terra-max78.6

BenchLM

지표: aggregated display score · benchlm.ai

순위모델조직점수
1Claude Fable 5.1Anthropic83
2GPT-6 AstraOpenAI81.1
3Claude Fable 5Anthropic80.9
4Claude Opus 5Anthropic80.7
5GPT-5.6 SolOpenAI79.7
6Gemini 3.8 FlashGoogle78.4
7Kimi K3Moonshot AI74.9
8GPT-5.5OpenAI73.3
9Qwen3.8 MaxAlibaba72.4
10Claude Opus 4.8Anthropic72.3
11Muse Spark 1.2Meta71.9
12Muse Spark 1.1Meta71.8
13GPT-5.6 TerraOpenAI71.4
14GPT-5.4OpenAI71
15Claude Sonnet 5Anthropic70.8

Aider polyglot (coding)

지표: pass rate 2 (%) · aider.chat/docs/leaderboards/

순위모델조직점수
1gpt-5 (high)88
2gpt-5 (medium)86.7
3o3-pro (high)84.9
4gemini-2.5-pro-preview-06-05 (32k think)83.1
5o3 (high)81.3
6gpt-5 (low)81.3
7grok-4 (high)79.6
8gemini-2.5-pro-preview-06-05 (default think)79.1
9o3 (high) + gpt-4.178.2
10Gemini 2.5 Pro Preview 05-0676.9
11o376.9
12DeepSeek-V3.2-Exp (Reasoner)74.2
13Gemini 2.5 Pro Preview 03-2572.9
14o4-mini (high)72
15claude-opus-4-20250514 (32k thinking)72

Artificial Analysis (Intelligence Index)

지표: AA Intelligence Index (0-100) · artificialanalysis.ai

순위모델조직점수
1Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback)Anthropic65.7
2Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback)Anthropic64.8
3Claude Opus 5 (Adaptive Reasoning, Max Effort)Anthropic63.1
4Claude Opus 5 (Adaptive Reasoning, Xhigh Effort)Anthropic62.5
5Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback)Anthropic62.5
6Muse Spark 1.3 (max)Meta62.1
7Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback)Anthropic62.1
8Claude Opus 5 (Adaptive Reasoning, High Effort)Anthropic61.5
9GPT-6 Astra (max)OpenAI61.2
10GPT-6 Astra (xhigh)OpenAI61
11GPT-5.6 Sol (max)OpenAI60.9
12Grok 4.6 (high)SpaceXAI60.9
13Muse Spark 1.3 (xhigh)Meta60.8
14Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback)Anthropic60.5
15GPT-6 Astra (high)OpenAI60.3

가격 및 컨텍스트 창

출처 및 방법론: OpenRouter

모델 가격 및 컨텍스트 메타데이터는 공개 OpenRouter API에서 제공됩니다. 가격은 1M 토큰당 USD입니다.

모델조직컨텍스트입력 $/1M출력 $/1M
Auto Routeropenrouter2,000,000$-1,000,000$-1,000,000
Auto Router (Beta)openrouter2,000,000$-1,000,000$-1,000,000
Pareto Code Routeropenrouter2,000,000$-1,000,000$-1,000,000
SpaceXAI: Grok 4.20x-ai2,000,000$1.25$2.5
SpaceXAI: Grok 4.20 Multi-Agentx-ai2,000,000$1.25$2.5
DeepSeek V4 Flash Latest~deepseek1,310,720$0.05$0.1
DeepSeek: DeepSeek V4 Flash 0731deepseek1,310,720$0.07$0.18
Meta: Llama 4 Scoutmeta-llama1,310,720$0.1$0.3
Z.ai: GLM 5.3z-ai1,310,720$1.4$4.4
Z.ai: GLM 5.3 Flashz-ai1,310,720$0.08$0.25
Z.ai: GLM Flash Latest~z-ai1,310,720$0.08$0.25
Z.ai: GLM Latest~z-ai1,310,720$1.15$3.5
OpenAI GPT Latest~openai1,050,000$2$10
OpenAI: GPT-5.4openai1,050,000$2.5$15
OpenAI: GPT-5.4 (batch)openai1,050,000$1.25$7.5
OpenAI: GPT-5.4 Proopenai1,050,000$30$180
OpenAI: GPT-5.4 Pro (batch)openai1,050,000$15$90
OpenAI: GPT-5.5openai1,050,000$5$30
OpenAI: GPT-5.5 (batch)openai1,050,000$2.5$15
OpenAI: GPT-5.5 Proopenai1,050,000$30$180

최근 변경 사항

변경 추적은 다음 일일 스냅샷부터 시작됩니다. 순위 및 점수 변동이 여기에 표시됩니다.

출처 및 방법론

위 순위는 오픈 커뮤니티 평가에서 집계되었습니다. Elo 등급, 신뢰 구간 및 투표 수는 LMArena(크라우드소싱된 일대일 모델 배틀, 오픈 데이터셋으로 공개)에서 제공됩니다. 모델 가격 및 컨텍스트 메타데이터는 공개 OpenRouter API에서 제공됩니다. Wikiprompt는 이러한 출처를 매일 스냅샷으로 저장하고 기록을 보존하며, 자체 독점 평가는 수행하지 않습니다.

  1. LMArena leaderboard dataset (Hugging Face)
  2. LMArena leaderboard
  3. OpenRouter models API
  4. Artificial Analysis (intelligence, speed and latency data)

참고 항목