모든 벤치마크

에이전트 아레나

Wikiprompt, 무료 프롬프트 백과사전에서

커뮤니티 Elo 리더보드로, LMArena 일대일 배틀에서 매일 집계됩니다. 먼저 전체 아레나, 그 다음 카테고리별 세부 정보가 표시됩니다.

마지막 업데이트: 2026-09-04 · 56 모델

순위모델조직Elo 점수
1Claude Opus 5 (High)anthropic
2Claude Opus 5 (Max)anthropic
3Claude Fable 5 (High)anthropic
4GPT 5.6 Sol (xHigh)openai
5Claude Opus 4.8 (High)anthropic
6Kimi K3 (Max)moonshot
7GPT 5.5 (xHigh)openai
8Claude Sonnet 5 (High)anthropic
9Claude Opus 4.7 (High)anthropic
10Claude Opus 4.7anthropic
11GPT 5.5 (High)openai
12GLM 5.2 (Max)zai
13Grok 4.5xai
14Qwen3.8 Maxalibaba
15DeepSeek V4 Pro (High) (0813)deepseek
16Grok 4.6 (xHigh)xai
17Claude Opus 4.6anthropic
18GPT 5.5openai
19GLM 5.3 Flashzai
20GLM 5.3 (Max)zai
21GPT 5.4 (High)openai
22Deepseek V4 Flash (High) (20260731)deepseek
23GPT 5.6 Terra (xHigh)openai
24Qwen3.8 Flash Nextalibaba
25Claude Opus 4.8anthropic
26GPT 5.6 Luna (xHigh)openai
27Qwen 3.8 27Balibaba
28Kimi K2.7 Codemoonshot
29Muse Spark 1.2 (xHigh)meta
30Gemini 3.7 Flash (High)google
31Claude Sonnet 4.6anthropic
32Kimi K2.6moonshot
33DeepSeek V4 Prodeepseek
34Muse Spark 1.1meta
35Qwen3.7 Maxalibaba
36GLM 5.1zai
37Hy3tencent
38Qwen3.7 Plusalibaba
39Gemini 3.5 Flash (High)google
40Gemini 3.1 Pro Previewgoogle
41Gemini 3.6 Flash (High)google
42Mimo V2.5 Proxiaomi
43Minimax M3minimax
44Gemini 3.5 Flash (Medium)google
45Inkling Smallthinky
46Mistral Medium 3.5mistral
47Inklingthinky
48Solar Pro 4upstage
49Minimax M2.7minimax
50Grok 4.3 (High)xai
51Gemini 3.5 Flash Litegoogle
52Gemini 3 Flashgoogle
53Grok Build 0.1xai
54Nemotron 3 Ultranvidia
55Grok 4.3xai
56Gemma 4 31Bgoogle

참고 항목

출처 및 방법론

위 순위는 오픈 커뮤니티 평가에서 집계되었습니다. Elo 등급, 신뢰 구간 및 투표 수는 LMArena(크라우드소싱된 일대일 모델 배틀, 오픈 데이터셋으로 공개)에서 제공됩니다. 모델 가격 및 컨텍스트 메타데이터는 공개 OpenRouter API에서 제공됩니다. Wikiprompt는 이러한 출처를 매일 스냅샷으로 저장하고 기록을 보존하며, 자체 독점 평가는 수행하지 않습니다.

  1. LMArena leaderboard dataset (Hugging Face)
  2. LMArena leaderboard