LLM 벤치마크
Wikiprompt, 무료 프롬프트 백과사전에서
대규모 언어 모델 및 생성형 AI를 위한 실시간 리더보드로, 오픈 커뮤니티 평가에서 매일 집계됩니다. 모든 표는 출처를 명시하며, Wikiprompt는 매일 스냅샷을 저장하므로 순위 변동이 기록에 남습니다.
마지막 업데이트: 2026-09-04 · 실시간 리더보드입니다. 날짜별 스냅샷은 모든 과거 순위를 보존합니다. 기록 →
대화형 탐색기
아레나, 조직 또는 라이선스로 필터링하고, 모델을 검색하고, 테이블을 정렬하고, 비용 대비 성능 차트를 확인하세요. 아래의 서버 테이블은 인용 가능한 기준입니다.
LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
가격 및 컨텍스트: OpenRouter (이름 기준 매칭)
행 또는 차트 포인트를 클릭하여 모델을 고정하고 해당 모델만 비교하세요.
비용 대비 성능
출력 가격 (USD / 1M 토큰, OpenRouter 기준) vs 커뮤니티 Elo (LMArena). 왼쪽 위 = 최고 가치.
선별된 하위 집합 표시 중 (조직별 상위 모델). 모델을 선택하거나 '모두 표시'를 선택하세요.
일일 및 주간 스냅샷이 누적되면 기록 차트가 채워집니다.
| 순위 ▲ | 모델 | 조직 | Elo 점수 | 투표 수 | 입력 $/1M | 출력 $/1M | 컨텍스트 |
|---|---|---|---|---|---|---|---|
| 2 | claude-opus-5-high | anthropic | 1,504 | 34,617 | $5 | $25 | 1,000,000 |
| 3 | claude-opus-4-6-high | anthropic | 1,503 | 72,110 | $5 | $25 | 1,000,000 |
| 4 | claude-opus-4-6 | anthropic | 1,498 | 76,032 | $5 | $25 | 1,000,000 |
| 5 | claude-fable-5 | anthropic | 1,494 | 26,977 | $10 | $50 | 1,000,000 |
| 7 | claude-opus-4-7-high | anthropic | 1,490 | 60,123 | $5 | $25 | 1,000,000 |
| 9 | gemini-3.5-flash-high | 1,484 | 33,874 | $1.5 | $9 | 1,048,576 | |
| 10 | claude-opus-4-7 | anthropic | 1,483 | 61,256 | $5 | $25 | 1,000,000 |
| 11 | gemini-3.1-pro-preview | 1,480 | 102,763 | $2 | $12 | 1,048,576 | |
| 13 | gemini-3-pro | 1,480 | 40,675 | $2 | $12 | 131,072 | |
| 14 | muse-spark-1.1 | meta | 1,479 | 23,768 | $1.25 | $4.25 | 1,048,576 |
| 15 | gemini-3.6-flash-high | 1,476 | 22,009 | $0.75 | $3.75 | 1,048,576 | |
| 17 | gemini-3.5-flash-medium | 1,476 | 32,274 | $1.5 | $9 | 1,048,576 | |
| 21 | gpt-5.5-high | openai | 1,472 | 63,265 | $5 | $30 | 1,050,000 |
| 22 | qwen3.5-max-preview | alibaba | 1,471 | 21,487 | |||
| 24 | gpt-5.4-high | openai | 1,470 | 60,657 | $2.5 | $15 | 1,050,000 |
| 25 | ernie-5.1 | baidu | 1,468 | 37,137 | |||
| 26 | glm-5.2-max | zai | 1,467 | 33,758 | $0.97 | $3.04 | 1,048,576 |
| 29 | mimo-v2.5-pro | xiaomi | 1,466 | 57,416 | $0.44 | $0.87 | 1,050,000 |
| 34 | kimi-k2.6 | moonshot | 1,455 | 37,573 | $0.95 | $4 | 262,144 |
| 39 | grok-4.5 | xai | 1,452 | 25,873 | $2 | $6 | 500,000 |
| 41 | deepseek-v4-pro | deepseek | 1,451 | 54,243 | $0.99 | $1.98 | 1,048,576 |
| 44 | dola-seed-2.0-pro | bytedance | 1,448 | 74,291 | |||
| 67 | inkling | thinky | 1,438 | 21,973 | $1 | $4.05 | 1,048,576 |
| 77 | minimax-m3 | minimax | 1,435 | 44,544 | $0.3 | $1.2 | 1,048,576 |
| 85 | mistral-large-3 | mistral | 1,428 | 65,336 | $0.5 | $1.5 | 262,144 |
| 88 | longcat-flash-chat-2602-exp | meituan | 1,426 | 27,991 | |||
| 116 | amazon-nova-experimental-chat-11-10 | amazon | 1,416 | 25,099 | |||
| 135 | step-3.5-flash | stepfun | 1,404 | 57,225 | $0.1 | $0.3 | 262,144 |
가격은 정규화된 모델 이름 기준으로 가장 가까운 OpenRouter 목록과 매칭됩니다. 추론 강화 변형은 기본 모델 가격을 공유합니다.
- • 현재 텍스트 아레나 리더: claude-opus-5-high (anthropic, Elo 1504)
- • 최고 가치 (달러당 Elo, $2/1M 출력 미만): mimo-v2.5-pro (Elo 1466, $0.87/1M)
- • 가장 강력한 오픈 라이선스 모델: glm-5.2-max (MIT, #26)
- • 코딩 리더 (Aider 통과율): gpt-5 (high) (88%)
텍스트 아레나25 모델전체 리더보드 →
출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
| 순위 | 모델 | 조직 | Elo 점수 |
|---|---|---|---|
| 2 | claude-opus-5-high | anthropic | 1,504 |
| 3 | claude-opus-4-6-high | anthropic | 1,503 |
| 4 | claude-opus-4-6 | anthropic | 1,498 |
| 5 | claude-fable-5 | anthropic | 1,494 |
| 7 | claude-opus-4-7-high | anthropic | 1,490 |
| 9 | gemini-3.5-flash-high | 1,484 | |
| 10 | claude-opus-4-7 | anthropic | 1,483 |
| 11 | gemini-3.1-pro-preview | 1,480 | |
| 13 | gemini-3-pro | 1,480 | |
| 14 | muse-spark-1.1 | meta | 1,479 |
| 15 | gemini-3.6-flash-high | 1,476 | |
| 17 | gemini-3.5-flash-medium | 1,476 | |
| 21 | gpt-5.5-high | openai | 1,472 |
| 22 | qwen3.5-max-preview | alibaba | 1,471 |
| 24 | gpt-5.4-high | openai | 1,470 |
| 25 | ernie-5.1 | baidu | 1,468 |
| 26 | glm-5.2-max | zai | 1,467 |
| 27 | gpt-5.5 | openai | 1,467 |
| 28 | gemini-3-flash | 1,467 | |
| 29 | mimo-v2.5-pro | xiaomi | 1,466 |
| 30 | glm-5.1 | zai | 1,463 |
| 31 | claude-opus-4-8-high | anthropic | 1,461 |
| 32 | claude-sonnet-4-6 | anthropic | 1,458 |
| 33 | gemini-2.5-pro | 1,458 | |
| 34 | kimi-k2.6 | moonshot | 1,455 |
웹 개발 아레나25 모델전체 리더보드 →
출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
| 순위 | 모델 | 조직 | Elo 점수 |
|---|---|---|---|
| 1 | qwen3.8-max-0902 | alibaba | 1,691 |
| 2 | claude-opus-5-max | anthropic | 1,688 |
| 3 | kimi-k3-max | moonshot | 1,674 |
| 4 | qwen3.8-max | alibaba | 1,669 |
| 5 | claude-opus-5-high | anthropic | 1,661 |
| 6 | hy4-preview | tencent | 1,629 |
| 7 | grok-4.6-high | xai | 1,629 |
| 8 | claude-fable-5 | anthropic | 1,628 |
| 9 | qwen3.8-flash-next | alibaba | 1,620 |
| 10 | gpt-5.6-sol-xhigh (codex-harness) | openai | 1,616 |
| 11 | glm-5.3-max | zai | 1,608 |
| 12 | glm-5.3-flash | zai | 1,604 |
| 13 | qwen3.8-27b | alibaba | 1,599 |
| 14 | gemini-3.7-flash-high | 1,587 | |
| 15 | glm-5.2-max | zai | 1,585 |
| 16 | deepseek-v4-pro-high-20260813 | deepseek | 1,584 |
| 17 | deepseek-v4-flash-high | deepseek | 1,581 |
| 18 | claude-opus-4-8-high | anthropic | 1,563 |
| 19 | claude-opus-4-7 | anthropic | 1,557 |
| 20 | claude-opus-4-7-high | anthropic | 1,556 |
| 21 | grok-4.5 | xai | 1,555 |
| 22 | claude-opus-4-6-high | anthropic | 1,546 |
| 23 | claude-opus-4-8 | anthropic | 1,540 |
| 24 | muse-spark-1.1 | meta | 1,540 |
| 25 | gemini-3.6-flash-high | 1,538 |
비전 아레나25 모델전체 리더보드 →
출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
| 순위 | 모델 | 조직 | Elo 점수 |
|---|---|---|---|
| 1 | claude-fable-5 | anthropic | 1,329 |
| 2 | claude-opus-5-high | anthropic | 1,322 |
| 3 | claude-opus-4-7 | anthropic | 1,317 |
| 4 | claude-opus-4-7-high | anthropic | 1,316 |
| 5 | claude-opus-4-6-high | anthropic | 1,315 |
| 6 | qwen3.8-max | alibaba | 1,313 |
| 7 | claude-opus-4-6 | anthropic | 1,311 |
| 8 | gemini-3.5-flash-high | 1,311 | |
| 9 | muse-spark | meta | 1,306 |
| 10 | gemini-3.5-flash-medium | 1,306 | |
| 11 | gemini-3-pro | 1,304 | |
| 12 | muse-spark-1.2 (xHigh) | meta | 1,304 |
| 13 | gemini-3.6-flash-high | 1,302 | |
| 14 | gpt-5.4-high | openai | 1,298 |
| 15 | glm-5.3-flash | zai | 1,296 |
| 16 | gpt-5.5 | openai | 1,296 |
| 17 | gemini-3.1-pro-preview | 1,295 | |
| 18 | gpt-5.5-high | openai | 1,294 |
| 19 | claude-opus-4-8-high | anthropic | 1,294 |
| 20 | gpt-5.4 | openai | 1,293 |
| 21 | muse-spark-1.1 | meta | 1,293 |
| 22 | grok-4.5 | xai | 1,291 |
| 23 | claude-opus-4-8 | anthropic | 1,289 |
| 24 | gemini-3-flash | 1,285 | |
| 25 | claude-sonnet-4-6 | anthropic | 1,282 |
텍스트-이미지 아레나25 모델전체 리더보드 →
출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
| 순위 | 모델 | 조직 | Elo 점수 |
|---|---|---|---|
| 1 | gpt-image-2 (medium) | openai | 1,380 |
| 2 | reve-2.1 | reve | 1,302 |
| 3 | muse-image | meta | 1,283 |
| 4 | reve-2.0 | reve | 1,270 |
| 5 | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1,263 | |
| 6 | qwen-image-3.0-pro | alibaba | 1,258 |
| 7 | seedream-5.0-pro | bytedance | 1,257 |
| 8 | mai-image-2.5 | microsoft-ai | 1,256 |
| 9 | gemini-3.1-flash-lite-image (nano-banana-2-lite) | 1,251 | |
| 10 | gemini-3-pro-image-2k (nano-banana-pro) | 1,246 | |
| 11 | gpt-image-1.5-high-fidelity | openai | 1,239 |
| 12 | gemini-3-pro-image-preview (nano-banana-pro) | 1,232 | |
| 13 | grok-imagine-image-quality | xai | 1,228 |
| 14 | ideogram-4.0-quality | ideogram | 1,206 |
| 15 | qwen-image-2.0-pro-2026-06-22 | alibaba | 1,191 |
| 16 | uni-1.1-max | luma-ai | 1,188 |
| 17 | mai-image-2 | microsoft-ai | 1,182 |
| 18 | Cosmos3-Super-Text2Image (Agentic) | nvidia | 1,181 |
| 19 | uni-1.1 | luma-ai | 1,180 |
| 20 | grok-imagine-image | xai | 1,172 |
| 21 | recraft-v4.1-utility-pro | recraft | 1,169 |
| 22 | flux-2-max | bfl | 1,162 |
| 23 | grok-imagine-image-pro | xai | 1,161 |
| 24 | Cosmos3-Super-Text2Image | nvidia | 1,158 |
| 25 | flux-2-flex | bfl | 1,156 |
이미지 편집 아레나25 모델전체 리더보드 →
출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
| 순위 | 모델 | 조직 | Elo 점수 |
|---|---|---|---|
| 1 | gpt-image-2 (medium) | openai | 1,463 |
| 2 | grok-imagine-image-2.0 (low) | xai | 1,439 |
| 3 | mai-image-2.6-preview | microsoft-ai | 1,420 |
| 4 | muse-image | meta | 1,406 |
| 5 | mai-image-2.5 | microsoft-ai | 1,401 |
| 6 | seedream-5.0-pro | bytedance | 1,394 |
| 7 | grok-imagine-image-quality (20260519) | xai | 1,390 |
| 8 | gemini-3-pro-image-2k (nano-banana-pro) | 1,390 | |
| 9 | chatgpt-image-latest-high-fidelity (20251216) | openai | 1,389 |
| 10 | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1,386 | |
| 11 | gemini-3-pro-image-preview (nano-banana-pro) | 1,385 | |
| 12 | reve-2.1 | reve | 1,375 |
| 13 | gpt-image-1.5-high-fidelity | openai | 1,370 |
| 14 | reve-2.0 | reve | 1,358 |
| 15 | uni-1.1-max | luma-ai | 1,334 |
| 16 | grok-imagine-image | xai | 1,330 |
| 17 | gemini-3.1-flash-lite-image (nano-banana-2-lite) | 1,314 | |
| 18 | uni-1.1 | luma-ai | 1,312 |
| 19 | qwen-image-2.0-pro-2026-06-22 | alibaba | 1,304 |
| 20 | hunyuan-image-3.0-instruct | tencent | 1,303 |
| 21 | wan2.7-image-pro | alibaba | 1,302 |
| 22 | seedream-4.5 | bytedance | 1,302 |
| 23 | wan2.7-image | alibaba | 1,301 |
| 24 | gemini-2.5-flash-image-preview (nano-banana) | 1,293 | |
| 25 | seedream-5.0-lite | bytedance | 1,293 |
텍스트-비디오 아레나25 모델전체 리더보드 →
출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
| 순위 | 모델 | 조직 | Elo 점수 |
|---|---|---|---|
| 1 | gemini-omni-1.1-flash | 1,515 | |
| 2 | gemini-omni-flash | 1,512 | |
| 3 | flux-3-video | bfl | 1,495 |
| 4 | dreamina-seedance-2.0-720p | bytedance | 1,479 |
| 5 | dreamina-seedance-2.5-720p | bytedance | 1,476 |
| 6 | minimax-h3 | minimax | 1,460 |
| 7 | muse-video | meta | 1,457 |
| 8 | happyhorse-1.0 | aorizon | 1,428 |
| 9 | sora-2-pro | openai | 1,365 |
| 10 | veo-3.1-audio | 1,364 | |
| 11 | veo-3.1-audio-1080p | 1,363 | |
| 12 | veo-3.1-fast-audio | 1,361 | |
| 13 | veo-3.1-fast-audio-1080p | 1,358 | |
| 14 | veo-3-fast-audio | 1,347 | |
| 15 | wan2.7-t2v | wan | 1,344 |
| 16 | grok-imagine-video-720p | xai | 1,344 |
| 17 | sora-2 | openai | 1,341 |
| 18 | veo-3-audio | 1,340 | |
| 19 | wan2.6-t2v | alibaba | 1,329 |
| 20 | seedance-v1.5-pro | bytedance | 1,256 |
| 21 | veo-3 | 1,253 | |
| 22 | veo-3-fast | 1,248 | |
| 23 | wan2.5-t2v-preview | alibaba | 1,247 |
| 24 | pixverse-v5.6 | 1,240 | |
| 25 | runway-gen-4.5 | runway | 1,224 |
비디오 편집 아레나10 모델전체 리더보드 →
출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
| 순위 | 모델 | 조직 | Elo 점수 |
|---|---|---|---|
| 1 | wan3.0 | alibaba | 1,414 |
| 2 | dreamina-seedance-2.5-720p | bytedance | 1,410 |
| 3 | minimax-h3 | minimax | 1,392 |
| 4 | gemini-omni-flash | 1,367 | |
| 5 | dreamina-seedance-2.0-720p | bytedance | 1,365 |
| 6 | happyhorse-1.0 | aorizon | 1,307 |
| 7 | grok-imagine-video | xai | 1,258 |
| 8 | kling-o3-pro | kling | 1,255 |
| 9 | kling-o1-pro | kling | 1,197 |
| 10 | runway-gen4-aleph | runway | 1,182 |
검색 아레나25 모델전체 리더보드 →
출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
| 순위 | 모델 | 조직 | Elo 점수 |
|---|---|---|---|
| 1 | gpt-5.6-sol-xhigh | openai | 1,257 |
| 2 | claude-opus-4-6-search | anthropic | 1,253 |
| 3 | gpt-5.5-search | openai | 1,242 |
| 4 | claude-opus-4-7 | anthropic | 1,233 |
| 5 | claude-fable-5 | anthropic | 1,230 |
| 6 | ernie-5.1 | baidu | 1,227 |
| 7 | claude-sonnet-4-6-search | anthropic | 1,221 |
| 8 | grok-4.5 | xai | 1,213 |
| 9 | gemini-3.1-pro-grounding | 1,210 | |
| 10 | gemini-3-pro-grounding | 1,207 | |
| 11 | gpt-5.2-search | openai | 1,207 |
| 12 | claude-opus-4-8 | anthropic | 1,204 |
| 13 | grok-4.20-multi-agent-beta-0309 | xai | 1,204 |
| 14 | gpt-5.1-search | openai | 1,199 |
| 15 | gemini-3-flash-grounding | 1,198 | |
| 16 | gpt-5.4-search | openai | 1,197 |
| 17 | claude-sonnet-5-search | anthropic | 1,194 |
| 18 | grok-4.20-beta1 | xai | 1,189 |
| 19 | claude-opus-4-5-search | anthropic | 1,180 |
| 20 | gpt-5.2-search-non-reasoning | openai | 1,172 |
| 21 | grok-4-1-fast-search | xai | 1,171 |
| 22 | grok-4-fast-search | xai | 1,171 |
| 23 | grok-4.3 | xai | 1,165 |
| 24 | claude-sonnet-4-5-search | anthropic | 1,158 |
| 25 | claude-opus-4-1-search | anthropic | 1,148 |
에이전트 아레나25 모델전체 리더보드 →
출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
| 순위 | 모델 | 조직 | Elo 점수 |
|---|---|---|---|
| 1 | Claude Opus 5 (High) | anthropic | |
| 2 | Claude Opus 5 (Max) | anthropic | |
| 3 | Claude Fable 5 (High) | anthropic | |
| 4 | GPT 5.6 Sol (xHigh) | openai | |
| 5 | Claude Opus 4.8 (High) | anthropic | |
| 6 | Kimi K3 (Max) | moonshot | |
| 7 | GPT 5.5 (xHigh) | openai | |
| 8 | Claude Sonnet 5 (High) | anthropic | |
| 9 | Claude Opus 4.7 (High) | anthropic | |
| 10 | Claude Opus 4.7 | anthropic | |
| 11 | GPT 5.5 (High) | openai | |
| 12 | GLM 5.2 (Max) | zai | |
| 13 | Grok 4.5 | xai | |
| 14 | Qwen3.8 Max | alibaba | |
| 15 | DeepSeek V4 Pro (High) (0813) | deepseek | |
| 16 | Grok 4.6 (xHigh) | xai | |
| 17 | Claude Opus 4.6 | anthropic | |
| 18 | GPT 5.5 | openai | |
| 19 | GLM 5.3 Flash | zai | |
| 20 | GLM 5.3 (Max) | zai | |
| 21 | GPT 5.4 (High) | openai | |
| 22 | Deepseek V4 Flash (High) (20260731) | deepseek | |
| 23 | GPT 5.6 Terra (xHigh) | openai | |
| 24 | Qwen3.8 Flash Next | alibaba | |
| 25 | Claude Opus 4.8 | anthropic |
문서 아레나25 모델전체 리더보드 →
출처 및 방법론: LMArena · LMArena에서 크라우드소싱된 1:1 대결의 커뮤니티 Elo.
| 순위 | 모델 | 조직 | Elo 점수 |
|---|---|---|---|
| 1 | claude-opus-5-high | anthropic | 1,520 |
| 2 | claude-opus-4-6 | anthropic | 1,510 |
| 3 | claude-opus-4-6-thinking | anthropic | 1,506 |
| 4 | claude-fable-5 | anthropic | 1,504 |
| 5 | claude-opus-4-7 | anthropic | 1,498 |
| 6 | claude-opus-4-7-thinking | anthropic | 1,497 |
| 7 | gpt-5.5-high | openai | 1,485 |
| 8 | claude-sonnet-4-6 | anthropic | 1,483 |
| 9 | gpt-5.5 | openai | 1,480 |
| 10 | gpt-5.6-terra-xhigh | openai | 1,479 |
| 11 | gpt-5.6-sol-xhigh | openai | 1,479 |
| 12 | claude-opus-4-8-thinking | anthropic | 1,475 |
| 13 | muse-spark-1.1 | meta | 1,472 |
| 14 | claude-sonnet-5-high | anthropic | 1,470 |
| 15 | gpt-5.4 | openai | 1,470 |
| 16 | claude-opus-4-8 | anthropic | 1,469 |
| 17 | gemini-3.5-flash-medium | 1,465 | |
| 18 | gpt-5.6-luna-xhigh | openai | 1,462 |
| 19 | claude-opus-4-5-20251101 | anthropic | 1,462 |
| 20 | grok-4.5 | xai | 1,454 |
| 21 | kimi-k2.6 | moonshot | 1,451 |
| 22 | claude-sonnet-4-5-20250929 | anthropic | 1,446 |
| 23 | gemini-3.1-pro-preview | 1,445 | |
| 24 | muse-spark | meta | 1,443 |
| 25 | qwen3.7-plus | alibaba | 1,440 |
다른 리더보드
LiveBench
지표: average score (0-100) · livebench.ai
| 순위 | 모델 | 조직 | 점수 |
|---|---|---|---|
| 1 | claude-fable-5-1-max-effort | 83.8 | |
| 2 | claude-fable-5-max-effort | 83.4 | |
| 3 | gpt-6-astra-max | 83.1 | |
| 4 | muse-spark-1.3-xhigh | 82.4 | |
| 5 | gpt-5.6-sol-max | 81.7 | |
| 6 | gpt-5.5-xhigh | 80.8 | |
| 7 | claude-opus-5-max-effort | 80.5 | |
| 8 | gemini-3.7-flash-high | 79.9 | |
| 9 | smaug-agentic | 79.7 | |
| 10 | qwen3.8-max | 79.5 | |
| 11 | kimi-k3 | 79.5 | |
| 12 | grok-4.6 | 79 | |
| 13 | muse-spark-1.2-xhigh | 78.9 | |
| 14 | gpt-5.4-xhigh | 78.8 | |
| 15 | gpt-5.6-terra-max | 78.6 |
BenchLM
지표: aggregated display score · benchlm.ai
| 순위 | 모델 | 조직 | 점수 |
|---|---|---|---|
| 1 | Claude Fable 5.1 | Anthropic | 83 |
| 2 | GPT-6 Astra | OpenAI | 81.1 |
| 3 | Claude Fable 5 | Anthropic | 80.9 |
| 4 | Claude Opus 5 | Anthropic | 80.7 |
| 5 | GPT-5.6 Sol | OpenAI | 79.7 |
| 6 | Gemini 3.8 Flash | 78.4 | |
| 7 | Kimi K3 | Moonshot AI | 74.9 |
| 8 | GPT-5.5 | OpenAI | 73.3 |
| 9 | Qwen3.8 Max | Alibaba | 72.4 |
| 10 | Claude Opus 4.8 | Anthropic | 72.3 |
| 11 | Muse Spark 1.2 | Meta | 71.9 |
| 12 | Muse Spark 1.1 | Meta | 71.8 |
| 13 | GPT-5.6 Terra | OpenAI | 71.4 |
| 14 | GPT-5.4 | OpenAI | 71 |
| 15 | Claude Sonnet 5 | Anthropic | 70.8 |
Aider polyglot (coding)
지표: pass rate 2 (%) · aider.chat/docs/leaderboards/
| 순위 | 모델 | 조직 | 점수 |
|---|---|---|---|
| 1 | gpt-5 (high) | 88 | |
| 2 | gpt-5 (medium) | 86.7 | |
| 3 | o3-pro (high) | 84.9 | |
| 4 | gemini-2.5-pro-preview-06-05 (32k think) | 83.1 | |
| 5 | o3 (high) | 81.3 | |
| 6 | gpt-5 (low) | 81.3 | |
| 7 | grok-4 (high) | 79.6 | |
| 8 | gemini-2.5-pro-preview-06-05 (default think) | 79.1 | |
| 9 | o3 (high) + gpt-4.1 | 78.2 | |
| 10 | Gemini 2.5 Pro Preview 05-06 | 76.9 | |
| 11 | o3 | 76.9 | |
| 12 | DeepSeek-V3.2-Exp (Reasoner) | 74.2 | |
| 13 | Gemini 2.5 Pro Preview 03-25 | 72.9 | |
| 14 | o4-mini (high) | 72 | |
| 15 | claude-opus-4-20250514 (32k thinking) | 72 |
Artificial Analysis (Intelligence Index)
지표: AA Intelligence Index (0-100) · artificialanalysis.ai
| 순위 | 모델 | 조직 | 점수 |
|---|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | Anthropic | 65.7 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) | Anthropic | 64.8 |
| 3 | Claude Opus 5 (Adaptive Reasoning, Max Effort) | Anthropic | 63.1 |
| 4 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | Anthropic | 62.5 |
| 5 | Claude Fable 5.1 (Adaptive Reasoning, High Effort, Default Fallback) | Anthropic | 62.5 |
| 6 | Muse Spark 1.3 (max) | Meta | 62.1 |
| 7 | Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) | Anthropic | 62.1 |
| 8 | Claude Opus 5 (Adaptive Reasoning, High Effort) | Anthropic | 61.5 |
| 9 | GPT-6 Astra (max) | OpenAI | 61.2 |
| 10 | GPT-6 Astra (xhigh) | OpenAI | 61 |
| 11 | GPT-5.6 Sol (max) | OpenAI | 60.9 |
| 12 | Grok 4.6 (high) | SpaceXAI | 60.9 |
| 13 | Muse Spark 1.3 (xhigh) | Meta | 60.8 |
| 14 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) | Anthropic | 60.5 |
| 15 | GPT-6 Astra (high) | OpenAI | 60.3 |
가격 및 컨텍스트 창
출처 및 방법론: OpenRouter
모델 가격 및 컨텍스트 메타데이터는 공개 OpenRouter API에서 제공됩니다. 가격은 1M 토큰당 USD입니다.
| 모델 | 조직 | 컨텍스트 | 입력 $/1M | 출력 $/1M |
|---|---|---|---|---|
| Auto Router | openrouter | 2,000,000 | $-1,000,000 | $-1,000,000 |
| Auto Router (Beta) | openrouter | 2,000,000 | $-1,000,000 | $-1,000,000 |
| Pareto Code Router | openrouter | 2,000,000 | $-1,000,000 | $-1,000,000 |
| SpaceXAI: Grok 4.20 | x-ai | 2,000,000 | $1.25 | $2.5 |
| SpaceXAI: Grok 4.20 Multi-Agent | x-ai | 2,000,000 | $1.25 | $2.5 |
| DeepSeek V4 Flash Latest | ~deepseek | 1,310,720 | $0.05 | $0.1 |
| DeepSeek: DeepSeek V4 Flash 0731 | deepseek | 1,310,720 | $0.07 | $0.18 |
| Meta: Llama 4 Scout | meta-llama | 1,310,720 | $0.1 | $0.3 |
| Z.ai: GLM 5.3 | z-ai | 1,310,720 | $1.4 | $4.4 |
| Z.ai: GLM 5.3 Flash | z-ai | 1,310,720 | $0.08 | $0.25 |
| Z.ai: GLM Flash Latest | ~z-ai | 1,310,720 | $0.08 | $0.25 |
| Z.ai: GLM Latest | ~z-ai | 1,310,720 | $1.15 | $3.5 |
| OpenAI GPT Latest | ~openai | 1,050,000 | $2 | $10 |
| OpenAI: GPT-5.4 | openai | 1,050,000 | $2.5 | $15 |
| OpenAI: GPT-5.4 (batch) | openai | 1,050,000 | $1.25 | $7.5 |
| OpenAI: GPT-5.4 Pro | openai | 1,050,000 | $30 | $180 |
| OpenAI: GPT-5.4 Pro (batch) | openai | 1,050,000 | $15 | $90 |
| OpenAI: GPT-5.5 | openai | 1,050,000 | $5 | $30 |
| OpenAI: GPT-5.5 (batch) | openai | 1,050,000 | $2.5 | $15 |
| OpenAI: GPT-5.5 Pro | openai | 1,050,000 | $30 | $180 |
최근 변경 사항
변경 추적은 다음 일일 스냅샷부터 시작됩니다. 순위 및 점수 변동이 여기에 표시됩니다.
출처 및 방법론
위 순위는 오픈 커뮤니티 평가에서 집계되었습니다. Elo 등급, 신뢰 구간 및 투표 수는 LMArena(크라우드소싱된 일대일 모델 배틀, 오픈 데이터셋으로 공개)에서 제공됩니다. 모델 가격 및 컨텍스트 메타데이터는 공개 OpenRouter API에서 제공됩니다. Wikiprompt는 이러한 출처를 매일 스냅샷으로 저장하고 기록을 보존하며, 자체 독점 평가는 수행하지 않습니다.