BlogGuides

LLM 벤치마크 스냅샷: 2026년 8월 23일

LLM 리더보드의 첫 주간 사진: LMArena, LiveBench,# BenchLM 및 Aider, 한 페이지에 고정되어 인용 가능. Anthrop Anthropic이 세 개의 시상대를 휩쓸었고, GPT-5는 코딩 부문 왕좌를 유지합니다.

LLM 벤치마크 스냅샷: 2026년 8월 23일

LLM 벤치마크 스냅샷: 2026년 8월 23일

이것은 새로운 위키프롬프트 시리즈의 첫 번째 항목입니다: 우리는 매주 주요 LLM 리더보드의 완전한 사진을 동결하여 영구적이고 인용 가능한 페이지로 게시합니다. 이 스냅샷의 전체 표는 /benchmarks/snapshot/2026-08-23에 있으며, 모든 향후 사진은 /benchmarks/history에서 색인됩니다.

왜 날짜가 있는 스냅샷인가?

벤치마크 숫자는 조용히 움직입니다: 모델이 오르고, 점수가 재계산되며, 지난달의 선두는 조용히 4위가 됩니다. 하나의 URL당 주간 사진을 유지함으로써, 기록은 공개적으로 남습니다. "2026년 8월 23일 기준 순위"를 인용할 수 있으며, 그 링크는 항상 정확히 그 내용을 보여줍니다.

사진이 보여주는 것

이 스냅샷은 각각 고유한 방법론을 가진 다섯 개의 독립적인 오픈 소스를 다룹니다:

  • LMArena (텍스트 아레나): claude-opus-5-high가 커뮤니티 Elo에서 선두를 달리며, claude-opus-5-max와 claude-opus-4-6-high가 그 뒤를 따릅니다. Anthropic이 이번 주 텍스트 포디움 전체를 차지합니다.
  • LMArena (웹 개발): claude-opus-5-max가 1위를 차지하고, 그 뒤를 kimi-k3-max와 qwen3.8-max가 따릅니다. 이 두 오픈 가중치 도전자는 Moonshot과 Alibaba에서 나와 프론티어 연구소를 압박합니다.
  • LiveBench: claude-fable-5-max-effort가 평균 83.4로 1위를 차지하며, gpt-5.6-sol (81.7)과 gpt-5.5-xhigh (80.8)가 그 뒤를 따릅니다.
  • BenchLM 집계: 전적으로 Anthropic 포디움: Claude Mythos 5 (83.0), Claude Opus 5 (82.7), Claude Fable 5 (82.7)이 0.25점 차이로 분리됩니다.
  • Aider 폴리글롯 (코딩): gpt-5 (high)가 실용 코딩에서 여전히 지배하며 88.0% 통과율을 기록하고, gpt-5 (medium)와 o3-pro (high)가 그 뒤를 따릅니다.
  • 흥미로운 읽을거리는 불일치입니다: 커뮤니티 투표 (LMArena), 학술적 작업 세트 (LiveBench), 집계 점수 (BenchLM), 실습 코딩 (Aider)은 같은 모델을 1위로 지목하지 않습니다. 그 불일치가 바로 우리가 하나가 아닌 여러 출처를 추적하는 이유입니다.

    탐색하기

  • 라이브 리더보드, 필터 및 비용 대 성능 차트: /benchmarks
  • 이번 주 동결 사진: /benchmarks/snapshot/2026-08-23
  • 모든 스냅샷: /benchmarks/history
  • 새 사진은 매주 일요일에 게시됩니다. 순위가 바뀌면, 당신은 정확히 언제인지 가리킬 수 있을 것입니다.

    Tags
    benchmarks·snapshot·leaderboard·lmarena·livebench·weekly