BlogBenchmarks

LLM 벤치마크 스냅샷: 2026년 8월 30일

주간 동결 사진: 6개의 LLM 리더보드 - Opus 5 max가 텍스트 아레나를 차지하고, Fable 5가 LiveBench를 유지하며, gpt-5가 Aider 코딩을 계속 선도하고, 소스들은 여전히 의견이 분분하다.

LLM 벤치마크 스냅샷: 2026년 8월 30일

LLM 벤치마크 스냅샷: 2026년 8월 30일

매주 일요일, Wikiprompt는 주요 LLM 리더보드의 사진을 고정합니다. 이것은 2026년 8월 30일로 끝나는 주의 스냅샷입니다 - 6개 소스에서 14,164개의 항목이 있으며, 전체는 /benchmarks/snapshot/2026-08-30에서 탐색할 수 있습니다.

소스별 리더

  • LMArena (텍스트): claude-opus-5-max가 최고 Elo (1504.7)를 차지하며, claude-opus-5-high (1503.6)를 약간 앞섰고, 이전 세대의 claude-opus-4-6-high가 여전히 3위를 유지합니다.
  • LMArena (웹 개발): claude-opus-5-max가 큰 격차로 선두 (1690.6)를 달리고 있으며, kimi-k3-max (1673.7)와 qwen3.8-max (1668.9)가 가장 강력한 오픈 가중치 도전자입니다.
  • LiveBench: claude-fable-5-max-effort가 최상위 (83.4)이며, gpt-5.6-sol-max (81.7)와 gpt-5.5-xhigh (80.8)가 그 뒤를 따릅니다.
  • BenchLM: Claude 5 제품군이 포디움을 휩쓸었습니다 - Mythos 5 (83.4), Fable 5 (83.2), Opus 5 (83.1) - 점수 차이는 1점 미만입니다.
  • Aider polyglot (코딩): gpt-5 (high)가 88.0% 통과율로 코딩 벤치마크 왕으로 남아 있으며, gpt-5 (medium)와 o3-pro (high)가 그 뒤를 따릅니다.
  • Artificial Analysis 지능 지수: Claude Opus 5가 최대 노력 설정에서 선두 (63.1)를 차지하며, Fable 5 변형들이 바로 뒤에 있습니다.
  • 지난 주 대비 변경 사항

    텍스트 아레나의 왕좌가 같은 제품군 내에서 바뀌었습니다: claude-opus-5-high (지난 주 1504.2)가 claude-opus-5-max (1504.7)에게 근소하게 밀렸습니다. 통계적으로는 동전 던지기 수준이지만, 편집자 관점에서는 상위권에서 노력 설정이 이제 모델 선택만큼 중요하다는 것을 상기시킵니다.

    소스들은 여전히 의견이 다릅니다

    매주 그렇듯, 두 리더보드가 같은 모델을 1위로 선정하지 않습니다: LMArena의 커뮤니티 Elo는 Opus 5를 선호하고, LiveBench의 오염 없는 학술 세트는 Fable 5를 선호하며, Aider의 실제 코딩 하네스는 여전히 gpt-5의 것입니다. 선택 전에 교차 참조하십시오 - 그것이 비교 보기의 목적입니다.

    전체 날짜별 테이블은 /benchmarks/snapshot/2026-08-30에서, 전체 아카이브는 /benchmarks/history에서 탐색하십시오.

    Tags
    benchmarks·llm·leaderboard·weekly