Blog›Benchmarks

LLMベンチマークスナップショット:2026年8月30日

6つのLLMリーダーボードの週間凍結写真:Opus 5がテキストアリーナで最高を記録、Fable 5がLiveBenchを維持、gpt-5がAiderコーディングを保持、そして情報源は依然として一致しない。

LLMベンチマークスナップショット:2026年8月30日

LLMベンチマークスナップショット:2026年8月30日

毎週日曜日、Wikipromptは主要なLLMリーダーボードの写真を凍結します。これは2026年8月30日までの週のスナップショットです。6つのソースからの14,164件のエントリがあり、/benchmarks/snapshot/2026-08-30で全件閲覧可能です。

ソース別リーダー

  • LMArena(テキスト):claude-opus-5-maxがトップのElo(1504.7)を獲得し、claude-opus-5-high(1503.6)をわずかに上回り、前世代のclaude-opus-4-6-highが依然として3位を保持。
  • LMArena(ウェブ開発):claude-opus-5-maxが大きな差でリード(1690.6)、kimi-k3-max(1673.7)とqwen3.8-max(1668.9)が最強のオープンウェイト挑戦者。
  • LiveBench:claude-fable-5-max-effortがトップ(83.4)、gpt-5.6-sol-max(81.7)とgpt-5.5-xhigh(80.8)が続く。
  • BenchLM:Claude 5ファミリーが表彰台を独占 - Mythos 5(83.4)、Fable 5(83.2)、Opus 5(83.1) - 小数点以下の差で分かれる。
  • Aider polyglot(コーディング):gpt-5(high)が88.0%の合格率でコーディングベンチマークの王座を維持、gpt-5(medium)とo3-pro(high)が続く。
  • Artificial Analysisインテリジェンス指数:Claude Opus 5が最大努力でリード(63.1)、Fable 5バリアントがすぐ後ろ。
  • 先週からの変更点

    テキストアリーナの王座が同じファミリー内で交代:claude-opus-5-high(先週1504.2)がclaude-opus-5-max(1504.7)に僅差で敗れました。統計的にはコイン投げに等しいですが、編集部的には、テーブルの最上位ではモデル選択と同様に努力設定が重要であることを思い出させます。

    ソースは依然として一致しない

    毎週のように、2つのリーダーボードが同じモデルを戴冠することはありません:LMArenaのコミュニティEloはOpus 5を支持し、LiveBenchの汚染フリーの学術セットはFable 5を支持し、Aiderの実世界コーディングハーネスは依然としてgpt-5に属します。選択する前に相互参照してください - それが比較ビューの目的です。

    完全な日付付きテーブルは/benchmarks/snapshot/2026-08-30、全アーカイブは/benchmarks/historyで閲覧できます。

    Tags
    benchmarks·llm·leaderboard·weekly