Blog›Guides

LLMベンチマークスナップショット:2026年9月13日の週

5つのリーダーボードにわたる週間写真:Claude Fable 5.1はテキスト、LiveBench、BenchLMを保持し、GPT-5はAiderコーディングの王座を維持、GPT-6 Astraはウェブ開発を支配。トップの安定性は、分野ごとに分かれている。

LLMベンチマークスナップショット:2026年9月13日の週

LLMリーダーボードの週間写真が届きました:スナップショット 2026-09-13、5つの独立したソースにわたるものです。今週の見出しは、トップの安定性と、分野による3方向の分裂です。

ソース別リーダー

  • LMArenaテキスト:Claude Fable 5.1(max)が1510 Eloで#1を維持し、Claude Opus 5のバリアントが#2と#3に続きます - オールAnthropicの表彰台です。
  • LiveBench:Claude Fable 5.1(max effort)が83.78でリードし、Fable 5とGPT-6 Astra(83.05)を上回ります。先週と同じリーダーです。
  • BenchLM:Claude Fable 5.1が84.61でGPT-6 Astra(84.08)を上回ります - 5つのボードの中で最も僅差です。
  • Aiderポリグロット(コーディング):GPT-5(high)が88.0でコーディングの王座を維持し、GPT-5 mediumとo3-proが続きます。Anthropicはこのトップ3に入りません。
  • LMArena webdev:GPT-6 Astra(max)が1800 Eloで支配し、Fable 5.1を42ポイント引き離します。
  • 先週からの変更点

    トップではほとんど変化がなく、それが物語です:同じ2つのファミリーが2週連続でボードを分割しています。Anthropicは一般的なテキストと混合タスクのベンチマーク(テキストアリーナ、LiveBench、BenchLM)を所有し、OpenAIは開発者向けボード(Aiderコーディング、webdevアリーナ)を所有しています。リーダーボードでモデルを選ぶ場合、答えは今や本当にどのリーダーボードを選ぶかによって異なります。

    ソース間の不一致の視点

    単一の「最良モデル」という主張は、3方向の分裂を隠しています:Fable 5.1は3つのボードで#1、GPT-6 Astraは1つ、GPT-5は1つです。だからこそ、私たちは5つすべてを毎日スナップショットするのです - 各ボードは異なるスキルを測定し、その証拠は記録に残ります。

    完全なテーブルは/benchmarksで閲覧するか、履歴で経時比較ができます。

    Tags
    benchmarks·llm·leaderboards·claude·gpt-5·weekly-snapshot