LLMベンチマークスナップショット:2026年9月13日の週
5つのリーダーボードにわたる週間写真:Claude Fable 5.1はテキスト、LiveBench、BenchLMを保持し、GPT-5はAiderコーディングの王座を維持、GPT-6 Astraはウェブ開発を支配。トップの安定性は、分野ごとに分かれている。

LLMリーダーボードの週間写真が届きました:スナップショット 2026-09-13、5つの独立したソースにわたるものです。今週の見出しは、トップの安定性と、分野による3方向の分裂です。
ソース別リーダー
先週からの変更点
トップではほとんど変化がなく、それが物語です:同じ2つのファミリーが2週連続でボードを分割しています。Anthropicは一般的なテキストと混合タスクのベンチマーク(テキストアリーナ、LiveBench、BenchLM)を所有し、OpenAIは開発者向けボード(Aiderコーディング、webdevアリーナ)を所有しています。リーダーボードでモデルを選ぶ場合、答えは今や本当にどのリーダーボードを選ぶかによって異なります。
ソース間の不一致の視点
単一の「最良モデル」という主張は、3方向の分裂を隠しています:Fable 5.1は3つのボードで#1、GPT-6 Astraは1つ、GPT-5は1つです。だからこそ、私たちは5つすべてを毎日スナップショットするのです - 各ボードは異なるスキルを測定し、その証拠は記録に残ります。
完全なテーブルは/benchmarksで閲覧するか、履歴で経時比較ができます。
Tags
benchmarks·llm·leaderboards·claude·gpt-5·weekly-snapshot
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read