Blog›Benchmarks

# LLMベンチマークスナップショット、2026年9月22日:トップの凍結された一週間

今週、LiveBench、BenchLM、Aider、LMArenaのトップ3の順位は一つも変わらなかった。本当の動きはランキング外にあった。JevとLayaの意思決定モデルが、まだどのベンチマークも測定していないカテゴリーを切り開いたのだ。

# LLMベンチマークスナップショット、2026年9月22日:トップの凍結された一週間

LLMベンチマークスナップショット、2026年9月22日:トップでの凍結された一週間

毎週、主要なLLMリーダーボードを撮影し、/benchmarks/historyで記録を保管しています。今週の写真、9月22日は、何が起こらなかったかで注目に値します:追跡している5つのソースすべてで、トップ3のポジションが1つも入れ替わりませんでした。

ソース別のリーダー

  • LiveBench(総合): Claude Fable 5.1(最大努力)が83.78で首位を維持し、Fable 5(83.38)とGPT-6 Astra max(83.05)をリード。3つのモデルが0.73ポイント以内にひしめいています。
  • BenchLM(総合): Claude Fable 5.1が84.58、GPT-6 Astraが83.79、Claude Opus 5が81.87。
  • Aider polyglot(コーディング): GPT-5(高)が88.0を維持し、GPT-5(中)が86.7、o3-proが84.9。OpenAIがこのボードを独占し続けています。
  • LMArenaテキストElo: Claude Fable 5.1 maxが1507.6で、2つのOpus 5バリアントが1505で迫っています - 2.6-Eloの差で、実質的に同点です。
  • LMArena webdev Elo: GPT-6 Astra maxが1800.3で、Fable 5.1 max(1758)を余裕でリード - 差が広い唯一のボードです。
  • ソースは依然として意見が分かれている

    毎週指摘する意見の相違パターンは続いています:Anthropicが3つのボードで汎用テキストをリードし、OpenAIがコーディング(Aider)とwebdev(LMArena)で決定的にリードしています。「リーダーボード」でモデルを選ぶ場合、答えは依然として、どのリーダーボードがあなたのワークロードに合っているかに完全に依存します。

    アクションはリーダーボードの外で

    トップでの凍結された一週間は、静かな一週間を意味しません。最も話題になったローンチは、チャットモデルではありませんでした:TypeSafeのJevと、インドのConvai InnovationsによるオープンソースのApache 2.0 Layaが、「System One」意思決定モデルカテゴリを切り開きました - 生成されたテキストではなく、校正された確率を持つ型付き回答です。上記のボードのどれも、まだその種のモデルを測定していません。これはそれ自体が注目に値するギャップです:ベンチマークエコシステムは文章作成とコーディングを測定する一方、生産AIの増加するスライスは高速分類です。私たちの比較:Laya vs Jev。

    完全なスナップショットは/benchmarks/snapshot/2026-09-22、またはライブボードは/benchmarksで閲覧できます。

    Tags
    benchmarks·llm·leaderboard·claude·gpt-6·aider·livebench·weekly-snapshot