# LLMベンチマークスナップショット、2026年9月22日:トップの凍結された一週間
今週、LiveBench、BenchLM、Aider、LMArenaのトップ3の順位は一つも変わらなかった。本当の動きはランキング外にあった。JevとLayaの意思決定モデルが、まだどのベンチマークも測定していないカテゴリーを切り開いたのだ。

LLMベンチマークスナップショット、2026年9月22日:トップでの凍結された一週間
毎週、主要なLLMリーダーボードを撮影し、/benchmarks/historyで記録を保管しています。今週の写真、9月22日は、何が起こらなかったかで注目に値します:追跡している5つのソースすべてで、トップ3のポジションが1つも入れ替わりませんでした。
ソース別のリーダー
ソースは依然として意見が分かれている
毎週指摘する意見の相違パターンは続いています:Anthropicが3つのボードで汎用テキストをリードし、OpenAIがコーディング(Aider)とwebdev(LMArena)で決定的にリードしています。「リーダーボード」でモデルを選ぶ場合、答えは依然として、どのリーダーボードがあなたのワークロードに合っているかに完全に依存します。
アクションはリーダーボードの外で
トップでの凍結された一週間は、静かな一週間を意味しません。最も話題になったローンチは、チャットモデルではありませんでした:TypeSafeのJevと、インドのConvai InnovationsによるオープンソースのApache 2.0 Layaが、「System One」意思決定モデルカテゴリを切り開きました - 生成されたテキストではなく、校正された確率を持つ型付き回答です。上記のボードのどれも、まだその種のモデルを測定していません。これはそれ自体が注目に値するギャップです:ベンチマークエコシステムは文章作成とコーディングを測定する一方、生産AIの増加するスライスは高速分類です。私たちの比較:Laya vs Jev。
完全なスナップショットは/benchmarks/snapshot/2026-09-22、またはライブボードは/benchmarksで閲覧できます。
Related Articles
- Instantánea de Evaluaciones de LLM, 22 de septiembre de 2026: Una Semana Congelada en la Cima
Sep 22, 2026 · 4 min read
- ## Instantâneo de Benchmark de LLM, 22 de setembro de 2026: Uma Semana Congelada no Topo
Sep 22, 2026 · 4 min read
- LLM基准快照,2026年9月22日:榜首冻结的一周
Sep 22, 2026 · 4 min read
- LLM Benchmark Snapshot, September 22, 2026: A Frozen Week at the Top
Sep 22, 2026 · 4 min read
- Aperçu des benchmarks LLM, 22 septembre 2026 : une semaine figée en tête
Sep 22, 2026 · 4 min read