LLM基准快照,2026年9月22日:榜首冻结的一周
本周LiveBench、BenchLM、Aider和LMArena的前三名排名均未发生变化。真正的动态发生在榜单之外:Jev和Laya决策模型开辟了一个尚无基准测试覆盖的新类别。

LLM基准快照,2026年9月22日:榜首冻结的一周
每周我们都会拍摄主要LLM排行榜的照片,并将凭证保存在/benchmarks/history。本周的照片,9月22日,值得注意的是一切都没有发生:在我们追踪的所有五个来源中,没有任何一个前三名的位置发生变化。
各来源的领先者
各来源仍然存在分歧
我们每周都会指出的分歧模式依然存在:Anthropic在三个榜单上领先通用文本,OpenAI在编码(Aider)和webdev(LMArena)上占据决定性优势。如果你根据“排行榜”来选择模型,答案仍然完全取决于哪个排行榜与你的工作负载匹配。
行动发生在排行榜之外
榜首冻结的一周并不意味着平静的一周。最受讨论的发布根本不是聊天模型:TypeSafe的Jev和来自印度Convai Innovations的开源、Apache 2.0许可的Laya开辟了“System One”决策模型类别,提供带校准概率的键入答案,而不是生成的文本。上述任何榜单都尚未衡量这类模型,这本身就是一个值得关注的空白:基准生态系统衡量写作和编码,而生产环境中越来越多的AI是快速分类。我们的对比:Laya vs Jev。
浏览完整快照,请访问/benchmarks/snapshot/2026-09-22,或访问/benchmarks查看实时榜单。
Tags
benchmarks·llm·leaderboard·claude·gpt-6·aider·livebench·weekly-snapshot
Related Articles
- Aperçu des benchmarks LLM, 22 septembre 2026 : une semaine figée en tête
Sep 22, 2026 · 4 min read
- Instantánea de Evaluaciones de LLM, 22 de septiembre de 2026: Una Semana Congelada en la Cima
Sep 22, 2026 · 4 min read
- ## Instantâneo de Benchmark de LLM, 22 de setembro de 2026: Uma Semana Congelada no Topo
Sep 22, 2026 · 4 min read
- LLM Benchmark Snapshot, September 22, 2026: A Frozen Week at the Top
Sep 22, 2026 · 4 min read
- # LLM-Benchmark-Momentaufnahme, 22. September 2026: Eine eingefrorene Woche an der Spitze
Sep 22, 2026 · 4 min read