Blog›Benchmarks

LLM基准快照,2026年9月22日:榜首冻结的一周

本周LiveBench、BenchLM、Aider和LMArena的前三名排名均未发生变化。真正的动态发生在榜单之外:Jev和Laya决策模型开辟了一个尚无基准测试覆盖的新类别。

LLM基准快照,2026年9月22日:榜首冻结的一周

LLM基准快照,2026年9月22日:榜首冻结的一周

每周我们都会拍摄主要LLM排行榜的照片,并将凭证保存在/benchmarks/history。本周的照片,9月22日,值得注意的是一切都没有发生:在我们追踪的所有五个来源中,没有任何一个前三名的位置发生变化。

各来源的领先者

  • LiveBench(总体): Claude Fable 5.1(最大努力)以83.78分保持第一,领先于Fable 5(83.38)和GPT-6 Astra max(83.05)。三个模型之间的差距在0.73分以内。
  • BenchLM(总体): Claude Fable 5.1为84.58,GPT-6 Astra为83.79,Claude Opus 5为81.87。
  • Aider polyglot(编码): GPT-5(高)保持其88.0,GPT-5(中)为86.7,o3-pro为84.9。OpenAI仍然独占这个榜单。
  • LMArena文本Elo: Claude Fable 5.1 max为1507.6,两个Opus 5变体以1505紧随其后,差距为2.6个Elo点,实际上算是平局。
  • LMArena webdev Elo: GPT-6 Astra max为1800.3,遥遥领先于Fable 5.1 max(1758),这是差距最大的一个榜单。
  • 各来源仍然存在分歧

    我们每周都会指出的分歧模式依然存在:Anthropic在三个榜单上领先通用文本,OpenAI在编码(Aider)和webdev(LMArena)上占据决定性优势。如果你根据“排行榜”来选择模型,答案仍然完全取决于哪个排行榜与你的工作负载匹配。

    行动发生在排行榜之外

    榜首冻结的一周并不意味着平静的一周。最受讨论的发布根本不是聊天模型:TypeSafe的Jev和来自印度Convai Innovations的开源、Apache 2.0许可的Laya开辟了“System One”决策模型类别,提供带校准概率的键入答案,而不是生成的文本。上述任何榜单都尚未衡量这类模型,这本身就是一个值得关注的空白:基准生态系统衡量写作和编码,而生产环境中越来越多的AI是快速分类。我们的对比:Laya vs Jev。

    浏览完整快照,请访问/benchmarks/snapshot/2026-09-22,或访问/benchmarks查看实时榜单。

    Tags
    benchmarks·llm·leaderboard·claude·gpt-6·aider·livebench·weekly-snapshot