Blog›Guides

LLM基准快照:2026年9月13日当周

每周五大排行榜照片:Claude Fable 5.1 在文本、LiveBench 和 BenchLM 中保持领先;GPT-5 继续稳坐 Aider 编程榜首;GPT-6 Astra 在网页开发领域独占鳌头。榜首稳定,但按领域分化。

LLM基准快照:2026年9月13日当周

LLM排行榜的每周快照已发布:2026-09-13快照,涵盖五个独立来源。本周头条是榜首稳定,以及按学科划分的三方分庭抗礼。

各来源领先者

  • LMArena文本:Claude Fable 5.1(max)以1510 Elo保持第一,Claude Opus 5变体位列第二和第三,这是全Anthropic的领奖台。
  • LiveBench:Claude Fable 5.1(最大努力)以83.78领先,超过Fable 5和GPT-6 Astra(83.05)。与上周相同领先者。
  • BenchLM:Claude Fable 5.1以84.61超过GPT-6 Astra(84.08),这是五个榜单中差距最小的。
  • Aider polyglot(编码):GPT-5(high)以88.0保持编码桂冠,GPT-5 medium和o3-pro紧随其后。Anthropic未进入前三。
  • LMArena webdev:GPT-6 Astra(max)以1800 Elo占据主导,领先Fable 5.1达42分。
  • 与上周相比的变化

    顶部变化极小,这正是重点:同样的两个家族已连续两周瓜分各榜单。Anthropic拥有通用文本和混合任务基准(文本竞技场、LiveBench、BenchLM);OpenAI拥有开发者榜单(Aider编码、webdev竞技场)。如果你按排行榜选模型,答案现在确实取决于哪个排行榜。

    来源分歧角度

    单一“最佳模型”的说法掩盖了三方分裂:Fable 5.1在三个榜单上排名第一,GPT-6 Astra在一个,GPT-5在一个。这正是我们每日快照全部五个的原因,每个榜单衡量不同技能,记录始终保留在案。

    浏览完整表格请访问/benchmarks,或通过历史记录比较随时间的变化。

    Tags
    benchmarks·llm·leaderboards·claude·gpt-5·weekly-snapshot