Blog›Benchmarks

# LLM基准快照,9月6日:Astra与Fable 5.1登场

每周照片:GPT-6 Astra在webdev上以1797 Elo首次亮相((比旧领先者高出107分),Claude Fable 5.1在文本竞技场和LiveBench中占据领先,而Aider尚未迎头赶上。

# LLM基准快照,9月6日:Astra与Fable 5.1登场

一年中最密集的发布窗口过去一周后,排行榜已见分晓。这是2026年9月6日的每周快照:各来源今日所言,自上周快照以来的变化,以及各来源间的分歧所在。每个数字均链接至一个永久性、带日期的页面。

头条:发布周尘埃落定

GPT-6 Astra与Claude Fable 5.1,均在9月初发布,现已位居榜首:

  • Web开发竞技场:GPT-6 Astra Max首秀即达1797 Elo,较上周榜首(Claude Opus 5 Max,1691)跃升+107。如此大的首秀增量实属罕见;今年此前的纪录不足+60。Claude Fable 5.1 Max以1762位列第二。
  • 文本竞技场:Claude Fable 5.1 Max以1514夺得#1,终结了Opus 5 Max的统治(1505,现居第三,落后于Opus 5 High)。
  • LiveBench:Fable 5.1 Max Effort略胜其前代,83.8对83.4,Astra Max紧随其后为83.1,三款模型在无污染套件上差距仅0.7分。
  • BenchLM:Fable 5.1以83.0居首,Astra以81.1次之。注意异常项:上周BenchLM榜首为Claude Mythos 5(83.4),即受限访问版本,这凸显了访问层级如何使排行榜解读复杂化。
  • Aider polyglot(实用代码编辑):无变化,GPT-5 High仍以88.0%领先。Astra与Fable 5.1均尚未在此基准上测试;敬请关注下周。
  • 各来源间的分歧

    竞技场已为新组合加冕;Aider尚未测试它们;LiveBench显示前三名差距不足一分。若只读一个榜单,你看到的是加冕礼;若通读五个榜单,你看到的是带星号的难分胜负。这种差异正是这些快照存在的原因。

    凭证

  • 今日冻结快照:基准快照 2026-09-06
  • 上周:快照 2026-08-30
  • 实时榜单,每日更新:文本 · Web开发 · 完整历史
  • 模型背景:GPT-6 Astra · Claude Fable 5与Mythos 5,见AI Wiki
  • Tags
    benchmarks·gpt-6-astra·claude-fable-5-1·snapshot·leaderboards