BlogBenchmarks

# LLM基准快照:2026年8月30日

六款LLM排行榜的每周冻结快照:Opus 5 在文本竞技场中独占鳌头,Fable 5 稳居 LiveBench 榜首,gpt-5 继续领跑 Aider 编程,而各数据源之间仍存在分歧。

# LLM基准快照:2026年8月30日

LLM基准快照:2026年8月30日

每周日,Wikiprompt都会冻结各大LLM排行榜的快照。这是截至2026年8月30日当周的快照,包含六个来源的14,164条记录,可在/benchmarks/snapshot/2026-08-30完整浏览。

各来源领先者

  • LMArena(文本):claude-opus-5-max以最高Elo(1504.7)位居榜首,略高于claude-opus-5-high(1503.6),上一代claude-opus-4-6-high仍保持第三名。
  • LMArena(网页开发):claude-opus-5-max以大幅优势领先(1690.6),kimi-k3-max(1673.7)和qwen3.8-max(1668.9)是最强的开源权重挑战者。
  • LiveBench:claude-fable-5-max-effort位居第一(83.4),领先于gpt-5.6-sol-max(81.7)和gpt-5.5-xhigh(80.8)。
  • BenchLM:Claude 5系列横扫领奖台,Mythos 5(83.4)、Fable 5(83.2)、Opus 5(83.1),彼此仅差零点几分。
  • Aider polyglot(编码):gpt-5(high)以88.0%的通过率仍是编码基准之王,领先于gpt-5(medium)和o3-pro(high)。
  • Artificial Analysis智能指数:Claude Opus 5在最大努力设置下领先(63.1),Fable 5变体紧随其后。
  • 与上周相比的变化

    文本竞技场的桂冠在同一家族内部易主:claude-opus-5-high(上周1504.2)被claude-opus-5-max(1504.7)以微弱优势超越。统计上这如同抛硬币,编辑上则提醒我们,在榜单顶端,努力设置现在与模型选择同等重要。

    各来源仍存在分歧

    与每周一样,没有两个排行榜会选出相同的冠军:LMArena的社区Elo偏爱Opus 5,LiveBench的无污染学术测试集偏爱Fable 5,而Aider的真实编码测试仍属于gpt-5。在选择之前请交叉参考,这正是比较视图的用途。

    浏览完整的带日期表格,请访问/benchmarks/snapshot/2026-08-30,或查看整个存档,请访问/benchmarks/history

    Tags
    benchmarks·llm·leaderboard·weekly