Blog›Guides

LLM基准快照:2026年8月23日

LLM排行榜首周照片:LMArena、LiveBench、BenchLM和Aider,冻结在一页可引用的页面上。Anthropic横扫三个领奖台;GPT-5保持编程桂冠。

LLM基准快照:2026年8月23日

LLM基准快照:2026年8月23日

这是Wikiprompt系列的第一篇:每周我们冻结主要LLM排行榜的完整快照,并将其发布为永久、可引用的页面。本次快照的完整表格位于/benchmarks/snapshot/2026-08-23,未来的每张快照都将在/benchmarks/history索引。

为什么需要带日期的快照?

基准数字悄然变化:一个模型攀升,一个分数被重新计算,上个月的领先者默默变成第四名。通过为每周快照保留一个URL,记录保持公开。你可以引用“截至2026年8月23日的排名”,该链接将始终显示确切的内容。

快照显示了什么

本次快照涵盖五个独立的开放来源,每个都有其自己的方法论:

  • LMArena(文本竞技场):claude-opus-5-high在社区Elo中领先,claude-opus-5-max和claude-opus-4-6-high紧随其后。Anthropic本周占据整个文本领奖台。
  • LMArena(网页开发):claude-opus-5-max位居榜首,其次是kimi-k3-max和qwen3.8-max,来自Moonshot和阿里巴巴的两个开放权重挑战者紧逼前沿实验室。
  • LiveBench:claude-fable-5-max-effort以平均83.4分夺得第一,领先于gpt-5.6-sol-max(81.7)和gpt-5.5-xhigh(80.8)。
  • BenchLM综合:全Anthropic领奖台:Claude Mythos 5(83.0)、Claude Opus 5(82.7)和Claude Fable 5(82.7),相差仅四分之一分。
  • Aider polyglot(编码):gpt-5(高)以88.0%的通过率仍主导实际编码,领先于gpt-5(中)和o3-pro(高)。
  • 有趣的解读在于分歧:社区投票(LMArena)、学术风格任务套件(LiveBench)、综合分数(BenchLM)和动手编码(Aider)并未加冕同一模型。这种分歧正是我们追踪多个来源而非单一来源的原因。

    探索它

  • 实时排行榜、过滤器和成本与性能对比图:/benchmarks
  • 本周的冻结快照:/benchmarks/snapshot/2026-08-23
  • 所有快照:/benchmarks/history
  • 新快照每周日发布。当排名变化时,你将能够精确指向变化发生的时间。

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art