LLM基准快照:2026年9月13日当周
每周五大排行榜照片:Claude Fable 5.1 在文本、LiveBench 和 BenchLM 中保持领先;GPT-5 继续稳坐 Aider 编程榜首;GPT-6 Astra 在网页开发领域独占鳌头。榜首稳定,但按领域分化。

LLM排行榜的每周快照已发布:2026-09-13快照,涵盖五个独立来源。本周头条是榜首稳定,以及按学科划分的三方分庭抗礼。
各来源领先者
与上周相比的变化
顶部变化极小,这正是重点:同样的两个家族已连续两周瓜分各榜单。Anthropic拥有通用文本和混合任务基准(文本竞技场、LiveBench、BenchLM);OpenAI拥有开发者榜单(Aider编码、webdev竞技场)。如果你按排行榜选模型,答案现在确实取决于哪个排行榜。
来源分歧角度
单一“最佳模型”的说法掩盖了三方分裂:Fable 5.1在三个榜单上排名第一,GPT-6 Astra在一个,GPT-5在一个。这正是我们每日快照全部五个的原因,每个榜单衡量不同技能,记录始终保留在案。
浏览完整表格请访问/benchmarks,或通过历史记录比较随时间的变化。
Tags
benchmarks·llm·leaderboards·claude·gpt-5·weekly-snapshot
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read