BlogBenchmarks

# GPT-6 Astra 与 Claude Fable 5.1:前沿发布周,纪实报道

Anthropic、Google和OpenAI均在72小时内发布了新品。发布了什么,我们每日基准测试快照已经显示的内容,以及为什么分层访问成为新的前沿模式。

# GPT-6 Astra 与 Claude Fable 5.1:前沿发布周,纪实报道

2026年9月的前三天,三大AI实验室都发布了新品:Anthropic在周一发布了Claude Fable 5.1和Mythos 5.1,Google在周二推出了Gemini 3.8 Flash,OpenAI在周三宣布了GPT-6 Astra。以下是实际发布的内容、我们每日基准快照已经显示的情况,以及接下来排行榜上值得关注的点。

发布内容

Claude Fable 5.1和Mythos 5.1(9月1日)。 Anthropic称其为用于编程和知识工作最先进的模型,在许多工作负载下比Fable 5结果更强且成本更低。这两个名称是同一底层模型的两条路径:Fable广泛发布,对双重用途能力增加了额外保障,而Mythos仅向经过审查的组织提供(目前是一组美国网络防御者和生命科学实验室)。关于这一层级的背景信息见我们的wiki:Claude Fable 5和Mythos 5

GPT-6 Astra(9月3日)。 OpenAI的新旗舰模型,被描述为“多年研究和重大押注”的成果,分阶段向ChatGPT付费计划、API和AWS推出。头条不仅仅是能力:Astra是首个达到公司内部“关键”网络安全阈值的OpenAI模型,OpenAI首先将这些能力限制在其Daybreak安全计划中的公司。这反映了Anthropic的Fable/Mythos拆分,并使分层访问成为事实上的前沿发布模式。Wiki页面:GPT-6 Astra

我们的快照已经显示的内容

Wikiprompt每日对主要排行榜进行快照,因此发布周会留下可追踪的记录:

  • Fable 5.1已出现在OpenRouter上,在我们9月3日的快照中,发布两天后即被列出,包括批量定价层级。
  • Claude Fable 5在LMArena的网页开发竞技场中领先,在今天的快照中整体Elo为1628(HTML任务为1663),领先于我们追踪的所有其他模型。
  • 在通用文本竞技场中,今天的前列是Anthropic的紧密集群:Opus 5 Max(1505)、Opus 5 High(1504)和Opus 4.6 High(1503),Fable 5以1494与Gemini 3.7 Flash High(1491)并列。
  • GPT-6 Astra尚未出现在社区竞技场中。 分阶段发布通常会在几天内出现;当它落地时,每日快照会捕捉到它,变化将在基准历史中可见。
  • 为什么访问层级很重要

    本周有趣的转变不是基准数字。两家实验室现在都公开在审查后发布其最强能力:Mythos面向批准的组织,Astra的网络能力面向Daybreak群体。对于提示词编写者来说,这意味着你能购买的模型和内部评估中排名最高的模型不再总是同一个产物,而社区排行榜(测试公开变体)是你实际能使用内容的诚实衡量标准。

    关注动态

  • 今日冻结快照:2026年9月3日基准快照
  • 文本竞技场,每日更新:文本排行榜
  • Fable 5目前领先的位置:网页开发排行榜
  • 所有排名变化的记录:基准历史
  • 我们将继续每日快照;当Astra和Fable 5.1进入竞技场时,差异将直接可见。

    Tags
    gpt-6-astra·claude-fable-5-1·openai·anthropic·benchmarks·model-launches