Blog›Benchmarks

# LLMベンチマークスナップショット、9月6日:AstraとFable 5.1が登場

週刊フォト:GPT-6 Astraがwebdevで1797 Eloでデビュー(旧リーダーより+107)、Claude Fable 5.1がテキストアリーナとLiveBenchを制覇、そしてAiderはまだ追いついていない。

# LLMベンチマークスナップショット、9月6日:AstraとFable 5.1が登場

今年最も密集した発表ウィンドウから1週間が経過し、リーダーボードが結果を語り始めました。これは2026年9月6日付の週次スナップショットです:各ソースが今日何を示しているか、先週のスナップショットから何が変わったか、そしてソース間でどこに意見の相違があるか。各数字は、恒久的な日付付きページにリンクしています。

見出し:発表週が着地

GPT-6 AstraとClaude Fable 5.1は、9月の最初の数日間にリリースされ、すでにボードのトップに立っています:

  • Web開発アリーナ:GPT-6 Astra Maxがデビューで1797 Eloを記録し、先週のリーダー(Claude Opus 5 Max、1691)から+107のジャンプ。この規模のデビュー差は稀で、今年のこれまでの記録は+60未満でした。Claude Fable 5.1 Maxは1762で2位に着地。
  • テキストアリーナ:Claude Fable 5.1 Maxが1514で1位を獲得し、Opus 5 Maxの支配(1505、現在はOpus 5 Highの後ろで3位)を終わらせました。
  • LiveBench:Fable 5.1 Max Effortが前モデルをわずかに上回り、83.8対83.4、Astra Maxが83.1で直後に続き、汚染フリーのスイートで3モデルが0.7ポイント以内に収まっています。
  • BenchLM:Fable 5.1が83.0で1位、Astraが81.1で2位。注目すべき例外は、先週のBenchLMリーダーがClaude Mythos 5(83.4)という制限アクセス版であり、アクセス層がリーダーボードの解釈を複雑にすることを示しています。
  • Aiderポリグロット(実用的なコード編集):変更なし、GPT-5 Highが88.0%で依然としてリード。AstraもFable 5.1もまだそこでベンチマークされておらず、来週に注目です。
  • ソース間の意見の相違

    アリーナはすでに新しいペアを称賛していますが、Aiderはまだテストしておらず、LiveBenchはトップ3が1ポイント未満の差であることを示しています。1つのボードだけを見れば戴冠式が見え、5つすべてを見ればアスタリスク付きの写真判定が見えます。その広がりこそが、これらのスナップショットが存在する理由です。

    証拠

  • 今日の凍結写真:ベンチマークスナップショット 2026-09-06
  • 先週のもの:スナップショット 2026-08-30
  • 毎日更新されるライブボード:テキスト・Web開発・完全な履歴
  • モデルの背景情報:GPT-6 Astra・Claude Fable 5とMythos 5(AI Wiki内)
  • Tags
    benchmarks·gpt-6-astra·claude-fable-5-1·snapshot·leaderboards