Blog›Guides

LLMベンチマークスナップショット:2026年8月23日

LLMリーダーボードの第1回週次写真:LMArena、LiveBench、BenchLM、Aiderを、1つの引用可能なページに固定。Anthropicが3つの表彰台を独占、GPT-5はコーディングの王座を維持。

LLMベンチマークスナップショット:2026年8月23日

LLMベンチマークスナップショット:2026年8月23日

これは新しいWikipromptシリーズの最初のエントリーです。毎週、主要なLLMリーダーボードの完全なスナップショットを凍結し、恒久的で引用可能なページとして公開します。このスナップショットの完全なテーブルは/benchmarks/snapshot/2026-08-23にあり、今後のすべてのスナップショットは/benchmarks/historyでインデックス化されます。

日付付きスナップショットの理由

ベンチマークの数値は静かに変動します。モデルが順位を上げ、スコアが再計算され、先月のリーダーがいつの間にか4位になっていることもあります。週ごとに1つのURLを維持することで、記録は公開され続けます。「2026年8月23日時点のランキング」を引用でき、そのリンクは常に正確にその内容を示します。

スナップショットが示すもの

このスナップショットは、それぞれ独自の方法論を持つ5つの独立したオープンソースをカバーしています:

  • LMArena(テキストアリーナ):claude-opus-5-highがコミュニティEloでリードし、claude-opus-5-maxとclaude-opus-4-6-highが続きます。Anthropicが今週のテキスト部門の表彰台を独占しています。
  • LMArena(ウェブ開発):claude-opus-5-maxがトップで、kimi-k3-maxとqwen3.8-maxが続きます。これらはMoonshotとAlibabaのオープンウェイトの挑戦者で、フロンティアラボに迫っています。
  • LiveBench:claude-fable-5-max-effortが平均83.0で首位に立ち、gpt-5.6-sol-max(81.7)とgpt-5.5-xhigh(80.8)が続きます。
  • BenchLMアグリゲート:Anthropicが表彰台を独占:Claude Mythos 5(83.0)、Claude Opus 5(82.7)、Claude Fable 5(82.7)が0.25ポイント差で並びます。
  • Aiderポリグロット(コーディング):gpt-5(high)が実用的なコーディングで依然として支配的で、88.0%の合格率を記録し、gpt-5(medium)とo3-pro(high)が続きます。
  • 興味深い読み物は、その不一致です。コミュニティ投票(LMArena)、学術スタイルのタスクスイート(LiveBench)、集約スコア(BenchLM)、実践的なコーディング(Aider)は、同じモデルを王者として認定しません。この不一致こそが、私たちが単一の情報源ではなく、複数の情報源を追跡する理由です。

    探索する

  • ライブリーダーボード、フィルター、コスト対パフォーマンスチャート:/benchmarks
  • 今週の凍結スナップショット:/benchmarks/snapshot/2026-08-23
  • すべてのスナップショット:/benchmarks/history
  • 新しいスナップショットは毎週日曜日に公開されます。ランキングが変動したとき、あなたは正確にその時点を指し示すことができます。

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art