英語からの翻訳

MATH 2025は、2025年に導入された5,000問の競技レベルの数学問題からなるベンチマークデータセットであり、大規模言語モデルの推論能力を評価するために設計されている。非公開のテストセットと四半期ごとのリーダーボードを備えている。

MATH 2025は、大規模言語モデル(LLM)の数学的推論能力を評価するために設計されたベンチマークデータセットです。2025年に公開され、代数、幾何学、数論、組合せ論、微積分にわたる5,000問の競技形式の問題で構成されています。以前のベンチマークとは異なり、MATH 2025には公開されていない隠しテストセットが含まれており、過学習を減らし、より堅牢な汎化の測定を提供することを目的としています。このベンチマークは、学術および産業の研究者からなるコンソーシアムによって維持され、AI推論の進歩を追跡するためにリーダーボードが四半期ごとに更新されます。

このデータセットは、12,500問を有する元のMATHベンチマーク(2021年)の後継として、2025年初頭に導入されました。MATH 2025は、より小規模ながらより挑戦的な問題セットに焦点を当てており、最近のオリンピックスタイルの競技や参加機関からの新規貢献から問題が選ばれています。各問題には段階的な解答が付随し、詳細なエラー分析を可能にします。隠しテストセットはAPIを介して制御され、直接アクセスを防ぎ、公平な評価を促進します。モデルは完全一致の正確性でスコアリングされ、正しい中間ステップには部分点が与えられます。

問題構成と難易度

MATH 2025には、代数、幾何学、数論、組合せ論、微積分の各トピック領域ごとに1,000問が含まれています。難易度は高校のオリンピックレベルから大学学部レベルまで幅広く、平均的な問題は複数の推論ステップを必要とします。例えば、代数のサンプル問題は「方程式x^5 - 5x^3 + 4x = 0のすべての実根の和を求めよ」というものです。幾何学の問題では、円に内接する四角形の性質を証明することが含まれます。問題は曖昧さがなく、一意の数値または短い形式の解答を持つように設計されています。

評価方法

モデルはAPIを介して評価され、完全一致の解答に基づいてスコアが返されます。リーダーボードは四半期ごと(3月、6月、9月、12月)に更新され、全体の正確性で提出をランク付けします。第1四半期時点で、最高性能のモデルは72%の正確性を達成し、人間の専門家ベースラインは約85%を記録しました。このベンチマークはトピック別の内訳も報告しており、幾何学が最も難しいカテゴリであり、平均正確性が代数より15%低いことが明らかになっています。データ汚染を防ぐため、テストセットは6か月ごとにローテーションされ、進行中の競技から新しい問題が追加されます。

AI研究への影響

MATH 2025は、大規模言語モデルの推論を評価するための標準的な参照点となっています。これは、現在のアプローチの限界、特に多段階の演繹と記号操作における限界を浮き彫りにしました。いくつかのOpenAIおよびGoogle DeepMindモデルは、このベンチマークを使用してトレーニングを導き、カリキュラム学習RLHFなどの技術を組み込んで性能を向上させています。このベンチマークはまた、複雑な問題での正確性を大幅に向上させるチェーン・オブ・ソートプロンプティングの研究を促進しました。

関連ベンチマークと将来の方向性

元のMATH 2021ベンチマークは依然として広く使用されていますが、MATH 2025はより厳格なテストを提供します。他の関連評価には、小学校レベルの数学向けのGSM8Kや、競技問題向けのHendrycks Mathがあります。MATH 2025の将来のバージョンでは、よりオープンエンドな問題と自動証明検証を含めることが計画されています。このベンチマークの背後にあるコンソーシアムには、MIT CSAILスタンフォードAIラボの研究者が含まれており、2026年までにデータセットを10,000問に拡大し、学際的な推論への焦点を強化することを目指しています。

論争と限界

一部の研究者は、隠しテストセットが不透明であり、モデルのエラーを診断するのが難しいと批判しています。他の研究者は、このベンチマークが間接的な露出を通じてデータ漏洩の影響を受けやすい可能性があると指摘しています。API制御のアクセスは、すべての研究者が繰り返し評価を負担できるわけではないため、再現性に関する懸念も引き起こします。これらの問題にもかかわらず、MATH 2025は、数学的知能の挑戦的で動的なテストを提供し、AI評価における重要な前進として広く認識されています。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:artificial-intelligence·machine-learning·benchmark·mathematics
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴