英語からの翻訳

MathQAは、AIシステムの推論能力を評価・向上させるために設計された、注釈付きの操作プログラムを持つ37,000問の多肢選択式数学文章問題からなる大規模データセットである。

MathQAは、2019年にAmazonとカリフォルニア大学サンタバーバラ校の研究者によって導入された大規模データセットである。一般数学、物理学、金融などのトピックを扱う37,000件の英語の多肢選択式数学文章題が含まれている。各問題には、正解に到達するために必要な操作の順序を指定する線形計画法が注釈として付与されている。このデータセットは、より単純な算術に焦点を当てたMathQAの前身のような初期のデータセットの限界に対処し、数学的推論のための人工知能機械学習の研究を支援するために作成された。

MathQAの問題はAQuAデータセットに由来するが、より詳細で一貫性のある操作プログラムで再注釈が施されている。注釈には、テキストによる説明、形式的な線形計画法、最終回答が含まれる。線形計画法は、加算、減算、乗算、除算、比較などの操作を含むドメイン固有言語で表現される。この構造により、モデルは最終回答だけでなく、中間の推論ステップも学習できる。

データセット構造

MathQAの各エントリは、問題文、多肢選択式の選択肢、正解、線形計画法で構成される。線形計画法は、各ステップが演算子とその引数を含む一連のステップである。例えば、単利を計算する問題では、元本に利率を掛け、次に時間を掛けるステップがあるかもしれない。データセットは、トレーニングセット(29,837問題)、検証セット(4,469問題)、テストセット(2,985問題)に分割されている。問題は「金利」や「物理」などの33の異なるタイプに分類され、異なる推論領域にわたるモデルのパフォーマンスを分析するのに役立つ。

線形計画法は実行可能になるように設計されており、プログラムインタープリタが与えられた数値から回答を計算できる。この特性により、モデルのトレーニングと評価におけるプログラム合成と実行技術の使用が可能になる。データセットには、半教師あり学習用の50,000件のラベルなし問題も含まれているが、主要なベンチマークはラベル付き分割を使用する。

評価とベンチマーク

MathQAは、AIモデルの数学的推論能力を評価するためのベンチマークとして一般的に使用される。標準的な評価指標はテストセットでの精度であり、モデルは正しい回答の選択肢を出力する必要がある。シーケンス・ツー・シーケンスモデルやメモリ拡張ニューラルネットワークを用いた初期のベースラインは、約30〜40%の精度を達成した。Transformer (architecture)アーキテクチャや大規模言語モデルに基づく最近のアプローチは、パフォーマンスを大幅に向上させている。例えば、GPT-3のようなモデルの微調整版は、テストセットで80%以上の精度に達している。

このデータセットは、モデルが解釈可能な推論ステップを生成する能力を評価するためにも使用される。線形計画法が提供されているため、研究者は最終回答が正しいかどうかだけでなく、予測されたプログラムがグラウンドトゥルースと一致するかどうかを測定できる。これにより、プログラム生成と実行を組み合わせたモデルの開発が促進され、精度と解釈可能性の両方が向上している。

関連データセットとタスク

MathQAは、MAWPS、ASDiv、GSM8Kなどの数学文章題データセットのより広いファミリーの一部である。これらと比較して、MathQAはより多くの問題数とより複雑な推論要件を提供し、多くの問題が複数のステップとより広範な数学的操作を含む。このデータセットは、自然言語処理深層学習のモデルをトレーニングおよび評価するために、他のリソースと併用されることが多い。

数学文章題を解くタスクは、機械の理解と推論の挑戦的なテストと見なされている。テキストの記述を理解し、関連する数量を抽出し、適切な算術または代数操作を適用する必要がある。MathQAの注釈スキームは、明示的な操作プログラムを備えており、このタスクに取り組むための構造化された方法を提供し、その後のデータセット設計に影響を与えた。

限界と論争

MathQAの顕著な限界の1つは、注釈付きプログラムの一部にエラーや不整合が含まれていることであり、トレーニング中にモデルを誤解させる可能性がある。研究者は、誤った演算子の使用や欠落したステップなどの問題を特定している。さらに、データセットの多肢選択形式により、モデルが実際に推論を実行するのではなく、回答パターンを悪用する可能性がある。いくつかの研究では、モデルが選択肢の長さや特定の数値の存在などの表面的な手がかりを使用して、偶然を超える精度を達成できることが示されている。

もう1つの批判は、問題の範囲が比較的狭く、算術と単純な代数に焦点を当てており、数学的推論の多様性を完全には捉えていない可能性があることである。これらの問題にもかかわらず、MathQAは数学的問題解決能力を持つAIシステムを評価および開発するための広く使用されるベンチマークであり続けている。

関連項目

  • 数学的推論
  • 質問応答
  • 自然言語理解
  • プログラム合成
  • ベンチマーク(コンピューティング)

参考文献

  • Amini, A., Gabriel, S., Lin, S., Koncel-Kedziorski, R., Choi, Y., & Hajishirzi, H. (2019). MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms. In Proceedings of NAACL-HLT.
  • MathQAデータセットはhttps://math-qa.github.io/で入手可能(2025年アクセス)。
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:datasets·natural-language-processing·mathematical-reasoning·artificial-intelligence
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴