SVAMP(Simple Variations on Arithmetic Math word Problems)は、人工知能システムが初等算数の文章題を解く能力を評価するために設計されたベンチマークデータセットである。2020年にArkil Patel、Satwik Bhattamishra、Navin Goyalらを含む研究者によって導入され、既存の数学文章題データセットから派生した1,000問の問題で構成される。各問題は、モデルの真の数学的推論能力を試すために変更が加えられており、統計的パターンを利用する能力ではなく、実際の推論能力を評価する。このベンチマークは、機械学習および自然言語処理の分野における標準的な評価ツールとなっており、特に大規模言語モデルの数学的タスクにおける性能評価に用いられている。
SVAMPの主な動機は、それ以前の数学文章題ベンチマークにおける重大な欠陥に対処することにあった。従来のベンチマークでは、モデルが実際の算数推論を行うのではなく、特定の数字やキーワードの存在などの表面的な手がかりに依存して高い精度を達成することが多かった。SVAMPは、元の問題に文の順序の変更、主語や目的語の変更、または数学的構造を保ちながら数字を変更するなどの制御された摂動を導入する。これにより、モデルは問題の意味内容に取り組むことを余儀なくされ、ベンチマークは推論能力のより信頼性の高い指標となる。
データセットの構築
SVAMPは、MAWPS、ASDiv-A、およびMath23kデータセットの2つのサブセットという4つの既存データセットから問題を取得して構築された。作成者は一連の変換を適用して、それぞれが1つまたは2つの演算(加算、減算、乗算、除算)を含む単一の算術解を持つ1,000問の独自問題を生成した。変換は意味的に中立となるように設計されており、必要な数学的演算を変えることなく表面的な形式を変更する。例えば、リンゴに関する問題がオレンジに関する問題に書き換えられたり、問題を説明する2つの文の順序が入れ替えられたりする場合がある。データセットには、100問の検証分割と900問のテスト分割が含まれており、テストセットには元の問題と変更された問題の重複はない。
評価方法
SVAMPにおける標準的な評価では、モデルの最終回答(単一の数値)の精度を測定する。モデルは通常、問題文を入力として与えられ、正しい数値を出力することが期待される。このベンチマークは、パターンマッチングに依存するモデルにとって挑戦的となるように設計されており、変動により単純なヒューリスティックが一貫して正解を生成できないことが保証されている。多くの発表された結果では、SVAMPの精度が主要な指標として報告されており、GSM8KやMathQAなどの他のベンチマークと並べて示されることが多い。例えば、初期のトランスフォーマーベースのモデルは20〜40%の範囲の精度を達成したが、チェーン・オブ・ソート推論を備えた最近の大規模言語モデルは80%以上の精度に達している。ただし、このベンチマークは数学的推論の進歩を測定するための参照点として残っている。
AI研究における重要性
SVAMPは、算数推論におけるニューラルネットワークアプローチの限界を浮き彫りにする上で顕著な役割を果たしてきた。SVAMPを用いた研究では、数学的内容が同一であっても問題の表現がわずかに変更されるとモデルが失敗することが多く、訓練パターンを記憶する傾向があり一般化できないことが明らかになっている。これにより、カリキュラム学習、データ拡張、特殊なアーキテクチャの開発など、より堅牢な推論技術の研究が促進された。このベンチマークは人工知能および深層学習に関する論文で頻繁に引用されており、OpenAI、Google DeepMind、Anthropicなどの主要ラボやオープンソースの取り組みからのモデルを評価するために使用されてきた。
限界と批判
その有用性にもかかわらず、SVAMPには限界がある。データセットはわずか1,000問と比較的小規模であり、評価結果に高いばらつきが生じる可能性がある。さらに、問題は初等算数に限定されているため、代数や幾何学などのより複雑な数学的推論は評価されない。一部の研究者は、摂動は有用ではあるものの、現実世界の文章題の多様性を完全には捉えていない可能性があると指摘している。その結果、SVAMPはより包括的な評価を提供するために他のベンチマークと併用されることが多い。それでもなお、制御された変動に焦点を当てた点は、モデル推論の特定の弱点を分離するための貴重なツールとなっており、この分野で広く認識された標準として残っている。