GSM8K 2021は、8,500問の高品質で言語的に多様な小学校高学年向け算数の文章問題からなるベンチマークデータセットである。2021年にOpenAIの研究者らによって、大規模言語モデルの算術推論能力を評価するために導入された。データセットは7,500問のトレーニング問題と1,000問のテスト問題に分割され、各問題には複数のステップに分解した自然言語の解答が付随している。名称は「Grade School Math 8K」の略であり、対象読者と問題数の概数を反映している。
GSM8K 2021の主な目的は、モデルが単なるパターンマッチングではなく、多段階の数学的推論を実行できるかをテストすることである。単一ステップの算術に依存するより単純なベンチマークとは異なり、GSM8Kではモデルが問題文を理解し、関連する数量を特定し、一連の演算を実行することが求められる。問題は優秀な中学生が解けるように書かれているが、しばしば妨害要素を含み、慎重な論理的推論を必要とする。これにより、このデータセットは機械学習および人工知能研究における進歩を測定するための、挑戦的で広く使用される標準となっている。
データセットの構築と特徴
GSM8K 2021データセットは、Jakob Uszkoreit、Lukasz Kaiser、Niki Parmarなどの貢献者を含むOpenAIのチームによって作成された。問題は、多様で自然な文章問題と明確なステップバイステップの解答を生成するよう指示された人間の請負業者によって書かれた。各解答は自然言語の文の連続であり、中間計算が明示的に示されている。データセットは、特定の数字やキーワードへの過度の依存などのバイアスを最小限に抑えるため、言語的な表面形式を変化させるように設計された。
GSM8Kの注目すべき特徴は、その高いアノテータ間一致度である。作成者らは、人間の解答者がテストセットでほぼ完璧な精度を達成し、期待される性能の強力なベースラインを確立したと報告している。問題は、加算、減算、乗算、除算、分数、百分率、簡単な代数を含むさまざまな算術演算をカバーしている。平均問題長は約30語、平均解答長は約8ステップであり、コンパクトながら要求の厳しい推論タスクとなっている。
評価と言語モデルへの影響
GSM8K 2021は、ニューラルネットワークおよびトランスフォーマーベースのモデルを評価するための標準ベンチマークとして急速に確立された。初期の結果では、標準的な深層学習モデルは苦戦し、多くがテストセットで20%未満の精度しか達成できなかった。これは、言語理解と数学的推論の間のギャップを浮き彫りにした。このデータセットは、Curriculum Learning、AIフィードバックからの強化学習、チェーン・オブ・ソート・プロンプティングなどの技術に関する研究を促進し、モデルが最終回答を出す前に中間推論ステップを生成するように訓練またはプロンプトされるようになった。
2022年までに、より大規模なモデルと改善された訓練方法が大幅に高いスコアを達成し始めた。例えば、検証器ベースのアプローチで微調整されたモデルや、明示的なステップバイステップの監督で訓練されたモデルは、80%以上の精度に達した。このベンチマークは、Google DeepMind、Anthropic、学術研究所を含む多くの組織によって、モデル能力を比較するために使用されている。これは算術推論を測定するための参照点であり続けているが、その後、より新しく複雑なベンチマークが導入されている。
限界と批判
その人気にもかかわらず、GSM8K 2021には限界がある。問題は実世界の数学的タスクと比較して比較的単純であり、データセットは小さいため、モデルが直接訓練されると過学習につながる可能性がある。批評家は、モデルが真の推論ではなく、パターンの記憶やヒューリスティックを使用して高いスコアを達成することがあると指摘している。さらに、データセットは英語のみであり、多言語評価への適用性が制限されている。研究者はまた、解答が常に最も効率的であるとは限らず、ベンチマークが算術を超えた概念的理解をテストしていないことも指摘している。
これらの問題の一部に対処するため、より複雑な問題や異なる言語を持つGSM8Kの変種などの後続データセットが作成されている。しかし、GSM8K 2021はこの分野の基礎的なツールであり続け、新しいモデルアーキテクチャや訓練技術の健全性チェックとしてしばしば使用されている。その単純さと明確な評価基準により、研究者にとってアクセスしやすい出発点となっている。
遺産と継続的な使用
2025年現在、GSM8K 2021は大規模言語モデルの研究論文で依然として広く引用されている。これは、OpenAIや他のAI研究所が使用するものなど、多くの評価スイートに含まれており、時間の経過に伴う進歩を追跡している。このデータセットは、Model PruningやData Augmentationなどの現象を研究するためにも使用されており、研究者は訓練データやモデル構造の変更が推論性能にどのように影響するかを調査している。その影響は学界を超えて広がり、商用モデルのベンチマークや、AI能力に関する公的な議論に情報を提供するために使用されている。
GSM8K 2021の作成は、AI研究におけるより厳格でタスク固有のベンチマークへの移行を示した。これは、複雑な認知スキルを評価するための高品質で人間が注釈を付けたデータの重要性を実証した。新しいベンチマークがより挑戦的であるかもしれないが、GSM8K 2021はニューラルモデルにおける算術推論のための最初の広く採用されたテストの1つとして歴史的な位置を占めている。