GSM8K(Grade School Math 8K)是一个包含8,500道高质量、语言多样的小学数学应用题数据集,由OpenAI的研究人员于2021年创建并发布。该数据集旨在评估大型语言模型(LLM)的多步数学推理能力。每个问题需要两到八步才能解决,涉及基本算术运算和逻辑推理,重点在于自然语言理解而非高级数学知识。
该基准已成为评估AI系统推理能力的标准测试,尤其是在人工智能研究领域。其名称源于数据集的规模(8,500个问题)及其对小学水平数学的关注。这些问题的设计使得聪明的中学生能够解答,但通常要求模型进行顺序计算并保持中间状态,这对早期神经网络架构构成了重大挑战。
数据集设计与构成
GSM8K数据集由一组标注人员构建,他们以模仿现实世界数学问题(如教科书或标准化考试中的问题)的风格撰写题目。问题涵盖分数、百分比、比率和简单代数等主题,但刻意以避免公式化模式的方式表述,鼓励模型进行真正的推理而非模式匹配。数据集分为包含7,500个问题的训练集和包含1,000个问题的测试集,其中测试集用于评估。
GSM8K中的每个问题都附带一个自然语言解决方案,将推理分解为多个步骤。这些解决方案不仅仅是最终答案,还包括中间计算和解释,这对于训练模型生成逐步推理非常有用。数据集还包含一组单独的1,000个问题,配有更详细的解决方案,称为“思维链”版本,后来用于研究提示技术的影响。
在语言模型评估中的作用
GSM8K迅速成为衡量Transformer模型推理能力的关键基准。早期的深度学习模型在该数据集上表现不佳,准确率通常低于10%,因为它们无法可靠地执行多步算术。思维链提示的引入(即鼓励模型在最终答案之前生成中间推理步骤)带来了显著改进,像GPT-3及后续版本的模型取得了更高的分数。
该基准已被用于比较来自不同组织的模型,包括Anthropic、Google DeepMind和Meta(尽管不在提供的列表中,但它是常见的参考)。它也被用于研究机器学习在数学推理方面的局限性,研究人员分析了诸如算术错误、对问题陈述的误解以及无法处理大数字等失败模式。
对AI研究的影响
GSM8K影响了LLM推理改进技术的发展。它在证明神经网络扩展的价值方面发挥了重要作用,因为基于更多数据训练的更大模型在该基准上表现出显著提升。该数据集还推动了生成式AI验证方法的研究,例如训练单独的模型来检查解决方案的正确性,以及强化学习方法,奖励正确的推理步骤。
除了作为评估工具外,GSM8K还被用作训练资源。一些研究人员使用训练集对模型进行微调,专门用于数学推理,而另一些则使用它生成合成数据以进一步训练。该数据集的设计,强调自然语言和多步问题,也影响了其他基准的创建,如MATH(一个更高级的数据集)和SVAMP(一个带有修改问题的变体)。
局限性与批评
尽管广受欢迎,GSM8K仍存在局限性。批评者指出,该数据集相对较小,可能无法捕捉数学推理的全部复杂性,因为问题仅限于小学水平。此外,模型有时可以通过利用问题中的统计规律而非真正推理来获得高分,这种现象被称为“捷径学习”。该基准也不测试对算术之外数学概念(如几何或微积分)的理解。
另一个批评是,数据集中的问题为英文,反映了西方教育背景,这可能限制其适用于其他语言或文化环境。研究人员呼吁开发更多样化和更具挑战性的基准来补充GSM8K,从而推动了如MATH和更新的GSM8K-Sym等数据集的发展,后者引入了符号变体以测试鲁棒性。
当前使用与未来方向
截至2025年,GSM8K仍然是机器学习社区广泛使用的基准,通常包含在新LLM的评估套件中。它经常在研究论文中被引用,并被公司用于报告模型性能。然而,随着模型的改进,许多模型在测试集上的准确率现已超过90%,这导致一些人认为该基准正在趋于饱和。这促使了更难版本的创建,如增加所需步骤数的GSM8K-Hard,以及将GSM8K整合到更广泛的推理基准中,如MMLU和BIG-bench。
GSM8K的未来可能在于作为基线而非区分因素,研究人员将重点放在更复杂的推理任务上。尽管如此,它对该领域的贡献是显著的,因为它帮助催化了AI中多步推理技术的发展,这些技术现在已成为许多人工智能应用的核心。