译自英文

GSM8K 2021是由OpenAI于2021年推出的一个包含8,500道小学水平数学应用题的数据集,旨在评估大型语言模型在算术推理方面的表现,其特点是包含高质量的人工编写解答,并划分为训练集和测试集。

GSM8K 2021是一个基准数据集,包含8,500道高质量、语言多样的小学数学应用题。它由OpenAI的研究人员于2021年提出,旨在评估大型语言模型的算术推理能力。该数据集分为7,500道训练题和1,000道测试题,每道题都配有自然语言解答,将问题分解为多个步骤。其名称代表“Grade School Math 8K”,反映了目标受众和大致题目数量。

GSM8K 2021的主要目的是测试模型能否执行多步数学推理,而不仅仅是模式匹配。与依赖单步算术的简单基准不同,GSM8K要求模型理解问题陈述、识别相关数量,并执行一系列运算。这些题目设计为可由聪明的初中生解决,但通常包含干扰项,需要仔细的逻辑推理。这使得该数据集成为衡量机器学习和人工智能研究进展的具有挑战性且广泛使用的标准。

数据集构建与特征

GSM8K 2021数据集由OpenAI的一个团队创建,贡献者包括Jakob Uszkoreit、Lukasz Kaiser和Niki Parmar等人。题目由人类承包商编写,他们被要求生成多样、自然且带有清晰分步解答的应用题。每个解答是一系列自然语言句子,中间计算过程明确展示。该数据集旨在通过变化语言表面形式,最小化偏差,例如对特定数字或关键词的过度依赖。

GSM8K的一个显著特点是其高注释者间一致性:创建者报告称,人类解题者在测试集上达到了近乎完美的准确率,为预期性能建立了强基线。题目涵盖一系列算术运算,包括加法、减法、乘法、除法、分数、百分比和简单代数。平均题目长度约为30个词,平均解答长度约为8个步骤,使其成为一个紧凑但要求高的推理任务。

评估与对语言模型的影响

GSM8K 2021迅速成为评估神经网络和基于Transformer (architecture)的模型的标准基准。早期结果显示,标准深度学习模型表现不佳,许多模型在测试集上的准确率低于20%。这凸显了语言理解与数学推理之间的差距。该数据集推动了诸如Curriculum Learning、基于AI反馈的强化学习和思维链提示等技术的研究,其中模型被训练或提示在给出最终答案前生成中间推理步骤。

到2022年,更大的模型和改进的训练方法开始取得显著更高的分数。例如,使用验证器方法微调或通过显式分步监督训练的模型达到了80%以上的准确率。该基准已被许多组织使用,包括Google DeepMind、Anthropic和学术实验室,以比较模型能力。它仍然是衡量算术推理的参考点,尽管此后已引入了更新、更复杂的基准。

局限性与批评

尽管广受欢迎,GSM8K 2021仍存在局限性。与真实世界的数学任务相比,这些题目相对简单,且数据集规模较小,如果模型直接在其上训练,可能导致过拟合。批评者指出,模型有时可以通过记忆模式或使用启发式方法获得高分,而非真正推理。此外,该数据集仅包含英文,限制了其在多语言评估中的适用性。研究人员还指出,解答并非总是最高效的,且该基准不测试超出算术范围的概念理解。

为解决其中一些问题,后续数据集已被创建,例如具有更复杂题目或不同语言的GSM8K变体。然而,GSM8K 2021仍然是该领域的基础工具,常被用作新模型架构和训练技术的合理性检查。其简单性和清晰的评估标准使其成为研究人员易于入门的起点。

遗产与持续使用

截至2025年,GSM8K 2021仍在Large language model研究论文中被广泛引用。它被纳入许多评估套件,例如OpenAI和其他AI实验室使用的套件,以跟踪随时间推移的进展。该数据集也被用于研究Model Pruning和Data Augmentation等现象,研究人员借此调查训练数据或模型结构的变化如何影响推理性能。其影响力超越学术界,因为它已被用于基准测试商业模型,并为关于AI能力的公共讨论提供信息。

GSM8K 2021的创建标志着AI研究向更严格、任务特定基准的转变。它展示了高质量、人工注释数据对于评估复杂认知技能的重要性。尽管更新的基准可能更具挑战性,但GSM8K 2021在历史上占据一席之地,是神经模型中算术推理最早被广泛采用的测试之一。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·benchmark·mathematics·natural-language-processing
本页最后编辑于 2026年10月7日 编辑者 AI Wiki Bot · 历史