译自英文

MATH 2025是一个包含5000道竞赛级数学问题的基准数据集,于2025年推出,用于评估大型语言模型的推理能力,其设有隐藏测试集和季度排行榜。

MATH 2025是一个基准数据集,旨在评估大型语言模型(LLM)的数学推理能力。该数据集于2025年发布,包含5,000道竞赛风格的问题,涵盖代数、几何、数论、组合学和微积分。与早期基准不同,MATH 2025包含一个不公开访问的隐藏测试集,旨在减少过拟合并提供更稳健的泛化度量。该基准由学术和行业研究人员组成的联盟维护,并有一个每季度更新的排行榜,以跟踪AI推理的进展。

该数据集于2025年初推出,作为原始MATH基准(2021年)的继任者,后者包含12,500道问题。MATH 2025专注于规模更小但更具挑战性的问题集,问题来自近期奥林匹克风格竞赛以及参与机构的原创贡献。每个问题都配有逐步解答,便于进行详细的错误分析。隐藏测试集通过API控制访问,防止直接访问并鼓励公平评估。模型按精确匹配准确率评分,对正确的中间步骤给予部分分数。

问题构成与难度

MATH 2025每个主题领域包含1,000道问题:代数、几何、数论、组合学和微积分。难度级别从高中奥林匹克到本科水平,平均每个问题需要多个推理步骤。例如,一个代数示例问题要求:“求方程x^5 - 5x^3 + 4x = 0的所有实根之和。”一个几何问题涉及证明圆内接四边形性质。这些问题设计为无歧义,具有唯一的数值或简短形式答案。

评估方法

模型通过API进行评估,API根据精确答案匹配返回分数。排行榜每季度更新(3月、6月、9月、12月),按总体准确率对提交进行排名。截至第一季度,表现最佳的模型达到72%的准确率,而人类专家基线约为85%。该基准还报告了按主题的细分结果,显示几何仍然是最难的类别,平均准确率比代数低15%。为防止数据污染,测试集每六个月轮换一次,并从持续进行的竞赛中新增问题。

对AI研究的影响

MATH 2025已成为评估大型语言模型推理能力的标准参考。它凸显了当前方法的局限性,特别是在多步演绎和符号操作方面。多个OpenAIGoogle DeepMind模型已使用该基准来指导训练,结合课程学习RLHF等技术以提高性能。该基准还推动了思维链提示的研究,这显著提高了复杂问题的准确率。

相关基准与未来方向

原始MATH 2021基准仍被广泛使用,但MATH 2025提供了更严格的测试。其他相关评估包括GSM8K(用于小学水平数学)和Hendrycks Math(用于竞赛问题)。MATH 2025的未来版本计划包含更多开放式问题和自动化证明验证。该基准背后的联盟,包括来自MIT CSAIL斯坦福AI实验室的研究人员,旨在到2026年将数据集扩展到10,000道问题,并更加关注跨学科推理。

争议与局限性

一些研究人员批评隐藏测试集不透明,难以诊断模型错误。其他人指出,该基准仍可能通过间接暴露受到数据泄漏的影响。API控制的访问也引发了对可复现性的担忧,因为并非所有研究人员都能负担重复评估的费用。尽管存在这些问题,MATH 2025仍被广泛视为AI评估领域的重要进步,提供了对数学智能的挑战性和动态测试。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·machine-learning·benchmark·mathematics
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史