人类最后的考试是一个基准数据集,旨在评估先进人工智能系统的能力。它由一组经过精心策划的高难度问题组成,这些问题由众多学科的专家撰写,意在探测当前大型语言模型及相关技术的极限。该基准的创建旨在提供一种严格且具有前瞻性的AI进展衡量标准,尤其是在模型在现有评估套件上接近或超越人类表现的情况下。
该项目被设想为一项协作努力,涉及来自领先AI组织的研究人员和从业者,包括OpenAI及其他知名机构。它于2025年初公开发布,目标是建立评估AI系统专家级知识和推理的新标准。基准的名称反映了其雄心,即代表对AI智力能力的最终、全面测试,至少对于当前一代模型而言。
设计与结构
该基准包含数千道多项选择题和简答题,每道题均由领域专家精心制作。问题涵盖广泛领域,包括数学、物理学、化学、生物学、计算机科学、历史、法律和人文学科。一个关键设计原则是,这些问题即使对高度能力的AI系统也应具有难度,但其正确答案必须是可验证且无歧义的。为确保质量,每道提交的问题都经过严格的审查流程,通常会被现有模型解决的问题会被拒绝。
数据集分为公开测试集和私有保留集。私有集用于官方评估,以防止过拟合和数据污染。公开集允许研究人员和开发者对其系统进行基准测试,而私有集则提供对泛化能力的更可靠衡量。基准的创建者还实施了严格协议,以防止模型在测试数据上进行训练,包括监控记忆化,并要求所有问题在发布前必须是新颖且不公开可得的。
主要参与者和贡献者
该倡议由一组研究人员领导,包括Jacob Steinhardt和David Kaplan,他们以在AI安全和评估方面的工作而闻名。他们与来自Anthropic、Google DeepMind及其他主要AI实验室的贡献者,以及来自MIT CSAIL、Stanford AI Lab和BAIR (Berkeley AI Research)等机构的学者共同参与。这项工作还利用了来自世界各地的独立研究人员和领域专家的专业知识,他们在各自领域提交了问题。
项目的协作性质是一个深思熟虑的选择,旨在确保问题类型和主题覆盖的多样性。组织者通过公开征集问题的方式征求贡献,吸引了数千名专家的提交。每份提交都由多位独立评估者审查,以验证其准确性、难度和适宜性。这一过程最终形成了一个既广泛又高质量的数据集。
当前AI系统的表现
基准的初步结果显示,即使是最先进的AI系统,包括基于Large language model架构的系统,其得分也远低于人类专家水平。表现最佳的模型,如由OpenAI和Google DeepMind开发的模型,在测试集上的准确率仅为个位数到低两位数。这与它们在早期基准上的表现形成鲜明对比,后者通常超过90%的准确率。
低得分归因于基准的设计,该设计专门针对推理、多步骤问题解决和深层领域知识。许多问题需要结合多个来源的信息或以新颖方式应用抽象概念,这些任务对当前的Machine learning方法仍然具有挑战性。结果凸显了AI能力与人类专家表现之间的显著差距,特别是在需要细致判断或创造性综合的领域。
影响与反响
人类最后的考试的发布在AI研究社区及其他领域引发了大量讨论。支持者认为,该基准通过设定一个不易被操纵的高标准,为追踪人工通用智能的进展提供了宝贵工具。然而,批评者指出,无论设计得多好,基准都可能随着模型改进而过时,并且在此类测试上的表现并不一定转化为现实世界的能力。
尽管存在这些争论,该基准已被广泛采用作为评估前沿模型的参考点。几家AI公司已报告了它们在公开测试集上的得分,该基准也在众多研究论文中被引用。它还推动了类似甚至更具挑战性的评估套件的开发,因为该领域继续推动AI所能实现的边界。截至2025年初,尚无模型接近通过该基准,其名称仍然证明了创造真正智能机器的持续挑战。
未来方向
人类最后的考试的创建者已表示计划定期更新该基准,添加新问题并淘汰那些变得过于简单的问题。这种迭代方法旨在随着AI能力的演变保持其相关性。此外,还有关于自动问题生成的持续研究,这可能有助于将基准扩展到更大规模。最终目标仍然是提供一种持久且严格的AI向专家级理解进展的衡量标准,这一目标继续塑造着Generative AI及相关领域的发展。