HellaSwag 2025是一个基准数据集,旨在评估人工智能系统的常识推理能力,特别是大型语言模型和多模态模型。它是原始HellaSwag基准的继承者,该基准于2019年由多伦多大学和艾伦人工智能研究所的研究人员推出。2025版本更新了数据集,增加了更具挑战性的示例,扩展了视觉和音频场景的覆盖范围,并采用了更严格的评估协议,以减少因记忆或统计捷径导致的虚高分数。
该基准测试模型在给定场景中选择最合理续写的能力,要求理解物理动态、社会惯例和时间因果性。与早期主要关注文本的版本不同,HellaSwag 2025包含结合文本与图像或音频片段的多模态提示,推动模型跨模态整合信息。数据集通过结合人类编写的场景和AI生成的对抗性示例构建,并经过过滤以确保质量和难度。
背景与动机
原始HellaSwag旨在解决现有基准中的空白,这些基准往往无法区分真正理解常识的模型与依赖表面语言模式的模型。其名称是“hell”和“swag”的合成词(对“愚蠢智慧”或“常识”的戏谑引用)。2025版本是为了应对生成式AI的快速发展而开发,因为现有模型在较旧基准上能达到接近完美的分数,使得衡量进一步进展变得困难。
该基准由学术和行业研究人员的联盟维护,包括来自斯坦福AI实验室、MIT CSAIL和伯克利AI研究的成员。项目获得多个来源的资助,包括国家科学基金会和私人基金会。
数据集构建
HellaSwag 2025包含约20,000道多项选择题,每道题有一个上下文和四个可能的结尾,其中只有一个正确。上下文来自多种来源,包括电影剧本、教学视频和日常场景。为了增加难度,数据集包含由AI系统生成的“对抗性”示例,这些示例随后由人类标注者验证,以确保人类可解但对机器具有挑战性。
构建过程涉及几个步骤:首先,收集大量候选场景;其次,AI模型生成合理和不合理的结尾;第三,人类标注者过滤并标记示例;最后,使用校准集确保基准不受长度或词频等琐碎线索的偏见影响。2025版本还引入了“反事实”子集,其中正确答案需要对场景的假设性变化进行推理。
评估与评分
模型通过测试集上的准确率进行评估,主要指标是正确回答问题的百分比。为防止过拟合,测试集不公开;相反,研究人员通过受控API提交模型进行评估,类似于OpenAI的评估方法。基准还报告“鲁棒性分数”,衡量在问题扰动版本(如改写上下文或修改图像)上的表现。
HellaSwag 2025设计得比其前身更难。在初步评估中,如GPT-4和Claude等最先进模型达到约85%的准确率,而原始HellaSwag上为95%。这一差距表明新基准在区分不同推理能力的模型方面提供了更好的信号。
影响与反响
HellaSwag 2025的发布引起了AI研究界的关注。许多研究人员将其作为开发新架构或训练方法时的标准评估工具。该基准也被工业实验室采用,包括Google DeepMind和Anthropic,作为其内部评估套件的一部分。一些批评者认为该基准仍有局限性,例如可能偏向西方文化背景,但联盟已努力纳入多样化场景。
该基准还影响了新训练技术的发展,如课程学习和数据增强,旨在改善常识推理。此外,HellaSwag 2025已被用于研究“捷径学习”现象,即模型利用统计规律而非真正理解。
未来方向
HellaSwag未来版本的计划包括扩展到更多语言、纳入交互式或具身场景,以及增加时间推理组件。联盟还打算发布一个跟踪进展的排行榜,类似于SuperGLUE基准。随着AI系统的持续发展,像HellaSwag 2025这样的基准在确保以有意义的方式衡量进展方面发挥着关键作用。