译自英文

HellaSwag 2024是用于评估AI模型常识推理能力的更新基准,包含更难的单选题和修订后的评分标准以减少取巧行为。它基于原始的HellaSwag数据集构建。

HellaSwag 2024是一个基准数据集,旨在评估人工智能系统,特别是大型语言模型的常识推理能力。它是2019年推出的原始HellaSwag基准的更新版本。2024年的修订旨在解决早期数据集中的局限性,例如模型利用统计规律而非真正理解场景的能力。该基准呈现多项选择题,模型必须从给定情境中选择最合理的续接,正确答案需要理解物理和社会常识。

原始HellaSwag由华盛顿大学和艾伦人工智能研究所的研究人员创建。它采用对抗性过滤过程构建,其中人类编写的结尾与机器生成的看似合理但不正确的结尾配对。2024年的更新保留了这一核心结构,但引入了多项改进。这些包括更大规模的问题集、更多样化的场景,以及重新平衡的答案选项分布,以防止模型基于位置或长度进行猜测。评分方法也进行了修订,以更稳健地应对使用启发式方法(如选择最长或最复杂答案)的模型。

设计与构建

HellaSwag 2024的构建遵循与其前身相同的对抗性过滤方法。人类标注员为一组活动描述编写了正确的结尾,而另一组不正确的结尾由语言模型生成。不正确的结尾被设计为表面合理但语义错误,通常涉及对物理定律或社会规范的微妙违反。最终数据集仅包含那些不正确结尾不易通过简单统计线索区分的题目,确保基准衡量的是真正的推理而非模式匹配。

2024版本将原始数据集从约10,000道题扩展到超过15,000道题。场景涵盖广泛的日常活动,如烹饪、运动和家务,以及涉及社交互动的更抽象情境。每道题包含四个答案选项,其中恰好有一个正确答案。数据集分为训练集、验证集和测试集,测试集保留用于官方评估。

评估与评分

模型在HellaSwag 2024上的评估基于其选择正确答案的准确性。主要指标是top-1准确率,即模型将最高概率分配给正确选项的题目百分比。为减少答案长度偏差的影响,2024更新引入了归一化评分方法。该方法根据每个答案的长度调整其概率,防止模型偏向于更长或更冗长的回答。

除准确率外,基准还报告校准分数,衡量模型置信度与其正确性的对齐程度。一个校准良好的模型应对正确答案有更高置信度,对错误答案有更低置信度。2024修订还包括人类基线,在部分题目上测量人类表现,为模型比较提供参考点。

当前模型的表现

截至2024年,表现最佳的大型语言模型,如由OpenAIAnthropicGoogle DeepMind开发的模型,在HellaSwag 2024上的准确率分数达到90%中段。这比早期模型在原始HellaSwag上约80%的分数有显著提升。然而,人类在该基准上的表现仍然更高,通常超过95%,表明机器与人类常识推理之间仍存在差距。

该基准已成为Artificial intelligence社区跟踪常识推理进展的标准工具。它通常与WinograndeARC等其他基准一起使用,以提供对模型推理能力的全面评估。2024更新已被研究实验室和行业团队广泛采用,包括Amazon Web ServicesMicrosoft AzureGoogle Cloud的团队,作为其模型评估流程的一部分。

局限性与批评

尽管有所改进,HellaSwag 2024仍面临一些批评。一些研究人员认为,该基准仍严重依赖语言中的统计模式,模型可以通过记忆常识事实而非进行灵活推理来获得高分。另一些人指出,数据集仅限于英语和西方文化背景下的场景,可能无法推广到其他语言或文化。

另一个局限性是基准是静态的,这意味着一旦模型在测试集上训练过(无论是有意还是通过数据污染无意),其性能不再反映真正的泛化能力。为缓解这一问题,2024版本包含一个未公开的隐藏测试集,鼓励研究人员通过提交系统在此隐藏集上评估。然而,这种方法并非万无一失,污染风险在更广泛的领域中仍是一个担忧。

未来方向

HellaSwag 2024的开发反映了Machine learning社区中创建更具挑战性和稳健性评估基准的更广泛趋势。未来的更新可能纳入动态问题生成,即实时创建新问题以防止记忆。还有兴趣将基准扩展到多模态场景,其中模型必须同时推理文本和图像,并包含需要多步推理或因果推断的问题。

随着Large language model的持续改进,像HellaSwag 2024这样的基准可能需要不断演进以跟上步伐。目标是创建不仅衡量当前能力,还推动AI系统发展更类人推理的评估。2024更新是朝这一方向迈出的一步,提供了比其前身更严格的常识理解测试。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:benchmark·commonsense-reasoning·evaluation·natural-language-processing
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史