很抱歉,我无法处理这个请求。

译自英文

CommonsenseQA是一个于2019年引入的多选题问答数据集,用于评估人工智能系统运用日常常识知识进行推理的能力,其中包含12,247个源自ConceptNet的问题。

CommonsenseQA是一个用于评估人工智能系统常识推理能力的基准数据集。该数据集由华盛顿大学和艾伦人工智能研究所的研究人员于2019年发布,包含12,247道多项选择题,每题有一个正确答案和四个干扰选项。该数据集的设计旨在弥补现有自然语言处理基准的不足,这些基准通常侧重于事实回忆或句法理解,但未能充分测试模型运用关于世界的日常知识的能力。

CommonsenseQA中的问题基于ConceptNet知识图谱生成,ConceptNet是一个编码日常概念之间关系的大型语义网络。每个问题都基于ConceptNet中的一个三元组,例如“狗是动物”或“下雨时使用雨伞”。数据集创建者使用众包工作者将这些三元组转化为自然语言问题,并生成看似合理但不正确的答案选项。这一过程确保了问题需要真正的常识推理,而非简单的模式匹配或记忆。

构建与设计

CommonsenseQA的创建涉及多阶段流程。首先,研究人员选择了一组涉及常见日常概念的ConceptNet三元组。然后,他们利用Amazon Mechanical Turk让工作者编写问题,以测试系统能否从三元组中推断出正确关系。对于每个问题,工作者还生成了四个与正确答案语义相关但在问题语境中不正确的干扰答案。这种对抗性设计使基准具有挑战性,因为干扰项往往看似合理但实际错误。

最终数据集被划分为训练集、开发集和测试集。训练集包含9,741个问题,开发集包含1,221个问题,测试集包含1,241个问题。测试集不公开,研究人员必须将模型提交至评估服务器才能获得测试集上的结果,这有助于防止过拟合。

评估与影响

CommonsenseQA迅速成为评估大型语言模型和其他AI系统的标准基准。早期结果显示,即使是当时最先进的模型(如BERT和GPT-2),其表现也仅略优于随机猜测,即五选一多项选择任务中20%的准确率。这凸显了常识推理对AI系统的难度。

后续工作显著提升了性能。整合外部知识的模型(如检索相关ConceptNet三元组或使用图神经网络的模型)取得了更高的准确率。更大规模预训练模型(包括GPT-3及后续模型)的引入也带来了大幅提升。到2021年,一些模型在开发集上的准确率接近80%,而人类表现估计约为91%。

与其他基准的关系

CommonsenseQA是更广泛的常识推理基准家族的一部分,包括Winograd Schema Challenge、SWAG和HellaSwag。与这些侧重于代词消解或句子补全的基准不同,CommonsenseQA明确测试涉及多样化日常场景的多项选择问答。它常与其他数据集结合使用,以评估通用AI系统,包括由OpenAIAnthropicGoogle DeepMind等公司开发的系统。

该数据集也得到了扩展和改编。例如,2021年发布了名为CommonsenseQA 2.0的变体,其采用基于生成模型的不同问题生成方法。此外,研究人员还创建了CommonsenseQA的对抗性划分以测试模型的鲁棒性,这些划分中的问题经过修改,使依赖表面线索的模型更难解答。

局限性与批评

尽管广受欢迎,CommonsenseQA仍面临批评。一些研究人员指出,该数据集存在偏差,例如某些答案选项出现频率更高,或正确答案往往更长或更具体。模型可以利用这些统计规律而无需进行真正的推理。此外,所有问题均为英文,且反映西方中心的常识观,这限制了其对其他文化和语言的适用性。

另一个局限是数据集是静态的,无法捕捉常识知识的演变特性。随着世界变化,常识的定义可能发生改变,但基准保持不变。这促使一些研究人员呼吁采用更动态、更多样化的评估方法。

当前使用情况

截至2020年代中期,CommonsenseQA仍是人工智能机器学习研究社区中广泛使用的基准。它常与MMLU和BIG-bench等其他基准一起被纳入大型语言模型的评估套件。该数据集可免费用于研究目的,并托管在Hugging Face等平台上,便于研究人员访问和使用。

CommonsenseQA还被用于更详细地研究模型的推理能力。例如,研究人员分析了哪些类型的常识知识(如空间、时间、社会)对模型最具挑战性,并利用该数据集探究基于Transformer的模型的内部表征。这些持续的研究继续为开发更鲁棒、能力更强的AI系统提供信息。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·commonsense-reasoning·nlp·benchmark
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史