QNLI,即问题自然语言推理(Question Natural Language Inference),是人工智能和机器学习领域的一个基准数据集。它作为GLUE(通用语言理解评估)基准的一部分被引入,该基准是一组旨在评估模型在各种自然语言理解挑战中表现的任务集合。该数据集源自斯坦福问答数据集(SQuAD),具体来自其v1.1版本,并将问答任务转化为二分类问题。
QNLI的核心任务是判断给定句子是否包含给定问题的答案。每个示例由一个问题和一个句子组成,模型必须将该对分类为“蕴含”(句子提供答案)或“不蕴含”(句子不提供答案)。这种表述将原始的抽取式问答任务转化为自然语言推理问题,这也是其被称为问题自然语言推理的原因。
起源与构建
QNLI由斯坦福人工智能实验室团队创建,作为GLUE基准的一部分,该基准于2018年发布。该数据集通过从SQuAD v1.1中提取问答对,并将每个问题与相应上下文中的句子配对来构建。对于每个问题,包含正确答案的句子被标记为“蕴含”,而同一上下文中的其他句子被标记为“不蕴含”。这一过程产生了一个平衡的数据集,正负示例数量大致相等。
原始SQuAD数据集包含基于维基百科文章的超过10万个问答对。对于QNLI,创建者选择了一个子集并重新格式化,最终得到约10.8万个训练示例和5700个验证示例。测试集被保留,用于官方GLUE排行榜,该排行榜跟踪基准中所有九个任务的表现。
任务定义与评估
在QNLI中,每个输入是一对文本片段:一个问题和一个句子。模型必须输出一个二分类标签,指示该句子是否蕴含问题的答案。评估指标是准确率,即正确分类对所占的百分比。这一简单指标使得任务在不同模型和方法之间的比较变得直接。
该任务旨在测试模型执行自然语言推理以及理解问题与文本片段之间关系的能力。它要求模型不仅识别相关信息,还要推理该信息是否直接回答问题。这涉及句法和语义理解,以及处理释义和改写问题的能力。
在GLUE基准中的作用
QNLI是GLUE基准中九个任务之一,该基准旨在为通用语言理解模型提供标准化评估。基准包括情感分析、文本蕴含和问答等任务,每个任务都有其自己的数据集和评估指标。GLUE旨在鼓励开发能够在多个任务上表现良好的模型,而非专精于单一任务。
自发布以来,QNLI已成为评估变换器模型(包括大型语言模型)的标准测试平台。许多著名模型,如BERT、RoBERTa和T5,都在其基准结果中报告了在QNLI上的表现。该任务也被纳入SuperGLUE基准,这是GLUE的一个更具挑战性的后继者,在其中以BoolQ的形式出现,但表述有所不同。
影响与意义
QNLI的引入对自然语言处理领域产生了重大影响。通过将问答任务转化为分类问题,它提供了一种更简单但有效的方式来评估模型的阅读理解能力和推理能力。这促进了模型开发的快速进展,因为研究人员可以迅速迭代架构和训练技术。
此外,QNLI有助于更广泛地理解模型处理复杂语言现象(如指代消解和逻辑推理)的能力。它还被用作诊断工具,以识别模型的弱点,例如其倾向于依赖表面线索而非深层理解。因此,即使引入了更新更复杂的数据集,它仍然是一个相关的基准。