SQuAD-Shifts是一个基准数据集,旨在评估问答模型在分布偏移下的鲁棒性。它于2019年由谷歌的研究人员(包括John Miller、Karl Krauth和Ludwig Schmidt)引入,作为斯坦福问答数据集(SQuAD)的配套数据集。该数据集包含从原始SQuAD训练数据中未出现的维基百科文章收集的新问答对,从而在主题分布和写作风格上产生自然偏移。其主要目的是衡量在SQuAD上训练的模型对未见数据的泛化能力,这是人工智能系统在实际部署中的关键属性。
该基准包含三个不同的子集:SQuAD-Shifts-New,包含关于全新维基百科文章的问题;SQuAD-Shifts-Wiki,使用在SQuAD创建时已存在但未包含在原始数据集中的文章;以及SQuAD-Shifts-Reddit,包含来自Reddit用户关于维基百科文章的问题。每个子集引入了不同类型的分布偏移,从主题新颖性到风格变化。数据集采用与SQuAD相同的格式,每个示例包含一个上下文段落、一个问题以及一组答案跨度。
动机与设计
分布偏移是机器学习中的一个基本挑战,模型在一个数据分布上训练后,应用于另一个分布时往往表现不佳。SQuAD-Shifts旨在提供对这种现象的受控但现实的评估。与合成扰动不同,SQuAD-Shifts中的偏移源于人类生成内容的自然变化。其设计遵循的原则是,鲁棒性应在部署中可能遇到的数据上进行衡量,而不仅仅是在对抗性构造的示例上。
该数据集利用了维基百科的结构,后者不断被编辑和扩展。通过在原始SQuAD发布后收集新文章和问题,创建者确保了测试数据在时间上与训练数据不相交。这种时间分离是一个关键特征,因为它防止模型记忆特定文章,并迫使模型依赖一般的理解能力。
评估协议
SQuAD-Shifts上的标准评估使用与SQuAD相同的指标:精确匹配(EM)和F1分数。EM衡量预测与一个真实答案完全匹配的百分比,而F1计算词元级别重叠的精确率和召回率的调和平均值。模型通常在原始SQuAD训练集上训练,然后在不进行任何适应的情况下在三个SQuAD-Shifts子集上评估。与分布内SQuAD开发集相比的性能下降量化了模型对分布偏移的敏感性。
在原始论文中,作者评估了几个基线模型,包括BiDAF和BERT。他们发现所有模型在偏移子集上都表现出显著的性能下降,其中SQuAD-Shifts-Reddit上的下降更大,因为该子集包含更多非正式和多样的问题表述。这突显了即使是强大的深度学习模型(如基于Transformer的架构)也无法对自然分布偏移保持鲁棒性,从而推动了领域适应和鲁棒训练方面的进一步研究。
与其他基准的关系
SQuAD-Shifts是自然语言处理中更广泛的分布偏移基准家族的一部分。它补充了GLUE-X和RobustQA等数据集,后者也测试各种扰动下的泛化能力。然而,SQuAD-Shifts的独特之处在于它使用自然发生的偏移而非人工修改。这使其成为现实世界条件的更真实代理,在现实世界中,数据分布会因用户行为、内容创作和语言使用的变化而随时间演变。
该基准在大型语言模型评估的发展中具有影响力。许多后续研究使用SQuAD-Shifts来评估模型(如OpenAI的GPT系列和Google DeepMind的模型)的鲁棒性。它也被用于比较不同的训练策略,如数据增强和领域适应,表明这些技术可以缓解但无法消除性能差距。
局限性与批评
SQuAD-Shifts的一个局限性是它仅涵盖阅读理解,这是自然语言理解中的一个狭窄任务。偏移也仅限于基于维基百科的内容,可能无法反映新闻、社交媒体或技术文档等其他领域的偏移。此外,与现代训练语料库相比,该数据集相对较小,这可能导致评估结果的高方差。一些研究人员指出,SQuAD-Shifts上的性能下降可能部分是由于问题难度的差异而非纯粹的分布偏移,尽管创建者通过匹配问题类型对此进行了控制。
尽管存在这些局限性,SQuAD-Shifts仍然是鲁棒性研究中广泛使用的基准。它已被纳入多个排行榜和评估套件,包括Robustness Gym。该数据集公开可用,可从官方仓库下载,允许研究人员复现结果并扩展分析。
影响与遗产
SQuAD-Shifts的引入促进了人们对人工智能中分布偏移问题的日益认识。它提供了经验证据,表明在标准基准上达到最先进结果的模型可能在略有不同的数据上严重失败。这影响了后续基准的设计,如WILDS套件,后者包含多个领域和具有自然偏移的任务。它还推动了领域不变表示学习和测试时适应等技术的研究。
在生成式人工智能的背景下,SQuAD-Shifts已被用于评估模型(如Anthropic的Claude和Google Cloud的AI服务)的鲁棒性。该基准对自然偏移的关注使其特别适用于数据不断演变的应用程序,如搜索引擎和虚拟助手。截至2024年,SQuAD-Shifts继续在关于模型鲁棒性的论文中被引用,并被视为评估问答泛化能力的标准工具。