译自英文

Sherlock是一个于2020年引入的视觉常识推理数据集,用于评估AI模型回答需要关于物体、场景及其交互的真实世界知识的问题的能力。

Sherlock是一个用于视觉常识推理的大规模数据集和基准,由北卡罗来纳大学教堂山分校和艾伦人工智能研究所的研究人员于2020年提出。该数据集包含超过103,000个问答对,这些问答对源自Visual Genome项目中的约21,000张图像,每个问题都设计为需要超越简单物体识别的常识知识。Sherlock的创建旨在填补视觉问答(VQA)基准中的空白,这些基准通常侧重于字面场景描述,而非人类用于解读图像的隐含日常知识。

该数据集围绕两个互补任务构建:多项选择问答任务和理由生成任务。在多项选择任务中,模型必须从四个选项中选择正确答案,而正确答案需要推断未明确陈述的属性或关系,例如预测手持冲浪板的人可能在海滩附近。理由生成任务要求模型为给定答案为何正确生成自由形式的解释,鼓励模型阐明其预测背后的常识推理。这种双重结构使Sherlock成为对识别和推理能力的严格测试。

构建与标注

Sherlock采用两阶段众包流程构建。首先,标注者被展示来自Visual Genome的图像,并被要求编写无法通过简单列出可见物体或属性来回答、而需要常识推理的问题。例如,一个问题可能问“为什么这个人戴着头盔?”,此时头盔是可见的,但原因(如骑摩托车)并不明显。其次,每个问题配对了四个答案选项,一个正确和三个似是而非的干扰项,标注者还撰写了简短的理由来解释正确答案。最终数据集包含103,302个问题,训练/测试划分约为80/20,每张图像平均关联五个问题。

为确保质量,标注过程包括多轮审查和过滤。模糊不清、需要外部事实知识(如特定历史事件)或存在多个合理答案的问题被丢弃。最终数据集强调日常、普遍的常识,例如理解持伞的人可能预期下雨,或厨房刀具用于切割食物。

评估与指标

模型主要根据两个指标进行评估:多项选择任务的准确率和生成理由的质量。对于多项选择任务,准确率即正确回答问题的百分比。对于理由生成,原始论文使用BLEU分数,尽管后续工作通常采用更稳健的指标,如ROUGE或人工评估。该基准设计为对当代模型具有挑战性;在原始论文中,基于Residual Network (ResNet)和注意力机制的强视觉问答模型准确率约为55%,而人类在抽样子集上的表现约为90%。这一显著差距凸显了视觉常识推理的难度,并推动了进一步研究。

意义与影响

Sherlock已成为Computer visionNatural language processing领域的标准基准,特别是对于视觉与语言交叉领域的研究。它已被用于评估众多模型,包括基于Transformer (architecture)架构和Large language model的模型。该数据集强调推理而非简单识别,影响了后续基准,如VCR(视觉常识推理)和OK-VQA,这些基准同样需要外部知识。Sherlock还促进了视觉-语言任务中解释生成方法的发展,这是Artificial intelligence系统可解释性和可信度日益关注的领域。

该数据集特别有助于研究Deep learning模型的局限性。例如,分析表明,模型通常依赖答案选项中的统计规律而非真正推理,并且在需要空间或时间推理的问题上表现不佳。这推动了更稳健训练技术的研究,包括Curriculum LearningData Augmentation,以及外部知识库的集成。

局限性与批评

尽管具有影响力,Sherlock在多个方面受到批评。使用BLEU进行理由评估已知与人类判断相关性较差,导致对措辞不同但有效的理由产生误导性的低分。此外,该数据集对Visual Genome图像的依赖引入了偏差,例如常见物体和西方城市场景的过度代表,这可能限制基于其训练的模型的泛化能力。一些研究人员还指出,多项选择格式可能被利用答案选项中微妙语言线索的模型所利用,这是许多VQA基准共有的问题。这些局限性促使人们呼吁构建更多样化和对抗性构造的数据集。

遗产与未来方向

Sherlock仍然是视觉-语言社区中被广泛引用的资源,常被用作旨在结合视觉和文本理解的模型的预训练或评估目标。其设计启发了后续专注于特定类型常识(如物理推理或社会互动)的数据集。截至2020年代中期,最先进的模型,包括基于Transformer (architecture)架构并在大规模多模态语料库上训练的模型,在Sherlock上取得了显著更高的准确率,部分超过80%,但人类水平的表现仍难以企及。该数据集继续作为探测Generative AI系统推理能力以及开发使此类推理更明确和可验证方法的有价值工具。

参见

参考文献

Sherlock原始论文发表于2020年计算机视觉与模式识别会议(CVPR),可在CVPR论文集中获取。该数据集公开托管,可通过项目官方网站访问。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·computer-vision·natural-language-processing·commonsense-reasoning
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史