Visual Genome 是一个大规模数据集,旨在将视觉理解与自然语言联系起来。它包含超过 108,000 张图像,每张图像都配有密集的区域描述、物体、属性和关系标注。该数据集的创建是为了让机器学习模型能够推理图像中物体之间的复杂交互,从而超越简单的物体识别,迈向更全面的场景理解。该数据集于 2016 年由斯坦福大学和多伦多大学的研究人员推出,包括 Ranjay Krishna、Yuke Zhu、Oliver Groth、Justin Johnson、Kenji Hata、Joshua Kravitz、Stephanie Chen、Yannis Kalantidis、Li-Jia Li、David A. Shamma、Michael S. Bernstein 和 Li Fei-Fei。
Visual Genome 的主要目标是提供一种资源,以支持 Artificial intelligence 系统的发展,使其能够回答关于图像的问题、生成描述性字幕,并执行视觉推理。与那些专注于单一物体分类或简单字幕生成的数据集不同,Visual Genome 提供了图像内容的结构化表示。每张图像平均标注了 35 个物体、26 个属性和 21 对物体之间的关系。这些标注被组织成一个场景图,这是一种有向图,其中节点代表物体,边代表诸如“骑”、“穿”或“在旁边”之类的关系。这种结构使得算法能够将图像解析为可查询和可操作的语义表示。
数据集结构与标注流程
该数据集包含几个关键组成部分:区域描述、物体、属性、关系和问答对。区域描述是对图像特定区域的简短自然语言句子。物体则带有标注框和对应的名称,而属性则描述颜色、大小或形状等特征。关系通过谓词(如“男人拿着冲浪板”)连接两个物体。此外,Visual Genome 还包含超过 170 万个问答对,用于训练视觉问答系统。标注过程涉及众包工作者,他们接受了详细指导以确保一致性。每张图像由多名工作者进行标注,结果经过汇总和筛选以保证质量。数据集还包含 80,000 张带有更密集连接区域图的图像,为训练复杂模型提供了更丰富的资源。
在机器学习中的应用
Visual Genome 已成为计算机视觉和 Machine learning 领域的标准基准。它被广泛用于训练和评估场景图生成模型,其目标是预测图像中的物体及其关系。该数据集还支持视觉问答、图像字幕生成和指代表达式理解等任务,其中模型必须根据自然语言短语定位物体。数据集中结构化的标注对于推动结合视觉和文本信息的 Neural network 架构研究起到了重要作用,例如基于 Transformer (architecture) 的模型。许多模型,如视觉 Transformer 和各种由 Large language model 引导的视觉系统,都在 Visual Genome 上进行了训练,以提高其将语言与视觉内容联系起来的能力。研究人员还利用该数据集研究组合泛化问题,即模型必须理解已知物体和关系的新颖组合。
影响与局限性
自发布以来,Visual Genome 影响了后续数据集的设计,例如 Open Images 数据集和 COCO 数据集的扩展标注。它还被与其他资源结合使用,以创建更全面的基准,用于具身 AI 和机器人技术,在这些领域中,智能体必须解释视觉场景才能在现实世界中行动。然而,该数据集也存在已知的局限性。其标注偏向于常见物体和日常场景,这可能导致模型在稀有或不寻常物体上表现不佳。众包标注的性质也引入了噪声,某些关系可能标注模糊或不一致。此外,该数据集是静态的,无法反映现实世界环境的多样性,例如包含许多遮挡物体的室内空间或光照条件变化的户外场景。研究人员已通过开发数据清洗方法或将数据与模拟合成数据相结合来应对这些问题。
与其他 AI 资源的关系
Visual Genome 是推动 Deep learning 进展的更广泛数据集和模型生态系统的一部分。它与 ImageNet(专注于物体分类)和 MS COCO(提供实例分割和字幕)等数据集形成互补。Visual Genome 引入的场景图表示也已被其他项目采用,例如 Scene Graph Benchmark 和 GQA 数据集,后者专注于更复杂的视觉推理问题。在现代 AI 的背景下,Visual Genome 已被用于预训练视觉-语言模型,这些模型随后会针对特定任务进行微调。这些模型通常基于 Transformer (architecture) 架构,由 Google DeepMind、OpenAI 和 Anthropic 等组织开发,尽管 Visual Genome 本身是学术资源而非商业产品。该数据集可免费用于研究目的,并托管在专门网站上,提供工具用于下载和可视化标注。
未来方向
截至 2020 年代中期,该领域已转向更大、更多样化的数据集,以及能够同时处理视频、音频和文本的多模态模型。Visual Genome 仍然是理解密集标注和场景图构建原理的重要资源。研究人员继续利用它来开发少样本学习的新算法,即模型必须从少量样本中泛化,以及零样本推理,即模型处理未见过的类别。该数据集对关系和属性的强调也启发了视觉中的因果推理研究,即模型不仅要推断存在什么,还要推断某些物体为何会交互。虽然更新的数据集可能在规模或多样性上更胜一筹,但 Visual Genome 的详细标注为研究视觉场景的组合性质提供了独特的基础,而这一挑战仍然是实现人类水平视觉智能的核心。