Open Images是由谷歌为计算机视觉研究创建的大规模数据集。它包含数百万张带有多种标签和元数据注释的图像,旨在训练和评估机器学习模型。该数据集以其规模和多样性著称,涵盖广泛的日常物体和场景,注释包括图像级标签、物体边界框和视觉关系三元组。
Open Images的首个版本于2016年发布,包含约900万张图像,涵盖近6000个类别的图像级标签。后续版本将数据集扩展至超过3000万张图像,其中超过1500万个边界框标注了600多个类别的物体。这些注释通过自动化方法与人工验证相结合的方式生成,反映了谷歌在大规模数据基础设施上的投入,以推进人工智能能力。
数据集结构
Open Images的结构旨在支持多种计算机视觉任务。核心组件包括图像集合、指示物体或概念存在的图像级标签,以及边界框和分割掩码等局部注释。对于每张图像,数据集提供唯一标识符、原始URL以及标签预测置信度等元数据。边界框注释以标准化格式提供,列出相对于图像尺寸的坐标,并附有物体类别的标签。
此外,数据集还包含一组视觉关系注释,用于描述物体之间的交互,例如“人骑马”或“狗追球”。这些关系以主语-谓语-宾语三元组的形式格式化。这一更丰富的注释层使研究人员能够探索关系推理和场景理解,这些是视觉识别和深度学习研究中的活跃领域。
注释方法
Open Images的创建依赖于一个半自动流水线,结合了机器生成的候选与人工策展。谷歌内部系统首先使用现有图像分类器和网络规模数据挖掘生成带有噪声的标签候选。然后,这些候选通过众包平台呈现给人工注释者,由工作人员验证或纠正标签并细化边界框。这种混合方法使数据集能够扩展到数百万张图像,同时保持适合训练现代神经网络的质量水平。
对于边界框,注释者被指示为每个目标类别的可见实例绘制尽可能紧密的框。最终注释通过一系列质量检查进行验证,包括对图像子集上多个注释者之间的一致性分析。因此,该数据集已成为单标签和多标签分类以及物体检测的基准。
对研究的影响
Open Images已被学术和工业研究团队广泛使用。它作为多个公开基准挑战的基础,包括在Kaggle上举办的Open Images挑战赛,该挑战赛于2018年和2019年运行。这些挑战吸引了数百个参赛团队,并推动了物体检测和视觉关系检测的最先进水平。该数据集已被数千篇研究论文引用,影响了大规模神经网络训练和迁移学习的方法。
大规模且多样化的标注数据集的可用性也支持了需要基于真实世界视觉概念的生成式人工智能系统的发展。在Open Images上预训练的模型已用于图像字幕生成、视觉问答和自动驾驶感知等下游任务。该数据集补充了ImageNet和COCO等其他资源,提供了更广泛的类别和更真实的日常图像分布。
版本与可用性
谷歌在知识共享许可下发布了多个版本的Open Images,使其可免费用于研究和商业用途。2018年推出的第4版增加了视觉关系注释,并将图像数量扩展至超过900万张,包含3000万个框级注释。2019年发布的第5版将边界框类别数量增加到600个,并为部分图像添加了分割掩码。该数据集可通过谷歌的存储基础设施访问,也可通过官方网站上的交互式可视化工具进行探索。
所有文件均以CSV格式提供,每种注释类型对应单独的文件。该数据集有一篇配套论文,首次发表于2017年计算机视觉与模式识别会议,详细介绍了其构建过程和统计数据。该项目由谷歌研究团队维护,更新由社区反馈和内部研究需求驱动。截至2025年,该数据集仍是大规模视觉识别基准的标准参考点。
局限性与未来方向
尽管规模庞大,Open Images仍存在固有局限性。图像级标签基于机器生成的预测,可能包含噪声,且类别分布偏向网络图像中常见的物体。注释主要关注物体存在和粗略关系,缺乏某些较小数据集中可用的细粒度属性或详细场景图。研究人员在处理专门任务时,通常会使用其他来源补充Open Images或应用领域适应技术。
数据集的未来方向可能包括更广泛的视频注释、更丰富的关系类型,或整合文本描述等多模态数据。Open Images的成功启发了类似的大规模数据收集工作,包括来自亚马逊AI和其他云服务提供商的项目,反映了使大规模标注语料库可访问以加速人工智能进展的更广泛趋势。