译自英文

Open Images是一个用于计算机视觉研究的大规模标注图像数据集,包含数百万张带有多种标签、物体边界框和视觉关系的图像,用于训练和评估机器学习模型。

Open Images是一个大规模数据集,旨在推动计算机视觉和机器学习的研究。它提供了大量带有丰富标签、目标边界框和视觉关系信息的图像集合。该数据集广泛用于训练和评估目标检测、图像分类和视觉关系理解等任务中的模型。其规模和多样性使其成为人工智能深度学习领域的基础资源。

Open Images由谷歌于2016年推出,并经历了多次重大版本发布。该数据集以其规模著称,完整版本包含超过900万张图像,标注覆盖数千个目标类别。标注结合了自动化方法和人工验证,以确保规模与质量之间的平衡。数据集包含训练集、验证集和测试集,便于对模型进行标准化基准测试。

数据集结构与标注

Open Images数据集提供多种类型的标注。主要标注是图像级标签,每张图像与一组类别标签关联,指示某些目标或概念的存在。此外,数据集还包括目标的边界框,即轴对齐的矩形,用于定位图像中的目标实例。这些边界框为部分图像提供,支持目标检测等任务。此外,数据集还包括视觉关系标注,描述目标之间的成对关系,例如“狗在滑板上”或“人拿着伞”。这些关系以主语-谓语-宾语三元组的形式结构化,便于场景理解研究。

标注按类别的层次分类法组织,支持从粗到细的分类。数据集还包括一组“负”标签,指示特定类别在图像中不存在,这对于使用负样本训练分类器很有用。边界框以归一化格式提供,坐标相对于图像尺寸,便于与标准深度学习框架配合使用。

版本与演进

Open Images已发布多个版本。2016年的初始版本包含约900万张图像和图像级标签。后续版本Open Images v4将数据集扩展到19,957个类别的3000万图像级标签,并为600个类别添加了174万个边界框。最近的主要版本Open Images v6进一步将600个类别的边界框数量增加到超过1200万,并添加了视觉关系标注。每个版本都附有详细论文,描述数据集构建和统计信息。

该数据集注重多样性,包含来自各种来源和领域的图像。图像来源于Flickr,采用知识共享许可,确保研究用途的合法可用性。标注过程结合了机器学习模型和人工标注者,并设有质量控制机制以确保准确性。

研究与行业应用

Open Images已成为计算机视觉的标准基准。它常用于训练目标检测模型,例如基于残差网络架构的模型,并评估其性能。数据集的大规模和多样标注使其适合训练具有数百万参数的模型,利用批归一化数据增强等技术。研究人员使用Open Images开发能很好泛化到其他数据集(如COCO)的模型,得益于其目标和场景的多样性。

在工业界,Open Images被公司用于构建视觉系统,应用于自动驾驶、机器人和内容审核等领域。例如,Waymo特斯拉自动驾驶开发了受益于大规模数据集的感知系统,尽管它们也常使用专有数据。该数据集还用于斯坦福人工智能实验室麻省理工学院计算机科学与人工智能实验室等机构的学术研究,探索机器学习的新方法。

挑战与局限性

尽管规模庞大,Open Images存在某些局限性。标注并非详尽无遗;图像中的许多目标可能未标注,这可能导致训练中出现假阴性。边界框仅针对部分类别提供,视觉关系标注也较稀疏。此外,数据集偏向于Flickr上常见的目标和场景,可能无法代表所有真实世界分布。研究人员通常需要将Open Images与其他数据集结合,或使用课程学习等技术来解决这些问题。

另一个挑战是在如此大规模的数据集上训练的计算成本。模型需要大量资源,通常使用专用硬件,如AWS Trainium谷歌云TPU。数据集的规模也带来存储和I/O挑战,通过使用高效的数据加载管道和模型剪枝技术来减小模型规模,可缓解这些问题。

影响与未来方向

Open Images对计算机视觉领域产生了重大影响,促进了更准确和鲁棒模型的发展。它已被数千篇研究论文引用,并影响了后续数据集的设计。该数据集持续维护,定期更新以包含新标注和类别。未来方向可能包括扩展数据集以包含视频数据或更细粒度的标注,如分割掩码。随着生成式人工智能领域的发展,Open Images也可能用于训练生成或编辑图像的模型,尽管此类应用需要谨慎考虑伦理影响。

总体而言,Open Images仍是计算机视觉研究的基石资源,提供丰富多样的图像集,推动机器学习模型能力的边界。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·machine-learning·image-annotation
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史