Places365是一个用于场景识别的大规模数据集,包含超过180万张图像,涵盖365个不同的场景类别。该数据集于2016年由麻省理工学院(MIT)的研究人员提出,包括Bolei Zhou、Aditya Khosla、Aude Oliva和Antonio Torralba。该数据集旨在推动计算机视觉领域的发展,特别是在场景理解方面,即识别图像拍摄时的背景或环境。Places365已成为评估深度学习模型在场景分类任务上性能的标准基准,与以物体为中心的ImageNet等数据集形成互补。
该数据集分为两个版本:Places365-Standard和Places365-Challenge。Places365-Standard包含约180万张训练图像,每个类别有3000至5000张图像。Places365-Challenge是更大的版本,包含超过800万张训练图像,用于2016年计算机视觉与模式识别会议(CVPR)上举办的Places Challenge竞赛。图像来源于网络,并标注为365个场景类别之一,涵盖从“山”和“海滩”等自然场景到“厨房”和“办公室”等室内环境。这些类别源自Places2数据集,而Places2本身是早期Places205数据集的扩展。
发展与动机
创建Places365是为了满足对全面场景识别数据集的需求。虽然物体识别在ImageNet等数据集的推动下取得了显著进展,但场景理解仍相对不发达。MIT团队旨在提供一个大规模、多样化且标注良好的数据集,以支持神经网络模型在场景分类方面的训练。该数据集通过从网络收集图像,并结合自动化与人工标注流程构建而成。最终选定的365个类别旨在覆盖广泛的日常环境,确保在Places365上训练的模型能够泛化到自动驾驶、机器人和图像检索等实际应用中。
Places365的创建是构建Places数据库这一更广泛努力的一部分,该数据库还包括Places205数据集和Places2数据集。Places205于2014年推出,包含205个场景类别,用作初步基准。Places365将其扩展到365个类别,提供了更全面的场景类型覆盖。该数据集已被研究界广泛采用,其发布推动了场景识别算法的诸多进展。
架构与内容
Places365包含分辨率各异的图像,预处理后通常约为224×224像素。每张图像标注为单个场景类别,使其成为单标签分类任务。该数据集包括训练集、验证集和测试集。验证集和测试集每个类别有50张图像,而训练集每个类别有数千张图像。图像以JPEG格式存储,并按类别组织到目录中。
Places365的一个显著特点是侧重于场景级上下文而非单个物体。这使其区别于物体识别数据集,因为模型必须学习识别整体环境。该数据集还包含一个语义层级,将365个类别分组为16个超类别,如“室内”、“室外自然”和“室外人造”。这一层级支持更结构化的模型性能评估和分析。
应用与影响
Places365已被广泛用于机器学习研究,特别是用于训练卷积神经网络(CNN)进行场景分类。许多最先进的模型,如ResNet和DenseNet,已在Places365上进行了评估,该数据集已成为比较不同架构的基准。除了分类之外,Places365还被用于场景解析、语义分割和迁移学习等任务。例如,在Places365上预训练的模型已被微调用于其他视觉任务,包括物体检测和图像描述。
该数据集还影响了工业界人工智能系统的开发。像Google DeepMind和OpenAI这样的公司已将场景理解能力整合到其模型中,Places365已被用于评估大规模视觉模型的性能。此外,该数据集还被用于人类场景感知研究,为人类如何对环境进行分类提供了见解。
局限性与未来方向
尽管取得了成功,Places365仍存在一些局限性。该数据集偏向于西方、英语背景,因为图像是从网络收集的,可能无法同等代表所有全球环境。此外,单标签格式无法捕捉现实世界场景的复杂性,这些场景通常包含多个重叠的上下文。研究人员已提出扩展和替代方案,例如多标签场景数据集和地理覆盖更广泛的数据集。随着生成式AI和大型语言模型的持续发展,人们对利用场景理解来增强多模态模型的兴趣日益增长,而Places365仍是训练和评估此类系统的相关资源。