Oxford Pets 是由牛津大学的研究人员创建的计算机视觉数据集,用于细粒度图像分类和语义分割。它包含37个品种的猫和狗的7,349张图像,每张图像都标注了物种标签、品种标签以及像素级的三分图分割掩码。该数据集于2012年推出,已成为评估模型在细粒度视觉识别任务上表现的标准基准。
该数据集旨在解决区分视觉相似品种的挑战,例如缅因猫和挪威森林猫之间的差异。每个品种约有200张图像,数据集包含预定义的训练集、验证集和测试集划分。图像收集自互联网,包含姿态、光照和背景的变化,使任务比早期数据集更贴近现实。
数据集结构
Oxford Pets 数据集提供两类主要标注:类别标签和分割掩码。类别标签标识每张图像中动物的品种,而分割掩码是三分图,将每个像素分配到三个类别之一:前景(动物)、背景或未知(通常是边界区域)。这种双重标注使数据集可用于分类和分割任务,通常在多任务学习设置中同时使用。
官方划分将约50%的图像用于训练,20%用于验证,30%用于测试。数据集不包含任何人类或其他动物的图像,仅专注于猫和狗。品种列表涵盖25个犬种和12个猫种,包括比格犬和波斯猫等常见类型,以及伯曼猫和美国斗牛犬等较稀有品种。
研究用途
Oxford Pets 已被机器学习和计算机视觉社区广泛使用。它作为评估卷积神经网络及其他架构在细粒度分类上性能的基准。该数据集尤其有价值,因为它要求模型捕捉品种之间的细微差异,超越了粗粒度物体识别。
研究人员使用 Oxford Pets 测试数据增强、迁移学习和模型剪枝方面的创新。例如,该数据集已被用于展示残差网络和U-Net架构在分割任务中的有效性。三分图掩码还支持弱监督分割研究,即模型从图像级标签学习生成像素级预测。
与其他数据集的关系
Oxford Pets 经常与斯坦福汽车数据集和CUB-200鸟类数据集等其他细粒度数据集进行比较。这些数据集具有相似的结构,包含许多视觉上相似的类别,通常一起使用以评估模型跨领域的泛化能力。该数据集也常与PASCAL VOC数据集结合用于多任务学习,因为两者都提供分割标注。
在人工智能研究的背景下,与ImageNet等大规模数据集相比,Oxford Pets 被认为是一个相对较小的数据集。这使其有助于研究数据集规模对模型性能的影响,以及开发在有限数据下表现良好的技术,如少样本学习和自监督学习。
局限性与扩展
Oxford Pets 的主要局限性在于其规模,从头训练大型模型时可能导致过拟合。为缓解这一问题,研究人员通常使用预训练模型并在数据集上进行微调。另一个局限性是图像均为自然环境中的宠物,可能无法泛化到医学成像或自动驾驶等其他领域。
尽管存在这些局限性,该数据集仍是基准测试和教学用途的热门选择。它可免费用于学术用途,并包含在许多流行的深度学习库中,如PyTorch和TensorFlow的内置数据集模块中。该数据集还启发了扩展版本,如 Oxford Pets II 数据集,增加了更多品种和图像,但原始版本仍是最广泛使用的。