牛津-IIIT宠物数据集

译自英文

牛津-IIIT宠物数据集是一个包含37个猫狗品种的基准图像集合,用于计算机视觉研究中的细粒度分类和语义分割。

牛津-IIIT宠物数据集是计算机视觉中用于细粒度图像分类和语义分割的广泛使用的基准数据集。该数据集由牛津大学和海得拉巴印度信息技术学院(IIIT-H)的研究人员于2012年发布,包含37个猫狗品种的7,349张图像。每张图像都标注了物种标签、品种标签、像素级三值图分割掩码以及粗略的头部边界框。该数据集旨在鼓励对视觉相似品种的分类以及从杂乱背景中分割动物的研究。

该数据集与一篇提出将可变形部件模型与语义分割方法相结合的论文同步发布。原始论文报告了使用带空间金字塔匹配的词袋模型达到59.2%的分类准确率,以及使用所提方法达到49.8%的平均交集-并集(IoU)分割准确率。这些数字已被现代Deep learning模型远远超越,但该数据集仍然是评估新架构的标准基准。

数据集结构

图像被分为12种猫品种和25种狗品种,每种约含200张图像。这些品种包括常见的宠物,如阿比西尼亚猫、孟加拉猫和英国短毛猫,以及如比格犬、德国牧羊犬和巴哥犬等狗类。数据集被划分为训练集和测试集,划分方式在原始版本中提供。训练集包含3,680张图像,测试集包含3,669张图像。图像分割掩码为trimap掩码,其中每个像素被标记为前景、背景或不确定边界区域。

研究影响

牛津-IIIT宠物数据集已被用于数百项研究,特别是用于评估U-Net和其他神经网络架构的语义分割。它经常与PASCAL VOC数据集配对使用进行迁移学习基准测试。该数据集的中等规模使其适合从零开始训练模型,而不同于如ImageNet这类更大的数据集。它还用于研究Data Augmentation技术,这是因为每类图像数量有限,因此需要增强以提高泛化能力。

常见评估协议

分类评估的标准是使用每类平均准确率,而分割则通过所有类别的平均IoU来衡量。研究人员通常将图像调整到固定分辨率(如224x224像素),并在训练期间应用随机翻转和裁剪。许多已发表的结果报告了使用现代残差网络Encoder-Decoder Architecture模型的分类准确率超过95%,分割IoU超过90%。数据集的官方勘误提供了原始标注和已发表的结果列表,尽管自2015年代中期以来更新已停止。

局限性与替代方案

该数据集具有已知的局限性,包括每类图像数量较小以及偏向于整洁、工作时式风格的分布,这些品种全部为纯种,并未反映混种宠物的多样性。对于更具挑战性的任务,研究人员已转向如斯坦福犬类数据集或iNaturalist挑战等大型数据集。尽管如此,牛津-IIIT数据集仍作为制作分割模型原型的便利起点,因为其尺寸紧凑且清洁度良好。

遗产

该数据集由Omkar M. Parkhi、Andrea Vedaldi、Andrew Zisserman和C. V. Jawahar创建。随伴论文发表于2012年的英国机器视觉大会(BMVC),已被引用数千次。它为细粒度识别方法的发展做出贡献,并帮助推动了trimap掩码用于弱监督分割的普及。该数据集可自由用于学术研究,并托管在视觉几何小组网站上(参见牛津大学)。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·benchmark·image-segmentation
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史