译自英文

牛津花卉是一个用于细粒度视觉分类的基准图像数据集,包含102类英国常见花卉及其分割掩码。它在机器学习和计算机视觉研究中被广泛使用。

牛津花卉是一个用于细粒度视觉分类的基准图像数据集,由牛津大学视觉几何组开发。该数据集包含8,189张图像,涵盖102种英国常见的花卉类别。每个类别包含40至258张图像,图像在尺度、姿态和光照条件上有所变化。该数据集于2008年由Maria-Elena Nilsback和Andrew Zisserman引入,他们还提供了一个配套数据集,即17类别的牛津花卉数据集,作为较小的前身。

牛津花卉的主要目的是支持细粒度图像分类研究,其目标是在单一基本类别内区分视觉上相似的子类别。与ImageNet等通用物体识别数据集不同,牛津花卉侧重于颜色、形状和纹理上的细微差异。该数据集为每朵花提供了像素级分割掩码,支持分类和分割任务的研究。图像来源于多个摄影网站,并非在受控条件下拍摄,增加了真实感和难度。

数据集结构

该数据集被划分为三个预定义部分:训练集、验证集和测试集。训练集包含1,020张图像(每类10张),验证集包含1,020张图像(每类10张),测试集包含6,149张图像(其余部分)。这种固定划分常用于不同模型之间的公平比较。每张图像关联一个从1到102的标签,分割掩码以二值图像形式提供。数据集还包括一组标签和一个列出类别名称的文本文件,这些类别对应于常见的英国野花,如蓝铃花、黄花九轮草和雪花莲。

研究影响

牛津花卉自发布以来一直是计算机视觉领域的标准基准。它被用于评估各种机器学习方法,从颜色直方图和形状描述符等手工特征方法到现代深度学习模型。特别是,它在细粒度识别技术的发展中发挥了重要作用,包括基于部件的模型和注意力机制。该数据集还被用于数据增强迁移学习少样本学习的研究,因为每类训练样本数量有限,对泛化能力构成了挑战。

显著方法与结果

牛津花卉的早期研究使用支持向量机配合手工特征,分类准确率约为60-70%。卷积神经网络(CNN)的引入显著提升了性能。例如,微调的ResNet模型在测试集上可以达到超过95%的准确率。该数据集还被用于基准测试注意力机制和基于Transformer的架构,最先进的模型已达到接近完美的准确率。然而,相对于现代标准,该数据集的规模较小,因此通常被用作次要基准而非主要基准,研究人员会将其结果与CIFAR-100或ImageNet等更大数据集一起报告。

扩展与变体

原始的102类别数据集启发了多个扩展。牛津花卉数据集(17类别)是一个用于快速原型开发的较小版本。此外,该数据集已被纳入更大的基准,如视觉十项全能挑战赛,该挑战赛评估模型在多个多样化数据集上的表现。一些研究人员还创建了合成变体或应用数据增强技术来增加训练集的有效规模。分割掩码已被用于图像分割和生成模型的研究,例如条件图像合成。

局限性

尽管牛津花卉广受欢迎,但它存在局限性。图像分辨率相对较低(最大维度约为500像素),可能无法反映现实世界中的高分辨率场景。该数据集还偏向英国植物区系,限制了其在其他地理区域的适用性。此外,固定的训练/验证/测试划分虽然方便,但如果模型在验证集上反复调优,可能导致过拟合。截至2020年代中期,该数据集相对于现代大规模基准被认为规模较小,其角色已从主要挑战转变为细粒度分类算法的健全性检查。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·fine-grained-classification
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史