CUB-200-2011,又称Caltech-UCSD Birds-200-2011数据集,是机器学习和计算机视觉领域中用于细粒度视觉分类任务的基准数据集。该数据集于2011年由加州理工学院和加州大学圣迭戈分校的研究人员发布,旨在挑战算法区分视觉上相似的鸟类物种,推动超越通用物体识别的能力。
该数据集包含200种鸟类的11,788张图像,每张图像都标注了边界框、二值部分分割掩码以及15个关键身体部位(如喙、翅膀、尾巴)的位置。此外,每张图像还关联了312个二值属性标签(例如“有红色胸部”、“翅膀颜色:蓝色”)和一段文本描述。这种丰富的标注结构使CUB-200-2011成为评估必须学习细微视觉差异的模型的标准测试平台。
历史与创建
CUB-200-2011是作为原始CUB-200数据集(2010年)的扩展而引入的,原始数据集包含200个物种的6,033张图像。2011年版本增加了更多图像、部位标注和属性标签。该数据集由Catherine Wah、Steve Branson、Peter Welinder、Pietro Perona和Serge Belongie创建,并得到了国家科学基金会和海军研究办公室的资助。图像来源于Flickr和其他在线存储库,然后通过众包平台由人工标注者进行筛选和标注。
结构与标注
CUB-200-2011中的每张图像都附带一组标注文件。边界框提供了鸟的紧密裁剪区域。部位位置以15个部位的(x,y)坐标给出,包括头顶、前额、眼睛、喙、喉咙、胸部、腹部、翅膀和尾巴。二值分割掩码指示哪些像素属于鸟。属性标签是二值的(0或1),涵盖颜色模式、形状和行为。数据集还包括训练/测试划分:5,994张图像用于训练,5,794张用于测试,每个划分中大约包含一半的物种。
在细粒度识别中的作用
CUB-200-2011是细粒度视觉分类(FGVC)的基石,FGVC是计算机视觉的一个子领域,旨在子类别级别(如物种、品种)对物体进行分类。与通用物体识别(例如区分鸟和汽车)不同,FGVC要求模型关注外观上的细微差异。CUB-200-2011已被用于开发和评估多种技术,包括基于部位的模型、注意力机制和深度学习架构。它通常与斯坦福狗和牛津花等其他FGVC数据集搭配使用。
对深度学习研究的影响
随着神经网络的兴起,CUB-200-2011成为测试新架构的热门基准。例如,它被用于评估残差网络和基于注意力的模型的性能。该数据集的部位标注促进了部位定位和基于部位分类的研究,其中模型首先检测部位,然后利用其特征进行分类。它还为专门针对细粒度任务设计的数据增强技术和损失函数提供了测试平台。截至2020年代中期,最先进的模型在CUB-200-2011上实现了超过90%的准确率,相比2010年代初约50-60%的准确率有了显著提升。
局限性与扩展
尽管CUB-200-2011广受欢迎,但它存在局限性。图像相对较小(平均分辨率约为500x500像素),且数据集偏向于北美鸟类物种。标注虽然详细,但由于众包可能存在不一致性。为了解决其中一些问题,研究人员创建了扩展版本,如带有额外属性标注的CUB-200-2011,或将其用于跨数据集迁移学习。该数据集仍然是评估细粒度识别的标准,其设计影响了后来的数据集,如iNaturalist。
参见
参考文献
- Wah, C., Branson, S., Welinder, P., Perona, P., & Belongie, S. (2011). The Caltech-UCSD Birds-200-2011 Dataset. California Institute of Technology.
- Welinder, P., et al. (2010). Caltech-UCSD Birds 200. California Institute of Technology.