译自英文

LVIS(Large Vocabulary Instance Segmentation)是一个用于长尾视觉识别的数据集,包含超过200万个高质量实例分割掩码,覆盖1,203个物体类别,旨在基准测试并改进AI模型在稀有和常见物体上的表现。

LVIS,即大型词汇实例分割(Large Vocabulary Instance Segmentation)的缩写,是一个用于计算机视觉和机器学习的数据集,用于评估和训练实例分割及目标检测模型。它于2019年由Facebook AI Research(现为Meta AI的一部分)的研究人员提出,旨在解决长尾视觉识别的挑战,即现实世界中的大多数目标类别是罕见的,而标准数据集却聚焦于少量常见类别。LVIS提供了1,203个目标类别的大型词汇表,涵盖从“香蕉”等日常物品到“三角龙头骨”等小众物体,并在源自COCO数据集的约164,000张图像上标注了超过200万个高质量的实例分割掩码。该数据集的设计强调穷尽式标注,即标注者被要求标记图像中存在的每个类别的每个实例,这与早期数据集常常忽略罕见物体的做法形成对比。这使得LVIS成为深度学习模型的严格基准,特别是在衡量罕见类别性能方面,并推动了诸如联邦损失和动态梯度裁剪等技术的研究,以缓解长尾效应。

LVIS的创建源于对现实世界视觉数据遵循幂律分布的观察,即少数类别(如“人”、“汽车”)频繁出现,而其他数千个类别仅偶尔出现。像COCO或ImageNet这样的传统数据集要么类别数量有限,要么未提供所有实例的像素级掩码,限制了它们在细粒度识别中的实用性。LVIS通过对COCO图像的一个子集进行重新标注,使用了一个众包标注流程,该流程包括两个阶段:首先是“发现”阶段,标注者识别图像中的所有物体;其次是“验证”阶段,以确保完整性和准确性。最终数据集包含1,203个类别,分为三个频率组:频繁(超过100张图像)、常见(10-100张图像)和罕见(少于10张图像),其中约77%的类别属于罕见组。这种不平衡是有意为之,因为它反映了现实世界条件,并迫使模型超越头部类别进行泛化。

数据集结构与标注

LVIS建立在COCO数据集之上,使用了其中的164,000张训练和验证图像,但类别词汇表显著扩展。每张图像都标注了实例级分割掩码,即每个物体实例都在像素级别被勾勒出来,而不仅仅是用边界框包围。标注过程被设计为穷尽式的:标注者必须标记所有存在的类别中的所有实例,即使它们很小、被遮挡或模糊。这是与COCO的关键区别,后者仅要求标注80个类别,且常常跳过罕见物体。数据集提供了一个JSON文件,其标注格式与COCO类似,包括图像ID、类别ID、分割多边形和边界框等字段。类别列表是通过WordNet同义词集和手动选择的组合来策划的,确保了对日常物体、动物、食物和工具的广泛覆盖。

基准与评估指标

LVIS的主要评估指标是标准的COCO风格平均精度(AP),在多个交并比(IoU)阈值(0.5至0.95)下计算。然而,LVIS引入了一个关键变化:AP分别针对三个频率组(罕见、常见、频繁)报告,总体AP是这三个组AP的平均值,而不是对所有类别的简单平均。这种“平衡”AP确保了罕见类别的性能不会被常见类别所掩盖,使其成为衡量长尾泛化能力的更敏感指标。例如,一个在“人”上表现良好但在“算盘”上表现不佳的模型,在LVIS上的得分将低于在COCO上的得分。该基准还包括用于实例分割的“掩码AP”和用于检测的“边界框AP”,主要排行榜侧重于掩码AP。自发布以来,LVIS已被用于多项挑战赛,包括2019年ICCV上的LVIS挑战赛及后续研讨会,其中顶级参赛作品采用了类平衡采样、损失重加权以及使用更大的骨干网络(如基于Transformer的检测器)等技术。

对长尾学习的影响

LVIS已成为长尾学习的标准测试平台,这是人工智能中一个关注在不平衡数据上训练模型的子领域。该数据集的设计激发了众多算法创新。一个 notable 的例子是LVIS作者提出的“联邦损失”,它根据频率将类别分组为“联邦”集合,并在每个组内计算softmax,防止罕见类别在损失函数中被频繁类别淹没。另一个是“动态梯度裁剪”,它调整训练期间罕见类别的梯度幅度。后续工作探索了解耦训练(先学习特征,再微调分类器)、针对罕见类的数据增强,以及使用具有更好特征提取能力的神经网络架构。LVIS还影响了其他数据集,如Open Images和Objects365,这些数据集采用了类似的穷尽式标注策略。截至2025年,LVIS仍是一个被广泛引用的基准,在学术文献中被引用超过1,000次,并且常与基于大型语言模型的视觉-语言模型结合使用,以测试其在罕见物体上的零样本或少样本识别能力。

相关数据集与扩展

LVIS催生了多个扩展和相关工作。LVIS挑战赛数据集包括一个包含20,000张图像的验证集和一个测试集,标注了相同的1,203个类别。2020年,作者发布了LVIS v1.0,修复了标注错误并将训练集扩展到100,000张图像(从原始的57,000张),提高了一致性。还引入了一个名为LVIS-OW(开放世界)的变体,用于开放世界实例分割,其中模型必须识别未知物体。此外,LVIS已被集成到Detectron2框架中,使研究人员能够轻松训练和评估模型。该数据集的类别列表也被用于其他任务,如全景分割和视频实例分割,作为通用词汇表。尽管取得了成功,LVIS仍有局限性:它源自COCO图像,这些图像偏向于网络照片,且其类别集虽然庞大,但仍然是有限的。未来的数据集,如Ego4D项目中的数据集,已基于LVIS的原则构建了更多样化的基准。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·long-tail-recognition·instance-segmentation
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史