अंग्रेज़ी से अनुवादित

LVIS (Large Vocabulary Instance Segmentation) एक लंबी-पूंछ दृश्य पहचान के लिए डेटासेट है, जिसमें 1,203 वस्तु श्रेणियों में 2 मिलियन से अधिक उच्च-गुणवत्ता वाले इंस्टेंस सेगमेंटेशन मास्क शामिल हैं, जो दुर्लभ और सामान्य वस्तुओं पर AI मॉडल को बेंचमार्क और बेहतर बनाने के लिए डिज़ाइन किया गया है।

LVIS,全称Large Vocabulary Instance Segmentation,是一个用于计算机视觉和机器学习的数据集,用于评估和训练实例分割及目标检测模型。它于2019年由Facebook AI Research(现为Meta AI的一部分)的研究人员引入,旨在解决长尾视觉识别的挑战,即现实世界中大多数目标类别是罕见的,而标准数据集却集中于少量常见类别。LVIS提供了1,203个目标类别的大词汇表,涵盖从‘香蕉’等日常物品到‘三角龙头骨’等小众物体,并在源自COCO数据集的约164,000张图像上标注了超过200万个高质量实例分割掩码。该数据集的设计强调穷尽式标注,即标注者被指示标注图像中存在的每个类别的每个实例,这与早期数据集常常忽略罕见物体的做法形成对比。这使得LVIS成为深度学习模型的严格基准,特别是在衡量罕见类别性能方面,并推动了如联邦损失和动态梯度裁剪等技术的研究,以缓解长尾效应。

LVIS的创建源于对现实世界视觉数据遵循幂律分布的观察,即少数类别(如‘人’、‘汽车’)频繁出现,而其他数千类别仅偶尔出现。传统数据集如COCO或ImageNet要么类别数量有限,要么未提供所有实例的像素级掩码,限制了其在细粒度识别中的实用性。LVIS通过重新标注COCO图像的子集,使用众包标注流程构建,该流程包括两个阶段:首先是‘发现’阶段,标注者识别图像中的所有物体;其次是‘验证’阶段,确保完整性和准确性。最终数据集包含1,203个类别,分为三个频率组:频繁(超过100张图像)、常见(10-100张图像)和罕见(少于10张图像),其中约77%的类别属于罕见组。这种不平衡是有意为之,因为它反映了现实世界条件,并迫使模型超越头部类别进行泛化。

数据集结构和标注

LVIS建立在COCO数据集之上,使用其164,000张训练和验证图像,但类别词汇表显著扩展。每张图像都标注了实例级分割掩码,即每个物体实例在像素级别被勾勒,而不仅仅由边界框限定。标注过程设计为穷尽式:标注者必须标注所有存在的类别的所有实例,即使它们很小、被遮挡或模糊。这是与COCO的关键区别,COCO仅要求标注80个类别,且常常跳过罕见物体。数据集提供JSON文件,格式类似于COCO,包括图像ID、类别ID、分割多边形和边界框等字段。类别列表由WordNet同义词集和手动选择组合而成,确保广泛覆盖日常物品、动物、食物和工具。

基准和评估指标

LVIS的主要评估指标是标准COCO风格的平均精度(AP),在多个交并比(IoU)阈值(0.5至0.95)下计算。然而,LVIS引入了一个关键变化:AP分别针对三个频率组(罕见、常见、频繁)报告,总体AP是这三个组AP的平均值,而不是所有类别的简单平均。这种‘平衡’AP确保罕见类别的性能不会被常见类别掩盖,使其成为长尾泛化的更敏感度量。例如,一个在‘人’上表现良好但在‘算盘’上表现不佳的模型,在LVIS上的得分将低于在COCO上的得分。该基准还包括用于实例分割的‘掩码AP’和用于检测的‘框AP’,主要排行榜侧重于掩码AP。自发布以来,LVIS已被用于多个挑战赛,包括ICCV 2019的LVIS挑战赛及后续研讨会,其中顶级参赛作品采用了类平衡采样、损失重加权和使用如变换器检测器等更大骨干网络的技术。

对长尾学习的影响

LVIS已成为长尾学习的标准测试平台,这是人工智能的一个子领域,关注在不平衡数据上训练模型。数据集的设计推动了众多算法创新。一个显著例子是LVIS作者提出的‘联邦损失’,它根据频率将类别分组为‘联邦’集合,并在每组上计算softmax,防止罕见类别在损失函数中被频繁类别淹没。另一个是‘动态梯度裁剪’,它在训练期间调整罕见类别的梯度幅度。后续工作探索了解耦训练(先学习特征,再微调分类器)、罕见类的数据增强,以及使用具有更好特征提取能力的神经网络架构。LVIS还影响了其他数据集,如Open Images和Objects365,它们采用了类似的穷尽式标注策略。截至2025年,LVIS仍是一个被广泛引用的基准,在学术文献中被引用超过1,000次,并常与基于大型语言模型的视觉语言模型结合使用,以测试其对罕见物体的零样本或少样本识别能力。

相关数据集和扩展

LVIS催生了多个扩展和相关工作。LVIS挑战数据集包括20,000张图像的验证集和一个测试集,标注了相同的1,203个类别。2020年,作者发布了LVIS v1.0,修复了标注错误并将训练集扩展到100,000张图像(从原始的57,000张),提高了一致性。一个名为LVIS-OW(开放世界)的变体被引入用于开放世界实例分割,其中模型必须识别未知物体。此外,LVIS已集成到Detectron2框架中,使研究人员易于训练和评估模型。数据集的类别列表也被用于其他任务,如全景分割和视频实例分割,作为通用词汇表。尽管取得了成功,LVIS仍有局限性:它源自COCO图像,这些图像偏向于网络照片,且其类别集虽然庞大,但仍是有限的。未来数据集,如Ego4D项目中的那些,已基于LVIS的原则构建了更多样化的基准。

另见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·long-tail-recognition·instance-segmentation
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास