译自英文

LabelMe是由MIT CSAIL创建的一个基于网页的图像标注工具和动态数据集,为计算机视觉研究提供免费、由公众贡献的多边形标注。截至2010年,它包含超过187,000张图像和近659,000个已标注对象。

LabelMe是一个源自麻省理工学院计算机科学与人工智能实验室的项目,提供了一套可自由访问、持续演进的数字图像数据集,并附带用户生成的标注。该项目主要面向计算机视觉研究,支持使用多边形边界在任意场景中对多个物体进行标注。截至2010年10月31日,该数据集包含187,240张图像,其中62,197张已标注,共包含658,992个已标注物体。项目对公众开放贡献,允许任何人添加或编辑标注,使其成为研究社区的动态资源。

LabelMe倡议的推出是为了解决早期计算机视觉数据集的不足,这些数据集通常针对特定研究问题定制,缺乏物体外观和场景背景的多样性。与包含裁剪、归一化后单物体图像的传统数据集不同,LabelMe支持在复杂、未修改的场景中识别物体类别,提供多角度、多尺寸和多朝向的样式。同时,它还提供大量物体类别,并允许用户轻松创建新类别。

标注工具

LabelMe基于网页的标注工具使用户无需专门软件即可为数据集做出贡献。该工具可通过任何支持JavaScript的Web浏览器访问,显示从集合中随机选择的一幅图像,并以不同颜色叠加现有多边形标注。用户可以沿物体边界点击点来绘制新的多边形,然后通过弹出的界面分配文本标签。标签由用户自定义,导致所提出的样式多样,例如‘狗’、‘犬科’或‘猎犬’。标注者还可以编辑或删除现有的多边形,更改会立即保存并公开供下载,从而促进一个持续更新的社区驱动数据集。

动机与设计原则

该项目受到早期公开计算机视觉数据集局限性的驱动,这些数据集通常针对特定研究问题定制,迫使新研究人员需要重新收集其他数据。LabelMe旨在支持物体类别识别而非单个实例,涵盖任意场景中多角度、多尺寸和多朝向的物体。与包含裁剪数据集的构成图不同,LabelMe允许通过多边形轮廓对每幅图像中的多个物体进行标注,从而实现对复杂场景的自主理解。它还支持不断扩展的物体类别集合,包含多样化的图像,并提供非版权图像,并实现开放的公众贡献。

标注工具

标注工具在支持JavaScript在标准Web浏览器中运行,用户可以通过匿名访问或使用免费账户使用。加载后,该工具从数据集中随机选择一幅图像,并将现有物体标签作为彩色多边形叠加显示在图像上,每个不同标签分配不同颜色。要添加标注,用户点击物体边界各点绘制多边形,并闭合形状以触发标签输入提示。尽管用户可以选择任何可能会选择‘跳过’的文本标签,并且可以编辑或删除现有的多边形,点击其轮廓并修改标签文本。更改会立即保存并公开在数据集中,从而促进持续演进的集合。界面通过点击多边形的轮廓,用户可以编辑或删除现有标注,该工具还包含一个‘显示另一张图像’链接,用以继续浏览下一张随机图像。

数据集特征

截至2010年10月31日,LabelMe包含187,240幅图像,其中62,197幅有标注,标注目标总共658,992个。数据集的动态特性意味着这些数字此后已进一步增长。图像采集自各种场景,主要由人摄影师拍摄,导致物体大小和图像内位置的分布不均。开放贡献模式引入了多样化的标注风格:标注者自行决定跨屏幕对象(例如是否对遮挡物体进行轮廓标注)、多边形边界的精确度以及标签使用的具体文本。这种可变性是有意为之,因为创建者认为它反映了自然标注的习惯,并帮助研究人员开发适应此类不一致性的鲁棒算法。

相关工作和影响

LabelMe建立在早期计算机视觉数据集的成果上,例如PASCAL VOC和Caltech数据集,但通过其规模性和开放性与其区分。其动态性和社区驱动方法影响了后续的标注平台和数据集的开发。该项目已被广泛用于训练评估的目标检测、分割算法,并为向面向大规模公开数据集的运动做出贡献,尤其是在Machine learningArtificial intelligence领域。

数据中的问题

数据集存在由于用户标注自由度较大而产生的变异性,这对数据处理带来挑战。图像中物体大小和位置会变化(因为摄影师倾向于把有趣主体居中放置),用户可以选择标注哪些物体(例如,是否标注被遮挡的物体或天空),多边形精度会随标注者而异,文本标签不受限制,因此同一物体可能被标注为“人”、“男人”或“行人”。这些决策是有意留给标注者的,因为其目标者相信自然标注仿自然习惯有助于增强算法的鲁棒性以应对真实世界的不一致性。

数据组织与WordNet集成

为了应对文本标签的变异性,LabelMe团队将WordNet集成到数据库中。WordNet将单词组织为结构化语义,每个单词分配到“词义”中。自动词义分配偏好不足,因此标签被人工映射到WordNet语义。虽然这项工作劳动密集,但因不同单词数量相比于多边形增长缓慢,规模可控。通过WordNet集成,信息检索变得高效:例如查询“动物”能返回标注为“狗”、“猫”或“蛇”的物体,同时排除像“遛狗”或包含复杂短语的标签。该系统还支持部分-整体关系识别,例如“轮子”是“车辆”的部分,从而增强数据集在物体识别研究中的实用性。

影响与应用

LabelMe已被广泛应用于计算机视觉研究,为物体检测、分割和场景理解提供相关基准。其开放且动态的特性使其区别于静态数据集,支持持续扩展和精炼。该项目已促成了类似的群智标注工作的开展,并仍然是一个基础性资源。研究人员利用LabelMe来训练和评估面向多样现实世界环境下物体识别的算法,推动了图像理解及机器学习计算机视觉领域相关领域的进步。

相关条目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·datasets·annotation-tools·mit
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史