英語からの翻訳

LabelMeは、MIT CSAILによって作成されたウェブベースの画像注釈ツールおよび動的データセットであり、コンピュータビジョン研究のために無料で公開されたポリゴン注釈を提供する。2010年時点で、18万7千枚以上の画像と約65万9千個のラベル付きオブジェクトを含んでいた。

LabelMe 是一个源自麻省理工学院计算机科学与人工智能实验室的项目,提供可自由访问且不断演进的数字图像数据集,并附带用户生成的标注。它主要面向计算机视觉研究,支持使用多边形边界对任意场景中的多个对象进行标注。截至2010年10月31日,该数据集包含187,240张图像,其中62,197张已完成标注,共计658,992个标注对象。该项目开放公众贡献,允许任何人添加或编辑标注,从而使其成为研究社区的动态资源。

LabelMe 项目的诞生旨在弥补早期计算机视觉数据集的不足,这些数据集通常针对特定研究问题定制,缺乏对象外观和场景背景的多样性。与传统数据集仅提供裁剪、归一化的单一对象图像不同,LabelMe 支持在复杂、未修改的场景中识别对象类别,涵盖多种角度、尺寸和方向。此外,它还提供大量对象类别,并允许用户轻松创建新类别。

标注工具

LabelMe 的基于网页的标注工具使用户无需专门软件即可参与数据贡献。只需支持 JavaScript 的网页浏览器,工具便会从数据集中随机显示一张图像,并以不同颜色叠加现有对象的多边形标注。用户可以点击对象边界上的点来绘制新多边形,然后通过弹出界面为其分配文本标签。标签由用户自定义,因此可能出现如“狗”、“犬科”或“猎犬”等不同表述。标注者还可以编辑或删除现有多边形,所有更改会立即保存并公开,供下载使用,从而推动数据集持续更新。

动机与设计原则

该项目的动机源于早期公开计算机视觉数据集的局限性,这些数据集往往针对特定研究问题定制,新研究人员需要额外收集数据。LabelMe 的设计目标是支持对象类别的识别,而非仅限于单个实例,并在任意场景中涵盖多种角度、尺寸和方向。与使用裁剪、归一化图像的传统数据集不同,LabelMe 允许通过多边形轮廓对每张图像中的多个对象进行标注,从而支持复杂场景理解。它还提供大量对象类别,并包含多样化的图像,且所有图像均为非版权限制,开放供公众贡献。

标注工具

标注工具在标准网页浏览器中运行,支持 JavaScript,用户可匿名或使用免费账户访问。加载后,工具会从数据集中随机选择一张图像,并显示现有对象的多边形标注,每个类别以不同颜色区分。要添加标注,用户可沿对象边界点击点绘制多边形,然后通过弹出提示输入标签。用户可自由选择任何文本标签,也可点击多边形并修改标签来编辑或删除现有标注。所有更改会立即保存并公开,供数据集下载,从而推动持续更新。界面还提供“显示另一张图像”的链接,以便浏览更多图像。

数据集特征

截至2010年10月31日,LabelMe 包含187,240张图像,其中62,197张已标注,总计658,992个标注对象。由于数据集的动态特性,这些数字此后持续增长。图像来源广泛,涵盖多种场景,主要由人类摄影师拍摄,因此对象大小和位置在画面中分布不均。开放贡献模式导致标注风格多样:标注者自行决定标注哪些对象(例如是否标注被遮挡的对象)、多边形边界的精度以及使用的文本标签。这种变异性是有意设计的,因为创建者认为它反映了自然的标注习惯,有助于研究人员开发对现实世界不一致性具有鲁棒性的算法。

相关工作与影响

LabelMe 建立在早期计算机视觉数据集(如 PASCAL VOC 和 Caltech 数据集)的基础上,但以其规模和开放性脱颖而出。其动态特性和社区驱动方法影响了后续的标注平台和数据集。该项目被广泛用于训练和评估对象检测与分割算法,并推动了大规模、公开数据在机器学习人工智能领域的发展。

数据问题

数据集因标注者的自由度而存在变异性,这带来了一些挑战。对象大小和图像位置可能因摄影师倾向于将主体居中而有所不同。用户可选择标注哪些对象,导致不一致性,例如是否标注被遮挡对象或天空。标注精度也因用户对多边形细节的把握而异。文本标签不受限制,因此同一对象可能有不同名称,如“人”、“男人”或“行人”。创建者有意保留这些决策由标注者自行决定,认为这种自然的标注变异性有助于开发对现实世界不一致性具有鲁棒性的算法。

数据组织与 WordNet 集成

为解决文本标签的变异性,LabelMe 团队将 WordNet 集成到数据库中。WordNet 将词汇组织为结构化的语义层级,并为每个词分配一个“义项”。自动义项分配被证明不可靠,因此标签被手动映射到 WordNet 义项。这项工作虽劳动密集,但因不同词汇数量相对于多边形数量增长缓慢而得以管理。通过 WordNet 集成,搜索变得更加高效:例如,查询“动物”可检索到“狗”、“猫”和“蛇”等标注对象,同时排除“遛狗”或带有复杂短语的无关对象。系统还支持部分关系识别,如“轮子”作为“车辆”的部件,从而增强了数据集在对象识别研究中的实用性。

影响与应用

LabelMe 已被广泛用于计算机视觉研究,为对象检测、分割和场景理解等任务提供基准。其开放、动态的特性使其区别于静态数据集,支持持续扩展和完善。该项目启发了类似的众包标注工作,并成为该领域的基础资源。研究人员利用 LabelMe 训练和评估算法,以在多样化的现实场景中识别对象,推动了图像理解及相关机器学习计算机视觉领域的进展。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:computer-vision·datasets·annotation-tools·mit
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴