Traducido del inglés

LabelMe es una herramienta de anotación de imágenes basada en web y un conjunto de datos dinámico creado por MIT CSAIL, que proporciona anotaciones de polígonos gratuitas y contribuidas públicamente para la investigación en visión por computadora. Hasta 2010, contenía más de 187,000 imágenes y casi 659,000 objetos etiquetados.

LabelMe es un proyecto originado en el MIT Computer Science and Artificial Intelligence Laboratory que ofrece un conjunto de datos de imágenes digitales en evolución, de acceso libre, acompañado de anotaciones generadas por usuarios. Diseñado principalmente para la investigación en visión por computador, permite etiquetar múltiples objetos dentro de escenas arbitrarias mediante contornos poligonales. Hasta el 31 de octubre de 2010, el conjunto de datos comprendía 187,240 imágenes, de las cuales 62,197 estaban anotadas, conteniendo 658,992 objetos etiquetados. El proyecto está abierto a la contribución pública, permitiendo que cualquiera añada o edite anotaciones, lo que lo convierte en un recurso dinámico para la comunidad investigadora.

La iniciativa LabelMe surgió para abordar las limitaciones de los conjuntos de datos de visión por computador anteriores, que a menudo estaban adaptados a problemas de investigación específicos y carecían de diversidad en la apariencia de los objetos y el contexto de la escena. A diferencia de los conjuntos de datos tradicionales que presentaban imágenes recortadas y normalizadas de objetos individuales, LabelMe admite el reconocimiento de clases de objetos dentro de escenas complejas y sin modificar, ofreciendo múltiples ángulos, tamaños y orientaciones. También proporciona una gran variedad de clases de objetos y permite a los usuarios crear otras nuevas fácilmente.

Herramienta de anotación

La herramienta de anotación basada en web de LabelMe permite a los usuarios contribuir al conjunto de datos sin necesidad de software especializado. Accesible a través de cualquier navegador web con JavaScript habilitado, la herramienta muestra una imagen seleccionada aleatoriamente de la colección, superponiendo las anotaciones poligonales existentes en colores distintivos. Los usuarios pueden dibujar nuevos polígonos haciendo clic en puntos a lo largo del límite de un objeto y luego asignar una etiqueta de texto mediante una interfaz emergente. Las etiquetas son definidas por el usuario, lo que genera variaciones como 'perro', 'canino' o 'sabueso'. Los anotadores también pueden editar o eliminar polígonos existentes, y los cambios se guardan inmediatamente y se ponen a disposición del público para su descarga, fomentando un conjunto de datos impulsado por la comunidad que se actualiza continuamente.

Motivación y principios de diseño

El proyecto fue impulsado por las limitaciones de los conjuntos de datos de visión por computador disponibles públicamente en épocas anteriores, que a menudo estaban adaptados a problemas de investigación específicos y requerían que los nuevos investigadores recopilaran datos adicionales. LabelMe fue diseñado para admitir el reconocimiento de clases de objetos en lugar de instancias individuales, abarcando objetos en múltiples ángulos, tamaños y orientaciones dentro de escenas arbitrarias. A diferencia de los conjuntos de datos con imágenes recortadas o normalizadas, LabelMe permite la anotación de múltiples objetos por imagen mediante contornos poligonales, lo que facilita la comprensión de escenas complejas. También admite un conjunto amplio y en expansión de clases de objetos, incluye imágenes diversas y proporciona imágenes sin derechos de autor con contribuciones públicas abiertas.

Herramienta de anotación

La herramienta de anotación funciona en un navegador web estándar con soporte de JavaScript MSN, y los usuarios pueden acceder a ella de forma anónima o con una cuenta gratuita. Al cargarse, la herramienta selecciona aleatoriamente una imagen del conjunto de datos y muestra cualquier etiqueta de objeto existente como polígonos de colores superpuestos en la imagen, asignando un color diferente a cada etiqueta distinta. Para añadir una anotación, un usuario dibuja un polígono haciendo clic en puntos a lo largo del límite de un objeto y cierra la forma para activar un aviso de introducción de etiqueta. Los usuarios pueden elegir cualquier etiqueta de texto que consideren adecuada, y también pueden editar o eliminar polígonos existentes haciendo clic en sus contornos y modificando el texto de la etiqueta. Los cambios se guardan inmediatamente y se vuelven públicos en el conjunto de datos, contribuyendo a una colección en evolución continua. La interfaz incluye un enlace 'Muéstrame otra imagen' para pasar a la siguiente imagen aleatoria.

Características del conjunto de datos

Hasta el 31 de octubre de 2010, LabelMe contenía 187,240 imágenes, de las cuales 62,197 estaban anotadas, con un total de 658,992 objetos etiquetados. La naturaleza dinámica del conjunto de datos implica que estas cifras han crecido desde entonces. Las imágenes provienen de una amplia variedad de escenas, principalmente capturadas por fotógrafos humanos, lo que resulta en distribuciones desiguales de tamaños y ubicaciones de objetos dentro de los encuadres. El modelo de contribución abierta introduce variabilidad en el estilo de anotación: los anotadores deciden qué objetos etiquetar (por ejemplo, si delinear objetos ocluidos), la precisión de los contornos poligonales y el texto exacto utilizado para las etiquetas. Esta variabilidad es intencional, ya que los creadores creen que refleja hábitos naturales de etiquetado y ayuda a los investigadores a desarrollar algoritmos robustos frente a tales inconsistencias.

Trabajo relacionado e impacto

LabelMe se basó en esfuerzos anteriores en conjuntos de datos de visión por computador, como los conjuntos de datos PASCAL VOC y Caltech, pero se distinguió por su escala y apertura. Su naturaleza dinámica y su enfoque impulsado por la comunidad influyeron en plataformas y conjuntos de datos de anotación posteriores en el campo. El proyecto ha sido ampliamente utilizado para entrenar y evaluar algoritmos de detección de objetos y segmentación, y contribuyó al movimiento más amplio hacia datos a gran escala y disponibles públicamente en aprendizaje automático y inteligencia artificial.

Problemas con los datos

El conjunto de datos muestra variabilidad debido a la libertad otorgada a los anotadores, lo que introduce ciertos desafíos. Los objetos pueden variar en tamaño y ubicación en la imagen porque los fotógrafos tienden a centrar sujetos interesantes. Los usuarios pueden elegir qué objetos etiquetar, lo que genera inconsistencias, como si etiquetar objetos ocluidos o el cielo. La precisión de la anotación también varía, ya que los usuarios deciden cuán detallados deben ser los polígonos. Las etiquetas de texto no están restringidas, por lo que el mismo objeto puede recibir diferentes nombres, como "persona", "hombre" o "peatón". Los creadores dejaron intencionalmente estas decisiones a los anotadores, creyendo que la variabilidad natural del etiquetado ayuda a los investigadores a desarrollar algoritmos robustos frente a inconsistencias del mundo real.

Organización de datos e integración con WordNet

Para abordar la variabilidad en las etiquetas de texto, el equipo de LabelMe integró WordNet en la base de datos. WordNet organiza las palabras en una jerarquía semántica estructurada, asignando cada palabra a un "sentido". La asignación automática de sentidos resultó poco fiable, por lo que las etiquetas se mapearon manualmente a los sentidos de WordNet. Este esfuerzo, aunque laborioso, siguió siendo manejable porque el número de palabras distintas crecía lentamente en relación con el número de polígonos. Con la integración de WordNet, las búsquedas se volvieron más efectivas: consultar "animal" podía recuperar objetos etiquetados como perros, gatos y serpientes, mientras excluía coincidencias irrelevantes como "paseo de perros" u objetos etiquetados con frases complejas. El sistema también admitía identificar relaciones de parte-todo, como ruedas como partes de vehículos, mejorando la utilidad del conjunto de datos para la investigación en reconocimiento de objetos.

Impacto y aplicaciones

LabelMe ha sido ampliamente utilizado en la investigación de visión por computador, proporcionando un punto de referencia para tareas como detección de objetos, segmentación y comprensión de escenas. Su naturaleza abierta y dinámica lo distingue de los conjuntos de datos estáticos, permitiendo una expansión y refinamiento continuos. El proyecto ha inspirado esfuerzos similares de anotación colaborativa y sigue siendo un recurso fundamental en el campo. Los investigadores han aprovechado LabelMe para entrenar y evaluar algoritmos que reconocen objetos en contextos diversos del mundo real, contribuyendo a avances en la comprensión de imágenes y áreas relacionadas de aprendizaje automático y visión por computador.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·datasets·annotation-tools·mit
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial