Conjunto de Datos de Límites Semánticos

Traducido del inglés

El Semantic Boundaries Dataset (SBD) es un conjunto de datos a gran escala para la detección de límites de objetos y la segmentación semántica, derivado del desafío PASCAL VOC 2011. Proporciona anotaciones de alta calidad a nivel de píxel para 20 clases de objetos en 11,355 imágenes, ampliamente utilizado para entrenar y evaluar modelos de aprendizaje profundo.

El conjunto de datos de Límites Semánticos (SBD, por sus siglas en inglés) es un conjunto de datos de referencia para tareas de visión por computadora, diseñado específicamente para la detección de límites de objetos y la segmentación semántica. Fue introducido en 2011 por investigadores de la Universidad de California, Berkeley, como una extensión del conjunto de datos PASCAL VOC 2011. SBD proporciona anotaciones densas a nivel de píxel para 20 clases de objetos (por ejemplo, persona, coche, avión, gato) en 11,355 imágenes, con una división de 8,498 imágenes de entrenamiento y 2,857 de validación. El conjunto de datos es notable por sus límites de alta calidad, que son anotados manualmente y refinados mediante una plataforma de crowdsourcing, lo que lo convierte en un estándar de referencia para evaluar algoritmos en segmentación semántica y detección de bordes.

El propósito principal de SBD es facilitar la investigación en segmentación semántica, donde el objetivo es asignar una etiqueta de clase a cada píxel de una imagen. A diferencia de conjuntos de datos anteriores que proporcionaban cajas delimitadoras o máscaras gruesas, SBD ofrece límites de objetos precisos, lo que permite que los modelos aprendan detalles espaciales finos. Las anotaciones se almacenan en formato PNG con etiquetas de clase codificadas por color, y el conjunto de datos también incluye máscaras de segmentación a nivel de instancia, que son útiles para tareas como segmentación de instancias y detección de objetos. SBD ha sido ampliamente adoptado en la comunidad de aprendizaje profundo, sirviendo como conjunto de entrenamiento para modelos como Redes Totalmente Convolucionales (FCNs, U-Net, y diversas arquitecturas basadas en redes neuronales convolucionales(CNNs).

Estructura del Conjunto de Datos y Anotaciones

SBD consiste en imágenes del desafío PASCAL VOC 2011, que incluye escenas diversas con múltiples objetos. Cada imagen está acompañada por una máscara de segmentación donde cada píxel se asigna a una de 20 clases de objetos o una clase de fondo( clase 0). Las anotaciones se proporcionan en dos formatos: máscaras a nivel de clase( donde cada píxel tiene una sola etiqueta de clase) y máscaras a nivel de instancia( donde cada instancia de objeto se identifica de manera única. El conjunto de datos también incluye mapas de límites que resaltan los bordes entre objetos, que se derivan de las máscaras de segmentación. El sitio web oficial proporciona el conjunto de datos como un único archivo( aproximadamente 1.2 GB) que contiene imágenes, máscaras, y metadatos.

Creación y Metodología

El conjunto de datos fue creado por Hariharan et al. (2011) como parte del grupo de investigación de Berkeley. El proceso de anotación involucró una combinación de segmentación automática y refinamiento manual. Inicialmente, las imágenes se segmentaron usando un algoritmo para proponer regiones candidatas, que luego fueron corregidas manualmente por anotadores usando una interfaz personalizada. Para garantizar la calidad, cada imagen fue anotada por múltiples trabajadores, y los desacuerdos se resolvieron mediante un mecanismo de votación. Las anotaciones finales se validaron contra las etiquetas originales de PASCAL VOC para mantener consistencia. Esta metodología resultó en límites de alta calidad que son más precisos que los del conjunto de datos original de PASCAL VOC, que usaba cajas delimitadoras para la detección de objetos.

Aplicaciones e Impacto

SBD se ha convertido en un estándar de facto para evaluar modelos de segmentación semántica. Se utiliza en numerosos artículos de investigación y competiciones, incluyendo el desafío de segmentación de PASCAL VOC, donde SBD sirve como datos de entrenamiento. El conjunto de datos ha sido instrumental en el avance del aprendizaje profundo para la segmentación, ya que proporciona un corpus lo suficientemente grande para entrenar modelos complejos. Por ejemplo, las arquitecturas FCN( Long et al., 2015) y DeepLab( Chen et al.,, 2017) fueron entrenadas y evaluadas en SBD. Además, SBD se ha utilizado para el aprendizaje por transferencia, donde modelos preentrenados en SBD se ajustan finamente en otros conjuntos de datos como Cityscapes o COCO. El conjunto de datos también apoya la investigación en detección de bordes, donde modelos como HED( Detección de Bordes Anidada Holísticamente) se entrenan con los mapas de límites de SBD.

Limitaciones y Extensiones

A pesar de su utilidad, SBD tiene limitaciones. El conjunto de datos es relativamente pequeño en comparación con conjuntos de datos modernos a gran escala como COCO( con más de 200,000 imágenes) o Open Images. Las imágenes también se limitan a las categorías de PASCAL VOC, que pueden no cubrir todos los escenarios del mundo real. Además, las anotaciones no son tan densas como las de conjuntos de datos más nuevos como Cityscapes, que incluyen más clases e imágenes de mayor resolución. Para abordar estos problemas, los investigadores han extendido SBD combinándolo con otros conjuntos de datos o usando técnicas de aumento de datos. Por ejemplo, SBD se usa a menudo en conjunto con el conjunto de datos PASCAL VOC 2012, donde el conjunto de entrenamiento se aumenta con imágenes de SBD para mejorar el rendimiento del modelo. Adicionalmente, algunos trabajos han creado variaciones sintéticas de SBD para estudios de adaptación de dominio.

Disponibilidad y Uso

SBD está disponible gratuitamente para fines de investigación desde la página oficial del proyecto. El conjunto de datos se distribuye como un archivo ZIP que contiene las imágenes( en formato JPEG), máscaras de segmentación( en PNG,) y una lista de identificadores de imagen para las divisiones de entrenamiento y validación. Los investigadores suelen descargar el conjunto de datos y usarlo con marcos populares de aprendizaje profundo como PyTorch o TensorFlow. El conjunto de datos también está integrado en varias bibliotecas de código abierto, incluyendo torchvision y GluonCV, que proporcionan cargadores de datos integrados. Al usar SBD, es habitual citar el artículo original: "Contornos Semánticos de Detectores Inversos" por Bharath Hariharan, Pablo Arbeláez, Lubomir Bourdev, Subhransu Maji, y Jitendra Malik, presentado en la Conferencia Internacional sobre Visión por Computadora(ICCV) de 2011.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision-datasets·semantic-segmentation·benchmark-datasets
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial