COCO Instance Segmentation es una tarea de referencia en visión por computadora definida por el conjunto de datos Microsoft COCO (Common Objects in Context). El objetivo es detectar cada instancia de un objeto en una imagen y producir una máscara a nivel de píxel que delinee con precisión cada instancia, distinguiendo entre objetos separados de la misma clase. La tarea cubre 80 clases de "cosas", que son objetos contables como persona, coche y perro, en oposición a clases de "material" como cielo o hierba. Se utiliza ampliamente para evaluar el rendimiento de los modelos de aprendizaje profundo en tareas que requieren tanto localización como comprensión espacial de grano fino.
El conjunto de datos COCO se publicó por primera vez en 2014 por un equipo de Microsoft, con las anotaciones de segmentación de instancias añadidas en la versión de 2015. El conjunto de datos contiene más de 200,000 imágenes, con más de 1.5 millones de instancias de objetos etiquetadas con polígonos que definen sus límites. La métrica de evaluación oficial es la Precisión Promedio (AP) promediada sobre umbrales de Intersección sobre Unión (IoU) de 0.5 a 0.95 en pasos de 0.05, con métricas adicionales para objetos pequeños, medianos y grandes. Esta métrica, a menudo llamada COCO AP, se ha convertido en el estándar de facto para comparar modelos de segmentación de instancias.
Evolución de los Modelos
Los primeros enfoques para la segmentación de instancias se basaron en marcos de detección de objetos. La arquitectura Mask R-CNN, introducida en 2017 por Kaiming He y colegas de Facebook AI Research, extendió el detector Faster R-CNN añadiendo una rama que predice máscaras de segmentación en paralelo con la regresión de cajas delimitadoras. Mask R-CNN logró mejoras significativas sobre métodos anteriores y estableció una línea base sólida, alcanzando alrededor de 35 AP en el conjunto de prueba COCO. Su éxito popularizó el uso de backbones de ResNet con Redes de Pirámides de Características para la extracción de características a múltiples escalas.
Los modelos posteriores mejoraron la precisión y la eficiencia. YOLACT, introducido en 2019, propuso un enfoque en tiempo real que genera máscaras prototipo y las combina con coeficientes por instancia, logrando una inferencia más rápida a costa de cierta precisión. En 2020, la variante Cascade Mask R-CNN mejoró la AP aplicando una cascada de detectores. El modelo DETR, introducido en 2020 por Facebook AI, utilizó una arquitectura de codificador-decodificador transformador para tratar la detección de objetos como un problema de predicción de conjuntos, eliminando componentes hechos a mano como cajas ancla y supresión de no máximos. DETR y sus sucesores, como Mask2Former (2021), unificaron las tareas de segmentación de instancias, panóptica y semántica bajo un marco único de clasificación de máscaras.
Evaluación y Métricas
La métrica principal para la segmentación de instancias COCO es la Precisión Promedio (AP), calculada ordenando todas las máscaras predichas por confianza y midiendo la precisión y el recuerdo en varios umbrales de IoU. La evaluación oficial de COCO también reporta la AP en IoU 0.50 y 0.75 por separado, así como la AP para diferentes tamaños de objetos: pequeños (área menor de 32^2 píxeles), medianos (entre 32^2 y 96^2) y grandes (mayor de 96^2). El desafío también rastrea el Recuerdo Promedio (AR) con un número fijo de detecciones por imagen. Estas métricas permiten comparaciones matizadas, ya que los modelos pueden sobresalir en la detección de objetos grandes mientras luchan con los pequeños.
El conjunto de prueba-dev de COCO se utiliza para el desafío anual, pero los investigadores a menudo reportan resultados en el conjunto de validación (val2017) para una iteración más rápida. El conjunto de datos se divide en train2017 (aproximadamente 118,000 imágenes) y val2017 (5,000 imágenes). El servidor de evaluación oficial garantiza una evaluación consistente, pero muchos artículos también utilizan la biblioteca pycocotools localmente para calcular métricas.
Aplicaciones e Impacto
La segmentación de instancias es crítica para aplicaciones que requieren límites de objetos precisos, como la conducción autónoma, la robótica, la imagen médica y la realidad aumentada. En conducción autónoma, segmentar peatones, vehículos y objetos de la carretera ayuda a los sistemas de percepción a comprender escenas. En robótica, las máscaras a nivel de píxel permiten agarrar y manipular objetos específicos. El punto de referencia COCO ha impulsado un progreso rápido en estas áreas, con modelos de última generación mejorando de alrededor de 35 AP en 2017 a más de 60 AP para 2024, en gran parte debido a avances en arquitecturas de redes neuronales, técnicas de aumento de datos y estrategias de entrenamiento.
La tarea también sirve como base para problemas relacionados. La segmentación panóptica combina la segmentación de instancias y semántica, requiriendo que los modelos etiqueten cada píxel con tanto una clase como un ID de instancia. El conjunto de datos COCO se ha extendido para incluir anotaciones panópticas, y modelos como Mask2Former manejan ambas tareas. Además, la segmentación de instancias se utiliza en modelos generativos para la edición de imágenes, donde las máscaras precisas permiten modificaciones dirigidas.
Desafíos y Limitaciones
A pesar del progreso, la segmentación de instancias COCO sigue siendo desafiante. Los objetos pequeños son particularmente difíciles debido a la información de píxeles limitada, y las instancias ocluidas o superpuestas pueden confundir a los modelos. Las 80 clases de cosas están desequilibradas, con clases comunes como persona y coche dominando, mientras que clases raras como secador de pelo y cepillo de dientes tienen pocos ejemplos. El conjunto de datos también tiene sesgos, como un predominio de imágenes de contextos occidentales, lo que puede afectar la generalización del modelo. A partir de 2025, los investigadores continúan abordando estos problemas a través de mejores funciones de pérdida, poda de modelos para eficiencia y el desarrollo de conjuntos de datos más grandes y diversos.
Otra limitación es el alto costo computacional de entrenar modelos de última generación, que a menudo requieren múltiples GPUs y días de entrenamiento. Esto ha llevado a un interés en arquitecturas eficientes y técnicas de poda. El punto de referencia COCO sigue siendo una herramienta clave para medir el progreso, pero algunos argumentan que se está saturando, lo que ha llevado a la creación de puntos de referencia más desafiantes como LVIS (Large Vocabulary Instance Segmentation), que tiene más de 1,200 clases.
Véase También
- U-Net - una arquitectura popular para segmentación semántica
- Aumento de Datos - técnicas utilizadas para mejorar la generalización del modelo
- Redes Residuales - arquitecturas de backbone comúnmente utilizadas en modelos de segmentación
- Funciones de Pérdida - incluyendo pérdida de máscara y pérdida de caja delimitadora