Traducido del inglés

La detección COCO es una tarea de referencia para la detección de objetos que utiliza el conjunto de datos COCO, que requiere que los modelos localicen y clasifiquen 80 categorías de objetos mediante cuadros delimitadores y evalúen utilizando la precisión media promedio (mAP).

La detección COCO es una tarea de referencia en visión por computadora que evalúa la capacidad de un modelo de detección de objetos para identificar y localizar objetos dentro de una imagen. La tarea está definida por el conjunto de datos Common Objects in Context (COCO), que contiene más de 200,000 imágenes con más de 1.5 millones de instancias de objetos anotadas con cajas delimitadoras y etiquetas de categoría. La tarea de detección requiere específicamente que un modelo genere una caja delimitadora y una etiqueta de clase para cada instancia de objeto de las 80 categorías definidas presentes en una imagen. Es uno de los puntos de referencia más utilizados para medir el progreso en la detección de objetos, junto con tareas como la segmentación de instancias y la detección de puntos clave que utilizan el mismo conjunto de datos subyacente.

La métrica de evaluación del punto de referencia es la precisión media promedio (mAP), calculada en múltiples umbrales de Intersección sobre Unión (IoU). La métrica principal, a menudo denotada como mAP@[0.5:0.95], promedia la precisión a través de umbrales de IoU desde 0.5 hasta 0.95 en pasos de 0.05. Esta métrica estricta recompensa la localización precisa, no solo la detección aproximada. El desafío de detección COCO ha sido un motor central de innovación en arquitecturas de detección basadas en aprendizaje profundo desde su introducción en 2015, con tablas de clasificación que rastrean la rápida mejora desde los primeros modelos convolucionales hasta los detectores modernos basados en transformadores.

Conjunto de Datos y Anotación

El conjunto de datos COCO fue lanzado por primera vez en 2014 por un equipo de Microsoft Research, liderado por Tsung-Yi Lin y otros. Fue diseñado para abordar las limitaciones de conjuntos de datos anteriores como PASCAL VOC al incluir más objetos por imagen, objetos más pequeños y escenas más complejas con relaciones contextuales. Las 80 categorías de objetos abarcan artículos cotidianos como persona, bicicleta, automóvil, perro y taza, así como clases más específicas como semáforo, hidrante y tabla de snowboard. Las anotaciones se proporcionan como cajas delimitadoras alineadas con los ejes, donde cada caja se define por sus coordenadas de esquina superior izquierda, ancho y alto. El conjunto de datos se divide en conjuntos de entrenamiento (aproximadamente 118,000 imágenes), validación (5,000 imágenes) y prueba, con las anotaciones del conjunto de prueba retenidas para la evaluación del desafío.

Evolución de los Modelos de Detección

Los primeros enfoques de última generación en la detección COCO dependían de detectores de dos etapas, notablemente la familia Faster R-CNN introducida por Shaoqing Ren, Kaiming He y colegas en 2015. Estos modelos primero proponen regiones candidatas utilizando una Red de Propuesta de Regiones, luego clasifican y refinan cada propuesta. La introducción de la arquitectura ResNet en 2015 proporcionó una columna vertebral que mejoró significativamente la extracción de características, elevando la mAP de COCO de alrededor del 21% a más del 37% para 2017. Los detectores de una etapa como YOLO y SSD ofrecieron ventajas de velocidad pero inicialmente quedaron rezagados en precisión. La adopción de Redes de Pirámides de Características (FPN) en 2017 permitió la fusión de características multiescala, reduciendo la brecha. Para 2018, modelos como Mask R-CNN, una extensión de Faster R-CNN, lograron una mAP superior al 39% mientras también realizaban segmentación de instancias.

Detectores Basados en Transformadores

Un cambio importante ocurrió en 2020 con la introducción del Transformador de Detección (DETR) por un equipo de Meta AI (entonces Facebook AI Research). DETR reformuló la detección de objetos como un problema de predicción de conjuntos, utilizando una arquitectura de codificador-decodificador Transformador y una pérdida de emparejamiento bipartito para generar directamente un número fijo de predicciones. Esto eliminó la necesidad de componentes diseñados a mano como cajas ancla y supresión no máxima. Aunque DETR inicialmente tuvo una convergencia más lenta, variantes posteriores como Deformable DETR (2021) mejoraron la eficiencia de entrenamiento y la precisión. Para 2023, los detectores basados en transformadores como DINO y RT-DETR superaron consistentemente a sus contrapartes convolucionales en el punto de referencia COCO, logrando valores de mAP superiores al 50% en el conjunto test-dev. Estos modelos aprovechan mecanismos de atención de múltiples cabezas para capturar el contexto global, lo cual es particularmente beneficioso para detectar objetos pequeños y ocluidos.

Entrenamiento y Aumento de Datos

Lograr un alto rendimiento en la detección COCO requiere estrategias de entrenamiento cuidadosas. La práctica estándar implica inicializar la columna vertebral con pesos preentrenados en ImageNet, luego ajustar finamente en COCO. El aumento de datos juega un papel crítico; las técnicas comunes incluyen volteo horizontal aleatorio, escalado aleatorio y perturbación de color. Métodos más avanzados como Mosaic y MixUp, popularizados por YOLOv4, combinan múltiples imágenes para mejorar la robustez. El entrenamiento típicamente utiliza el optimizador Adam o SGD con un programa de tasa de aprendizaje que incluye calentamiento y decaimiento coseno. La normalización por lotes es estándar en columnas vertebrales convolucionales, mientras que la normalización de capas se usa en cabezas basadas en transformadores. El proceso de entrenamiento es computacionalmente intensivo, a menudo requiriendo múltiples GPUs durante varios días. Por ejemplo, un modelo DETR típico entrenado en 8 GPUs V100 toma alrededor de 3 días para converger.

Impacto y Puntos de Referencia Relacionados

La detección COCO se ha convertido en el estándar de facto para evaluar la investigación en detección de objetos, con miles de artículos reportando resultados en su conjunto de validación. Su influencia se extiende a tareas relacionadas: el mismo conjunto de datos soporta segmentación de instancias (segmentación COCO), detección de puntos clave (puntos clave COCO) y segmentación panóptica. El punto de referencia también ha impulsado aplicaciones práticas en campos como conducción autónoma, robótica y imageneología médica, donde la localización precisa es crítica. La comunidád de aprendizaje automático continúa usándo COCO como punto de referencia, aunque conjuntos de datos más nuevos como LVIS y Objects365 ofrecen más categorías o mayor escala. El desafío permanece activo, con talleres anuales en conferencias principales como CVPR y ECCV, y la tabla de clasificación es un objetivo común tanto para equipos de investigación académica como industrial.

Limitaciones y Críticas

A pesar de su popularidád, la detección COCO tiene limitaciones conocidas. Las 80 categorías son fijas y no cubren muchos objetos del mundo real, y el conjunto de datos tiene un sesgo hacia objetos bien centrados y claramente visibles. La métrica mAP puede ser sensible a pequeños cambios en los umbrales de confianza, y las anotaciones del conjunto de prueba no son públicas, lo que puede llevar a un sobreajuste en el conjunto de validación. Algunos investigadores han notado que el rendimiento en COCO no siempre se traduce a otros dominios, como imágenes aéreas o subacuáticas. Adicionalmente, el punto de referencia no mide explícitamente la velocidad de inferencia o el costo computacional, aunque muchos artículos reportan estos por separado. Estos problemas han motivado la creación de puntos de referencia alternativos como Open Images y el más reciente EgoObjects, que buscan abordar algunas de estas brechas.

Véase También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·object-detection·benchmark·dataset
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial