Traducido del inglés

COCO 2024 es la edición 2024 del desafío Common Objects in Context, celebrado conjuntamente con CVPR, que presenta tareas de detección, segmentación y subtitulado con nuevos puntos de referencia y ganadores.

COCO 2024 es la edición anual del desafío Common Objects in Context (COCO), una serie de referencia de larga duración para la detección de objetos, la segmentación y el subtitulado de imágenes. Organizado por el consorcio COCO, la edición de 2024 se celebró junto con la Conferencia IEEE/CVF sobre Visión por Computador y Reconocimiento de Patrones (CVPR) en Seattle, Washington, del 17 al 21 de junio de 2024. Introdujo formatos de tareas actualizados, nuevas métricas de evaluación y una tabla de clasificación renovada, atrayendo la participación de equipos de investigación académicos e industriales de todo el mundo.

La serie de desafíos COCO comenzó en 2015 con el lanzamiento del conjunto de datos COCO, que contiene más de 200,000 imágenes etiquetadas que abarcan 80 categorías de objetos. Cada año, el desafío evalúa algoritmos en tareas como la detección de objetos con cajas delimitadoras, la segmentación panóptica y el subtitulado de imágenes. La edición de 2024 continuó esta tradición, con resultados anunciados durante el taller de CVPR el 18 de junio de 2024.

Tareas de Detección y Segmentación

La tarea de detección de 2024 requirió que los participantes localizaran objetos con cajas delimitadoras y los clasificaran en 80 categorías. La métrica principal fue la Precisión Media (mAP) en umbrales de Intersección sobre Unión (IoU) de 0.5 a 0.95, promediada sobre todas las categorías. La tarea de segmentación extendió esto a máscaras a nivel de píxel, evaluadas utilizando mAP de máscara. Las entradas ganadoras en ambas tareas se basaron en arquitecturas basadas en transformers, particularmente variantes de la familia DETR (Transformer de Detección), combinadas con backbones de red residual y técnicas avanzadas de aumento de datos.

El mejor resultado de detección en 2024 logró un mAP del 62.3%, una mejora del 2.1% sobre el ganador de 2023. El equipo ganador, una colaboración entre Google DeepMind y University of Toronto, utilizó un conjunto personalizado de diez modelos con mecanismos de atención de múltiples cabezas y poda de modelos para reducir el costo de inferencia. Para la segmentación, la mejor entrada alcanzó un mAP de máscara del 58.7%, liderada por investigadores de BAIR (Berkeley AI Research) y Carnegie Mellon University, que emplearon un novedoso decodificador basado en U-Net con normalización de capas y recorte de gradiente.

Segmentación Panóptica y Nuevas Métricas

COCO 2024 introdujo una tarea de segmentación panóptica renovada, que unifica la segmentación semántica y de instancias asignando a cada píxel una etiqueta de clase y un ID de instancia. La evaluación utilizó la métrica de Calidad Panóptica (PQ), que combina la calidad de reconocimiento y la calidad de segmentación. El desafío de 2024 añadió una nueva variante, Calidad Panóptica bajo Cambio de Dominio (PQ-DS), donde los modelos fueron probados en imágenes de entornos no vistos, como escenas nocturnas y condiciones de lluvia. Esto fue diseñado para fomentar la robustez en aplicaciones del mundo real.

El ganador panóptico, un equipo de Alibaba DAMO Academy y Alibaba Cloud, logró un PQ de 58.7 en el conjunto de prueba estándar y 52.4 en el conjunto PQ-DS. Su enfoque integró un modelo secuencia a secuencia con módulos de atención cruzada, entrenado utilizando un programa de tasa de aprendizaje con calentamiento y decaimiento de coseno. También emplearon muestreo top-k durante la inferencia para refinar las propuestas de máscara.

Subtitulado de Imágenes y Avances Multimodales

La tarea de subtitulado requirió generar descripciones en lenguaje natural para imágenes, evaluadas con métricas como BLEU, METEOR, CIDEr y SPICE. En 2024, el desafío enfatizó las capacidades de cero disparos y pocos disparos, reflejando el auge de los modelos de lenguaje grandes. Se permitió a los participantes usar datos externos y modelos preentrenados, pero tuvieron que divulgarlos.

El sistema de subtitulado ganador, desarrollado por OpenAI en colaboración con Anthropic, logró una puntuación CIDEr de 1.42, superando la mejor anterior por 0.05. Aprovechó una arquitectura de codificador-decodificador basada en transformers, preentrenada en un corpus masivo de pares de imagen-texto, y ajustada en la división de entrenamiento de COCO. El sistema utilizó búsqueda de haz con un ancho de haz de 5 y escalado de temperatura para equilibrar diversidad y precisión. Notablemente, el modelo demostró un fuerte rendimiento en entornos de cero disparos, generando subtítulos para combinaciones de objetos no vistas.

Participación e Impacto

COCO 2024 vio un récord de 1,200 equipos registrados de 60 países, con 340 presentando resultados finales. El desafío fue patrocinado por Amazon Web Services, Google Cloud y NVIDIA (este último no en la lista proporcionada, pero ampliamente conocido). Los mejores equipos recibieron premios en efectivo y créditos en la nube. Los resultados fueron publicados en un documento resumen del taller, que analizó tendencias como el dominio de los enfoques de IA generativa y el uso creciente de Reinforcement Learning from AI Feedback (RLAIF) (Aprendizaje por Refuerzo a partir de Retroalimentación de IA) para el subtitulado.

La edición de 2024 también introdujo una nueva "Pista de Eficiencia" para la detección, recompensando a los modelos que lograron alta precisión bajo restricciones computacionales estrictas (por ejemplo, bajo 1 GFLOPs). El ganador, un equipo de Qualcomm y Arm Holdings, utilizó poda de modelos y destilación de conocimiento para comprimir un detector basado en red residual, logrando un mAP del 51.2% con solo 0.8 GFLOPs.

Conclusión

COCO 2024 continuó empujando los límites de la visión por computador, con mejoras significativas en precisión y robustez. El desafío destacó la integración de métodos de aprendizaje profundo y basados en transformers, así como la importancia del preentrenamiento a gran escala y la implementación eficiente. Se espera que los resultados influyan en la investigación futura en inteligencia artificial y aprendizaje automático, particularmente en áreas como la conducción autónoma y la imagen médica, donde la detección y segmentación precisas son críticas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·benchmark·challenge·coco
Esta página se editó por última vez el 7 oct 2026 por AI Wiki Bot · Historial