Traducido del inglés

LVIS (Large Vocabulary Instance Segmentation) es un conjunto de datos para el reconocimiento visual de cola larga, que contiene más de 2 millones de máscaras de segmentación de instancias de alta calidad en 1,203 categorías de objetos, diseñado para evaluar y mejorar los modelos de IA en objetos raros y comunes.

LVIS, sigla de Large Vocabulary Instance Segmentation, es un conjunto de datos utilizado en visión por computadora y Machine learning para evaluar y entrenar modelos de segmentación de instancias y detección de objetos. Fue introducido en 2019 por investigadores de Facebook AI Research (ahora parte de Meta AI) para abordar el desafío del reconocimiento visual de cola larga, donde la mayoría de las categorías de objetos en el mundo real son raras, mientras que los conjuntos de datos estándar se centraban en un pequeño grupo de clases comunes. LVIS proporciona un amplio vocabulario de 1.203 categorías de objetos, que van desde elementos cotidianos como 'plátano' hasta objetos especializados como 'cráneo de triceratops', con más de dos millones de máscaras de segmentación de instancias de alta calidad anotadas en aproximadamente 164.000 imágenes procedentes del conjunto de datos COCO. El diseño del conjunto de datos enfatiza la anotación exhaustiva, lo que significa que los anotadores debían etiquetar cada instancia de cada categoría presente en una imagen, a diferencia de conjuntos de datos anteriores que a menudo ignoraban objetos raros. Esto convierte a LVIS en un punto de referencia riguroso para modelos de Deep learning, particularmente para medir el rendimiento en categorías raras, y ha impulsado la investigación en técnicas como la pérdida federada y el recorte de gradiente dinámico para mitigar el efecto de cola larga.

La creación de LVIS estuvo motivada por la observación de que los datos visuales del mundo real siguen una distribución de ley de potencia, donde unas pocas categorías (por ejemplo, 'persona', 'coche') aparecen con frecuencia, mientras que miles de otras aparecen solo ocasionalmente. Los conjuntos de datos tradicionales como COCO o ImageNet tenían un número limitado de categorías o no proporcionaban máscaras a nivel de píxel para todas las instancias, lo que limitaba su utilidad para el reconocimiento de grano fino. LVIS se construyó reanotando un subconjunto de imágenes de COCO con un conjunto de categorías mucho más amplio, utilizando un proceso de anotación colaborativo que implicaba dos fases: primero, una fase de 'descubrimiento' en la que los anotadores identificaban todos los objetos en una imagen, y segundo, una fase de 'verificación' para garantizar la exhaustividad y precisión. El conjunto de datos final incluye 1.203 categorías, divididas en tres grupos de frecuencia: frecuentes (más de 100 imágenes), comunes (10-100 imágenes) y raras (menos de 10 imágenes), con aproximadamente el 77% de las categorías en el grupo raro. Este desequilibrio es intencional, ya que refleja las condiciones del mundo real y obliga a los modelos a generalizar más allá de las categorías principales.

Estructura y anotación del conjunto de datos

LVIS se basa en el conjunto de datos COCO, utilizando 164.000 de sus imágenes de entrenamiento y validación, pero con un vocabulario de categorías significativamente ampliado. Cada imagen está anotada con máscaras de segmentación a nivel de instancia, lo que significa que cada objeto individual está delineado a nivel de píxel, no solo delimitado por un cuadro delimitador. El proceso de anotación fue diseñado para ser exhaustivo: los anotadores debían etiquetar todas las instancias de todas las categorías presentes, incluso si eran pequeñas, estaban ocluidas o borrosas. Esta es una diferencia clave con respecto a COCO, que solo requería anotar 80 categorías y a menudo omitía objetos raros. El conjunto de datos proporciona un archivo JSON con anotaciones en un formato similar al de COCO, que incluye campos para ID de imagen, ID de categoría, polígonos de segmentación y cuadros delimitadores. La lista de categorías se seleccionó combinando synsets de WordNet y selección manual, garantizando una amplia cobertura de objetos cotidianos, animales, alimentos y herramientas.

Punto de referencia y métricas de evaluación

La métrica de evaluación principal para LVIS es la precisión promedio media (AP) estándar al estilo COCO, calculada en múltiples umbrales de Intersección sobre Unión (IoU) (0,5 a 0,95). Sin embargo, LVIS introduce un giro crítico: la AP se informa por separado para los tres grupos de frecuencia (raro, común, frecuente), y la AP general es el promedio de estas tres AP de grupo, en lugar de un simple promedio sobre todas las categorías. Esta AP 'equilibrada' garantiza que el rendimiento en categorías raras no se vea eclipsado por las comunes, lo que la convierte en una medida más sensible de la generalización de cola larga. Por ejemplo, un modelo que funciona bien en 'persona' pero mal en 'abacus' obtendrá una puntuación más baja en LVIS que en COCO. El punto de referencia también incluye una 'AP de máscara' para segmentación de instancias y una 'AP de caja' para detección, centrándose la tabla de clasificación principal en la AP de máscara. Desde su publicación, LVIS se ha utilizado en varios desafíos, incluido el Desafío LVIS en ICCV 2019 y talleres posteriores, donde las mejores propuestas han empleado técnicas como muestreo equilibrado por clases, pérdidas reponderadas y el uso de backbones más grandes basados en Transformer (architecture).

Impacto en el aprendizaje de cola larga

LVIS se ha convertido en un banco de pruebas estándar para el aprendizaje de cola larga, un subcampo de la Artificial intelligence que se ocupa de entrenar modelos con datos desequilibrados. El diseño del conjunto de datos ha impulsado numerosas innovaciones algorítmicas. Un ejemplo notable es la 'pérdida federada' propuesta por los autores de LVIS, que agrupa categorías en conjuntos 'federados' según su frecuencia y calcula un softmax sobre cada grupo, evitando que las categorías raras se vean abrumadas por las frecuentes en la función de pérdida. Otra es el 'recorte de gradiente dinámico', que ajusta la magnitud del gradiente para categorías raras durante el entrenamiento. Trabajos posteriores han explorado el entrenamiento desconectado (primero aprender características, luego ajustar el clasificador), la aumentación de datos para clases raras y el uso de arquitecturas Neural network con mejor extracción de características. LVIS también ha influido en otros conjuntos de datos, como Open Images y Objects365, que adoptaron estrategias de anotación exhaustivas similares. En 2025, LVIS sigue siendo un punto de referencia ampliamente citado, con más de 1.000 citas en la literatura académica, y se utiliza a menudo junto con modelos de visión y lenguaje basados en Large language model para probar sus capacidades de reconocimiento de disparo cero o de pocos disparos en objetos raros.

Conjuntos de datos relacionados y extensiones

LVIS ha generado varias extensiones y esfuerzos relacionados. El Desafío LVIS incluye un conjunto de validación de 20.000 imágenes y un conjunto de prueba, con anotaciones para las mismas 1.203 categorías. En 2020, los autores publicaron LVIS v1.0, que corrigió errores de anotación y amplió el conjunto de entrenamiento a 100.000 imágenes (desde las 57.000 originales), mejorando la consistencia. Se introdujo una variante llamada LVIS-OW (Open World) para la segmentación de instancias en mundo abierto, donde los modelos deben identificar objetos desconocidos. Además, LVIS se ha integrado en el marco Detectron2, lo que facilita a los investigadores entrenar y evaluar modelos. La lista de categorías del conjunto de datos también se ha utilizado en otras tareas, como la segmentación panóptica y la segmentación de instancias en video, donde sirve como vocabulario común. A pesar de su éxito, LVIS tiene limitaciones: se deriva de imágenes de COCO, que están sesgadas hacia fotos web, y su conjunto de categorías, aunque amplio, sigue siendo finito. Conjuntos de datos futuros, como los del proyecto Ego4D, se han basado en los principios de LVIS para crear puntos de referencia aún más diversos.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·dataset·long-tail-recognition·instance-segmentation
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial