VQA 1.0 es el primer conjunto de datos y punto de referencia a gran escala para la respuesta a preguntas visuales (VQA), una tarea que requiere que un sistema de inteligencia artificial responda preguntas abiertas sobre imágenes. Introducido en 2015 por investigadores de Virginia Tech y Microsoft, se convirtió en el conjunto de evaluación estándar para el campo, impulsando el progreso en la combinación de visión por computador y procesamiento del lenguaje natural. El conjunto de datos comprende fotografías reales con preguntas y respuestas anotadas por humanos, diseñadas para probar la capacidad de un modelo para razonar sobre el contenido visual y el lenguaje.
La creación de VQA 1.0 estuvo motivada por el objetivo de desarrollar sistemas de inteligencia artificial que puedan interactuar con el mundo visual de manera similar a los humanos. A diferencia de tareas anteriores como el subtitulado de imágenes, que genera una única frase descriptiva, VQA requiere responder preguntas específicas, lo que exige una comprensión y un razonamiento más profundos. El diseño del conjunto de datos anima a los modelos a manejar una variedad de tipos de preguntas, incluyendo sí/no, conteo y consultas abiertas, y a fundamentar sus respuestas en evidencia visual.
Estructura y estadísticas del conjunto de datos
VQA 1.0 consta de 204,721 imágenes del conjunto de datos Microsoft COCO, junto con 614,163 preguntas y 6,141,630 respuestas. Cada imagen está asociada con aproximadamente tres preguntas, y cada pregunta tiene diez respuestas de referencia proporcionadas por diferentes anotadores humanos. Las preguntas son abiertas y cubren categorías como objetos, colores, conteo y relaciones espaciales. El conjunto de datos se divide en conjuntos de entrenamiento (82,783 imágenes), validación (40,504 imágenes) y prueba (81,434 imágenes), y el conjunto de prueba se subdivide en test-dev y test-standard para la evaluación.
Definición de la tarea y evaluación
En VQA, un modelo recibe una imagen y una pregunta en lenguaje natural, y debe producir una respuesta concisa. La métrica de evaluación es la precisión, calculada comparando la respuesta del modelo con las diez respuestas humanas. La respuesta de un modelo se considera correcta si al menos tres de las diez respuestas humanas coinciden exactamente con ella. Esta métrica, conocida como precisión VQA, fue diseñada para tener en cuenta la variabilidad humana en la redacción. El punto de referencia también proporciona un conjunto de desgloses por 'tipo de pregunta', lo que permite a los investigadores analizar el rendimiento en categorías específicas como 'qué color' o 'cuántos'.
Modelos de referencia y progreso inicial
Los puntos de referencia iniciales para VQA 1.0 incluían enfoques simples como la recuperación del vecino más cercano y un modelo 'previo' que siempre predice la respuesta más común para un tipo de pregunta dado. Estos puntos de referencia lograron precisiones de alrededor del 30-40%. Los primeros modelos neuronales, que combinaban redes neuronales convolucionales para características de imagen con redes neuronales recurrentes para la codificación de preguntas, mejoraron el rendimiento hasta aproximadamente el 55-60%. Estos primeros sistemas utilizaban redes LSTM y incrustaciones de palabras para procesar preguntas, y extraían características de imagen de una red VGG preentrenada. La brecha entre el rendimiento humano (alrededor del 83%) y el rendimiento de las máquinas destacó la dificultad de la tarea.
Impacto y legado
VQA 1.0 estableció la tarea VQA como un desafío central en inteligencia artificial, impulsando el desarrollo de numerosos conjuntos de datos y modelos posteriores. Condujo a la creación de VQA 2.0, que equilibró la distribución de respuestas para reducir los sesgos lingüísticos, y Visual Genome, que añadió anotaciones a nivel de región. El conjunto de datos también influyó en el diseño de puntos de referencia posteriores como GQA y CLEVR, que se centran en el razonamiento composicional. VQA 1.0 sigue siendo un punto de referencia para evaluar las capacidades de razonamiento visual, y su metodología ha sido adoptada en muchos puntos de referencia multimodales posteriores.
El lanzamiento de VQA 1.0 coincidió con el auge del aprendizaje profundo y la arquitectura transformer, que más tarde se volvió dominante en los modelos multimodales. Los sistemas modernos, como los basados en grandes modelos de lenguaje con codificadores visuales, ahora logran un rendimiento casi humano en VQA 1.0, pero el legado del conjunto de datos reside en su papel como catalizador para la investigación en razonamiento visual y comprensión del lenguaje fundamentado.
Véase también
- Respuesta a preguntas visuales
- Microsoft COCO
- Subtitulado de imágenes
- Aprendizaje multimodal