OK-VQA (Outside Knowledge Visual Question Answering) es un conjunto de datos de referencia para evaluar sistemas de respuesta a preguntas visuales (VQA). A diferencia de conjuntos de datos VQA anteriores que se centran en preguntas respondibles solo a partir de la imagen, OK-VQA requiere específicamente que los modelos incorporen conocimiento externo sobre objetos, escenas y conceptos cotidianos para producir respuestas correctas. El conjunto de datos fue introducido en 2019 por investigadores del Instituto de Tecnología de Georgia, incluyendo a Kenneth Marino, Mohammad Rastegari, Ali Farhadi y Roozbeh Mottaghi, y desde entonces se ha convertido en un banco de pruebas estándar para estudiar modelos de visión y lenguaje aumentados con conocimiento.
El punto de referencia comprende 14,031 preguntas emparejadas con 14,031 imágenes, donde cada imagen tiene exactamente una pregunta. Las preguntas están diseñadas para ser inequívocas y requieren conocimiento externo que no está presente visualmente. Por ejemplo, una pregunta podría ser "¿Qué tipo de animal es este?" cuando la imagen muestra una criatura parcialmente oculta, o "¿Cuál es el propósito de esta herramienta?" para un objeto desconocido. El conjunto de datos cubre una amplia gama de dominios de conocimiento, incluyendo alimentos, animales, vehículos, deportes y artículos del hogar, asegurando diversidad y desafiando a los modelos a razonar sobre el contexto del mundo real.
Construcción y Anotación
OK-VQA se construyó mediante crowdsourcing de preguntas de trabajadores de Amazon Mechanical Turk. El proceso de anotación implicaba mostrar a los trabajadores una imagen y pedirles que generaran una pregunta que no pudiera responderse solo mirando la imagen, sino que requiriera sentido común o conocimiento factual. Para garantizar la calidad, cada pregunta fue validada por múltiples anotadores, y solo se retuvieron aquellas con alto acuerdo entre anotadores. El conjunto de datos final se dividió en conjuntos de entrenamiento (9,009 preguntas), validación (2,016 preguntas) y prueba (3,006 preguntas). El conjunto de prueba se utiliza para la evaluación oficial a través de un servidor en línea, con la precisión como métrica principal.
Evaluación y Métricas
La métrica de evaluación estándar para OK-VQA es la precisión de coincidencia exacta, donde la respuesta predicha por un modelo se considera correcta si coincide exactamente con una de las respuestas de referencia. Cada pregunta tiene 10 respuestas de referencia proporcionadas por diferentes anotadores, y una predicción se puntúa como correcta si coincide con cualquiera de ellas. Este enfoque tiene en cuenta la variabilidad en cómo los humanos formulan las respuestas. Los modelos se evalúan típicamente en el conjunto de prueba, pero los investigadores a menudo usan el conjunto de validación para el desarrollo y el ajuste de hiperparámetros.
Desafíos y Limitaciones
OK-VQA plantea varios desafíos para los sistemas de IA. Primero, requiere integrar información visual con una amplia base de conocimiento del mundo, lo cual es difícil para modelos entrenados principalmente en pares de imagen y texto. Segundo, muchas preguntas son ambiguas o requieren razonar sobre contexto implícito, como comprender prácticas culturales o propiedades físicas. Tercero, el conjunto de datos ha sido criticado por contener algunas preguntas que son respondibles solo a partir de la imagen a pesar de la intención del diseño, y por tener un tamaño relativamente pequeño en comparación con otros puntos de referencia VQA. Además, la métrica de coincidencia exacta puede ser severa, penalizando respuestas semánticamente correctas pero con diferente redacción.
Impacto y Uso
OK-VQA se ha convertido en un punto de referencia ampliamente utilizado en los campos de aprendizaje automático y visión por computadora. Ha sido adoptado por investigadores para evaluar modelos que combinan codificadores visuales con modelos de lenguaje grandes, a menudo usando técnicas como atención cruzada para fusionar representaciones de imagen y texto. Muchos modelos de visión y lenguaje de última generación, incluidos aquellos basados en arquitecturas transformador, reportan el rendimiento en OK-VQA como un indicador clave de su capacidad para realizar razonamiento basado en conocimiento. El conjunto de datos también ha impulsado el desarrollo de métodos especializados para la recuperación e integración de conocimiento, como incorporar bases de conocimiento externas o usar técnicas de aumento de datos para mejorar la generalización.
Puntos de Referencia Relacionados
OK-VQA es parte de una familia más amplia de puntos de referencia VQA. El conjunto de datos VQA original, introducido en 2015, se centra en preguntas respondibles a partir del contenido de la imagen. Otros puntos de referencia relacionados incluyen Visual Genome, que enfatiza relaciones y atributos, y GQA, que prueba razonamiento composicional. Puntos de referencia más recientes como A-OKVQA extienden OK-VQA proporcionando opciones de respuesta adicionales y anotaciones de razonamiento. OK-VQA sigue siendo distintivo en su enfoque explícito en conocimiento externo, lo que lo convierte en un recurso único para estudiar la intersección de percepción y razonamiento en IA.