Sherlock es un conjunto de datos y punto de referencia a gran escala para el razonamiento de sentido común visual, introducido en 2020 por investigadores de la Universidad de Carolina del Norte en Chapel Hill y el Instituto Allen de Inteligencia Artificial. El conjunto de datos comprende más de 103,000 pares de preguntas y respuestas derivados de aproximadamente 21,000 imágenes provenientes del proyecto Visual Genome, con cada pregunta diseñada para requerir conocimiento de sentido común más allá del simple reconocimiento de objetos. Sherlock fue creado para abordar una brecha en los puntos de referencia de respuesta a preguntas visuales (VQA), que a menudo se centran en descripciones literales de escenas en lugar del conocimiento implícito y cotidiano que los humanos utilizan para interpretar imágenes.
El conjunto de datos está estructurado en torno a dos tareas complementarias: una tarea de respuesta a preguntas de opción múltiple y una tarea de generación de justificaciones. En la tarea de opción múltiple, los modelos deben seleccionar la respuesta correcta entre cuatro opciones, donde la respuesta correcta requiere inferir propiedades o relaciones no declaradas, como predecir que una persona que sostiene una tabla de surf probablemente esté cerca de una playa. La tarea de generación de justificaciones pide a los modelos producir una explicación en forma libre de por qué una respuesta dada es correcta, alentando a los modelos a articular el razonamiento de sentido común detrás de sus predicciones. Esta estructura dual hace de Sherlock una prueba rigurosa tanto de las capacidades de reconocimiento como de razonamiento.
Construcción y Anotación
Sherlock se construyó utilizando un proceso de crowdsourcing en dos etapas. Primero, se mostraron imágenes de Visual Genome a los anotadores y se les pidió que escribieran preguntas que no pudieran responderse simplemente enumerando objetos o atributos visibles, sino que requirieran inferencia de sentido común. Por ejemplo, una pregunta podría ser: "¿Por qué la persona lleva un casco?" cuando el casco es visible pero la razón (por ejemplo, andar en motocicleta) no lo es. Segundo, cada pregunta se emparejó con cuatro opciones de respuesta, una correcta y tres distractores plausibles, y los anotadores también escribieron una breve justificación explicando la respuesta correcta. El conjunto de datos final contiene 103,302 preguntas, con una división de entrenamiento/prueba de aproximadamente 80/20, y cada imagen está asociada con un promedio de cinco preguntas.
Para garantizar la calidad, el proceso de anotación incluyó múltiples rondas de revisión y filtrado. Se descartaron preguntas que eran ambiguas, requerían conocimiento factual externo (como eventos históricos específicos) o tenían múltiples respuestas plausibles. El conjunto de datos resultante enfatiza el sentido común universal y cotidiano, como entender que una persona que sostiene un paraguas probablemente espera lluvia o que un cuchillo de cocina se usa para cortar alimentos.
Evaluación y Métricas
Los modelos se evalúan en dos métricas principales: precisión en la tarea de opción múltiple y calidad de las justificaciones generadas. Para la tarea de opción múltiple, la precisión es simplemente el porcentaje de preguntas respondidas correctamente. Para la generación de justificaciones, el artículo original utilizó puntuaciones BLEU, aunque trabajos posteriores a menudo han empleado métricas más robustas como ROUGE o evaluación humana. El punto de referencia está diseñado para ser desafiante para los modelos contemporáneos; en el artículo original, un modelo fuerte de respuesta a preguntas visuales basado en una Residual Network (ResNet) y mecanismos de atención logró una precisión de alrededor del 55%, en comparación con un rendimiento humano de aproximadamente el 90% en un subconjunto muestreado. Esta brecha significativa destacó la dificultad del razonamiento de sentido común visual y motivó investigaciones adicionales.
Importancia e Impacto
Sherlock se ha convertido en un punto de referencia estándar en los campos de Computer vision y Natural language processing, particularmente para la investigación en la intersección de visión y lenguaje. Se ha utilizado para evaluar numerosos modelos, incluidos aquellos basados en arquitecturas Transformer (architecture) y Large language models. El énfasis del conjunto de datos en el razonamiento sobre el reconocimiento simple ha influido en puntos de referencia posteriores, como VCR (Razonamiento de Sentido Común Visual) y OK-VQA, que requieren de manera similar conocimiento externo. Sherlock también contribuyó al desarrollo de métodos para generar explicaciones en tareas de visión y lenguaje, un área de creciente interés para la interpretabilidad y la confianza en sistemas de Artificial intelligence.
El conjunto de datos ha sido particularmente útil para estudiar las limitaciones de los modelos de Deep learning. Por ejemplo, los análisis han mostrado que los modelos a menudo dependen de regularidades estadísticas en las opciones de respuesta en lugar de un razonamiento verdadero, y que tienen dificultades con preguntas que requieren inferencia espacial o temporal. Esto ha estimulado la investigación en técnicas de entrenamiento más robustas, incluido el Curriculum Learning y la Data Augmentation, así como la integración de bases de conocimiento externas.
Limitaciones y Críticas
A pesar de su influencia, Sherlock ha sido criticado por varias razones. El uso de BLEU para la evaluación de justificaciones se sabe que se correlaciona mal con el juicio humano, lo que lleva a puntuaciones engañosamente bajas para justificaciones válidas pero redactadas de manera diferente. Además, la dependencia del conjunto de datos en imágenes de Visual Genome introduce sesgos, como una sobrerrepresentación de objetos comunes y escenas de contextos urbanos occidentales, lo que puede limitar la generalización de los modelos entrenados en él. Algunos investigadores también han señalado que el formato de opción múltiple puede ser explotado por modelos que aprovechan señales lingüísticas sutiles en las opciones de respuesta, un problema común a muchos puntos de referencia de VQA. Estas limitaciones han provocado llamados a conjuntos de datos más diversos y construidos de manera adversarial.
Legado y Direcciones Futuras
Sherlock sigue siendo un recurso ampliamente citado en la comunidad de visión y lenguaje y a menudo se utiliza como objetivo de preentrenamiento o evaluación para modelos que buscan combinar la comprensión visual y textual. Su diseño ha inspirado conjuntos de datos posteriores que se centran en tipos específicos de sentido común, como el razonamiento físico o las interacciones sociales. A mediados de la década de 2020, los modelos de última generación, incluidos aquellos construidos sobre arquitecturas Transformer (architecture) y entrenados en corpus multimodales masivos, han logrado una precisión significativamente mayor en Sherlock, con algunos superando el 80%, aunque el rendimiento a nivel humano sigue siendo difícil de alcanzar. El conjunto de datos continúa sirviendo como una herramienta valiosa para sondear las capacidades de razonamiento de los sistemas de Generative AI y para desarrollar métodos que hagan dicho razonamiento más explícito y verificable.
Véase También
- respuesta a preguntas visuales
- razonamiento de sentido común
- conjunto de datos
- Visual Genome
Referencias
El artículo original de Sherlock se presentó en la Conferencia de 2020 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) y está disponible en las actas de CVPR. El conjunto de datos está alojado públicamente y se puede acceder a través del sitio web oficial del proyecto.