Visual Genome es un conjunto de datos a gran escala diseñado para conectar la comprensión visual con el lenguaje natural. Contiene más de 108,000 imágenes, cada una anotada con un conjunto denso de descripciones de regiones, objetos, atributos y relaciones. El conjunto de datos fue creado para permitir que los modelos de aprendizaje automático razonen sobre las interacciones complejas entre objetos en una imagen, yendo más allá del simple reconocimiento de objetos hacia una comprensión más completa de la escena. Fue introducido en 2016 por investigadores de la Universidad de Stanford y la Universidad de Toronto, incluyendo a Ranjay Krishna, Yuke Zhu, Oliver Groth, Justin Johnson, Kenji Hata, Joshua Kravitz, Stephanie Chen, Yannis Kalantidis, Li-Jia Li, David A. Shamma, Michael S. Bernstein y Li Fei-Fei.
El objetivo principal de Visual Genome es proporcionar un recurso que apoye el desarrollo de sistemas de inteligencia artificial capaces de responder preguntas sobre imágenes, generar descripciones de subtítulos y realizar razonamiento visual. A diferencia de los conjuntos de datos que se centran en la clasificación de un solo objeto o en subtítulos simples, Visual Genome ofrece una representación estructurada del contenido de una imagen. Cada imagen está anotada con un promedio de 35 objetos, 26 atributos y 21 relaciones por pares entre objetos. Estas anotaciones se organizan en un grafo de escena, un grafo dirigido donde los nodos representan objetos y las aristas representan relaciones como "montando", "vistiendo" o "junto a". Esta estructura permite que los algoritmos analicen una imagen en una representación semántica que puede ser consultada y manipulada.
Estructura del Conjunto de Datos y Proceso de Anotación
El conjunto de datos comprende varios componentes clave: descripciones de regiones, objetos, atributos, relaciones y pares de preguntas y respuestas. Las descripciones de regiones son oraciones cortas en lenguaje natural que describen un área específica de una imagen. Los objetos son cajas delimitadoras etiquetadas con nombres correspondientes, mientras que los atributos describen propiedades como color, tamaño o forma. Las relaciones conectan dos objetos con un predicado, como "hombre sosteniendo tabla de surf". Además, Visual Genome incluye más de 1.7 millones de pares de preguntas y respuestas, que se utilizan para entrenar sistemas de respuesta a preguntas visuales. El proceso de anotación involucró a trabajadores de crowdsourcing que recibieron instrucciones detalladas para garantizar la consistencia. Cada imagen fue anotada por múltiples trabajadores, y los resultados fueron agregados y filtrados para mantener la calidad. El conjunto de datos también incluye un conjunto de 80,000 imágenes con grafos de región más densamente conectados, proporcionando una fuente más rica para entrenar modelos complejos.
Aplicaciones en Aprendizaje Automático
Visual Genome se ha convertido en un punto de referencia estándar para tareas en visión por computadora y aprendizaje automático. Se utiliza ampliamente para entrenar y evaluar modelos en la generación de grafos de escena, donde el objetivo es predecir los objetos y sus relaciones a partir de una imagen. También apoya la respuesta a preguntas visuales, la generación de subtítulos de imágenes y la comprensión de expresiones referenciales, donde un modelo debe localizar un objeto descrito por una frase en lenguaje natural. Las anotaciones estructuradas del conjunto de datos han sido fundamentales para avanzar en la investigación sobre arquitecturas de redes neuronales que combinan información visual y textual, como los modelos basados en transformadores. Por ejemplo, modelos como el Visual Transformer y varios sistemas de visión guiados por grandes modelos de lenguaje han sido entrenados en Visual Genome para mejorar su capacidad de anclar el lenguaje en el contenido visual. Los investigadores también han utilizado el conjunto de datos para estudiar la generalización composicional, donde los modelos deben comprender combinaciones novedosas de objetos y relaciones conocidos.
Impacto y Limitaciones
Desde su lanzamiento, Visual Genome ha influido en el diseño de conjuntos de datos posteriores, como el conjunto de datos Open Images y las anotaciones expandidas del conjunto de datos COCO. También se ha utilizado junto con otros recursos para crear puntos de referencia más completos para la IA encarnada y la robótica, donde los agentes deben interpretar escenas visuales para actuar en el mundo. Sin embargo, el conjunto de datos tiene limitaciones conocidas. Las anotaciones están sesgadas hacia objetos comunes y escenas cotidianas, lo que puede llevar a modelos que funcionan mal en objetos raros o inusuales. La naturaleza de crowdsourcing de las anotaciones introduce ruido, y algunas relaciones pueden ser ambiguas o etiquetadas de manera inconsistente. Además, el conjunto de datos es estático y no refleja la diversidad de entornos del mundo real, como espacios interiores con muchos objetos ocluidos o escenas exteriores con condiciones de iluminación variables. Los investigadores han abordado estos problemas desarrollando métodos para limpiar los datos o combinándolos con datos sintéticos de simulaciones.
Relación con Otros Recursos de IA
Visual Genome es parte de un ecosistema más amplio de conjuntos de datos y modelos que han impulsado el progreso en aprendizaje profundo. Complementa conjuntos de datos como ImageNet, que se centra en la clasificación de objetos, y MS COCO, que proporciona segmentación de instancias y subtítulos. La representación de grafo de escena introducida por Visual Genome ha sido adoptada por otros proyectos, como el Scene Graph Benchmark y el conjunto de datos GQA, que se centra en el razonamiento visual con preguntas más complejas. En el contexto de la IA moderna, Visual Genome se ha utilizado para preentrenar modelos de visión y lenguaje, que luego se ajustan para tareas específicas. Estos modelos, a menudo construidos sobre arquitecturas de transformadores, han sido desarrollados por organizaciones como Google DeepMind, OpenAI y Anthropic, aunque Visual Genome en sí es un recurso académico más que un producto comercial. El conjunto de datos está disponible gratuitamente para fines de investigación y se aloja en un sitio web dedicado, con herramientas para descargar y visualizar las anotaciones.
Direcciones Futuras
A mediados de la década de 2020, el campo se ha movido hacia conjuntos de datos más grandes y diversos, y modelos multimodales que pueden manejar video, audio y texto junto con imágenes. Visual Genome sigue siendo un recurso valioso para comprender los principios de la anotación densa y la construcción de grafos de escena. Los investigadores continúan utilizándolo para desarrollar nuevos algoritmos para el aprendizaje con pocos ejemplos, donde los modelos deben generalizar a partir de un pequeño número de ejemplos, y para el razonamiento de cero disparos, donde los modelos manejan categorías no vistas. El énfasis del conjunto de datos en relaciones y atributos también ha inspirado trabajo en razonamiento causal en visión, donde los modelos deben inferir no solo qué está presente sino por qué ciertos objetos interactúan. Aunque los conjuntos de datos más nuevos pueden ofrecer más escala o diversidad, las anotaciones detalladas de Visual Genome proporcionan una base única para estudiar la naturaleza composicional de las escenas visuales, un desafío que sigue siendo central para lograr una inteligencia visual a nivel humano.