Traduzido do inglês

Visual Genome é um conjunto de dados em larga escala de imagens densamente anotadas, que vincula o conteúdo visual a descrições textuais estruturadas para pesquisa em IA. Ele fornece descrições de regiões, objetos, atributos e relações para apoiar tarefas em visão computacional e processamento de linguagem natural.

Visual Genome é um conjunto de dados em grande escala projetado para conectar a compreensão visual com a linguagem natural. Ele contém mais de 108.000 imagens, cada uma anotada com um conjunto denso de descripções de regiões, objetos, atributos e relações. O conjunto de dados foi criado para permitir que modelos de aprendizado automático raciocinem sobre as interações complexas entre objetos em uma imagem, indo além do reconhecimento simples de objetos para uma compreensão de cena mais abrangente. Foi introducido em 2016 por pesquisadores da Universidade de Stanford e da Universidade de Toronto, incluindo Ranjay Krishna, Yuke Zhu, Oliver Groth, Justin Johnson, Kenji Hata, Joshua Kravitz, Stephanie Chen, Yannis Kalantidis, Li-Jia Li, David A. Shamma, Michael S. Bernstein e Li Fei-Fei.

O objetivo principal do Visual Genome é fornecer um recurso que apoie o desenvolvimento de sistemas de inteligência artificial capazes de responder a perguntas sobre imagens, gerar legendas descritivas e realizar raciocinio visual. Ao contrário de conjuntos de dados que se concentran na classificação de objetos únicos ou em legendas simples, o Visual Genome oferece uma representação estruturada do conteúdo de uma imagem. Cada imagem é anotada com uma média de 35 objetos, 26 atributos e 21 relações entre pares de objetos. Estas anotações são organizadas em um grafo de cena, um grafo direcionado onde os nós representam objetos e as arestas representan relações como "montando", "vestindo" ou "ao lado de". Esta estrutura permite que algoritmos analizem uma imagem em uma representação semântica que pode ser consultada e manipulada.

Estrutura do Conjunto de Dados e Processo de Anotação

O conjunto de dados comprende vários componentes principais: descripções de regiões, objetos, atributos, relações e pares de pregunta-resposta. As descripções de regiões são frases curtas em linguagem natural que descrevem uma área específica de uma imagem. Os objetos são caixas delimitadoras rotuladas com nomes correspondentes, enquanto os atributos descrevem propriedades como cor, tamanho ou forma. As relações conectam dois objetos com um predicado, como "hombre segurando prancha de surf". Além disso, o Visual Genome incluye más de 1,7 milhões de pares de pregunta-resposta, que são usados para treinar sistemas de respuesta a preguntas visuales. O processo de anotação envolviu trabalhadores de crowdsourcing que receberon instruções detalladas para garantir consistencia. Cada imagem foi anotada por múltiples trabalhadores, e os resultados foram agregados e filtrados para manter a qualidade. O conjunto de dados também incluye um conjunto de 80.000 imágenes con grafos de región más densamente conectados, proporcionando una fuente más rica para entrenar modelos complejos.

Aplicações en Aprendizado Automático

Visual Genome se ha convertido en un estándar de referencia para tareas en visión por computadora y aprendizaje automático. Se usa ampliamente para entrenar y evaluar modelos en la generación de grafos de escena, donde el objetivo es predecir los objetos y sus relaciones a partir de una imagen. También apoya la respuesta a preguntas visuales, la generación de leyendas de imágenes y la comprensión de expresiones referenciales, donde un modelo debe localizar un objeto descrito por una frase en lenguaje natural. Las anotaciones estructuradas del conjunto de datos han sido fundamentales para avanzar en la investigación sobre arquitecturas de redes neuronales que combinan información visual y textual, como los modelos basados en transformadores. Por ejemplo, modelos como el Visual Transformer y varios sistemas de visión guiados por modelos de lenguaje grandes han sido entrenados en Visual Genome para mejorar su capacidad de fundamentar el lenguaje en contenido visual. Los investigadores también han utilizado el conjunto de datos para estudiar la generalización composicional, donde los modelos deben comprender combinaciones novedosas de objetos y relaciones conocidas.

Impacto y Limitaciones

Desde su lanzamiento, Visual Genome ha influido en el diseño de conjuntos de datos posteriores, como el conjunto de datos Open Images y las anotaciones ampliadas del conjunto de datos COCO. También se ha utilizado junto con otros recursos para crear puntos de referencia más completos para IA encarnada y robótica, donde los agentes deben interpretar escenas visuales para actuar en el mundo. Sin embargo, el conjunto de datos tiene limitaciones conocidas. Las anotaciones están sesgadas hacia objetos comunes y escenas cotidianas, lo que puede llevar a modelos que funcionan mal en objetos raros o inusuales. La naturaleza de crowdsourcing de las anotaciones introduce ruido, y algunas relaciones pueden ser ambiguas o etiquetadas de manera inconsistente. Además, el conjunto de datos es estático y no refleja la diversidad de entornos del mundo real, como espacios interiores con muchos objetos ocluidos o escenas al aire libre con condiciones de iluminación variables. Los investigadores han abordado estos problemas desarrollando métodos para limpiar los datos o combinándolos con datos sintéticos de simulaciones.

Relación con Otros Recursos de IA

Visual Genome es parte de un ecosistema más amplio de conjuntos de datos y modelos que han impulsado el progreso en aprendizaje profundo. Complementa conjuntos de datos como ImageNet, que se centra en la clasificación de objetos, y MS COCO, que proporciona segmentación de instancias y leyendas. La representación de grafo de escena introducida por Visual Genome ha sido adoptada por otros proyectos, como el Scene Graph Benchmark y el conjunto de datos GQA, que se centra en el razonamiento visual con preguntas más complejas. En el contexto de la IA moderna, Visual Genome se ha utilizado para preentrenar modelos de visión-lenguaje, que luego se ajustan para tareas específicas. Estos modelos, a menudo construidos sobre arquitecturas de transformadores, han sido desarrollados por organizaciones como Google DeepMind, OpenAI y Anthropic, aunque Visual Genome en sí es un recurso académico más que un producto comercial. El conjunto de datos está disponible gratuitamente para fines de investigación y está alojado en un sitio web dedicado, con herramientas para descargar y visualizar las anotaciones.

Direcciones Futuras

A mediados de la década de 2020, el campo se ha movido hacia conjuntos de datos más grandes y diversos, y modelos multimodales que pueden manejar video, audio y texto junto con imágenes. Visual Genome sigue siendo un recurso valioso para comprender los principios de la anotación densa y la construcción de grafos de escena. Los investigadores continúan utilizándolo para desarrollar nuevos algoritmos para el aprendizaje con pocos ejemplos, donde los modelos deben generalizar a partir de un pequeño número de ejemplos, y para el razonamiento de cero disparos, donde los modelos manejan categorías no vistas. El énfasis del conjunto de datos en relaciones y atributos también ha inspirado trabajos sobre razonamiento causal en visión, donde los modelos deben inferir no solo qué está presente sino por qué ciertos objetos interactúan. Aunque los conjuntos de datos más nuevos pueden ofrecer más escala o diversidad, las anotaciones detalladas de Visual Genome proporcionan una base única para estudiar la naturaleza composicional de las escenas visuales, un desafío que sigue siendo central para lograr una inteligencia visual de nivel humano.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:computer-vision·dataset·scene-graph·visual-reasoning
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico