Visual7W é um conjunto de dados de referência para resposta a perguntas visuais (VQA) e ancoragem visual, apresentado pela primeira vez em 2016 por pesquisadores da Universidade de Stanford. Ele compreende 47.300 imagens do mundo real provenientes do Microsoft COCO e mais de 327.000 pares de pergunta-resposta, cada um associado a uma ou mais caixas delimitadoras que localizam a evidência visual que sustenta a resposta. O conjunto de dados é notável por sua ênfase na ancoragem, exigindo que os modelos não apenas respondam às perguntas, mas também identifiquem as regiões relevantes da imagem, uma capacidade central para sistemas de IA interpretáveis.
O nome Visual7W deriva dos sete tipos de perguntas que cobre: o quê, onde, quando, quem, por quê e como, com 'qual' adicionado como uma sétima categoria para abordar tarefas de seleção de objetos. Diferentemente de conjuntos de dados VQA anteriores, que se concentravam principalmente no reconhecimento de objetos, o Visual7W inclui uma parcela substancial de perguntas 'por quê' e 'como', que exigem raciocínio sobre relações causais e processuais em cenas. Esse design o torna um teste rigoroso para modelos de aprendizado profundo, pois ele faz a ponte entre percepção e cognição de nível superior.
Estrutura do Conjunto de Dados
O Visual7W é organizado em dois componentes principais: QA de múltipla escolha e QA de resposta aberta. O subconjunto de múltipla escolha fornece quatro respostas candidatas por pergunta, enquanto o subconjunto de resposta aberta exige geração de forma livre. Cada pergunta é anotada com uma caixa de ancoragem, que é uma caixa delimitadora ao redor da região da imagem que contém a resposta. O conjunto de dados é dividido em conjuntos de treinamento, validação e teste, com o conjunto de teste dividido em uma porção pública e uma porção oculta usada para avaliação oficial.
Todas as imagens são extraídas do conjunto de dados Microsoft COCO, garantindo cenas diversas com objetos e atividades do cotidiano. As anotações foram coletadas via Amazon Mechanical Turk, com medidas de controle de qualidade para filtrar perguntas ambíguas ou incorretas. O comprimento médio das perguntas é de cerca de 8 palavras, e o vocabulário cobre aproximadamente 4.000 palavras, tornando-o um espaço linguístico compacto, mas desafiador, para modelos de rede neural.
Formulação da Tarefa
A tarefa principal no Visual7W é a ancoragem visual, onde um modelo recebe uma imagem e uma pergunta e deve produzir tanto uma resposta quanto uma caixa delimitadora. Isso é formalizado como um problema de predição conjunta: o modelo deve localizar a região que responde à pergunta e, em seguida, classificar ou gerar a resposta com base nessa região. As métricas de avaliação incluem precisão da resposta e precisão da ancoragem, com a ancoragem medida pela Interseção sobre União (IoU) entre as caixas previstas e as de referência.
Uma tarefa secundária é a resposta a perguntas visuais sem ancoragem, o que permite comparação com conjuntos de dados anteriores. No entanto, o requisito de ancoragem torna o Visual7W particularmente adequado para estudar mecanismos de atenção, pois os modelos devem aprender a focar em partes relevantes de uma imagem. Isso influenciou arquiteturas subsequentes, como aquelas que usam camadas de atenção de múltiplas cabeças e atenção cruzada, que agora são padrão em modelos de visão-linguagem baseados em transformers.
Significância do Benchmark
O Visual7W foi um dos primeiros benchmarks de VQA a enfatizar perguntas 'por quê' e 'como', que exigem raciocínio de senso comum além do simples reconhecimento de padrões. Por exemplo, uma pergunta como 'Por que a pessoa está segurando um guarda-chuva?' exige compreensão do contexto climático e inferência causal. Isso impulsionou o campo em direção a grandes modelos de linguagem mais sofisticados e abordagens de pré-treinamento de visão-linguagem.
O conjunto de dados tem sido usado para avaliar inúmeros modelos, desde os primeiros residual networks combinados com redes recorrentes até sistemas modernos de IA generativa. Ele também serviu como precursor de benchmarks maiores, como Visual Genome e GQA, que expandiram o escopo do raciocínio relacional. Pesquisadores em instituições como Stanford AI Lab e Berkeley AI Research usaram o Visual7W para testar técnicas de interpretabilidade e visualização de atenção.
Limitações e Críticas
Apesar de suas contribuições, o Visual7W tem limitações conhecidas. As caixas de ancoragem são frequentemente grosseiras, cobrindo regiões maiores do que o objeto específico referenciado, o que pode inflar a precisão da ancoragem. O conjunto de dados também sofre de viés linguístico, onde certas respostas se correlacionam com tipos de perguntas, permitindo que modelos explorem atalhos sem verdadeira compreensão visual. Além disso, as perguntas 'por quê' e 'como' são relativamente raras em comparação com 'o quê' e 'onde', limitando a profundidade da avaliação de raciocínio.
Críticos notaram que o formato de múltipla escolha pode ser explorado por regularidades estatísticas, e as respostas de formato aberto são avaliadas com correspondência exata de strings, o que penaliza respostas semanticamente corretas, mas parafraseadas. Essas questões motivaram o desenvolvimento de protocolos de avaliação mais robustos em conjuntos de dados posteriores, como o uso de feedback humano no estilo RLHF para pontuação.
Legado e Impacto
O Visual7W permanece um recurso valioso para estudar ancoragem visual e resposta a perguntas, particularmente para fins educacionais e para avaliar modelos baseados em atenção. Suas anotações de ancoragem foram reaproveitadas para tarefas como raciocínio de senso comum visual e compreensão de expressões de referência. A ênfase do conjunto de dados na interpretabilidade está alinhada com tendências mais amplas em aprendizado de máquina em direção à IA explicável, e ele continua sendo citado em pesquisas sobre aprendizado multimodal e estratégias de aumento de dados.
Em meados da década de 2020, o Visual7W é menos usado como benchmark primário devido ao surgimento de conjuntos de dados maiores e mais complexos, mas permanece uma referência padrão para avaliar capacidades fundamentais de VQA. Seus princípios de design influenciaram a criação de conjuntos de dados para direção autônoma e robótica, onde a ancoragem é crítica para a tomada de decisão segura.