VQA 1.0 é o primeiro conjunto de dados e referencial de grande escala para resposta a perguntas visuais (VQA), uma tarefa que exige que um sistema de IA responda a perguntas abertas sobre imagens. Introduzido em 2015 por pesquisadores da Virginia Tech e da Microsoft, tornou-se o conjunto de avaliação padrão para o campo, impulsionando o progresso na combinação de visão computacional e processamento de linguagem natural. O conjunto de dados compreende fotografias reais com perguntas e respostas anotadas por humanos, projetado para testar a capacidade de um modelo de raciocinar sobre conteúdo visual e linguagem.
A criação do VQA 1.0 foi motivada pelo objetivo de desenvolver sistemas de IA que possam interagir com o mundo visual de maneira semelhante à humana. Diferentemente de tarefas anteriores, como a legenda de imagens, que gera uma única frase descritiva, o VQA exige responder a perguntas específicas, demandando compreensão e raciocínio mais profundos. O design do conjunto de dados incentiva os modelos a lidar com uma variedade de tipos de perguntas, incluindo sim/não, contagem e consultas abertas, e a fundamentar suas respostas em evidências visuais.
Estrutura do Conjunto de Dados e Estatísticas
O VQA 1.0 consiste em 204.721 imagens do conjunto de dados Microsoft COCO, emparelhadas com 614.163 perguntas e 6.141.630 respostas. Cada imagem está associada a aproximadamente três perguntas, e cada pergunta tem dez respostas de referência fornecidas por diferentes anotadores humanos. As perguntas são abertas, cobrindo categorias como objetos, cores, contagem e relações espaciais. O conjunto de dados é dividido em conjuntos de treinamento (82.783 imagens), validação (40.504 imagens) e teste (81.434 imagens), com o conjunto de teste ainda dividido em test-dev e test-standard para avaliação.
Definição da Tarefa e Avaliação
No VQA, um modelo recebe uma imagem e uma pergunta em linguagem natural, e deve produzir uma resposta concisa. A métrica de avaliação é a precisão, calculada comparando a resposta do modelo com as dez respostas humanas. A resposta de um modelo é considerada correta se pelo menos três das dez respostas humanas corresponderem exatamente a ela. Essa métrica, conhecida como precisão VQA, foi projetada para levar em conta a variabilidade humana na formulação das respostas. O referencial também fornece um conjunto de detalhamentos por 'tipo de pergunta', permitindo que pesquisadores analisem o desempenho em categorias específicas, como 'qual cor' ou 'quantos'.
Modelos de Base e Progresso Inicial
As linhas de base iniciais para o VQA 1.0 incluíam abordagens simples, como recuperação por vizinho mais próximo e um modelo 'a priori' que sempre prevê a resposta mais comum para um determinado tipo de pergunta. Essas linhas de base alcançaram precisões em torno de 30-40%. Os primeiros modelos neurais, que combinavam redes neurais convolucionais para características de imagem com redes neurais recorrentes para codificação de perguntas, melhoraram o desempenho para cerca de 55-60%. Esses primeiros sistemas usavam redes LSTM e incorporações de palavras para processar perguntas, e extraíam características de imagem de uma rede VGG pré-treinada. A lacuna entre o desempenho humano (cerca de 83%) e o desempenho das máquinas destacou a dificuldade da tarefa.
Impacto e Legado
O VQA 1.0 estabeleceu a tarefa de VQA como um desafio central em inteligência artificial, estimulando o desenvolvimento de numerosos conjuntos de dados e modelos subsequentes. Ele levou à criação do VQA 2.0, que equilibrou a distribuição de respostas para reduzir vieses linguísticos, e do Visual Genome, que adicionou anotações em nível de região. O conjunto de dados também influenciou o design de referenciais posteriores, como GQA e CLEVR, que se concentram em raciocínio composicional. O VQA 1.0 permanece como um ponto de referência para avaliar capacidades de raciocínio visual, e sua metodologia foi adotada em muitos referenciais multimodais subsequentes.
O lançamento do VQA 1.0 coincidiu com a ascensão do aprendizado profundo e da arquitetura transformer, que mais tarde se tornou dominante em modelos multimodais. Sistemas modernos, como aqueles baseados em modelos de linguagem de grande porte com codificadores visuais, agora alcançam desempenho quase humano no VQA 1.0, mas o legado do conjunto de dados reside em seu papel como catalisador para a pesquisa em raciocínio visual e compreensão de linguagem fundamentada.
Ver Também
- Resposta a Perguntas Visuais
- Microsoft COCO
- Legenda de Imagens
- Aprendizado Multimodal