Traduzido do inglês

VQA v2 é um conjunto de dados balanceado de resposta a perguntas visuais, introduzido em 2017 para abordar os vieses linguísticos do VQA v1, apresentando pares complementares de imagem-pergunta para uma avaliação robusta.

VQA v2 é um conjunto de dados em larga escala para resposta a perguntas visuais (VQA), uma tarefa na qual um modelo deve responder a uma pergunta em linguagem natural sobre uma imagem. Foi introduzido em 2017 como sucessor do conjunto de dados VQA original, projetado para mitigar o problema de viés linguístico que afetava seu predecessor. O conjunto de dados contém mais de 1,1 milhão de perguntas sobre mais de 200.000 imagens, com cada pergunta emparelhada a uma imagem complementar que possui uma resposta diferente, forçando os modelos a depender de informações visuais em vez de prioridades linguísticas.

A criação do VQA v2 foi motivada pela observação de que muitos modelos tinham bom desempenho no VQA v1 ao explorar regularidades estatísticas nas perguntas, sem compreender verdadeiramente as imagens. Por exemplo, um modelo poderia responder 'sim' à maioria das perguntas do tipo 'Existe um...' independentemente do conteúdo da imagem. Para resolver isso, o conjunto de dados VQA v2 foi construído coletando pares complementares de imagem-pergunta: para cada pergunta, uma imagem adicional foi selecionada de modo que a resposta à mesma pergunta difere entre as duas imagens. Esse design balanceado incentiva o desenvolvimento de modelos que integram raciocínio visual e textual.

O conjunto de dados é amplamente utilizado como referência nas áreas de aprendizado de máquina e aprendizado profundo, particularmente para avaliar arquiteturas de redes neurais e mecanismos de atenção. Ele foi fundamental para avançar a pesquisa em aprendizado multimodal, onde os modelos devem alinhar características visuais com representações linguísticas. Muitos sistemas de última geração, incluindo aqueles baseados em arquiteturas transformers e modelos de linguagem de grande escala, foram avaliados no VQA v2, frequentemente relatando precisão como métrica principal.

Estrutura do Conjunto de Dados

O VQA v2 compreende imagens provenientes do conjunto de dados Microsoft COCO, que inclui cenas complexas com múltiplos objetos e interações. Cada imagem está associada a várias perguntas, e cada pergunta possui 10 respostas de referência coletadas de anotadores humanos. As perguntas são abertas, cobrindo categorias como presença de objetos, cor, contagem e relações espaciais. O conjunto de dados é dividido em conjuntos de treinamento, validação e teste, com o conjunto de teste ainda dividido em subconjuntos test-dev e test-standard para fins de avaliação.

A principal inovação do VQA v2 é seu emparelhamento balanceado: para cada pergunta, existe pelo menos uma outra imagem no conjunto de dados onde a resposta é diferente. Isso garante que um modelo não possa alcançar alta precisão simplesmente memorizando padrões de pergunta-resposta. O conjunto de dados inclui aproximadamente 1,1 milhão de perguntas, com cerca de 250.000 imagens no conjunto de treinamento, 25.000 no conjunto de validação e 25.000 no conjunto de teste.

Métricas de Avaliação

A precisão é a métrica principal usada para o VQA v2. Para cada pergunta, a resposta prevista por um modelo é comparada com as 10 respostas fornecidas por humanos. A precisão para uma única pergunta é calculada como o mínimo do número de respostas humanas que correspondem à previsão dividido por 3, limitado a 1. Esse esquema de pontuação recompensa respostas que são acordadas por múltiplos anotadores, incentivando os modelos a produzir respostas de senso comum.

Além da precisão geral, os resultados são frequentemente relatados por tipo de pergunta, como 'sim/não', 'número' e 'outro' (aberto). Essa divisão ajuda a identificar pontos fortes e fracos específicos de um modelo. Por exemplo, um modelo pode se destacar em perguntas de sim/não, mas ter dificuldades com contagem ou raciocínio sobre relações espaciais.

Impacto na Pesquisa

O VQA v2 se tornou uma referência padrão nas comunidades de visão computacional e processamento de linguagem natural, embora a lista de links fornecida não inclua esses slugs. Ele impulsionou o desenvolvimento de numerosos modelos de aprendizado profundo, incluindo aqueles que empregam mecanismos de atenção, redes residuais e camadas de atenção multi-cabeça. O conjunto de dados também foi usado para estudar técnicas de aumento de dados e funções de perda adaptadas para tarefas multimodais.

O design balanceado do VQA v2 influenciou a criação de conjuntos de dados subsequentes, como os conjuntos Visual Genome e GQA, que também visam reduzir o viés. Pesquisadores usaram o VQA v2 para sondar capacidades de modelos em áreas como raciocínio composicional e ancoragem visual, levando a insights sobre as limitações dos sistemas atuais de inteligência artificial.

Limitações e Críticas

Apesar de suas melhorias, o VQA v2 ainda apresenta alguns vieses. Por exemplo, certas perguntas podem ter uma resposta dominante em todo o conjunto de dados, e os modelos podem aproveitar essas prioridades. Além disso, o conjunto de dados foca principalmente em imagens estáticas do COCO, que podem não capturar a diversidade de cenários visuais do mundo real. Alguns críticos argumentam que a natureza aberta das perguntas leva à ambiguidade, e a métrica de avaliação não considera respostas semanticamente equivalentes (por exemplo, 'carro' vs. 'automóvel').

Além disso, o conjunto de dados foi criticado por não exigir raciocínio profundo; muitas perguntas podem ser respondidas reconhecendo objetos ou atributos sem inferência complexa. Isso levou ao desenvolvimento de referências mais desafiadoras, como o VQA-CP (VQA sob Prioridades Variáveis), que redivide os dados para expor o viés linguístico de forma mais explícita.

Conclusão

O VQA v2 continua sendo um recurso fundamental na pesquisa de IA multimodal. Seu design balanceado estabeleceu um novo padrão para a construção de conjuntos de dados, incentivando o desenvolvimento de modelos que integram genuinamente informações visuais e textuais. Embora referências mais recentes tenham surgido, o VQA v2 continua sendo usado para avaliar e comparar modelos, e sua influência é evidente no design de conjuntos de dados e tarefas subsequentes.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·visual-question-answering·multimodal-learning·benchmark
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico