Visual Question Answering (VQA) é uma tarefa de inteligência artificial que exige que um sistema responda a perguntas em linguagem natural sobre uma imagem. Ela se situa na interseção entre visão computacional e processamento de linguagem natural, exigindo que o modelo não apenas reconheça objetos, cenas e atividades em uma imagem, mas também compreenda a semântica da pergunta e raciocine sobre o conteúdo visual para produzir uma resposta correta. O VQA é considerado um benchmark para compreensão e raciocínio visual de nível superior, indo além da simples classificação de imagens ou da geração de legendas.
A tarefa normalmente envolve uma imagem de entrada e uma pergunta em texto de forma livre, com a saída esperada sendo uma resposta concisa, geralmente uma única palavra ou uma frase curta. Os sistemas de VQA devem lidar com uma ampla gama de tipos de perguntas, incluindo aquelas sobre presença de objetos, cor, contagem, relações espaciais e até mesmo raciocínio de senso comum que vai além do que é diretamente visível. O campo ganhou tração significativa em meados da década de 2010 com o lançamento de conjuntos de dados em grande escala e a aplicação de técnicas de aprendizado profundo, e desde então se tornou uma avaliação padrão para modelos de IA multimodal.
Conjuntos de Dados e Benchmarks
O conjunto de dados VQA, lançado pela primeira vez em 2015 por pesquisadores da Virginia Tech e da Microsoft, tornou-se o benchmark de facto para a tarefa. O conjunto de dados VQA original continha mais de 200.000 imagens do conjunto de dados Microsoft COCO e mais de 600.000 perguntas, com cada pergunta emparelhada com múltiplas respostas de referência coletadas de anotadores humanos. O conjunto de dados foi projetado para exigir uma variedade de habilidades, incluindo reconhecimento de objetos, contagem e raciocínio espacial. Versões subsequentes, como o VQA 2.0, equilibraram a distribuição de respostas para reduzir vieses de linguagem, onde os modelos podiam adivinhar respostas com base apenas em padrões de perguntas, sem olhar para a imagem. Outros benchmarks notáveis incluem o Visual Genome, que fornece anotações densas de objetos, atributos e relacionamentos, e o CLEVR, um conjunto de dados sintético projetado para testar raciocínio composicional ao gerar imagens de formas 3D simples e fazer perguntas que exigem lógica de múltiplas etapas.
Abordagens e Arquiteturas
Os primeiros sistemas de VQA usavam uma combinação de redes neurais convolucionais (CNNs) para extração de características de imagem e redes neurais recorrentes (RNNs) ou redes de memória de longo prazo (LSTM) para codificação de perguntas. Essas características eram então fundidas, muitas vezes por meio de multiplicação elemento a elemento ou concatenação, e passadas por um classificador para prever a resposta. Um grande avanço veio com a introdução de mecanismos de atenção, que permitiram ao modelo focar em regiões relevantes da imagem com base na pergunta. A arquitetura Transformer, introduzida em 2017, revolucionou ainda mais o campo ao permitir o processamento unificado de tokens visuais e textuais. Modelos modernos de VQA, como aqueles baseados em pré-treinamento de visão-linguagem, usam modelos transformer em grande escala pré-treinados em pares de imagem-texto e depois ajustados em conjuntos de dados de VQA. Esses modelos, muitas vezes integrados com grandes modelos de linguagem, podem gerar respostas de forma livre e realizar raciocínio complexo, às vezes até mesmo sem ajuste fino explícito em dados de VQA.
Desafios e Limitações
Apesar do progresso significativo, o VQA continua sendo uma tarefa desafiadora. Uma questão importante é o viés de linguagem: os modelos podem explorar regularidades estatísticas nos dados de treinamento para responder perguntas sem realmente compreender a imagem. Por exemplo, um modelo pode responder "2" para perguntas que começam com "Quantos" porque essa é a resposta mais comum no conjunto de dados. O conjunto de dados VQA 2.0 foi criado para mitigar isso, garantindo que cada pergunta tenha imagens complementares com respostas diferentes. Outro desafio é a generalização composicional, onde os modelos têm dificuldade em responder perguntas que exigem combinações novas de conceitos conhecidos. Além disso, os sistemas de VQA frequentemente falham em perguntas que exigem conhecimento externo ou raciocínio de senso comum, como "Por que a pessoa está sorrindo?" ou "O que acontecerá a seguir?". A robustez a exemplos adversariais e imagens fora da distribuição também é uma preocupação, pois os modelos podem ser facilmente enganados por pequenas perturbações.
Aplicações
O VQA tem aplicações práticas em vários domínios. Na acessibilidade, pode auxiliar pessoas com deficiência visual a responder perguntas sobre seus arredores, como ler placas ou identificar objetos. Na interação humano-computador, o VQA permite interfaces mais naturais onde os usuários podem fazer perguntas sobre imagens em sistemas de chat ou busca. Na área da saúde, o VQA pode ajudar radiologistas a responder perguntas sobre imagens médicas, embora isso exija treinamento especializado e validação cuidadosa. No comércio eletrônico, o VQA pode alimentar sistemas de busca visual e recomendação de produtos. A tecnologia também é usada em direção autônoma, onde os sistemas devem compreender e raciocinar sobre cenas visuais para responder perguntas como "O semáforo está vermelho?" ou "Há um pedestre atravessando?"
Desenvolvimentos Recentes
O surgimento de grandes modelos multimodais, como aqueles desenvolvidos pela OpenAI, Google DeepMind e outros laboratórios de pesquisa, avançou significativamente as capacidades de VQA. Esses modelos, muitas vezes construídos sobre arquiteturas transformer e treinados em conjuntos de dados massivos de imagens e texto, podem responder perguntas com alta precisão e até mesmo fornecer explicações. Por exemplo, modelos como GPT-4V e Gemini demonstraram forte desempenho em benchmarks padrão de VQA, às vezes se aproximando da precisão humana em certas tarefas. No entanto, esses modelos não estão isentos de limitações, e ainda podem exibir vieses ou alucinações. O campo continua a evoluir, com pesquisas focadas em melhorar habilidades de raciocínio, reduzir vieses e tornar os modelos mais interpretáveis e robustos. Em 2025, o VQA permanece uma área ativa de pesquisa, com novos benchmarks e desafios sendo introduzidos para ampliar os limites da compreensão visual.