KVQA (Visual Question Answering com Conhecimento) é um subcampo da inteligência artificial e do aprendizado de máquina que combina visão computacional, processamento de linguagem natural e representação de conhecimento. Diferentemente do visual question answering (VQA) tradicional, que depende exclusivamente do conteúdo visual de uma imagem, os sistemas KVQA também precisam acessar e raciocinar sobre fontes de conhecimento externas, como grafos de conhecimento, bases de dados enciclopédicas ou fatos estruturados, para produzir respostas precisas. Essa tarefa exige que o modelo não apenas reconheça objetos, cenas e relações em uma imagem, mas também recupere conhecimento mundial relevante e realize raciocínio de múltiplas etapas para responder a perguntas que podem referenciar entidades, atributos ou fatos não diretamente visíveis na imagem.
O desenvolvimento do KVQA está intimamente ligado aos avanços do aprendizado profundo e ao surgimento de modelos multimodais em grande escala. Os primeiros conjuntos de dados de VQA, introduzidos em meados da década de 2010, focavam em perguntas respondíveis apenas a partir da imagem. No entanto, os pesquisadores logo reconheceram que muitas perguntas naturais, como "Quem construiu este edifício?" ou "Qual é a população desta cidade?", exigem conhecimento externo. Essa percepção levou à criação de benchmarks específicos de KVQA e à integração de bases de conhecimento em arquiteturas neurais, frequentemente usando modelos baseados em transformadores que podem atender tanto a características visuais quanto a representações textuais de conhecimento.
Desenvolvimento Histórico
O conceito de KVQA emergiu da agenda de pesquisa mais ampla do VQA, que ganhou tração após o lançamento do conjunto de dados VQA em 2015 por pesquisadores da Virginia Tech e da Microsoft. A tarefa inicial de VQA era puramente visual, mas trabalhos subsequentes, como o conjunto de dados FVQA (Fact-based Visual Question Answering), introduzido em 2016, exigiam explicitamente fatos externos. O FVQA fornecia uma base de conhecimento de triplas (sujeito, relação, objeto) e desafiava os modelos a recuperar fatos relevantes para responder perguntas. Isso foi seguido por outros conjuntos de dados, como o KVQA (o homônimo, introduzido em 2018 por pesquisadores do Indian Institute of Technology Delhi e colaboradores), que focava em perguntas sobre pessoas e lugares famosos, exigindo conhecimento de fontes como Wikipédia e Freebase.
Esses primeiros conjuntos de dados usavam bases de conhecimento estruturadas e frequentemente dependiam de modelos sequência a sequência ou mecanismos de atenção para combinar características de imagem com conhecimento recuperado. A introdução da arquitetura transformadora em 2017, particularmente o mecanismo de atenção de múltiplas cabeças, permitiu uma fusão mais sofisticada de informações visuais e textuais. No final da década de 2010, modelos como LXMERT e VisualBERT, que eram pré-treinados em pares de imagem-texto, começaram a incorporar módulos de conhecimento, embora ainda tivessem dificuldades com conhecimento de domínio aberto que não estava presente nos dados de treinamento.
Desafios Centrais
O KVQA apresenta vários desafios únicos em comparação com o VQA padrão. Primeiro, o sistema deve determinar quando o conhecimento externo é necessário; muitas perguntas podem ser respondidas apenas a partir da imagem, e a recuperação desnecessária de conhecimento pode introduzir ruído. Segundo, o processo de recuperação deve ser eficiente e preciso, frequentemente exigindo que o sistema consulte uma grande base de conhecimento em tempo real. Terceiro, a integração de evidências visuais e baseadas em conhecimento requer raciocínio sofisticado, pois a resposta pode depender da combinação de múltiplos fatos ou da resolução de contradições entre o que é visto e o que é conhecido.
Outro desafio significativo é o custo de aumento de dados e anotação. Criar conjuntos de dados KVQA exige emparelhar imagens com perguntas cujas respostas não estão na imagem, o que demanda anotação manual e curadoria de base de conhecimento. Isso levou ao uso de pipelines semiautomáticos que geram perguntas a partir de grafos de conhecimento, mas esses frequentemente produzem perguntas simplistas ou não naturais. Como resultado, muitos modelos KVQA são avaliados em domínios limitados, como marcos famosos ou celebridades, e seu desempenho em perguntas de domínio aberto permanece limitado.
Abordagens Modernas
Com o surgimento de grandes modelos de linguagem e modelos multimodais como GPT-4V (da OpenAI) e Gemini (da Google DeepMind), o KVQA passou por uma mudança de paradigma. Esses modelos, frequentemente construídos sobre arquiteturas de transformadores com bilhões de parâmetros, são pré-treinados em corpora massivos de texto e imagens, codificando implicitamente uma vasta quantidade de conhecimento mundial. Como resultado, eles podem frequentemente responder a perguntas visuais baseadas em conhecimento sem recuperação explícita, aproveitando o conhecimento incorporado em seus parâmetros. Essa abordagem, às vezes chamada de KVQA de "livro fechado", mostrou resultados impressionantes em benchmarks como OK-VQA (Outside Knowledge VQA), introduzido em 2019 e que exige conhecimento externo.
No entanto, modelos de livro fechado têm limitações, incluindo alucinação (gerar respostas plausíveis, mas incorretas) e dificuldade com fatos raros ou recentes. Para abordar isso, abordagens híbridas combinam conhecimento paramétrico com recuperação não paramétrica, usando técnicas como atenção cruzada para fundir trechos de conhecimento recuperados com características visuais. Por exemplo, modelos como REVEAL e KAT (Knowledge-Augmented Transformer) usam um recuperador para buscar passagens relevantes de um corpus de conhecimento e, em seguida, alimentam um gerador baseado em transformador. Esses sistemas frequentemente empregam busca em feixe ou amostragem top-p durante a decodificação para produzir respostas.
A integração de embeddings de grafos de conhecimento também foi explorada, onde o modelo aprende a raciocinar sobre estruturas de grafo. Por exemplo, alguns trabalhos usam redes neurais de grafo para propagar informações de entidades recuperadas, permitindo raciocínio de múltiplos saltos. Esses métodos são particularmente úteis para perguntas que exigem a combinação de múltiplos fatos, como "Quem é o diretor do filme estrelado por este ator?"
Avaliação e Benchmarks
Benchmarks padrão para KVQA incluem FVQA, KVQA e OK-VQA. O FVQA (2016) contém cerca de 2.000 perguntas com uma base de conhecimento de 50.000 fatos. O KVQA (2018) tem mais de 18.000 perguntas sobre 1.800 pessoas e marcos famosos, com respostas provenientes do Freebase. O OK-VQA (2019) é maior, com mais de 14.000 perguntas que exigem conhecimento externo, mas não fornece uma base de conhecimento específica, tornando-o mais desafiador. Benchmarks mais recentes, como A-OKVQA (2022), estendem isso com perguntas de múltipla escolha e abertas, e incluem uma base de conhecimento de legendas de imagem e fatos externos.
As métricas de avaliação tipicamente incluem precisão (correspondência exata ou correção de múltipla escolha) e, para modelos generativos, métricas como CIDEr ou BLEU. No entanto, essas métricas frequentemente falham em capturar a qualidade do raciocínio, e há um debate contínuo sobre se os modelos estão realmente raciocinando ou simplesmente memorizando padrões. Alguns pesquisadores propuseram conjuntos de dados diagnósticos que testam habilidades de raciocínio específicas, como perguntas composicionais ou exemplos adversariais que exigem conhecimento fora da distribuição de treinamento.
Aplicações e Direções Futuras
O KVQA tem aplicações práticas em domínios como tecnologia assistiva (ajudando usuários com deficiência visual a entender seu ambiente), educação (respondendo perguntas sobre imagens históricas ou diagramas científicos) e comércio eletrônico (fornecendo informações de produtos com base em imagens). No campo médico, o KVQA poderia auxiliar radiologistas respondendo perguntas sobre exames que exigem conhecimento de anatomia ou doença, embora isso permaneça uma área de pesquisa ativa.
Direções futuras incluem melhorar a confiabilidade da recuperação de conhecimento, reduzir a alucinação em modelos generativos e desenvolver benchmarks que reflitam melhor a complexidade do mundo real. Há também interesse em tornar os modelos KVQA mais interpretáveis, permitindo que os usuários vejam quais fatos foram usados para derivar uma resposta. À medida que a IA generativa continua avançando, o KVQA provavelmente se tornará um componente padrão de assistentes multimodais, permitindo que eles respondam a uma ampla gama de perguntas visuais com conhecimento mundial.
Ver Também
- Visual Question Answering
- Grafo de conhecimento
- Aprendizado multimodal
- Geração aumentada por recuperação