Traduzido do inglês

OK-VQA é um benchmark de resposta a perguntas visuais projetado para avaliar a capacidade de sistemas de IA de responder a perguntas que exigem conhecimento externo além do conteúdo da imagem, apresentando 14.031 perguntas distribuídas em 14.031 imagens.

OK-VQA (Outside Knowledge Visual Question Answering) é um conjunto de dados de referência para avaliar sistemas de resposta a perguntas visuais (VQA). Diferentemente de conjuntos de dados de VQA anteriores, que focam em perguntas respondíveis apenas a partir da imagem, o OK-VQA exige especificamente que os modelos incorporem conhecimento externo sobre objetos, cenas e conceitos cotidianos para produzir respostas corretas. O conjunto de dados foi introduzido em 2019 por pesquisadores do Instituto de Tecnologia da Geórgia, incluindo Kenneth Marino, Mohammad Rastegari, Ali Farhadi e Roozbeh Mottaghi, e desde então se tornou um ambiente de teste padrão para o estudo de modelos de visão e linguagem aumentados por conhecimento.

O benchmark compreende 14.031 perguntas emparelhadas com 14.031 imagens, sendo que cada imagem possui exatamente uma pergunta. As perguntas são projetadas para serem inequívocas e exigirem conhecimento externo que não está visualmente presente. Por exemplo, uma pergunta pode ser "Que tipo de animal é este?" quando a imagem mostra uma criatura parcialmente obscurecida, ou "Qual é a finalidade desta ferramenta?" para um objeto desconhecido. O conjunto de dados cobre uma ampla gama de domínios de conhecimento, incluindo alimentos, animais, veículos, esportes e itens domésticos, garantindo diversidade e desafiando os modelos a raciocinar sobre o contexto do mundo real.

Construção e Anotação

O OK-VQA foi construído por meio de crowdsourcing de perguntas de trabalhadores do Amazon Mechanical Turk. O processo de anotação envolveu mostrar uma imagem aos trabalhadores e pedir que gerassem uma pergunta que não pudesse ser respondida apenas olhando para a imagem, mas que exigisse senso comum ou conhecimento factual. Para garantir a qualidade, cada pergunta foi validada por múltiplos anotadores, e apenas aquelas com alta concordância entre anotadores foram mantidas. O conjunto de dados final foi então dividido em conjuntos de treinamento (9.009 perguntas), validação (2.016 perguntas) e teste (3.006 perguntas). O conjunto de teste é usado para avaliação oficial por meio de um servidor online, com a acurácia como métrica principal.

Avaliação e Métricas

A métrica de avaliação padrão para o OK-VQA é a acurácia de correspondência exata, em que a resposta prevista por um modelo é considerada correta se corresponder exatamente a uma das respostas de referência. Cada pergunta possui 10 respostas de referência fornecidas por diferentes anotadores, e uma previsão é pontuada como correta se corresponder a qualquer uma delas. Essa abordagem leva em conta a variabilidade na forma como os humanos formulam respostas. Os modelos são tipicamente avaliados no conjunto de teste, mas os pesquisadores frequentemente usam o conjunto de validação para desenvolvimento e ajuste de hiperparâmetros.

Desafios e Limitações

O OK-VQA apresenta vários desafios para sistemas de IA. Primeiro, exige integrar informações visuais com uma ampla base de conhecimento de mundo, o que é difícil para modelos treinados principalmente em pares de imagem e texto. Segundo, muitas perguntas são ambíguas ou exigem raciocínio sobre contexto implícito, como compreender práticas culturais ou propriedades físicas. Terceiro, o conjunto de dados foi criticado por conter algumas perguntas que são respondíveis apenas a partir da imagem, apesar da intenção do projeto, e por ter um tamanho relativamente pequeno em comparação com outros benchmarks de VQA. Além disso, a métrica de correspondência exata pode ser severa, penalizando respostas semanticamente corretas, mas com formulação diferente.

Impacto e Uso

O OK-VQA se tornou um benchmark amplamente utilizado nas áreas de aprendizado de máquina e visão computacional. Ele foi adotado por pesquisadores para avaliar modelos que combinam codificadores visuais com modelos de linguagem de grande escala, frequentemente usando técnicas como atenção cruzada para fundir representações de imagem e texto. Muitos modelos de visão e linguagem de última geração, incluindo aqueles baseados em arquiteturas transformers, relatam desempenho no OK-VQA como um indicador-chave de sua capacidade de realizar raciocínio baseado em conhecimento. O conjunto de dados também estimulou o desenvolvimento de métodos especializados para recuperação e integração de conhecimento, como a incorporação de bases de conhecimento externas ou o uso de técnicas de aumento de dados para melhorar a generalização.

Benchmarks Relacionados

O OK-VQA faz parte de uma família mais ampla de benchmarks de VQA. O conjunto de dados VQA original, introduzido em 2015, foca em perguntas respondíveis a partir do conteúdo da imagem. Outros benchmarks relacionados incluem o Visual Genome, que enfatiza relações e atributos, e o GQA, que testa raciocínio composicional. Benchmarks mais recentes, como o A-OKVQA, estendem o OK-VQA fornecendo opções de resposta adicionais e anotações de justificativa. O OK-VQA permanece distinto em seu foco explícito em conhecimento externo, tornando-o um recurso único para estudar a interseção entre percepção e raciocínio em IA.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:visual-question-answering·benchmark·computer-vision·dataset
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico