DocVQA (Document Visual Question Answering) é um conjunto de dados de referência (benchmark) projetado para avaliar a capacidade de sistemas de inteligência artificial de responder a perguntas sobre o conteúdo de imagens de documentos. Diferentemente da resposta visual a perguntas (VQA) tradicional, que se concentra em cenas naturais, o DocVQA aborda os desafios únicos dos documentos, que combinam conteúdo textual, layouts complexos, tabelas, figuras e tipografia variada. A tarefa exige que um modelo não apenas leia o texto, mas também compreenda o arranjo espacial e as pistas visuais para localizar e sintetizar a resposta correta.
O conjunto de dados foi introduzido em 2020 por pesquisadores da Universidade do País Basco (UPV/EHU) e da Universidade de Alicante, liderados por Ruben Tito e seus colegas. Ele foi criado para preencher uma lacuna nos benchmarks existentes, que se concentravam em imagens naturais ou em extração pura de texto sem o componente de raciocínio. Desde então, o DocVQA tornou-se um ponto de referência padrão para o progresso na compreensão de documentos, impulsionando avanços em modelos multimodais que combinam processamento de visão e linguagem.
Composição do Conjunto de Dados
O conjunto de dados DocVQA compreende mais de 50.000 perguntas derivadas de mais de 12.000 páginas individuais de documentos. Esses documentos são provenientes de uma ampla gama de setores e formatos, incluindo artigos acadêmicos, relatórios empresariais, faturas, formulários e manuais técnicos. Cada pergunta é emparelhada com uma resposta de referência (ground-truth), que pode ser uma frase curta, um número, uma data ou uma lista de itens. As perguntas são projetadas para exigir diferentes níveis de compreensão, desde a recuperação simples de texto (por exemplo, "Qual é o número da fatura?") até o raciocínio mais complexo que envolve combinar informações de várias partes do documento (por exemplo, "Qual é o custo total de todos os itens listados na tabela?").
O conjunto de dados é dividido em conjuntos de treinamento, validação e teste. O conjunto de treinamento contém aproximadamente 41.000 perguntas, o de validação cerca de 5.000 e o de teste cerca de 5.000. O conjunto de teste é reservado e usado para avaliação oficial, com resultados relatados em um ranking público. As perguntas são categorizadas por tipo, incluindo respostas sim/não, número, data e frase curta, permitindo uma análise detalhada do desempenho do modelo em diferentes formatos de pergunta.
Métricas de Avaliação
O desempenho no DocVQA é medido principalmente usando a métrica de Similaridade de Levenshtein Normalizada Média (ANLS). Diferentemente da precisão de correspondência exata, a ANLS é tolerante a pequenos erros de ortografia ou variações leves na formulação, o que é mais realista para a compreensão de documentos, onde erros de OCR (reconhecimento óptico de caracteres) ou diferenças de formatação podem ocorrer. A pontuação ANLS varia de 0 a 1, com 1 indicando concordância perfeita entre as respostas previstas e as de referência. Essa métrica penaliza respostas incorretas mais severamente do que correspondências parciais, fornecendo uma medida robusta da qualidade do modelo.
Além da ANLS, alguns estudos relatam a precisão de correspondência exata como uma métrica secundária. O ranking oficial classifica as submissões pela pontuação ANLS, com os modelos de melhor desempenho alcançando pontuações acima de 0,90 em 2024, indicando desempenho quase humano no benchmark. No entanto, essas pontuações altas geralmente vêm de modelos grandes e computacionalmente intensivos, e ainda há uma lacuna entre o desempenho no benchmark e a robustez no mundo real.
Relação com Outros Benchmarks
O DocVQA faz parte de uma família mais ampla de benchmarks de compreensão de documentos, incluindo SQuAD para resposta a perguntas somente em texto e Visual QA para imagens naturais. Ele está intimamente relacionado a outras tarefas específicas de documentos, como OCR, extração de informações-chave e análise de layout. O benchmark inspirou conjuntos de dados derivados, como InfographicVQA e ChartQA, que se concentram em tipos de documentos mais especializados. No contexto de inteligência artificial e aprendizado de máquina, o DocVQA serve como um campo de teste para sistemas multimodais que integram arquiteturas de rede neural, particularmente aquelas baseadas no modelo transformador.
O surgimento de modelos de linguagem de grande escala (LLMs) com capacidades de visão, como os desenvolvidos por OpenAI, Anthropic e Google DeepMind, levou a um interesse renovado no DocVQA. Esses modelos, frequentemente construídos sobre mecanismos de codificador-decodificador ou atenção de múltiplas cabeças, são avaliados no DocVQA para medir suas habilidades de raciocínio em documentos. O benchmark também tem sido usado para avaliar o desempenho de sistemas especializados de IA para documentos de empresas como Amazon Web Services e Google Cloud, que oferecem serviços de processamento de documentos.
Desafios e Limitações
Apesar de seu uso generalizado, o DocVQA tem várias limitações. O conjunto de dados é principalmente em inglês, o que limita sua aplicabilidade à compreensão de documentos multilíngues. Os documentos são relativamente limpos e bem digitalizados, enquanto documentos do mundo real frequentemente contêm ruído, escrita manual ou esquemas de cores complexos. Além disso, as perguntas são geradas por anotadores humanos e podem não cobrir todos os tipos de raciocínio, potencialmente enviesando os modelos para certos padrões. O benchmark também não testa explicitamente a robustez a perturbações adversariais ou mudanças de domínio, que são importantes para a implantação em ambientes de produção.
Outro desafio é o custo computacional para alcançar pontuações altas. Muitos modelos de melhor desempenho dependem de pré-treinamento em larga escala em conjuntos de dados massivos, o que não é viável para todos os grupos de pesquisa. Isso levou a um interesse crescente em arquiteturas e métodos de treinamento mais eficientes, como poda de modelo e aumento de dados, para tornar a compreensão de documentos mais acessível.
Direções Futuras
O campo da resposta visual a perguntas em documentos está evoluindo rapidamente. Trabalhos futuros podem se concentrar em estender o DocVQA a outros idiomas e tipos de documentos, incorporar tarefas de raciocínio mais complexas e melhorar a interpretabilidade dos modelos. Há também um impulso em direção ao aprendizado zero-shot e few-shot, onde os modelos podem generalizar para formatos de documentos não vistos sem ajuste fino extensivo. À medida que a IA generativa continua a avançar, o DocVQA permanece um benchmark crítico para garantir que os sistemas de IA possam ler e raciocinar de forma confiável sobre a vasta quantidade de informações armazenadas em documentos em todo o mundo.