DocVQA (Document Visual Question Answering) es un conjunto de datos de referencia diseñado para evaluar la capacidad de los sistemas de inteligencia artificial para responder preguntas sobre el contenido de imágenes de documentos. A diferencia del question answering visual (VQA) tradicional, que se centra en escenas naturales, DocVQA aborda los desafíos únicos de los documentos, que combinan contenido textual, diseños complejos, tablas, figuras y tipografía variada. La tarea requiere que un modelo no solo lea el texto, sino que también comprenda la disposición espacial y las señales visuales para localizar y sintetizar la respuesta correcta.
El conjunto de datos fue introducido en 2020 por investigadores de la Universidad del País Vasco (UPV/EHU) y la Universidad de Alicante, liderados por Ruben Tito y sus colegas. Se creó para llenar un vacío en los benchmarks existentes, que se centraban en imágenes naturales o en la extracción de texto puro sin el componente de razonamiento. Desde entonces, DocVQA se ha convertido en un punto de referencia estándar para el progreso en la comprensión de documentos, impulsando avances en modelos multimodales que combinan el procesamiento de visión y lenguaje.
Composición del conjunto de datos
El conjunto de datos DocVQA comprende más de 50,000 preguntas derivadas de más de 12,000 páginas de documentos individuales. Estos documentos provienen de una amplia gama de industrias y formatos, incluidos artículos académicos, informes empresariales, facturas, formularios y manuales técnicos. Cada pregunta está emparejada con una respuesta de verdad fundamental, que puede ser una frase corta, un número, una fecha o una lista de elementos. Las preguntas están diseñadas para requerir diferentes niveles de comprensión, desde la recuperación de texto simple (por ejemplo, "¿Cuál es el número de factura?") hasta un razonamiento más complejo que implica combinar información de múltiples partes del documento (por ejemplo, "¿Cuál es el costo total de todos los elementos enumerados en la tabla?").
El conjunto de datos se divide en conjuntos de entrenamiento, validación y prueba. El conjunto de entrenamiento contiene aproximadamente 41,000 preguntas, el de validación alrededor de 5,000 y el de prueba cerca de 5,000. El conjunto de prueba se reserva para la evaluación oficial, con resultados reportados en un leaderboard público. Las preguntas se categorizan por tipo, incluyendo respuestas de sí/no, número, fecha y frase corta, lo que permite un análisis detallado del rendimiento del modelo en diferentes formatos de pregunta.
Métricas de evaluación
El rendimiento en DocVQA se mide principalmente utilizando la métrica de Similitud de Levenshtein Normalizada Promedio (ANLS). A diferencia de la precisión de coincidencia exacta, ANLS es tolerante a errores ortográficos menores o variaciones ligeras en la redacción, lo que es más realista para la comprensión de documentos donde pueden ocurrir errores de OCR (reconocimiento óptico de caracteres) o diferencias de formato. La puntuación ANLS varía de 0 a 1, donde 1 indica una concordancia perfecta entre las respuestas predichas y las de verdad fundamental. Esta métrica penaliza las respuestas incorrectas más severamente que las coincidencias parciales, proporcionando una medida robusta de la calidad del modelo.
Además de ANLS, algunos estudios reportan la precisión de coincidencia exacta como métrica secundaria. El leaderboard oficial clasifica las presentaciones por la puntuación ANLS, con los modelos de mejor rendimiento logrando puntuaciones superiores a 0.90 a partir de 2024, lo que indica un rendimiento casi humano en el benchmark. Sin embargo, estas puntuaciones altas a menudo provienen de modelos grandes y computacionalmente intensivos, y sigue existiendo una brecha entre el rendimiento en el benchmark y la robustez en el mundo real.
Relación con otros benchmarks
DocVQA es parte de una familia más amplia de benchmarks de comprensión de documentos, incluidos SQuAD para question answering basado solo en texto y Visual QA para imágenes naturales. Está estrechamente relacionado con otras tareas específicas de documentos como OCR, extracción de información clave y análisis de diseño. El benchmark ha inspirado conjuntos de datos derivados como InfographicVQA y ChartQA, que se centran en tipos de documentos más especializados. En el contexto de la Artificial intelligence y el Machine learning, DocVQA sirve como banco de pruebas para sistemas multimodales que integran arquitecturas de Neural network, particularmente aquellas basadas en el modelo Transformer (architecture).
El auge de los Large language models (LLMs) con capacidades de visión, como los desarrollados por OpenAI, Anthropic y Google DeepMind, ha llevado a un renovado interés en DocVQA. Estos modelos, a menudo construidos sobre mecanismos de Encoder-Decoder Architecture o Multi-Head Attention, se evalúan en DocVQA para comparar sus habilidades de razonamiento en documentos. El benchmark también se ha utilizado para evaluar el rendimiento de sistemas de IA de documentos especializados de empresas como Amazon Web Services y Google Cloud, que ofrecen servicios de procesamiento de documentos.
Desafíos y limitaciones
A pesar de su uso generalizado, DocVQA tiene varias limitaciones. El conjunto de datos está principalmente en inglés, lo que limita su aplicabilidad a la comprensión de documentos multilingües. Los documentos son relativamente limpios y bien escaneados, mientras que los documentos del mundo real a menudo contienen ruido, escritura a mano o esquemas de color complejos. Además, las preguntas son generadas por anotadores humanos y pueden no cubrir todos los tipos posibles de razonamiento, lo que potencialmente sesga los modelos hacia ciertos patrones. El benchmark tampoco prueba explícitamente la robustez frente a perturbaciones adversarias o cambios de dominio, que son importantes para el despliegue en entornos de producción.
Otro desafío es el costo computacional de lograr puntuaciones altas. Muchos modelos de mejor rendimiento dependen de un pretraining a gran escala en conjuntos de datos masivos, lo que no es factible para todos los grupos de investigación. Esto ha llevado a un creciente interés en arquitecturas y métodos de entrenamiento más eficientes, como Model Pruning y Data Augmentation, para hacer la comprensión de documentos más accesible.
Direcciones futuras
El campo del question answering visual de documentos está evolucionando rápidamente. El trabajo futuro puede centrarse en extender DocVQA a otros idiomas y tipos de documentos, incorporar tareas de razonamiento más complejas y mejorar la interpretabilidad del modelo. También hay un impulso hacia el aprendizaje zero-shot y few-shot, donde los modelos pueden generalizar a formatos de documentos no vistos sin un ajuste fino extenso. A medida que la Generative AI continúa avanzando, DocVQA sigue siendo un benchmark crítico para garantizar que los sistemas de IA puedan leer y razonar de manera confiable sobre la vasta cantidad de información almacenada en documentos en todo el mundo.