TextVQA es una tarea de investigación y un punto de referencia en el campo de la inteligencia artificial que combina la visión por computadora y el procesamiento del lenguaje natural. Se centra en responder preguntas sobre imágenes donde la respuesta correcta depende de leer y comprender el texto que aparece dentro de la propia imagen. Esto incluye texto en señales de tráfico, etiquetas de productos, menús de restaurantes, notas escritas a mano y otros objetos del mundo real. A diferencia de la respuesta a preguntas visuales estándar (VQA), que a menudo se basa en reconocer objetos y escenas, TextVQA prueba específicamente la capacidad de un modelo para realizar el reconocimiento óptico de caracteres (OCR) e integrar la información textual extraída con el contexto visual y la semántica de la pregunta.
La tarea se introdujo para abordar una brecha en los conjuntos de datos VQA anteriores, que típicamente contenían imágenes con poco o ningún texto significativo. TextVQA requiere que un sistema no solo detecte y reconozca texto, sino que también razone sobre su relevancia para la pregunta, a menudo involucrando razonamiento espacial (por ejemplo, "¿Qué está escrito encima de la puerta?") o inferencia de sentido común (por ejemplo, "¿Qué tipo de tienda es esta?" basado en un letrero). El punto de referencia ha impulsado una investigación significativa en el aprendizaje multimodal, particularmente en el desarrollo de arquitecturas que puedan procesar conjuntamente características visuales, tokens OCR y representaciones del lenguaje.
Conjunto de Datos y Punto de Referencia
El conjunto de datos TextVQA fue publicado en 2019 por investigadores del Instituto de Tecnología de Georgia y Facebook AI Research (ahora parte de Meta AI). Consiste en 28,408 preguntas sobre 4,972 imágenes, con imágenes obtenidas del conjunto de datos Open Images. Cada imagen contiene al menos una palabra de texto, y las preguntas están diseñadas para requerir la lectura de ese texto para responder correctamente. El conjunto de datos se divide en conjuntos de entrenamiento (34,602 preguntas), validación (5,000 preguntas) y prueba, con el conjunto de prueba utilizado para la evaluación oficial a través de un servidor en línea.
Las preguntas son abiertas y requieren respuestas cortas, típicamente de una a tres palabras. El conjunto de datos incluye anotaciones OCR de verdad fundamental para cada imagen, proporcionando cuadros delimitadores de palabras y texto reconocido. Esto permite que los modelos se entrenen con supervisión OCR explícita o que utilicen características OCR preextraídas. La métrica de evaluación es la precisión VQA estándar, donde una respuesta predicha se considera correcta si coincide con una de las diez respuestas de verdad fundamental proporcionadas por humanos.
Arquitecturas de Modelos
Los primeros enfoques para TextVQA utilizaron pipelines modulares que combinaban un sistema OCR preentrenado (como Rosetta o Tesseract) con una red neuronal para el razonamiento. Una arquitectura común fue el modelo Look, Read, Reason, Answer (LoRRA), que utilizaba una red residual para características de imagen, un LSTM bidireccional para la codificación de preguntas y una capa de fusión multimodal para combinar características visuales, textuales y OCR. LoRRA también incorporaba un mecanismo de copia que permitía al modelo generar palabras directamente de los tokens OCR, lo que resultó efectivo para responder preguntas que requieren texto verbatim.
Los modelos posteriores aprovecharon arquitecturas basadas en transformadores, como M4C (Multimodal Multi-Copy Mesh), que introdujo un proceso de decodificación de respuestas iterativo y un mecanismo de múltiples copias para manejar múltiples tokens OCR. Más tarde, modelos unificados de visión-lenguaje basados en sistemas de modelos de lenguaje grandes (por ejemplo, LLaVA, Flamingo) se adaptaron para TextVQA mediante el ajuste fino en el conjunto de datos, logrando una mayor precisión al aprovechar el preentrenamiento a gran escala en pares de imagen-texto.
Desafíos y Evaluación
TextVQA presenta varios desafíos únicos. Primero, el OCR en escenas naturales es difícil debido a fuentes variadas, iluminación, oclusión y distorsión de perspectiva. Segundo, el modelo debe determinar qué texto es relevante para la pregunta, ya que las imágenes a menudo contienen múltiples instancias de texto. Tercero, el razonamiento puede requerir combinar texto con señales visuales, como identificar el color de un letrero o la posición de una etiqueta. Cuarto, algunas preguntas requieren razonamiento aritmético o temporal basado en texto (por ejemplo, "¿A qué hora cierra la tienda?" a partir de un letrero).
La evaluación se realiza en el conjunto de prueba, con modelos clasificados por precisión. A partir de 2024, los modelos de última generación logran alrededor del 80% de precisión, frente a aproximadamente el 40% de los primeros puntos de referencia. El punto de referencia también se ha extendido a tareas relacionadas como OCR-VQA y ST-VQA, que se centran en la comprensión de texto en escenas en diferentes contextos.
Impacto y Aplicaciones
TextVQA ha influido en el desarrollo de sistemas de IA multimodal, particularmente en el contexto de la comprensión de documentos y tecnologías de asistencia. Las aplicaciones incluyen ayudar a usuarios con discapacidad visual a leer letreros o etiquetas, procesamiento automatizado de formularios y mejora de motores de búsqueda que indexan imágenes con texto. La tarea también ha impulsado la investigación en mecanismos de atención cruzada y codificación posicional para el anclaje espacial de texto.
El punto de referencia se utiliza ampliamente en la investigación académica y la industria, con Google DeepMind, OpenAI y otros laboratorios usándolo como banco de pruebas para evaluar modelos de visión-lenguaje. También se ha integrado en puntos de referencia más amplios como el conjunto de razonamiento de inteligencia artificial, contribuyendo a la comprensión de cómo los modelos manejan el razonamiento multimodal con señales textuales.
Tareas y Conjuntos de Datos Relacionados
TextVQA es parte de una familia de tareas de comprensión de texto en escenas. Los conjuntos de datos relacionados incluyen ST-VQA (Scene Text Visual Question Answering), que se centra en el razonamiento basado en texto con una distribución de imágenes diferente, y OCR-VQA, que utiliza imágenes de portadas de libros y hace preguntas sobre títulos y autores. Estos puntos de referencia colectivamente empujan los límites del aprendizaje automático en la combinación de OCR con razonamiento de alto nivel.
Direcciones Futuras
El trabajo futuro en TextVQA puede involucrar un manejo más robusto de texto multilingüe, una mejor integración con modelos de IA generativa que puedan producir respuestas más largas y una mejor generalización a dominios no vistos. Los investigadores también están explorando cómo hacer que los modelos sean más interpretables al explicar sus pasos de razonamiento y cómo reducir la dependencia de grandes conjuntos de datos anotados mediante el aprendizaje autosupervisado en imágenes no etiquetadas con texto.