L'OCR-VQA (Optical Character Recognition - Visual Question Answering) est une tâche de recherche et un benchmark en intelligence artificielle qui combine la reconnaissance optique de caractères (OCR) avec la réponse à des questions visuelles (VQA). Dans cette tâche, un modèle reçoit une image contenant du texte (comme un panneau de signalisation, un document ou une étiquette de produit) et une question en langage naturel sur ce texte ou sur l'image. Le modèle doit d'abord extraire le texte pertinent de l'image à l'aide de techniques d'OCR, puis raisonner à la fois sur le contenu visuel et sur le texte extrait pour produire une réponse précise. Cela va au-delà de la VQA traditionnelle, qui se concentre généralement sur les objets, les couleurs et les relations spatiales, en exigeant du modèle qu'il lise et interprète les informations textuelles intégrées dans la scène visuelle.
La tâche OCR-VQA a été introduite pour répondre au besoin croissant de systèmes d'IA capables de comprendre des images du monde réel où le texte est une caractéristique dominante. Elle sert de benchmark pour évaluer les capacités des modèles en matière de compréhension conjointe visuelle-textuelle, et elle a des implications pour des applications telles que les technologies d'assistance pour les utilisateurs malvoyants, l'analyse automatisée de documents et la compréhension de scènes dans les systèmes autonomes. La tâche est étroitement liée à d'autres domaines de l'intelligence artificielle, notamment la recherche en Machine learning, Deep learning et Neural network, et elle s'appuie sur les avancées des architectures Transformer (architecture) et des Large language models.
Historique et origines
Le concept d'OCR-VQA est issu du domaine plus large de la réponse à des questions visuelles, qui a gagné une attention significative au milieu des années 2010 avec la publication de jeux de données comme VQA v1 en 2015 et VQA v2 en 2017. Ces premiers jeux de données se concentraient principalement sur des images naturelles sans texte, mais les chercheurs ont rapidement reconnu que les images du monde réel contiennent souvent du texte crucial pour répondre aux questions. En 2019, un jeu de données OCR-VQA dédié a été introduit par des chercheurs de l'Université du Maryland, contenant plus de 200 000 images de couvertures de livres, chacune associée à des questions sur le titre, l'auteur et d'autres détails textuels. Ce jeu de données a fourni un environnement contrôlé pour étudier l'interaction entre l'OCR et la VQA.
Des travaux ultérieurs ont élargi la portée pour inclure divers types d'images, tels que des scènes de rue, des menus de restaurant et des emballages de produits. La tâche a gagné en popularité avec l'essor des grands modèles pré-entraînés, en particulier ceux basés sur l'architecture Transformer (architecture), qui pouvaient être affinés pour l'OCR-VQA en combinant des encodeurs visuels avec des décodeurs de texte. Au début des années 2020, l'OCR-VQA était devenu une tâche d'évaluation standard dans la recherche en IA multimodale, avec des modèles atteignant de plus en plus une haute précision sur les jeux de données de référence.
Approche technique
Résoudre l'OCR-VQA implique généralement un pipeline en plusieurs étapes ou un modèle de bout en bout. Le pipeline traditionnel applique d'abord un système d'OCR pour détecter et reconnaître les régions de texte dans l'image, produisant une liste de chaînes de caractères avec leurs boîtes englobantes. Ces informations sont ensuite introduites dans un modèle VQA, qui combine les caractéristiques visuelles (issues d'un réseau de neurones convolutif ou d'un vision transformer) avec les plongements de texte OCR et le plongement de la question. Le modèle utilise un mécanisme d'attention pour se concentrer sur les parties pertinentes de l'image et du texte extrait, puis génère une réponse, souvent à l'aide d'un décodeur séquence-à-séquence.
Les approches modernes, en particulier celles utilisant des Large language models, intègrent l'OCR directement dans l'architecture du modèle. Par exemple, des modèles comme Flamingo et LLaVA intègrent des capacités d'OCR en étant entraînés sur des paires image-texte incluant des images riches en texte. Ces modèles utilisent un mécanisme de Multi-Head Attention pour aligner les jetons visuels et textuels, leur permettant de lire le texte des images sans étape d'OCR séparée. L'utilisation d'architectures Encoder-Decoder Architecture et de couches de Cross-Attention permet au modèle de raisonner conjointement sur les deux modalités. L'entraînement de tels modèles nécessite des jeux de données à grande échelle et des ressources de calcul importantes, s'appuyant souvent sur l'infrastructure Amazon Web Services ou Google Cloud.
Applications et cas d'utilisation
L'OCR-VQA a des applications pratiques dans plusieurs domaines. Dans les technologies d'assistance, elle peut aider les utilisateurs malvoyants en lisant le texte des images qu'ils capturent, comme des panneaux, des étiquettes ou des documents, et en répondant à des questions sur le contenu. Par exemple, un utilisateur pourrait prendre une photo d'un flacon de médicament et demander : « Quel est le dosage ? » Le système extrairait le texte et fournirait la réponse. Dans l'analyse de documents, l'OCR-VQA permet aux systèmes automatisés d'interroger des documents ou des formulaires numérisés, facilitant l'extraction et la récupération de données. Dans le commerce électronique, elle peut être utilisée pour répondre à des questions sur des images de produits, comme lire la date de péremption sur un emballage alimentaire ou le numéro de modèle sur un appareil électronique.
Dans la conduite autonome, l'OCR-VQA contribue à la compréhension de scènes en lisant les panneaux de signalisation, les panneaux publicitaires et d'autres textes dans l'environnement. Cela est particulièrement pertinent pour des entreprises comme Waymo et Tesla, qui s'appuient sur des systèmes de perception devant interpréter les informations textuelles pour une navigation sûre. De plus, l'OCR-VQA est utilisée dans les outils éducatifs, où les étudiants peuvent poser des questions sur des images dans des manuels ou des documents historiques, et dans la modération de contenu, où elle aide à identifier le texte dans les images qui pourrait violer les politiques.
Défis et limites
Malgré les progrès, l'OCR-VQA fait face à plusieurs défis. Un problème majeur est la variabilité du texte dans les images du monde réel : les polices, les orientations, les conditions d'éclairage et les occlusions peuvent dégrader la précision de l'OCR. Un autre défi est la nécessité d'un raisonnement de bon sens au-delà de la simple extraction de texte. Par exemple, répondre à « Quel est le titre de ce livre ? » nécessite de lire le titre, mais répondre à « Ce livre est-il adapté aux enfants ? » nécessite un raisonnement sur le contenu, qui peut ne pas être directement énoncé dans le texte. Les modèles ont souvent du mal avec un texte ambigu ou incomplet, et ils peuvent halluciner des réponses lorsque le texte n'est pas entièrement lisible.
De plus, les jeux de données de référence comme OCR-VQA peuvent ne pas capturer pleinement la diversité des scénarios du monde réel, ce qui conduit à un surajustement. Le coût de calcul de l'entraînement de grands modèles multimodaux pour l'OCR-VQA est également significatif, ce qui limite l'accessibilité pour les petits groupes de recherche. Les chercheurs explorent des techniques telles que la Data Augmentation et le Curriculum Learning pour améliorer la robustesse, mais la tâche reste un domaine de recherche ouvert.
Orientations futures
L'avenir de l'OCR-VQA est étroitement lié aux avancées en Generative AI et aux modèles de langage multimodaux à grande échelle. À mesure que les modèles deviennent plus capables de gérer de longues séquences et d'intégrer plusieurs modalités, ils devraient mieux performer sur les tâches d'OCR-VQA. Il existe également une tendance à construire des modèles unifiés capables de gérer une large gamme de tâches visuelles et textuelles sans affinage spécifique à la tâche. De plus, l'intégration de l'OCR-VQA avec d'autres domaines de l'IA, comme le Reinforcement learning et le Model Pruning, pourrait conduire à des systèmes plus efficaces et adaptables. Au milieu des années 2020, la recherche est en cours, et il est probable que l'OCR-VQA continuera d'évoluer en tant que benchmark clé pour évaluer l'intersection de la vision et du langage.