TextCaps est un ensemble de données et un banc d'essai à grande échelle pour la génération de légendes d'images, qui se concentre spécifiquement sur la production de légendes intégrant le texte apparaissant dans les images. Contrairement aux tâches traditionnelles de génération de légendes d'images qui décrivent des objets et des scènes, TextCaps exige que les modèles lisent et raisonnent sur le texte présent dans l'image, comme les panneaux de rue, les étiquettes de produits ou les couvertures de livres, et intègrent cette information dans une description en langage naturel cohérente. L'ensemble de données a été introduit en 2020 par des chercheurs de Google et de l'Université de Californie à Berkeley, et est devenu une évaluation standard pour les modèles de vision-langage visant à combler le fossé entre la perception visuelle et la reconnaissance optique de caractères (OCR).
Le défi central de TextCaps est qu'il combine deux capacités distinctes : la compréhension visuelle et la reconnaissance de texte. Un modèle doit non seulement identifier les objets et leurs relations, mais aussi transcrire avec précision le texte de l'image et décider quelles parties de ce texte sont pertinentes pour la description globale de la scène. Par exemple, une image d'un café pourrait nécessiter que la légende mentionne le nom sur la devanture, le type de boisson sur le tableau des menus ou le texte sur une affiche en arrière-plan. Cela exige une intégration profonde des techniques de Computer vision avec les systèmes de Natural language processing et de Optical character recognition (OCR).
Composition de l'ensemble de données et annotations
L'ensemble de données TextCaps contient 28 000 images, chacune associée à plusieurs légendes rédigées par des humains, totalisant plus de 145 000 légendes. Les images proviennent du domaine du texte dans les images, qui comprend une grande variété de scènes du monde réel, telles que des vues de rue, des environnements intérieurs et des photos de produits. Chaque image a en moyenne cinq légendes, et celles-ci sont conçues pour être descriptives et naturelles, incluant souvent des chaînes de texte spécifiques apparaissant dans l'image. L'ensemble de données est divisé en ensembles d'entraînement, de validation et de test, l'ensemble de test étant utilisé pour l'évaluation officielle du banc d'essai. Les annotations ont été collectées via une plateforme de crowdsourcing, avec des instructions minutieuses pour garantir que les légendes ne mentionnent le texte que lorsqu'il est pertinent pour la scène.
L'ensemble de données fournit également des annotations OCR pour chaque image, y compris des boîtes englobantes et le texte transcrit, qui sont utilisées comme entrée pour de nombreux modèles. Cela permet aux chercheurs de se concentrer sur les aspects de raisonnement et de génération plutôt que sur la détection OCR brute, bien que certains modèles intègrent également un apprentissage OCR de bout en bout.
Métriques d'évaluation et défis
La principale métrique d'évaluation pour TextCaps est CIDEr, qui mesure la similarité entre les légendes générées et les références humaines, en mettant l'accent sur le consensus et l'informativité. D'autres métriques telles que BLEU, METEOR et ROUGE sont également rapportées, mais CIDEr est le principal critère de classement. La tâche est particulièrement difficile car les légendes doivent être à la fois grammaticalement correctes et factuellement précises par rapport au texte de l'image. Un modèle qui identifie correctement les objets mais lit mal un panneau obtiendra un score faible.
Les modèles de base précoces utilisant des modèles standard de génération de légendes d'images, tels que ceux basés sur des architectures Encoder-Decoder Architecture avec des caractéristiques Residual Network (ResNet), ont obtenu de mauvais résultats sur TextCaps, atteignant des scores CIDEr inférieurs à 50. Cela a mis en évidence la nécessité d'architectures spécialisées capables d'incorporer des jetons OCR dans le processus de génération. Des travaux ultérieurs ont introduit des méthodes utilisant un décodeur basé sur Transformer (architecture) avec une attention croisée sur les caractéristiques OCR, conduisant à des améliorations significatives.
Architectures de modèles et approches
La plupart des approches réussies pour TextCaps utilisent un pipeline en deux étapes : d'abord, un système OCR extrait le texte de l'image, puis un modèle de génération de légendes produit la description en utilisant à la fois les caractéristiques visuelles et les jetons OCR. Le modèle de génération de légendes est souvent un Transformer (architecture) qui prend en entrée une séquence de caractéristiques de régions d'image et des plongements de jetons OCR, et génère une légende jeton par jeton. Par exemple, le modèle M4C (Multimodal Multi-Copy Mesh), introduit par Hu et al., utilise un transformer avec un mécanisme de copie qui peut copier directement le texte des jetons OCR, ce qui est crucial pour reproduire avec précision des chaînes comme les noms de marques ou les adresses.
Une autre ligne de travail intègre l'OCR directement dans l'encodeur visuel, en utilisant un Neural network qui traite simultanément les pixels et les plongements de texte. Ces modèles exploitent souvent des Large language model pré-entraînés pour la partie génération de texte, en les affinant sur l'ensemble d'entraînement de TextCaps. L'utilisation de Cross-Attention entre les modalités visuelle et textuelle est un modèle de conception courant, permettant au modèle d'aligner les jetons OCR avec les régions d'image.
Impact et bancs d'essai connexes
TextCaps a stimulé le développement de bancs d'essai plus complets combinant texte et vision, tels que OCR-VQA et ST-VQA, qui se concentrent sur la réponse à des questions visuelles avec du texte. Il a également influencé la conception de Large language model multimodaux, tels que ceux développés par OpenAI et Google DeepMind, qui sont désormais capables de lire le texte dans les images et de générer des réponses descriptives. L'ensemble de données reste un terrain de test standard pour évaluer les capacités de raisonnement conscient de l'OCR des systèmes d'IA, et il est souvent utilisé en conjonction avec d'autres ensembles de données comme text-vqa et COCO-Text.
En 2025, les modèles de pointe sur TextCaps atteignent des scores CIDEr supérieurs à 140, une amélioration significative par rapport aux modèles de base initiaux, mais la tâche est toujours considérée comme ouverte, avec des possibilités d'amélioration dans la gestion des styles de texte rares, des mises en page complexes et de la pertinence ambiguë du texte. Le banc d'essai continue d'être une ressource précieuse pour faire progresser la recherche en Generative AI et en compréhension multimodale.
Orientations futures
L'avenir de la recherche sur TextCaps réside dans le développement de modèles capables non seulement de lire le texte, mais aussi de raisonner sur sa signification sémantique dans le contexte, comme comprendre qu'un panneau « Solde » implique une remise ou qu'un panneau « Entrée interdite » indique une restriction. Cela nécessite une intégration plus profonde des connaissances du monde et du sens commun, ce qui est un domaine d'étude actif en Artificial intelligence. De plus, il existe un intérêt pour étendre TextCaps à la vidéo, où le texte apparaît dynamiquement, et à des contextes multilingues, où l'OCR et la génération de légendes doivent gérer plusieurs écritures. La conception de l'ensemble de données a également inspiré des efforts similaires dans d'autres domaines, tels que l'imagerie médicale et la conduite autonome, où la lecture du texte dans l'environnement est critique.
Voir aussi
- image-captioning
- Optical character recognition
- Vision-language model
- multimodal-learning
Références
- Hu, R., Singh, A., Darrell, T., & Rohrbach, M. (2020). TextCaps : A Dataset for Image Captioning with Reading Comprehension. Dans European Conference on Computer Vision (ECCV).
- Sidorov, O., Hu, R., Rohrbach, M., & Singh, A. (2020). TextCaps : A Dataset for Image Captioning with Reading Comprehension. arXiv preprint arXiv:2003.12462.