COCO-Text est un jeu de données à grande échelle conçu pour la détection et la reconnaissance de texte dans des scènes naturelles. Il est construit sur la collection d'images Microsoft Common Objects in Context (COCO), qui contient plus de 200 000 images annotées. COCO-Text se concentre spécifiquement sur les instances de texte dans ces images, fournissant des annotations pour les régions de texte, leurs transcriptions et des attributs supplémentaires. Le jeu de données a été introduit en 2016 par des chercheurs de Google et d'autres institutions, et il est devenu une référence standard pour évaluer les algorithmes de détection et de reconnaissance de texte dans le domaine de la vision par ordinateur.
L'objectif principal de COCO-Text est de soutenir le développement et l'évaluation de modèles capables de localiser et de lire du texte dans des environnements non contraints, tels que les panneaux de rue, les devantures de magasins et les étiquettes de produits. Contrairement aux jeux de données antérieurs qui se concentraient sur des documents scannés ou des environnements contrôlés, COCO-Text met l'accent sur les défis de l'imagerie du monde réel, notamment les variations d'éclairage, les distorsions de perspective et les arrière-plans complexes. Le jeu de données inclut à la fois du texte imprimé par machine et du texte manuscrit, avec des annotations indiquant si chaque instance de texte est lisible ou non.
Composition du jeu de données
COCO-Text contient 63 686 images, réparties en ensembles d'entraînement (43 686 images), de validation (10 000 images) et de test (10 000 images). Chaque image est annotée avec des instances de texte, représentées par des polygones englobants (pas seulement des rectangles) pour capturer les formes irrégulières. Pour chaque instance de texte, le jeu de données fournit une transcription (le contenu textuel réel), un indicateur de lisibilité (lisible ou illisible) et une classification dans l'une des plusieurs catégories : imprimé par machine, manuscrit ou autres. Les annotations ont été créées par une combinaison de méthodes automatisées et de crowdsourcing humain, garantissant un haut niveau de précision.
Le jeu de données comprend plus de 145 000 instances de texte au total, avec une moyenne d'environ 2,3 instances de texte par image. Les instances de texte varient considérablement en longueur, des caractères uniques aux phrases complètes, et couvrent une gamme diversifiée de polices, de tailles et d'orientations. Cette diversité fait de COCO-Text une référence difficile pour les modèles de Machine learning, en particulier ceux basés sur des architectures de Deep learning.
Détails des annotations
Chaque instance de texte dans COCO-Text est annotée avec un ensemble d'attributs cruciaux pour l'entraînement et l'évaluation. Le polygone englobant est défini par une liste de points, permettant une localisation précise du texte qui peut être courbé ou rotaté. Le champ de transcription contient la chaîne exacte de caractères, utilisée pour les tâches de reconnaissance. L'attribut de lisibilité indique si le texte est lisible par un humain ; le texte illisible est souvent inclus pour tester la robustesse des modèles face à du texte bruité ou partiellement obscurci.
De plus, chaque instance de texte est classée dans l'une des trois catégories : 'imprimé par machine', 'manuscrit' ou 'autres'. Cette classification aide à analyser les performances des modèles sur différents types de texte. Le jeu de données fournit également des métadonnées au niveau de l'image, telles que l'ID d'image COCO d'origine, ce qui permet aux chercheurs de croiser les références avec d'autres annotations COCO (par exemple, les étiquettes de détection d'objets) pour l'apprentissage multitâche.
Utilisation comme référence
COCO-Text est largement utilisé comme référence pour les tâches de détection et de reconnaissance de texte. Il a été adopté dans plusieurs compétitions internationales, notamment la compétition de lecture robuste de l'ICDAR (Conférence internationale sur l'analyse et la reconnaissance de documents). Le jeu de données fournit des scripts d'évaluation qui calculent des métriques standard telles que la précision, le rappel et la mesure F pour la détection, et la précision des mots pour la reconnaissance. Ces métriques sont calculées sur l'ensemble de test, dont les annotations sont cachées pour éviter le surapprentissage.
Les chercheurs ont utilisé COCO-Text pour entraîner et évaluer une variété de modèles, des méthodes traditionnelles de vision par ordinateur aux approches modernes de Neural network. En particulier, les modèles de Deep learning basés sur des réseaux de neurones convolutifs (CNN) et des réseaux de neurones récurrents (RNN) ont atteint des performances de pointe sur ce jeu de données. Le jeu de données a également été utilisé pour étudier l'apprentissage par transfert, où des modèles pré-entraînés sur de grands jeux de données d'images sont affinés pour la détection de texte.
Jeux de données connexes et extensions
COCO-Text fait partie d'une famille plus large de jeux de données de texte de scène, notamment ICDAR 2013, ICDAR 2015 et Total-Text. Cependant, COCO-Text se distingue par son échelle et son intégration avec l'écosystème COCO. Depuis sa publication, plusieurs extensions et variantes ont été proposées. Par exemple, le jeu de données COCO-Text-OCR, introduit plus tard, fournit des annotations supplémentaires pour la reconnaissance de texte, y compris des boîtes englobantes au niveau des caractères. Ces extensions ont encore accru l'utilité de COCO-Text pour la recherche.
De plus, COCO-Text a été utilisé en conjonction avec d'autres jeux de données pour créer des références plus complètes. Par exemple, le jeu de données Open Images inclut des annotations de texte qui complètent COCO-Text, permettant un entraînement à plus grande échelle. La disponibilité de tels jeux de données a accéléré les progrès dans le domaine de la compréhension du texte de scène, qui est un composant critique d'applications comme la conduite autonome, la technologie d'assistance et la recherche d'images.
Défis et limitations
Malgré ses forces, COCO-Text présente certaines limitations. Le jeu de données est biaisé vers le texte en anglais, car la plupart des annotations sont en anglais. Cela limite son applicabilité à des scénarios multilingues. De plus, le processus d'annotation, bien que minutieux, peut contenir des erreurs, en particulier dans la transcription de texte petit ou déformé. Le jeu de données ne comprend pas non plus d'informations temporelles, il ne peut donc pas être utilisé pour des tâches de détection de texte basées sur la vidéo.
Un autre défi est le déséquilibre dans les catégories de texte : le texte imprimé par machine domine, tandis que le texte manuscrit est relativement rare. Cela peut conduire à des modèles qui performent bien sur le texte imprimé mais mal sur l'écriture manuscrite. Les chercheurs doivent souvent augmenter COCO-Text avec d'autres jeux de données pour combler ces lacunes. Néanmoins, COCO-Text reste une ressource fondamentale pour la communauté de la vision par ordinateur, et son impact est évident dans les nombreux articles et systèmes qui le citent.