Total-Text est un ensemble de données de référence pour la détection de texte dans les scènes, introduit en 2017 par des chercheurs de l'Université de Toronto et d'autres institutions. Il a été conçu pour remédier aux limitations des ensembles de données antérieurs, qui se concentraient principalement sur du texte horizontal ou approximativement aligné, en incluant une proportion significative d'instances de texte courbé et orienté arbitrairement. Cet ensemble est devenu une ressource d'évaluation standard pour les modèles de apprentissage automatique et de apprentissage profond dans le domaine de la détection de texte dans les scènes, un sous-domaine de l'intelligence artificielle et de la vision par ordinateur.
L'ensemble se compose de 1 555 images collectées dans des scènes réelles, telles que des panneaux de rue, des devantures de magasins et des affiches. Chaque image est annotée avec des polygones de délimitation au niveau du mot qui délimitent précisément les régions de texte, y compris le texte courbé et multi-orienté. Les annotations sont fournies dans un format qui prend en charge à la fois les représentations polygonales et rectangulaires, permettant une évaluation flexible des algorithmes de détection. Total-Text comprend un ensemble d'entraînement de 1 255 images et un ensemble de test de 300 images, avec un total de plus de 9 000 instances de texte annotées. L'ensemble est remarquable pour sa forte proportion de texte courbé, ce qui représente un défi significatif pour les méthodes de détection traditionnelles qui supposent un texte aligné sur les axes ou horizontal.
Total-Text a été largement utilisé dans la recherche académique et les compétitions, telles que les défis ICDAR (Conférence internationale sur l'analyse et la reconnaissance de documents), pour évaluer les performances des systèmes de détection de texte. Il a stimulé le développement d'architectures avancées de réseaux de neurones, y compris celles basées sur les réseaux résiduels et les approches de segmentation de type U-Net, ainsi que des méthodes qui exploitent la augmentation de données et la normalisation par lots pour améliorer la robustesse.
Composition et annotation de l'ensemble de données
Les images de Total-Text proviennent de divers environnements urbains, capturant du texte dans différentes langues, polices, conditions d'éclairage et perspectives. Les annotations sont effectuées au niveau du mot, chaque mot étant entouré d'un polygone qui suit la forme du texte, qu'il soit courbé, rotatif ou horizontal. L'ensemble fournit également un ensemble distinct de boîtes englobantes alignées sur les axes pour chaque mot, qui peut être utilisé pour les méthodes d'évaluation nécessitant des régions rectangulaires. La vérité terrain est stockée dans un format de fichier texte, où chaque ligne correspond à un mot et inclut les coordonnées du polygone et la transcription du texte.
Métriques et protocoles d'évaluation
L'évaluation standard pour Total-Text suit les protocoles établis par les compétitions ICDAR, utilisant la précision, le rappel et la mesure F comme métriques principales. Les résultats de détection sont appariés aux polygones de vérité terrain en fonction de seuils d'intersection sur union (IoU), généralement fixés à 0,5. Le code d'évaluation officiel de l'ensemble est disponible pour garantir une comparaison cohérente entre les méthodes. Les chercheurs sont encouragés à rapporter les résultats sur l'ensemble de test, et de nombreux articles publiés incluent des comparaisons sur Total-Text aux côtés d'autres ensembles comme ICDAR 2015 et MSRA-TD500.
Impact sur la recherche en détection de texte dans les scènes
Total-Text a considérablement influencé la conception des systèmes modernes de détection de texte. Les premières méthodes reposaient sur des caractéristiques artisanales et l'analyse de composants connexes, mais la complexité du texte courbé a incité à passer à des approches de apprentissage profond. De nombreux modèles de pointe utilisent désormais des réseaux entièrement convolutifs, des mécanismes de attention multi-têtes et des architectures encodeur-décodeur pour prédire les régions de texte de manière pixel par pixel. L'ensemble a également été utilisé pour entraîner et évaluer des systèmes de repérage de texte de bout en bout qui combinent détection et reconnaissance, exploitant souvent des modèles séquence à séquence et des backbones transformers.
Limitations et extensions
Bien que Total-Text fournisse un benchmark difficile, il présente des limitations, notamment un nombre relativement faible d'images par rapport à certains ensembles modernes et une concentration sur le texte anglais. Des ensembles ultérieurs, tels que CTW1500 et ArT, ont élargi la portée pour inclure des formes de texte et des langues plus diverses. Néanmoins, Total-Text reste une ressource largement citée et utilisée pour évaluer la robustesse des algorithmes de détection de texte, en particulier pour gérer le texte courbé et orienté arbitrairement.