CORD (Consolidated Receipt Dataset) est un ensemble de données accessible au public, conçu pour la recherche en compréhension de reçus, un sous-domaine de la compréhension de documents dans le cadre de l'intelligence artificielle. Il comprend plus de 11 000 images de reçus annotées, collectées à partir de sources réelles, couvrant divers commerçants, mises en page et langues. L'ensemble de données fournit des annotations au niveau des pixels et des jetons, qui prennent en charge des tâches telles que l'extraction d'informations clés, la segmentation sémantique et la reconnaissance d'entités, ce qui en fait une référence pour évaluer les modèles qui traitent les reçus.
CORD a été introduit en 2019 par des chercheurs de la Naver Corporation et de l'Université des sciences et technologies de Corée du Sud. L'ensemble de données a été créé pour répondre au manque de données annotées standardisées et à grande échelle pour l'analyse des reçus, ce qui est essentiel pour des applications telles que le suivi des dépenses, l'automatisation de la comptabilité et les systèmes de paiement mobile. Depuis sa publication, CORD a été largement adopté dans la recherche académique et l'industrie, servant de banc d'essai standard pour comparer les approches de apprentissage profond et de apprentissage automatique pour l'intelligence documentaire.
Les annotations dans CORD suivent une structure hiérarchique qui organise les informations des reçus en catégories telles que le nom du magasin, la date, l'heure, les articles, les prix et les méthodes de paiement. Chaque région de texte est étiquetée avec une classe sémantique, et les relations entre les régions (par exemple, article à prix) sont capturées. Cette annotation fine permet aux modèles d'apprendre non seulement quelles informations sont présentes, mais aussi comment elles sont structurées, ce qui est essentiel pour des tâches en aval comme la tenue de livres automatisée.
Structure des annotations
Le schéma d'annotation de CORD définit 30 classes réparties en 4 catégories principales : menu, sous-menu, article et option, ainsi que des champs supplémentaires comme la quantité, le prix unitaire et le total. Chaque segment de texte se voit attribuer une classe, et les relations spatiales entre les segments sont encodées sous forme d'arêtes dirigées. Par exemple, un nom d'article est lié à son prix unitaire et à sa quantité correspondants. Cette structure prend en charge à la fois la classification plate et l'apprentissage relationnel, permettant aux modèles d'effectuer une extraction conjointe et une prédiction de relations.
L'ensemble de données comprend des boîtes englobantes pour chaque région de texte, ainsi que le contenu textuel et son étiquette de classe. Les annotations sont fournies au format JSON, facilitant l'intégration avec les pipelines modernes de réseaux de neurones. La conception hiérarchique permet également l'évaluation des performances au niveau des jetons et des segments, offrant aux chercheurs des métriques granulaires.
Applications dans la recherche en IA
CORD est devenu un point de référence pour développer et évaluer des modèles en compréhension de documents. Il est couramment utilisé pour entraîner et tester des architectures basées sur les transformeurs, telles que celles qui combinent des caractéristiques visuelles et textuelles. Par exemple, des modèles comme LayoutLM et Donut ont été évalués sur CORD, démontrant son utilité pour faire progresser les performances de pointe. L'ensemble de données soutient également la recherche en IA générative, où les modèles génèrent des sorties structurées à partir d'images de reçus brutes.
Au-delà de la recherche académique, CORD a des applications pratiques dans les industries qui dépendent de la numérisation des reçus. Les entreprises de fintech, de vente au détail et de logistique utilisent des modèles entraînés sur CORD pour automatiser la saisie de données, réduire les erreurs manuelles et améliorer l'expérience client. La diversité des formats de reçus dans l'ensemble de données aide à garantir que les modèles généralisent bien aux variations du monde réel, telles que différentes polices, orientations et conditions d'éclairage.
Défis techniques
La compréhension des reçus pose plusieurs défis que CORD aide les chercheurs à aborder. Les reçus contiennent souvent du texte bruité, des éléments qui se chevauchent et des mises en page irrégulières, ce qui rend la segmentation précise difficile. De plus, la variété des langues et des devises dans CORD exige que les modèles gèrent des entrées multilingues et multi-formats. Un autre défi est la petite taille de certaines régions de texte, qui peuvent être manquées par les systèmes de détection. Les annotations détaillées de CORD permettent aux chercheurs d'isoler ces problèmes et de développer des solutions ciblées, telles que des techniques améliorées de augmentation de données ou des mécanismes de attention multi-têtes.
Ensembles de données et références associés
CORD est souvent comparé à d'autres ensembles de données de reçus et de documents, tels que SROIE (Scanned Receipts OCR and Information Extraction) et FUNSD (Form Understanding in Noisy Documents). Alors que SROIE se concentre sur l'extraction d'informations clés à partir de reçus, CORD fournit des annotations plus riches, y compris la segmentation sémantique et l'extraction de relations. Cela rend CORD plus adapté aux tâches qui nécessitent une compréhension plus approfondie de la structure des documents. Les chercheurs utilisent fréquemment CORD en conjonction avec ces ensembles de données pour évaluer la généralisation de leurs modèles sur différents types de documents.
Orientations futures
Le domaine de la compréhension de documents évolue rapidement, avec des grands modèles de langage adaptés pour des tâches multimodales. CORD est susceptible de rester une ressource précieuse pour former et évaluer de tels modèles, surtout à mesure qu'ils deviennent plus capables de gérer des mises en page et des langues complexes. Les extensions futures de CORD pourraient inclure des formats de reçus plus diversifiés, des langues supplémentaires et des annotations pour de nouvelles tâches comme l'extraction de tableaux ou la détection d'anomalies. Alors que l'intelligence artificielle continue de progresser, des ensembles de données comme CORD joueront un rôle crucial pour garantir que les modèles sont robustes, précis et applicables à des scénarios réels.