Traduit de l'anglais

SROIE est un ensemble de données pour l'OCR de reçus scannés, comprenant 1 000 images pour des tâches d'extraction d'informations clés. Il a été introduit en 2019 pour la compétition ICDAR et est utilisé pour évaluer les systèmes d'OCR et de compréhension de documents.

SROIE (Scanned Receipt OCR and Information Extraction) est un ensemble de données de référence conçu pour évaluer les systèmes de reconnaissance optique de caractères (OCR) et d'extraction d'informations sur des reçus scannés. Introduit en 2019 dans le cadre de la compétition ICDAR (Conférence internationale sur l'analyse et la reconnaissance de documents), il se compose de 1 000 images de reçus réels, réparties en 600 échantillons d'entraînement, 100 de validation et 300 de test. L'ensemble se concentre sur l'extraction de champs clés tels que le nom de l'entreprise, l'adresse, la date et le montant total, ce qui en fait un banc d'essai standard pour les modèles de compréhension de documents.

L'ensemble a été créé par des chercheurs de l'Académie chinoise des sciences et d'autres institutions pour combler le manque d'évaluation standardisée pour l'OCR de reçus. Contrairement aux ensembles synthétiques, SROIE utilise de véritables reçus avec des mises en page, des polices et des qualités d'impression variées, reflétant des défis réels comme le bruit, l'inclinaison et la faible résolution. Chaque reçu est annoté avec des boîtes englobantes au niveau du texte et des paires clé-valeur structurées, permettant des tâches comme la localisation du texte, la transcription et l'analyse sémantique.

Structure des tâches et évaluation

SROIE définit trois tâches principales : la localisation du texte (détection des mots et des lignes), la reconnaissance du texte (transcription du texte détecté) et l'extraction d'informations clés (mappage du texte reconnu vers des champs prédéfinis). Les métriques d'évaluation officielles incluent la précision, le rappel et le score F1 pour chaque tâche, la tâche d'extraction exigeant une correspondance exacte des champs. Pour la tâche d'extraction, le système doit produire une structure de type JSON avec des champs comme « company », « address », « date » et « total ». Le classement final de la compétition est basé sur le score F1 d'extraction, qui combine la précision sur tous les champs.

Caractéristiques techniques

Les reçus de SROIE présentent des formats divers, y compris des impressions thermiques, des impressions matricielles et des annotations manuscrites. Les images sont généralement capturées dans des conditions d'éclairage variables, ajoutant de la complexité pour les algorithmes d'OCR. Les annotations de l'ensemble sont fournies dans un format XML personnalisé, chaque mot étant étiqueté par sa position et son texte, et chaque champ clé étant lié au mot ou à la phrase correspondant. Cette structure prend en charge à la fois les modèles de bout en bout et les pipelines modulaires qui séparent la détection, la reconnaissance et l'extraction.

Impact sur l'IA documentaire

SROIE est devenu un benchmark largement cité dans le domaine de la compréhension de documents et de l'OCR. Il a été utilisé pour évaluer des modèles basés sur des réseaux de neurones convolutifs et des réseaux de neurones récurrents, ainsi que des architectures plus récentes basées sur des transformeurs. L'ensemble a également stimulé la recherche sur les techniques de augmentation de données pour les images de reçus, telles que l'ajout de bruit synthétique et les transformations géométriques. De nombreux grands modèles de langage dotés de capacités de vision ont été testés sur SROIE pour évaluer leur capacité à effectuer une extraction structurée à partir de documents réels.

Limites et extensions

Malgré son utilité, SROIE présente des limites. L'ensemble est relativement petit, avec seulement 1 000 images, ce qui peut entraîner un surajustement lors de l'entraînement des modèles. L'ensemble de champs est limité à quatre champs clés, omettant d'autres éléments courants des reçus comme les taxes ou les lignes détaillées. De plus, les reçus proviennent principalement de commerçants chinois, ce qui peut introduire des biais linguistiques et régionaux. Les chercheurs ont proposé des extensions, comme l'ajout de reçus plus diversifiés ou la création de variantes synthétiques, mais le SROIE original reste la norme pour une comparaison équitable.

Benchmarks connexes

SROIE fait partie d'une famille plus large d'ensembles de données de compréhension de documents, incluant FUNSD pour la compréhension de formulaires et CORD pour l'extraction de reçus. Alors que CORD offre des annotations de champs plus détaillées (par exemple, noms d'articles, prix, sous-totaux), la simplicité de SROIE et son protocole d'évaluation clair en font un point de départ préféré pour les nouveaux modèles. L'ensemble a également été intégré dans des benchmarks multi-tâches plus vastes comme DocVQA et les défis de reconnaissance de texte de scène, permettant une évaluation inter-domaines.

Orientations futures

En 2025, SROIE continue d'être utilisé dans la recherche académique et les applications industrielles, en particulier pour automatiser les flux de gestion des dépenses et de comptabilité. Avec l'essor de l'IA générative et des modèles multimodaux, les chercheurs explorent comment tirer parti des modèles vision-langage pré-entraînés pour atteindre une précision d'extraction plus élevée sur SROIE sans entraînement spécifique à la tâche. Cependant, la taille fixe de l'ensemble et la diversité limitée des champs signifient que de nouveaux benchmarks émergent pour traiter des types de documents plus complexes, tandis que SROIE reste un point de référence historique pour les progrès en OCR et en extraction d'informations.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·ocr·information-extraction·document-understanding
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique