Aus dem Englischen übersetzt

SROIE ist ein Datensatz für die OCR von gescannten Belegen, der 1.000 Bilder für Aufgaben zur Extraktion wichtiger Informationen umfasst. Er wurde 2019 für den ICDAR-Wettbewerb eingeführt und wird zur Bewertung von OCR- und Dokumentverständnissystemen verwendet.

SROIE (Scanned Receipt OCR and Information Extraction) ist ein Benchmark-Datensatz, der zur Bewertung von Systemen zur optischen Zeichenerkennung (OCR) und Informationsextraktion auf gescannten Belegen entwickelt wurde. Er wurde 2019 als Teil des ICDAR-Wettbewerbs (International Conference on Document Analysis and Recognition) eingeführt und besteht aus 1.000 realen Belegbildern, aufgeteilt in 600 Trainings-, 100 Validierungs- und 300 Testproben. Der Datensatz konzentriert sich auf die Extraktion wichtiger Felder wie Firmenname, Adresse, Datum und Gesamtbetrag, was ihn zu einem Standard-Testfeld für Dokumentverständnismodelle macht.

Der Datensatz wurde von Forschern der Chinesischen Akademie der Wissenschaften und anderen Institutionen erstellt, um den Mangel an standardisierter Bewertung für Beleg-OCR zu beheben. Im Gegensatz zu synthetischen Datensätzen verwendet SROIE echte Belege mit unterschiedlichen Layouts, Schriftarten und Druckqualitäten, die reale Herausforderungen wie Rauschen, Schräglage und niedrige Auflösung widerspiegeln. Jeder Beleg ist sowohl mit Bounding-Boxen auf Textebene als auch mit strukturierten Schlüssel-Wert-Paaren annotiert, was Aufgaben wie Textlokalisierung, Transkription und semantische Analyse ermöglicht.

Aufgabenstruktur und Bewertung

SROIE definiert drei primäre Aufgaben: Textlokalisierung (Erkennung von Wörtern und Zeilen), Texterkennung (Transkription des erkannten Textes) und Schlüsselinformationsextraktion (Zuordnung erkannter Texte zu vordefinierten Feldern). Die offiziellen Bewertungsmetriken umfassen Präzision, Recall und F1-Score für jede Aufgabe, wobei die Extraktionsaufgabe eine exakte Feldübereinstimmung erfordert. Für die Extraktionsaufgabe muss das System eine JSON-ähnliche Struktur mit Feldern wie „company“, „address“, „date“ und „total“ ausgeben. Die endgültige Rangfolge des Wettbewerbs basiert auf dem Extraktions-F1-Score, der die Genauigkeit über alle Felder kombiniert.

Technische Merkmale

Belege in SROIE weisen vielfältige Formate auf, einschließlich Thermodrucken, Nadeldrucken und handschriftlichen Anmerkungen. Die Bilder werden typischerweise unter variierenden Lichtbedingungen aufgenommen, was die Komplexität für OCR-Algorithmen erhöht. Die Annotationen des Datensatzes werden in einem benutzerdefinierten XML-Format bereitgestellt, wobei jedes Wort durch seine Position und seinen Text gekennzeichnet ist und jedes Schlüsselfeld mit dem entsprechenden Wort oder Satz verknüpft ist. Diese Struktur unterstützt sowohl End-to-End-Modelle als auch modulare Pipelines, die Erkennung, Transkription und Extraktion trennen.

Einfluss auf Document AI

SROIE ist ein weit verbreiteter Benchmark im Bereich des Dokumentverständnisses und der optischen Zeichenerkennung. Er wurde verwendet, um Modelle auf Basis von Faltungsneuronalen Netzen und rekurrenten neuronalen Netzen sowie neuere Transformer-basierte Architekturen zu bewerten. Der Datensatz hat auch Forschung zu Datenaugmentierung-Techniken für Belegbilder vorangetrieben, wie synthetische Rauschzugabe und geometrische Transformationen. Viele große Sprachmodelle mit Vision-Fähigkeiten wurden auf SROIE getestet, um ihre Fähigkeit zur strukturierten Extraktion aus realen Dokumenten zu bewerten.

Einschränkungen und Erweiterungen

Trotz seiner Nützlichkeit hat SROIE Einschränkungen. Der Datensatz ist relativ klein, mit nur 1.000 Bildern, was zu Überanpassung beim Modelltraining führen kann. Der Feldsatz ist auf vier Schlüsselfelder begrenzt und lässt andere häufige Belegelemente wie Steuern oder Einzelposten aus. Darüber hinaus stammen die Belege überwiegend von chinesischen Händlern, was sprachliche und regionale Verzerrungen einführen kann. Forscher haben Erweiterungen vorgeschlagen, wie das Hinzufügen vielfältigerer Belege oder die Erstellung synthetischer Varianten, aber das ursprüngliche SROIE bleibt der Standard für faire Vergleiche.

Verwandte Benchmarks

SROIE ist Teil einer breiteren Familie von Dokumentverständnis-Datensätzen, einschließlich FUNSD für Formularverständnis und CORD für Belegextraktion. Während CORD detailliertere Feldannotationen bietet (z. B. Artikelnamen, Preise, Zwischensummen), machen SROIEs Einfachheit und klares Bewertungsprotokoll es zu einem bevorzugten Ausgangspunkt für neue Modelle. Der Datensatz wurde auch in größere Multi-Task-Benchmarks wie DocVQA und Herausforderungen zur Szenentexterkennung integriert, was eine domänenübergreifende Bewertung ermöglicht.

Zukünftige Richtungen

Stand 2025 wird SROIE weiterhin in akademischer Forschung und industriellen Anwendungen verwendet, insbesondere zur Automatisierung von Spesenmanagement- und Buchhaltungsabläufen. Mit dem Aufstieg von generativer KI und multimodalen Modellen erforschen Forscher, wie vortrainierte Vision-Sprachmodelle genutzt werden können, um höhere Extraktionsgenauigkeit auf SROIE ohne aufgabenspezifisches Training zu erzielen. Die feste Größe und begrenzte Feldvielfalt des Datensatzes bedeuten jedoch, dass neue Benchmarks entstehen, um komplexere Dokumenttypen zu adressieren, während SROIE ein historischer Referenzpunkt für Fortschritte in OCR und Informationsextraktion bleibt.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:dataset·ocr·information-extraction·document-understanding
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte