Aus dem Englischen übersetzt

ICDAR 2015 war ein Wettbewerb, der im Rahmen der 13. Internationalen Konferenz für Dokumentenanalyse und -erkennung stattfand und sich auf die Erkennung und Erkennung von Szenentext in natürlichen Bildern konzentrierte.

ICDAR 2015 bezieht sich auf den Robust Reading Competition, der 2015 auf der 13. International Conference on Document Analysis and Recognition (ICDAR) stattfand. Der Wettbewerb konzentrierte sich auf die Erkennung und das Lesen von Text in natürlichen Bildern und forderte die Teilnehmer heraus, Text in natürlichen Bildern zu lokalisieren und zu lesen. Er war Teil einer Reihe von Wettbewerben, die Fortschritte im Bereich Computersehen und Dokumentenanalyse vorangetrieben haben, indem sie standardisierte Benchmarks zur Bewertung von Algorithmen bereitstellten.

Der Wettbewerb umfasste mehrere Aufgaben, insbesondere die Textlokalisierung (Erkennung von Begrenzungsrahmen um Textregionen) und die Texterkennung (Transkription des erkannten Textes in eine maschinenlesbare Zeichenfolge). Der primäre Datensatz war der ICDAR 2015 Incidental Scene Text Datensatz, der aus 1.500 Bildern bestand, die mit einem Google-Glass-Gerät in einer belebten Straßenumgebung aufgenommen wurden. Diese Bilder wurden absichtlich auf eine „beiläufige“ Weise aufgenommen, das heißt, sie wurden nicht sorgfältig gerahmt, was zu Herausforderungen wie Bewegungsunschärfe, geringer Auflösung und beliebigen Textausrichtungen führte.

Datensatz und Bewertung

Der ICDAR-2015-Datensatz umfasste 1.000 Trainingsbilder und 500 Testbilder. Die Ground-Truth-Annotationen lieferten Begrenzungsrahmen auf Wortebene und Transkriptionen. Die Bewertung der Erkennung verwendete das standardmäßige PASCAL-VOC-Kriterium, bei dem eine Erkennung als korrekt galt, wenn die Intersection-over-Union (IoU) mit einem Ground-Truth-Rahmen 0,5 überschritt. Für die Erkennung war die Metrik die Editierdistanz zwischen der vorhergesagten und der Ground-Truth-Zeichenfolge. Der Wettbewerb umfasste auch eine kombinierte Aufgabe, die sowohl Erkennung als auch Erkennung erforderte und mit der End-to-End-Wortfindungsmetrik bewertet wurde.

Ergebnisse und Auswirkungen

Der Siegerbeitrag für die Textlokalisierungsaufgabe wurde von einem Team der University of Toronto eingereicht und erreichte ein F-Maß von etwa 0,72. Für die End-to-End-Erkennungsaufgabe war das beste Team von der Chinesischen Akademie der Wissenschaften, das ein F-Maß von etwa 0,68 erreichte. Diese Ergebnisse waren im Vergleich zu späteren Jahren bescheiden und spiegeln die Schwierigkeit des Problems der beiläufigen Szenentexterkennung wider. Der Wettbewerb hob die Einschränkungen bestehender Methoden bei der Handhabung beliebiger Ausrichtungen und wechselnder Lichtverhältnisse hervor und förderte anschließende Forschung zu Ansätzen auf Basis von Deep Learning.

Vermächtnis und Folgeveranstaltungen

ICDAR 2015 wurde zu einem weit verbreiteten Benchmark in der Forschungsgemeinschaft. Viele nachfolgende Arbeiten zur Erkennung und Erkennung von Szenentext, insbesondere solche, die Deep Learning und neuronale Netze verwenden, berichteten über Ergebnisse auf diesem Datensatz. Die Betonung des Wettbewerbs auf beiläufigen Text beeinflusste spätere Ausgaben wie ICDAR 2017 und ICDAR 2019, die noch anspruchsvollere Datensätze einführten. Der Benchmark von 2015 bleibt eine Standardreferenz zur Bewertung der Robustheit von Textlesesystemen in realen Szenarien.

Bezug zur breiteren KI-Forschung

Die für ICDAR 2015 entwickelten Techniken, wie Region Proposal Networks und Sequenz-zu-Sequenz-Modelle für die Erkennung, überschnitten sich mit breiteren Fortschritten in künstlicher Intelligenz und maschinellem Lernen. Der Wettbewerb diente als praktischer Testfall für Algorithmen, die später Anwendungen in autonomen Fahrzeugen, erweiterter Realität und Dokumentendigitalisierung fanden. Er trug auch zur Entwicklung von Datenaugmentierungs-Strategien bei, da die Teilnehmer synthetische Texterzeugung und Bildtransformationen einsetzten, um die Generalisierung zu verbessern.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:computer-vision·document-analysis·competition·scene-text
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte