Document AI, auch bekannt als Dokumentenintelligenz, ist ein Technologiefeld, das maschinelles Lernen-Techniken wie die Verarbeitung natürlicher Sprache einsetzt, um Computermodelle zu entwickeln, die Dokumente ähnlich wie eine menschliche Prüfung analysieren können. Durch die Verarbeitung natürlicher Sprache verstehen Computersysteme Beziehungen und kontextuelle Nuancen in Dokumentinhalten, was die Extraktion von Informationen und Erkenntnissen erleichtert. Diese Technologie ermöglicht auch die Kategorisierung und Organisation von Dokumenten selbst. Die Anwendungen erstrecken sich auf die Verarbeitung und das Parsen verschiedener semi-strukturierter Dokumente, darunter Formulare, Tabellen, Quittungen, Rechnungen, Steuerformulare, Verträge, Kreditvereinbarungen und Finanzberichte.
Document AI kombiniert Methoden der künstlichen Intelligenz mit dokumentenspezifischen Datenstrukturen. Es nutzt Deep-Learning-Architekturen, um sowohl den textuellen Inhalt als auch das räumliche Layout von Dokumenten zu verarbeiten, und ermöglicht Aufgaben, die von einfacher Datenextraktion bis hin zu komplexem Dokumentverständnis und -generierung reichen.
Hauptmerkmale
Maschinelles Lernen wird in Document AI eingesetzt, um Informationen aus gedruckten und digitalen Dokumenten zu extrahieren. Die Technologie erkennt Bilder, Texte und Zeichen in verschiedenen Sprachen und unterstützt die Gewinnung von Erkenntnissen aus unstrukturierten Dokumenten. Der Einsatz dieser Technologie kann die Geschwindigkeit und Qualität der Entscheidungsfindung bei der Dokumentenanalyse verbessern. Die Automatisierung von Datenextraktion und -validierung trägt zu einer höheren Effizienz in Dokumentenanalyseprozessen bei. Seit den frühen 2020er-Jahren hat die Integration von großen Sprachmodellen Document AI über die Extraktion hinaus auf generative Aufgaben erweitert, einschließlich der automatisierten Erstellung von Formularen, Verträgen und Dokumentzusammenfassungen.
Datendimensionen und ML-Architektur
Daten werden typischerweise in räumliche Daten und Zeitreihendaten unterschieden. Räumliche Daten umfassen Bilder, Karten und Grafiken, während Zeitreihendaten Signale wie Aktienkurse oder Sprachaufnahmen umfassen. Document AI kombiniert Textdaten, die eine Zeitdimension haben, mit anderen Datentypen, wie der Position einer Adresse in einem Geschäftsbrief, die räumlich ist.
Historisch wurden räumliche Daten mit einer Architektur neuronaler Netze wie einem Convolutional Neural Network analysiert und zeitliche Daten mit einem Recurrent Neural Network. Mit dem Aufkommen der dimensionstyp-agnostischen Transformer-Architektur können diese beiden verschiedenen Dimensionstypen leichter kombiniert werden. Document AI ist ein Beispiel für diese Integration, da Transformer Sequenzen von Tokens verarbeiten und gleichzeitig Positionskodierungen einbeziehen, die Layoutinformationen erfassen.
Beispiel: Analyse eines Geschäftsbriefs
Ein Geschäftsbrief enthält Informationen in Form von Text sowie andere Arten von Informationen, wie die Position des Textes. Beispielsweise enthält ein typischer Brief zwei Adressen vor dem Textkörper. Die Adresse ganz oben, manchmal rechtsbündig, ist die Absenderadresse. Darauf folgt normalerweise das Datum des Briefes mit dem Ort der Verfassung. Danach wird die Empfängeradresse aufgeführt.
Die Unterscheidung zwischen Absenderadresse und Empfängeradresse wird ausschließlich durch die Position der Adresse auf der Seite vermittelt; es gibt keinen textuellen Hinweis wie „Absender:“ vor den Adressen. Document-AI-Systeme müssen lernen, diese räumlichen Informationen zu nutzen, um diese Felder korrekt zu klassifizieren und zu extrahieren, was die Bedeutung der Kombination von Text- und Layoutdaten demonstriert.
Benchmarks
Zur Bewertung von Document-AI-Systemen werden mehrere öffentliche Datensätze verwendet. FUNSD (Form Understanding in Noisy Scanned Documents) enthält 199 annotierte Formulare mit Token- und Block-Ebenen-Labels für Aufgaben des Formularverständnisses. CORD (Consolidated Receipt Dataset) unterstützt die Extraktion wichtiger Informationen aus Quittungen. DocVQA enthält etwa 50.000 Fragen zu 12.000 Dokumentbildern für layoutbewusstes visuelles Fragenbeantworten. Diese Benchmarks helfen Forschern, die Leistung verschiedener Modelle bei Aufgaben wie der Extraktion wichtiger Informationen, dem Formularverständnis und der dokumentbasierten Fragenbeantwortung zu vergleichen.
Häufige Anwendungen
Document-AI-Systeme automatisieren die Dokumentenverarbeitung und Informationsextraktion in Geschäfts- und Finanzabläufen, einschließlich Rechnungs- und Quittungsverarbeitung, Automatisierung der Dateneingabe, Anomalieerkennung, Hypothekenbearbeitung, Überwachung von Kreditportfolios, Kreditrisikomanagement und Betrugserkennung wie Falschgeld und betrügerische Schecks. Sie werden auch bei der Einhaltung gesetzlicher Vorschriften und der Vertragsanalyse eingesetzt, einschließlich der Bewertung von Änderungen in Rechts- und Regulierungsdokumenten. Im Immobilienbereich unterstützt Document AI die Dokumentklassifizierung und die strukturierte Informationsextraktion für standardisierte Verarbeitung und Analysen. Mit der Einführung von generativer KI können Document-AI-Systeme auch strukturierte Dokumente wie Verträge oder Geschäftsformulare aus natürlichen Sprachaufforderungen generieren und vorausfüllen.