Document AI, también conocido como Inteligencia Documental, es un campo de la tecnología que emplea técnicas de aprendizaje automático, como el procesamiento de lenguaje natural, para desarrollar modelos informáticos capaces de analizar documentos de manera similar a la revisión humana. A través del procesamiento de lenguaje natural, los sistemas informáticos comprenden relaciones y matices contextuales en los contenidos de los documentos, lo que facilita la extracción de información y conocimientos. Esta tecnología también permite categorizar y organizar los propios documentos. Las aplicaciones se extienden al procesamiento y análisis de una variedad de documentos semiestructurados, incluidos formularios, tablas, recibos, facturas, formularios de impuestos, contratos, acuerdos de préstamo y informes financieros.
Document AI combina métodos de inteligencia artificial con estructuras de datos específicas de documentos. Se aprovecha de arquitecturas de aprendizaje profundo para manejar tanto el contenido textual como el diseño espacial de los documentos, habilitando tareas que van desde la extracción simple de datos hasta la comprensión y generación complejas de documentos.
Características Clave
El aprendizaje automático se utiliza en Document AI para extraer información de documentos impresos y digitales. La tecnología reconoce imágenes, texto y caracteres en diversos idiomas, ayudando a extraer conocimientos de documentos no estructurados. El uso de esta tecnología puede mejorar la velocidad y la calidad de la toma de decisiones en el análisis de documentos. La automatización de la extracción y validación de datos contribuye a una mayor eficiencia en los procesos de análisis documental. Desde principios de la década de 2020, la integración de modelos de lenguaje de gran escala ha ampliado Document AI más allá de la extracción hacia tareas generativas, incluida la redacción automatizada de formularios, contratos y resúmenes de documentos.
Dimensiones de datos y arquitectura de ML
Los datos se distinguen típicamente en datos espaciales y datos de series temporales. Los datos espaciales incluyen imágenes, mapas y gráficos, mientras que los datos de series temporales incluyen señales como precios de acciones o grabaciones de voz. Document AI combina datos de texto, que tienen una dimensión temporal, con otros tipos de datos, como la posición de una dirección en una carta comercial, que es espacial.
Históricamente, los datos espaciales se analizaban mediante una arquitectura de red neuronal como una red neuronal convolucional, y los datos temporales mediante una red neuronal recurrente. Con el advenimiento de la arquitectura transformador agnóstica al tipo de dimensión, estos dos tipos de dimensiones se pueden combinar más fácilmente. Document AI es un ejemplo de esta integración, ya que los transformadores procesan secuencias de tokens mientras incorporan codificaciones posicionales que capturan información de maquetación.
Ejemplo: análisis de una carta comercial
Una carta comercial contiene información en forma de texto, así como otros tipos de información, como la posición del texto. Por ejemplo, una carta típica contiene dos direcciones antes del cuerpo del texto. La dirección en la parte superior, a veces alineada a la derecha, es la dirección del remitente. Normalmente le sigue la fecha de la carta, con el lugar de escritura. Después de esto, se lista la dirección del destinatario.
La diferenciación entre las direcciones del remitente y del destinatario se transmite únicamente por la posición de la dirección en la página; no hay indicación textual como "Remitente: " delante de las direcciones. Los sistemas de Document AI deben aprender a usar esta información espacial para clasificar y extraer correctamente estos campos, demostrando la importancia de combinar datos textuales y de maquetación.
Benchmarks
Varios conjuntos de datos públicos se utilizan para evaluar los sistemas de Document AI. El FunSD (Form and Document Understanding in Noisy Scanned Documents, en sus siglas en inglés) contiene 199 formularios anotados con rótulos de nivel de token y de bloque para tareas de comprensión de formularios. El CORD (Combined Order Relation Dataset) apoya la extracción de información clave de recibos. DocVQA contiene aproximadamente 50,000 preguntas sobre 12,000 imágenes de documentos para respuesta a preguntas visuales sensibles a la maquetación. Estos puntos de referencia ayudan a los investigadores a comparar el rendimiento de diferentes modelos en tareas como la extracción de información clave, la comprensión de formularios y el respondido de preguntas basado en documentos.
Usos comunes
Los sistemas de Document AI automatizan el procesamiento documental y la extracción de información en flujos de trabajo empresariales y financieros, incluyendo el procesamiento de facturas y recibos, la automatización de entrada de datos, la detección anomalías, el procesamiento de hipotecas, la monitorización de materias de préstamos, la gestión de riesgo de crédito y la detección de fraude como moneda falsa (contratos y correspondencia fraudulenta). También se aplican en la conformidad regulatoria al análisis de contratos y documentos legales, incluyendo la evaluación de cambios en documentos legales y regulatorios. En el sector inmobiliario, Document AI respalda los sistemas de clasificación de documentos y la extracción de información estructurada para procesamientos y análisis estandarizados. Con la adopción de IA generativa, los sistemas de Document AI también pueden generar y rellenar estructuras documentales como contratos o formularios empresariales a partir de indicaciones en lenguaje natural.