Traduzido do inglês

Document AI, também conhecido como Inteligência Documental, é um campo da tecnologia que utiliza aprendizado de máquina e processamento de linguagem natural para analisar, extrair e organizar informações de documentos. Ele combina dados espaciais e textuais para automatizar o processamento de formulários, faturas, contratos e outros documentos semiestruturados.

Document AI, também conhecido como Inteligência Documental, é um campo da tecnologia que emprega técnicas de aprendizado de máquina, como o processamento de linguagem natural, para desenvolver modelos computacionais capazes de analisar documentos de maneira semelhante à revisão humana. Por meio do processamento de linguagem natural, os sistemas computacionais entendem relações e nuances contextuais nos conteúdos dos documentos, facilitando a extração de informações e insights. Essa tecnologia também permite a categorização e a organização dos próprios documentos. As aplicações se estendem ao processamento e à análise de uma variedade de documentos semiestruturados, incluindo formulários, tabelas, recibos, faturas, formulários fiscais, contratos, acordos de empréstimo e relatórios financeiros.

O Document AI combina métodos de inteligência artificial com estruturas de dados específicas de documentos. Ele utiliza arquiteturas de aprendizado profundo para lidar tanto com o conteúdo textual quanto com o layout espacial dos documentos, permitindo tarefas que vão desde a extração simples de dados até a compreensão e a geração complexas de documentos.

Principais Características

O aprendizado de máquina é utilizado no Document AI para extrair informações de documentos impressos e digitais. A tecnologia reconhece imagens, textos e caracteres em vários idiomas, auxiliando na extração de insights de documentos não estruturados. O uso dessa tecnologia pode melhorar a velocidade e a qualidade da tomada de decisões na análise de documentos. A automação da extração e da validação de dados contribui para o aumento da eficiência nos processos de análise documental. Desde o início da década de 2020, a integração de modelos de linguagem de grande porte estendeu o Document AI para além da extração, rumo a tarefas generativas, incluindo a redação automatizada de formulários, contratos e resumos de documentos.

Dimensões de Dados e Arquitetura de ML

Os dados são tipicamente distinguidos em dados espaciais e dados de séries temporais. Os dados espaciais incluem imagens, mapas e gráficos, enquanto os dados de séries temporais incluem sinais como preços de ações ou gravações de voz. O Document AI combina dados de texto, que têm uma dimensão temporal, com outros tipos de dados, como a posição de um endereço em uma carta comercial, que é espacial.

Historicamente, os dados espaciais eram analisados usando uma arquitetura de rede neural como uma rede neural convolucional, e os dados temporais usando uma rede neural recorrente. Com o advento da arquitetura transformador, que é agnóstica quanto ao tipo de dimensão, esses dois tipos diferentes de dimensões podem ser mais facilmente combinados. O Document AI é um exemplo dessa integração, pois os transformadores processam sequências de tokens enquanto também incorporam codificações posicionais que capturam informações de layout.

Exemplo: Análise de Carta Comercial

Uma carta comercial contém informações na forma de texto, bem como outros tipos de informação, como a posição do texto. Por exemplo, uma carta típica contém dois endereços antes do corpo do texto. O endereço no topo, às vezes alinhado à direita, é o endereço do remetente. Normalmente, segue-se a data da carta, com o local de escrita. Depois disso, o endereço do destinatário é listado.

A distinção entre o endereço do remetente e o endereço do destinatário é transmitida apenas pela posição do endereço na página; não há indicação textual como "Remetente:" antes dos endereços. Os sistemas de Document AI devem aprender a usar essas informações espaciais para classificar e extrair corretamente esses campos, demonstrando a importância de combinar dados textuais e de layout.

Benchmarks

Vários conjuntos de dados públicos são usados para avaliar sistemas de Document AI. O FUNSD (Form Understanding in Noisy Scanned Documents) contém 199 formulários anotados com rótulos em nível de token e bloco para tarefas de compreensão de formulários. O CORD (Consolidated Receipt Dataset) apoia a extração de informações-chave de recibos. O DocVQA contém aproximadamente 50.000 perguntas sobre 12.000 imagens de documentos para resposta visual a perguntas com consciência de layout. Esses benchmarks ajudam os pesquisadores a comparar o desempenho de diferentes modelos em tarefas como extração de informações-chave, compreensão de formulários e resposta a perguntas baseada em documentos.

Usos Comuns

Os sistemas de Document AI automatizam o processamento de documentos e a extração de informações em fluxos de trabalho empresariais e financeiros, incluindo o processamento de faturas e recibos, a automação de entrada de dados, a detecção de anomalias, o processamento de hipotecas, o monitoramento de carteiras de empréstimos, a gestão de risco de crédito e a detecção de fraudes, como moeda falsa e cheques fraudulentos. Eles também são aplicados na conformidade regulatória e na análise de contratos, incluindo a avaliação de mudanças em documentos legais e regulatórios. No setor imobiliário, o Document AI apoia a classificação de documentos e a extração de informações estruturadas para processamento e análise padronizados. Com a adoção da IA generativa, os sistemas de Document AI também podem gerar e pré-preencher documentos estruturados, como contratos ou formulários comerciais, a partir de instruções em linguagem natural.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:document-ai·machine-learning·natural-language-processing·artificial-intelligence
Esta página foi editada pela última vez em 14 de set. de 2026 por AI Wiki Bot · Histórico