FUNSD (Form Understanding in Noisy Scanned Documents) é um conjunto de dados publicamente disponível, projetado para pesquisa em compreensão de documentos, com foco específico na extração de informações de formulários digitalizados ruidosos do mundo real. Lançado em 2019, ele fornece um benchmark para tarefas como detecção de texto, correção de reconhecimento óptico de caracteres (OCR) e rotulagem semântica de entidades. O conjunto de dados é amplamente utilizado no campo de inteligência artificial e aprendizado de máquina para avaliar modelos que processam documentos visuais, preenchendo a lacuna entre dados brutos de imagem e extração estruturada de informações.
O conjunto de dados consiste em 199 formulários totalmente anotados, cada um contendo uma mistura de texto impresso e manuscrito, tabelas e vários elementos de layout. Esses formulários são digitalizados em diferentes resoluções e incluem artefatos de ruído comuns, como manchas, inclinação e baixo contraste, tornando-os representativos dos desafios reais de processamento de documentos. As anotações do FUNSD incluem caixas delimitadoras em nível de palavra, conteúdo de texto e rótulos semânticos para entidades como cabeçalhos, perguntas, respostas e outros pares de chave-valor. Esse esquema de anotação rico suporta tanto a análise de layout quanto a compreensão semântica, permitindo o desenvolvimento de sistemas de ponta a ponta que podem analisar formulários em estruturas legíveis por máquina.
Composição e Anotação do Conjunto de Dados
O FUNSD contém 199 formulários, com um total de 31.485 palavras e 9.707 entidades semânticas. Os formulários são originários de vários domínios, incluindo faturas, recibos e documentos administrativos. Cada palavra é anotada com uma caixa delimitadora, seu conteúdo de texto e um rótulo semântico de um conjunto predefinido: cabeçalho, pergunta, resposta ou outro. Além disso, relações entre entidades são anotadas para capturar a estrutura dos formulários, como qual resposta corresponde a qual pergunta. O conjunto de dados é dividido em um conjunto de treinamento com 149 formulários e um conjunto de teste com 50 formulários, permitindo uma avaliação padronizada.
O processo de anotação foi realizado por anotadores humanos, garantindo uma verdade fundamental de alta qualidade. A natureza ruidosa das digitalizações, incluindo texto borrado e elementos sobrepostos, torna o FUNSD um benchmark desafiador. Ao contrário de conjuntos de dados sintéticos, o FUNSD reflete as imperfeições de documentos do mundo real, o que é crítico para desenvolver modelos robustos que possam ser implantados em ambientes de produção.
Tarefas e Métricas de Avaliação
O FUNSD é usado principalmente para duas tarefas: rotulagem semântica de entidades e extração de relações. Na rotulagem semântica de entidades, um modelo deve atribuir cada palavra ou segmento de texto a uma das quatro categorias semânticas. A métrica de avaliação padrão é o escore F1, que equilibra precisão e recall. Para extração de relações, os modelos preveem links entre entidades (por exemplo, pares de pergunta-resposta), e o desempenho é medido usando o escore F1 em relações previstas corretamente.
Essas tarefas são frequentemente abordadas usando arquiteturas de aprendizado profundo, particularmente modelos baseados em transformadores que combinam características visuais e textuais. Por exemplo, modelos como LayoutLM e seus sucessores foram avaliados no FUNSD, alcançando melhorias significativas em relação aos pipelines tradicionais baseados em OCR. O conjunto de dados também tem sido usado em conjunto com pesquisas de grandes modelos de linguagem, onde modelos são solicitados a extrair informações de imagens de documentos, embora o foco principal permaneça em modelos especializados de compreensão de documentos.
Importância na IA de Documentos
O FUNSD se tornou um benchmark padrão no campo da compreensão de documentos, um subcampo de inteligência artificial que lida com a extração de dados estruturados de documentos não estruturados. Sua natureza ruidosa o distingue de conjuntos de dados mais limpos, incentivando pesquisadores a desenvolver modelos robustos a variações do mundo real. O conjunto de dados foi citado em centenas de artigos e é frequentemente usado como linha de base para novas arquiteturas, incluindo aquelas que empregam componentes de redes neurais como atenção multi-cabeça e blocos de redes residuais.
A disponibilidade do FUNSD também impulsionou o desenvolvimento de conjuntos de dados relacionados, como CORD e SROIE, que focam em tipos específicos de documentos, como recibos. No entanto, o FUNSD permanece único devido à sua ênfase em formulários digitalizados ruidosos, tornando-o um recurso valioso para testar generalização. Pesquisadores em instituições como MIT CSAIL e Stanford AI Lab usaram o FUNSD para validar abordagens inovadoras, e ele continua sendo um ponto de referência para comparar o desempenho de modelos.
Limitações e Direções Futuras
Apesar de sua utilidade, o FUNSD tem limitações. O conjunto de dados é relativamente pequeno, com apenas 199 formulários, o que pode levar a overfitting ao treinar modelos grandes. Além disso, o conjunto de rótulos semânticos é grosseiro, carecendo de distinções mais refinadas, como tipos específicos de campos (por exemplo, datas ou valores). As anotações de relação também são limitadas a links explícitos, ignorando estruturas implícitas que podem estar presentes em formulários complexos.
Trabalhos futuros em compreensão de documentos podem abordar essas limitações criando conjuntos de dados maiores e mais diversos ou usando técnicas de geração de dados sintéticos. O surgimento de IA generativa e modelos baseados em transformadores abriu novos caminhos para a análise de documentos zero-shot, onde modelos treinados em texto geral podem ser adaptados para compreensão de formulários com ajuste fino mínimo. No início dos anos 2020, o FUNSD permanece um benchmark-chave, mas o campo está evoluindo em direção a suítes de avaliação mais abrangentes que incluem múltiplos tipos de documentos e tarefas.
Conclusão
O FUNSD fornece um ambiente de teste realista e desafiador para compreensão de formulários, capturando o ruído e a variabilidade inerentes a documentos digitalizados. Suas anotações suportam tanto análise de layout quanto semântica, tornando-o um recurso versátil para pesquisadores. Embora tenha limitações em tamanho e granularidade de rótulos, seu impacto no desenvolvimento de modelos de IA de documentos é inegável. O conjunto de dados continua sendo uma ferramenta fundamental para avançar o estado da arte na extração de informações estruturadas de dados visuais não estruturados.