Traduzido do inglês

SROIE é um conjunto de dados para OCR de recibos digitalizados, composto por 1.000 imagens para tarefas de extração de informações-chave. Foi introduzido em 2019 para a competição ICDAR e é usado para avaliar sistemas de OCR e compreensão de documentos.

SROIE (Scanned Receipt OCR and Information Extraction) é um conjunto de dados de referência (benchmark) projetado para avaliar sistemas de reconhecimento óptico de caracteres (OCR) e extração de informações em recibos digitalizados. Introduzido em 2019 como parte da competição ICDAR (Conferência Internacional sobre Análise e Reconhecimento de Documentos), consiste em 1.000 imagens reais de recibos, divididas em 600 amostras de treinamento, 100 de validação e 300 de teste. O conjunto de dados foca na extração de campos-chave, como nome da empresa, endereço, data e valor total, tornando-o um ambiente de teste padrão para modelos de compreensão de documentos.

O conjunto de dados foi criado por pesquisadores da Academia Chinesa de Ciências e outras instituições para abordar a falta de avaliação padronizada para OCR de recibos. Diferentemente de conjuntos de dados sintéticos, o SROIE utiliza recibos genuínos com layouts, fontes e qualidade de impressão variados, refletindo desafios do mundo real, como ruído, inclinação e baixa resolução. Cada recibo é anotado com caixas delimitadoras em nível de texto e pares chave-valor estruturados, permitindo tarefas como localização de texto, transcrição e análise semântica.

Estrutura de Tarefas e Avaliação

O SROIE define três tarefas principais: localização de texto (detecção de palavras e linhas), reconhecimento de texto (transcrição do texto detectado) e extração de informações-chave (mapeamento do texto reconhecido para campos predefinidos). As métricas oficiais de avaliação incluem precisão, recall e pontuação F1 para cada tarefa, com a tarefa de extração exigindo correspondência exata de campos. Para a tarefa de extração, o sistema deve gerar uma estrutura semelhante a JSON com campos como "empresa", "endereço", "data" e "total". A classificação final da competição é baseada na pontuação F1 de extração, que combina a precisão em todos os campos.

Características Técnicas

Os recibos no SROIE exibem formatos diversos, incluindo impressões térmicas, impressões matriciais e anotações manuscritas. As imagens são tipicamente capturadas sob condições de iluminação variadas, adicionando complexidade aos algoritmos de OCR. As anotações do conjunto de dados são fornecidas em um formato XML personalizado, com cada palavra marcada por sua posição e texto, e cada campo-chave vinculado à palavra ou frase correspondente. Essa estrutura suporta tanto modelos de ponta a ponta quanto pipelines modulares que separam detecção, reconhecimento e extração.

Impacto na IA de Documentos

O SROIE tornou-se um benchmark amplamente citado no campo da compreensão de documentos e OCR. Tem sido usado para avaliar modelos baseados em redes neurais convolucionais e redes neurais recorrentes, bem como arquiteturas mais recentes baseadas em transformers. O conjunto de dados também impulsionou pesquisas em técnicas de aumento de dados para imagens de recibos, como adição de ruído sintético e transformações geométricas. Muitos modelos de linguagem de grande escala com capacidades de visão foram testados no SROIE para avaliar sua capacidade de realizar extração estruturada de documentos do mundo real.

Limitações e Extensões

Apesar de sua utilidade, o SROIE tem limitações. O conjunto de dados é relativamente pequeno, com apenas 1.000 imagens, o que pode levar a overfitting no treinamento de modelos. O conjunto de campos é limitado a quatro campos-chave, omitindo outros elementos comuns de recibos, como impostos ou linhas itemizadas. Além disso, os recibos são predominantemente de comerciantes chineses, o que pode introduzir vieses linguísticos e regionais. Pesquisadores propuseram extensões, como adicionar recibos mais diversos ou criar variantes sintéticas, mas o SROIE original permanece como o padrão para comparação justa.

Benchmarks Relacionados

O SROIE faz parte de uma família mais ampla de conjuntos de dados de compreensão de documentos, incluindo FUNSD para compreensão de formulários e CORD para extração de recibos. Enquanto o CORD oferece anotações de campos mais detalhadas (por exemplo, nomes de itens, preços, subtotais), a simplicidade do SROIE e seu protocolo de avaliação claro o tornam um ponto de partida preferido para novos modelos. O conjunto de dados também foi incorporado a benchmarks multitarefa maiores, como DocVQA e desafios de reconhecimento de texto em cenas, permitindo avaliação entre domínios.

Direções Futuras

Em 2025, o SROIE continua sendo usado em pesquisa acadêmica e aplicações industriais, particularmente para automatizar fluxos de trabalho de gerenciamento de despesas e contabilidade. Com o avanço da IA generativa e dos modelos multimodais, pesquisadores estão explorando como aproveitar modelos de visão-linguagem pré-treinados para alcançar maior precisão de extração no SROIE sem treinamento específico para a tarefa. No entanto, o tamanho fixo do conjunto de dados e a diversidade limitada de campos significam que novos benchmarks estão surgindo para abordar tipos de documentos mais complexos, enquanto o SROIE permanece como um ponto de referência histórico para o progresso em OCR e extração de informações.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:dataset·ocr·information-extraction·document-understanding
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico