SROIE (Scanned Receipt OCR and Information Extraction) es un conjunto de datos de referencia diseñado para evaluar sistemas de reconocimiento óptico de caracteres (OCR) y extracción de información en recibos escaneados. Introducido en 2019 como parte de la competición ICDAR (Conferencia Internacional sobre Análisis y Reconocimiento de Documentos), consta de 1,000 imágenes de recibos del mundo real, divididas en 600 muestras de entrenamiento, 100 de validación y 300 de prueba. El conjunto de datos se centra en extraer campos clave como el nombre de la empresa, la dirección, la fecha y el importe total, lo que lo convierte en un banco de pruebas estándar para modelos de comprensión de documentos.
El conjunto de datos fue creado por investigadores de la Academia China de Ciencias y otras instituciones para abordar la falta de evaluación estandarizada para el OCR de recibos. A diferencia de los conjuntos de datos sintéticos, SROIE utiliza recibos genuinos con diseños, fuentes y calidades de impresión variados, reflejando desafíos del mundo real como ruido, inclinación y baja resolución. Cada recibo está anotado tanto con cuadros delimitadores a nivel de texto como con pares clave-valor estructurados, lo que permite tareas como localización de texto, transcripción y análisis semántico.
Estructura de tareas y evaluación
SROIE define tres tareas principales: localización de texto (detección de palabras y líneas), reconocimiento de texto (transcripción del texto detectado) y extracción de información clave (mapeo del texto reconocido a campos predefinidos). Las métricas de evaluación oficiales incluyen precisión, exhaustividad y puntuación F1 para cada tarea, con la tarea de extracción que requiere una coincidencia exacta de campos. Para la tarea de extracción, el sistema debe generar una estructura similar a JSON con campos como "empresa", "dirección", "fecha" y "total". La clasificación final de la competición se basa en la puntuación F1 de extracción, que combina la precisión en todos los campos.
Características técnicas
Los recibos en SROIE presentan formatos diversos, incluyendo impresiones térmicas, impresiones matriciales y anotaciones manuscritas. Las imágenes suelen capturarse bajo condiciones de iluminación variables, lo que añade complejidad a los algoritmos de OCR. Las anotaciones del conjunto de datos se proporcionan en un formato XML personalizado, con cada palabra etiquetada por su posición y texto, y cada campo clave vinculado a la palabra o frase correspondiente. Esta estructura admite tanto modelos de extremo a extremo como pipelines modulares que separan detección, reconocimiento y extracción.
Impacto en la IA de documentos
SROIE se ha convertido en un punto de referencia ampliamente citado en el campo de la comprensión de documentos y el OCR. Se ha utilizado para evaluar modelos basados en redes neuronales convolucionales y redes neuronales recurrentes, así como arquitecturas más recientes basadas en transformers. El conjunto de datos también ha impulsado la investigación en técnicas de aumento de datos para imágenes de recibos, como la adición de ruido sintético y transformaciones geométricas. Muchos modelos de lenguaje grandes con capacidades de visión se han probado en SROIE para evaluar su capacidad de realizar extracción estructurada de documentos del mundo real.
Limitaciones y extensiones
A pesar de su utilidad, SROIE tiene limitaciones. El conjunto de datos es relativamente pequeño, con solo 1,000 imágenes, lo que puede provocar sobreajuste en el entrenamiento de modelos. El conjunto de campos se limita a cuatro campos clave, omitiendo otros elementos comunes de recibos como impuestos o líneas detalladas. Además, los recibos provienen predominantemente de comerciantes chinos, lo que puede introducir sesgos lingüísticos y regionales. Los investigadores han propuesto extensiones, como añadir recibos más diversos o crear variantes sintéticas, pero el SROIE original sigue siendo el estándar para una comparación justa.
Puntos de referencia relacionados
SROIE forma parte de una familia más amplia de conjuntos de datos de comprensión de documentos, incluyendo FUNSD para comprensión de formularios y CORD para extracción de recibos. Mientras que CORD ofrece anotaciones de campos más detalladas (por ejemplo, nombres de artículos, precios, subtotales), la simplicidad y el protocolo de evaluación claro de SROIE lo convierten en un punto de partida preferido para nuevos modelos. El conjunto de datos también se ha incorporado a puntos de referencia multitarea más grandes como DocVQA y desafíos de reconocimiento de texto en escenas, permitiendo una evaluación entre dominios.
Direcciones futuras
A partir de 2025, SROIE continúa utilizándose en investigación académica y aplicaciones industriales, particularmente para automatizar flujos de gestión de gastos y contabilidad. Con el auge de la IA generativa y los modelos multimodales, los investigadores están explorando cómo aprovechar modelos preentrenados de visión-lenguaje para lograr una mayor precisión de extracción en SROIE sin entrenamiento específico de la tarea. Sin embargo, el tamaño fijo y la diversidad limitada de campos del conjunto de datos significan que están surgiendo nuevos puntos de referencia para abordar tipos de documentos más complejos, mientras que SROIE sigue siendo un punto de referencia histórico para el progreso en OCR y extracción de información.