SROIE(扫描收据OCR与信息抽取)是一个基准数据集,旨在评估光学字符识别(OCR)和信息抽取系统在扫描收据上的性能。该数据集于2019年作为ICDAR(国际文档分析与识别会议)竞赛的一部分推出,包含1,000张真实收据图像,分为600张训练样本、100张验证样本和300张测试样本。数据集专注于抽取公司名称、地址、日期和总金额等关键字段,使其成为文档理解模型的标准测试平台。
该数据集由中国科学院及其他机构的研究人员创建,旨在解决收据OCR缺乏标准化评估的问题。与合成数据集不同,SROIE使用具有多种布局、字体和打印质量的真实收据,反映了噪声、倾斜和低分辨率等现实挑战。每张收据都标注了文本级边界框和结构化键值对,支持文本定位、转录和语义解析等任务。
任务结构与评估
SROIE定义了三个主要任务:文本定位(检测单词和行)、文本识别(转录检测到的文本)和关键信息抽取(将识别文本映射到预定义字段)。官方评估指标包括每个任务的精确率、召回率和F1分数,其中抽取任务要求精确字段匹配。对于抽取任务,系统必须输出类似JSON的结构,包含“公司”、“地址”、“日期”和“总计”等字段。竞赛的最终排名基于抽取F1分数,该分数综合了所有字段的准确性。
技术特征
SROIE中的收据呈现出多种格式,包括热敏打印、点阵打印和手写注释。图像通常在不同光照条件下拍摄,增加了OCR算法的复杂性。数据集的注释以自定义XML格式提供,每个单词由其位置和文本标记,每个关键字段链接到相应的单词或短语。这种结构既支持端到端模型,也支持将检测、识别和抽取分离的模块化流水线。
对文档AI的影响
SROIE已成为文档理解领域广泛引用的基准,并用于评估基于卷积神经网络和循环神经网络的模型,以及更近期的Transformer架构。该数据集还推动了收据图像数据增强技术的研究,例如合成噪声添加和几何变换。许多具有视觉能力的大型语言模型已在SROIE上进行了测试,以评估其从真实文档中进行结构化抽取的能力。
局限性与扩展
尽管SROIE具有实用性,但它也存在局限性。数据集相对较小,仅有1,000张图像,可能导致模型训练中的过拟合。字段集仅限于四个关键字段,忽略了其他常见收据元素,如税费或逐项明细。此外,收据主要来自中国商户,这可能引入语言和区域偏差。研究人员已提出扩展方案,例如添加更多样化的收据或创建合成变体,但原始SROIE仍是公平比较的标准。
相关基准
SROIE是更广泛的文档理解数据集家族的一部分,包括用于表单理解的FUNSD和用于收据抽取的CORD。虽然CORD提供了更详细的字段注释(例如项目名称、价格、小计),但SROIE的简单性和清晰的评估协议使其成为新模型的首选起点。该数据集也被纳入更大的多任务基准,如DocVQA和场景文本识别挑战,支持跨域评估。
未来方向
截至2025年,SROIE继续用于学术研究和工业应用,特别是在自动化费用管理和会计工作流方面。随着生成式AI和多模态模型的兴起,研究人员正在探索如何利用预训练的视觉-语言模型在SROIE上实现更高的抽取准确性,而无需特定任务训练。然而,数据集的固定大小和有限的字段多样性意味着新基准正在涌现,以应对更复杂的文档类型,而SROIE仍然是OCR和信息抽取进展的历史参考点。