SROIE([[sroie|SROIE]])

英語からの翻訳

SROIEは、スキャンされたレシートのOCR用データセットであり、キー情報抽出タスクのために1,000枚の画像で構成されています。2019年にICDARコンペティション向けに導入され、OCRおよび文書理解システムのベンチマークに使用されています。

SROIE(扫描收据OCR与信息提取)是一个基准数据集,旨在评估扫描收据上的光学字符识别(OCR)和信息提取系统。该数据集于2019年作为ICDAR(国际文档分析与识别会议)竞赛的一部分推出,包含1,000张真实世界的收据图像,分为600个训练样本、100个验证样本和300个测试样本。数据集专注于提取公司名称、地址、日期和总金额等关键字段,使其成为文档理解模型的标准测试平台。

该数据集由中国科学院的研究人员及其他机构创建,旨在解决收据OCR缺乏标准化评估的问题。与合成数据集不同,SROIE使用具有多种布局、字体和打印质量的真实收据,反映了噪声、倾斜和低分辨率等现实挑战。每张收据都标注了文本级边界框和结构化键值对,支持文本定位、转录和语义解析等任务。

任务结构与评估

SROIE定义了三个主要任务:文本定位(检测单词和行)、文本识别(转录检测到的文本)和关键信息提取(将识别出的文本映射到预定义字段)。官方评估指标包括每个任务的精确率、召回率和F1分数,其中提取任务要求精确字段匹配。对于提取任务,系统必须输出类似JSON的结构,包含“company”、“address”、“date”和“total”等字段。竞赛的最终排名基于提取F1分数,该分数综合了所有字段的准确性。

技术特征

SROIE中的收据表现出多种格式,包括热敏打印、点阵打印和手写注释。图像通常在不同光照条件下拍摄,增加了OCR算法的复杂性。数据集的注释以自定义XML格式提供,每个单词通过其位置和文本进行标记,每个关键字段链接到相应的单词或短语。这种结构支持端到端模型以及分离检测、识别和提取的模块化流水线。

对文档AI的影响

SROIE已成为文档理解领域广泛引用的基准,以及OCR。它已被用于评估基于卷积神经网络循环神经网络的模型,以及更近期的基于Transformer的架构。该数据集还推动了收据图像数据增强技术的研究,例如合成噪声添加和几何变换。许多具有视觉能力的大型语言模型已在SROIE上进行了测试,以评估其从真实世界文档中执行结构化提取的能力。

局限性与扩展

尽管SROIE具有实用性,但它存在局限性。数据集相对较小,仅有1,000张图像,可能导致模型训练中的过拟合。字段集仅限于四个关键字段,忽略了其他常见收据元素,如税费或逐项明细。此外,收据主要来自中国商户,可能引入语言和区域偏差。研究人员提出了扩展方案,例如添加更多样化的收据或创建合成变体,但原始SROIE仍然是公平比较的标准。

相关基准

SROIE是更广泛的文档理解数据集家族的一部分,包括用于表单理解的FUNSD和用于收据提取的CORD。虽然CORD提供更详细的字段注释(例如项目名称、价格、小计),但SROIE的简单性和清晰的评估协议使其成为新模型的首选起点。该数据集也被纳入更大的多任务基准,如DocVQA和场景文本识别挑战,支持跨域评估。

未来方向

截至2025年,SROIE继续用于学术研究和行业应用,特别是在自动化费用管理和会计工作流程方面。随着生成式AI和多模态模型的兴起,研究人员正在探索如何利用预训练的视觉-语言模型,在无需任务特定训练的情况下提高SROIE上的提取准确性。然而,数据集的固定大小和有限的字段多样性意味着新基准正在出现,以应对更复杂的文档类型,而SROIE仍然是OCR和信息提取进展的历史参考点。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:dataset·ocr·information-extraction·document-understanding
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴