ICDAR 2015指的是2015年在第13届国际文档分析与识别会议(ICDAR)上举办的鲁棒阅读竞赛。该竞赛聚焦于场景文本检测与识别,挑战参与者定位并读取自然图像中的文字。它是推动Computer vision和文档分析领域进步的一系列竞赛之一,为评估算法提供了标准化基准。
该竞赛包含多个任务,最显著的是文本定位(检测文本区域周围的边界框)和文本识别(将检测到的文本转录为机器可读的字符串)。主要使用的数据集是ICDAR 2015偶然场景文本数据集,该数据集包含1,500张使用Google Glass设备在繁忙街道环境中拍摄的图像。这些图像故意以“偶然”方式拍摄,意味着它们没有被仔细构图,导致出现运动模糊、低分辨率和文本任意方向等挑战。
数据集与评估
ICDAR 2015数据集包含1,000张训练图像和500张测试图像。真实标注提供了词级边界框和转录文本。检测评估使用标准的PASCAL VOC标准,即当检测结果与真实框的交并比(IoU)超过0.5时,该检测被视为正确。对于识别,指标是预测字符串与真实字符串之间的编辑距离。竞赛还包括一个要求同时进行检测和识别的组合任务,使用端到端词定位指标进行评估。
结果与影响
文本定位任务的获胜提交来自多伦多大学的一个团队,实现了约0.72的F值。对于端到端识别任务,最佳表现者是中国科学院的一个团队,达到了约0.68的F值。这些结果与后来几年相比相对有限,反映了偶然场景文本问题的难度。该竞赛凸显了现有方法在处理任意方向和变化光照条件方面的局限性,推动了后续基于深度学习的研究。
遗产与后续发展
ICDAR 2015成为研究社区广泛使用的基准。许多后续关于场景文本检测和识别的论文,特别是那些采用Deep learning和Neural network架构的论文,都在该数据集上报告了结果。该竞赛对偶然文本的强调影响了后续版本,如ICDAR 2017和ICDAR 2019,这些版本引入了更具挑战性的数据集。2015年基准仍然是评估文本阅读系统在现实场景中鲁棒性的标准参考。
与更广泛AI研究的关系
为ICDAR 2015开发的技术,如区域提议网络和用于识别的序列到序列模型,与Artificial intelligence和Machine learning的更广泛进展相交汇。该竞赛为后来应用于自动驾驶、增强现实和文档数字化的算法提供了一个实用测试平台。它还促进了Data Augmentation策略的发展,因为参与者使用合成文本生成和图像变换来提高泛化能力。