译自英文

Total-Text是一个用于场景文本检测的基准数据集,包含真实世界图像中的曲线、多方向和水平文本实例,用于评估和推进文本检测算法。

Total-Text是一个用于场景文本检测的基准数据集,由多伦多大学的研究人员及其他机构于2017年提出。它旨在解决早期数据集主要关注水平或大致对齐文本的局限性,通过包含大量弯曲和任意方向文本实例来实现这一目标。该数据集已成为场景文本检测领域(人工智能和计算机视觉的一个子领域)中机器学习深度学习模型的标准评估资源。

该数据集包含从真实世界场景(如街道标志、店面招牌和海报)收集的1,555张图像。每张图像都标注了词级边界多边形,精确勾勒出文本区域,包括弯曲和多方向文本。标注格式支持多边形和矩形表示,便于灵活评估检测算法。Total-Text包含1,255张图像的训练集和300张图像的测试集,总计超过9,000个标注文本实例。该数据集以其高比例的弯曲文本而著称,这对假设轴对齐或水平文本的传统检测方法构成了重大挑战。

Total-Text已广泛应用于学术研究和竞赛中,例如ICDAR(国际文档分析与识别会议)挑战赛,用于基准测试文本检测系统的性能。它推动了先进神经网络架构的发展,包括基于残差网络U-Net类分割方法的方法,以及利用数据增强批量归一化来提高鲁棒性的技术。

数据集构成与标注

Total-Text中的图像来源于多种城市环境,捕捉了不同语言、字体、光照条件和视角下的文本。标注在词级进行,每个词由遵循文本形状(无论是弯曲、旋转还是水平)的多边形包围。数据集还为每个词提供了一组轴对齐的边界框,可用于需要矩形区域的评估方法。真实标注以文本文件格式存储,每行对应一个词,包含多边形坐标和文本转录。

评估指标与协议

Total-Text的标准评估遵循ICDAR竞赛建立的协议,使用精确率、召回率和F值作为主要指标。检测结果根据交并比(IoU)阈值(通常设为0.5)与真实标注多边形进行匹配。数据集的官方评估代码可供使用,以确保不同方法之间的一致性比较。鼓励研究人员在测试集上报告结果,许多已发表的论文在Total-Text上与其他数据集(如ICDAR 2015和MSRA-TD500)一起进行比较。

对场景文本检测研究的影响

Total-Text显著影响了现代文本检测系统的设计。早期方法依赖手工特征和连通组件分析,但弯曲文本的复杂性促使研究转向深度学习方法。许多最先进的模型现在采用全卷积网络、多头注意力机制和编码器-解码器架构,以像素级方式预测文本区域。该数据集还用于训练和评估结合检测与识别的端到端文本识别系统,通常利用序列到序列模型和变换器骨干网络。

局限性与扩展

尽管Total-Text提供了一个具有挑战性的基准,但它存在局限性,包括与一些现代数据集相比图像数量相对较少,且主要关注英语文本。后续数据集,如CTW1500和ArT,已扩展范围以涵盖更多样化的文本形状和语言。尽管如此,Total-Text仍然是评估文本检测算法鲁棒性(特别是在处理弯曲和任意方向文本方面)的广泛引用和使用的资源。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:dataset·computer-vision·scene-text-detection
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史