译自英文

COCO-Text是一个用于自然图像中文本检测与识别的数据集,基于COCO图像集合构建,包含超过63,000张带有标注文本区域的图像。

COCO-Text是一个大规模数据集,专为自然场景中的文本检测与识别而设计。它基于微软的“上下文中的常见对象”(COCO)图像集合构建,该集合包含超过20万张标注图像。COCO-Text特别关注这些图像中的文本实例,提供文本区域、其转录内容及附加属性的标注。该数据集于2016年由谷歌及其他机构的研究人员推出,并已成为计算机视觉领域评估文本检测与识别算法的标准基准。

COCO-Text的主要目的是支持在无约束环境中(如街道标志、店面招牌和产品标签)定位和读取文本的模型的开发与评估。与早期专注于扫描文档或受控环境的数据集不同,COCO-Text强调真实世界图像的挑战,包括变化的照明、透视畸变和复杂背景。该数据集同时包含机器印刷和手写文本,并标注了每个文本实例是否可读。

数据集构成

COCO-Text包含63,686张图像,分为训练集(43,686张)、验证集(10,000张)和测试集(10,000张)。每张图像都标注了文本实例,这些实例以边界多边形(而非仅矩形)表示,以捕捉不规则形状。对于每个文本实例,数据集提供转录内容(实际文本内容)、可读性标志(可读或不可读),以及分类为若干类别之一:机器印刷、手写或其他。标注通过自动化方法与人工众包相结合的方式创建,确保了较高的准确性。

该数据集总共包含超过145,000个文本实例,平均每张图像约2.3个文本实例。文本实例的长度差异很大,从单个字符到完整句子不等,并涵盖多种字体、大小和方向。这种多样性使COCO-Text成为Machine learning模型(尤其是基于Deep learning架构的模型)的一个具有挑战性的基准。

标注细节

COCO-Text中的每个文本实例都标注了一组对训练和评估至关重要的属性。边界多边形由一系列点定义,允许精确定位可能弯曲或旋转的文本。转录字段包含确切的字符字符串,用于识别任务。可读性属性指示文本是否可被人类阅读;不可读文本通常被包含在内,以测试模型对噪声或部分遮挡文本的鲁棒性。

此外,每个文本实例被分类为三个类别之一:“机器印刷”、“手写”或“其他”。这种分类有助于分析模型在不同文本类型上的表现。数据集还提供图像级元数据,如原始COCO图像ID,使研究人员能够与其他COCO标注(例如,对象检测标签)进行交叉引用,以用于多任务学习。

基准使用

COCO-Text被广泛用作文本检测和识别任务的基准。它已被多个国际竞赛采用,包括ICDAR(国际文档分析与识别会议)鲁棒阅读竞赛。该数据集提供评估脚本,用于计算检测的标准指标(如精确率、召回率和F值)以及识别的单词准确率。这些指标在测试集上计算,测试集具有隐藏标注以防止过拟合。

研究人员已使用COCO-Text训练和评估各种模型,从传统计算机视觉方法到现代Neural network方法。特别是,基于卷积神经网络(CNN)和循环神经网络(RNN)的Deep learning模型在该数据集上取得了最先进的性能。该数据集还被用于研究迁移学习,其中在大规模图像数据集上预训练的模型被微调用于文本检测。

相关数据集与扩展

COCO-Text是更广泛的场景文本数据集家族的一部分,包括ICDAR 2013、ICDAR 2015和Total-Text。然而,COCO-Text通过其规模以及与COCO生态系统的集成而脱颖而出。自发布以来,已提出了若干扩展和变体。例如,后来推出的COCO-Text-OCR数据集为文本识别提供了额外标注,包括字符级边界框。这些扩展进一步提高了COCO-Text在研究中的实用性。

此外,COCO-Text已与其他数据集结合使用,以创建更全面的基准。例如,Open Images数据集包含补充COCO-Text的文本标注,允许更大规模的训练。此类数据集的可用性加速了场景文本理解领域的进展,而场景文本理解是自动驾驶、辅助技术和图像搜索等应用的关键组成部分。

挑战与局限性

尽管有其优势,COCO-Text仍存在某些局限性。该数据集偏向英语文本,因为大多数标注为英语。这限制了其在多语言场景中的适用性。此外,标注过程虽然详尽,但可能包含错误,尤其是在小尺寸或扭曲文本的转录中。该数据集也不包含时间信息,因此无法用于基于视频的文本检测任务。

另一个挑战是文本类别的不平衡:机器印刷文本占主导地位,而手写文本相对稀少。这可能导致模型在印刷文本上表现良好,但在手写文本上表现不佳。研究人员通常需要将COCO-Text与其他数据集结合,以解决这些差距。尽管如此,COCO-Text仍然是计算机视觉社区的基础资源,其影响在众多引用它的论文和系统中显而易见。

参见

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:computer-vision·dataset·text-detection·benchmark
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史