Traducido del inglés

Total-Text es un conjunto de datos de referencia para la detección de texto en escenas, que contiene instancias de texto curvas, multi-orientadas y horizontales en imágenes del mundo real, utilizado para evaluar y avanzar en los algoritmos de detección de texto.

Total-Text es un conjunto de datos de referencia para la detección de texto en escenas, introducido en 2017 por investigadores de la Universidad de Toronto y otras instituciones. Fue diseñado para abordar las limitaciones de conjuntos de datos anteriores que se centraban principalmente en texto horizontal o aproximadamente alineado, al incluir una proporción significativa de instancias de texto curvo y con orientación arbitraria. El conjunto de datos se ha convertido en un recurso de evaluación estándar para modelos de aprendizaje automático y aprendizaje profundo en el campo de la detección de texto en escenas, una subárea de la inteligencia artificial y la visión por computadora.

El conjunto de datos consta de 1,555 imágenes recopiladas de escenas del mundo real, como letreros de calles, fachadas de tiendas y carteles. Cada imagen está anotada con polígonos delimitadores a nivel de palabra que delinean con precisión las regiones de texto, incluyendo texto curvo y multi-orientado. Las anotaciones se proporcionan en un formato que respalda tanto representaciones poligonales como rectangulares, lo que permite una evaluación flexible de los algoritmos de detección. Total-Text incluye un conjunto de entrenamiento de 1,255 imágenes y un conjunto de prueba de 300 imágenes, con más de 9,00 instancias de texto anotadas en total. El conjunto de datos es notable por su alta proporción de texto curvo, lo que plantea un desafío significativo para los métodos de detección tradicionales que asumen texto alineado al eje u horizontal.

Total-Text ha sido ampliamente utilizado en investigación académica y competiciones, como los desafíos de ICDAR (Conferencia Internacional sobre Análisis y Reconocimiento de Documentos), para evaluar el rendimiento de sistemas de detección de texto. Ha impulsado el desarrollo de arquitecturas avanzadas de redes neuronales, incluyendo las basadas en redes residuales y enfoques de segmentación tipo U-Net, así como métodos que aprovechan la aumento de datos y la normalización por lotes para mejorar la robustez.

Composición y Anotación del Conjunto de Datos

Las imágenes en Total-Text provienen de diversos entornos urbanos, capturando texto en diferentes idiomas, fuentes, condiciones de iluminación y perspectivas. Las anotaciones se realizan a nivel de palabra, con cada palabra delimitada por un polígono que sigue la forma del texto, ya sea curvo, rotado u horizontal. El conjunto de datos también proporciona un conjunto separado de cuadros delimitadores alineados al eje para cada palabra, que se pueden utilizar en métodos de evaluación que requieren regiones rectangulares. La verdad de terreno se almacena en un formato de archivo de texto, donde cada línea corresponde a una palabra e incluye las coordenadas del polígono y la transcripción del texto.

Métricas y Protocolos de Evaluación

La evaluación estándar para Total-Text sigue los protocolos establecidos por los concursos de la ICDAR, usando precisión, recall y medida-F como métricas principales. Los resultados de detección se comparan con los polímeros de verdad de campamento, basándose en los umbrales de intersección sobre unión (IoU), que típicamente se fijan en 0.5. Los datos de evaluación oficiales están disponibles para garantizar la comparación consistente de métodos; además, se alienta a los investigadores a reportar resultados en el conjunto de prueba, y muchos artículos publicados incluyen comparaciones en Total-Text junto con otros conjuntos de datos como ICACIAR 2015 y MSRA-TD500.

Impacto en la Investigación en Detección de Texto en Escenas

Total-Text ha influido significativamente en el diseño de los sistemas modernos de detección de texto. Los primeros métodos dependían de características handicraft y análisis de componentes conectados, pero la complejidad de los textos curvos impulsó un cambio hacia los enfoques de aprendizaje profundo. Muchos modelos de comparación de última generación now emplean redes completamente convolucionales, mecanismos de [[multi-head-attention|atención todos

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·computer-vision·scene-text-detection
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial