Traducido del inglés

COCO-Text es un conjunto de datos para la detección y el reconocimiento de texto en imágenes naturales, construido sobre la colección de imágenes COCO, que contiene más de 63,000 imágenes con regiones de texto anotadas.

COCO-Text es un conjunto de datos a gran escala diseñado para la detección y el reconocimiento de texto en escenas naturales. Se basa en la colección de imágenes Microsoft Common Objects in Context (COCO), que contiene más de 200,000 imágenes etiquetadas. COCO-Text se centra específicamente en las instancias de texto dentro de estas imágenes, proporcionando anotaciones para regiones de texto, sus transcripciones y atributos adicionales. El conjunto de datos fue introducido en 2016 por investigadores de Google y otras instituciones, y se ha convertido en un estándar de referencia para evaluar algoritmos de detección y reconocimiento de texto en el campo de la visión por computadora.

El propósito principal de COCO-Text es apoyar el desarrollo y la evaluación de modelos que puedan localizar y leer texto en entornos no restringidos, como señales de calle, fachadas de tiendas y etiquetas de productos. A diferencia de conjuntos de datos anteriores que se centraban en documentos escaneados o entornos controlados, COCO-Text enfatiza los desafíos de las imágenes del mundo real, incluida la iluminación variable, las distorsiones de perspectiva y los fondos complejos. El conjunto de datos incluye tanto texto impreso por máquina como texto escrito a mano, con anotaciones que indican si cada instancia de texto es legible o no.

Composición del conjunto de datos

COCO-Text contiene 63,686 imágenes, divididas en conjuntos de entrenamiento (43,686 imágenes), validación (10,000 imágenes) y prueba (10,000 imágenes). Cada imagen está anotada con instancias de texto, que se representan como polígonos delimitadores (no solo rectángulos) para capturar formas irregulares. Para cada instancia de texto, el conjunto de datos proporciona una transcripción (el contenido de texto real), un indicador de legibilidad (legible o ilegible) y una clasificación en una de varias categorías: impreso por máquina, escrito a mano u otros. Las anotaciones se crearon mediante una combinación de métodos automatizados y crowdsourcing humano, lo que garantiza un alto nivel de precisión.

El conjunto de datos incluye más de 145,000 instancias de texto en total, con un promedio de aproximadamente 2.3 instancias de texto por imagen. Las instancias de texto varían ampliamente en longitud, desde caracteres individuales hasta oraciones completas, y cubren una diversa gama de fuentes, tamaños y orientaciones. Esta diversidad hace que COCO-Text sea un punto de referencia desafiante para los modelos de Machine learning, particularmente aquellos basados en arquitecturas de Deep learning.

Detalles de las anotaciones

Cada instancia de texto en COCO-Text está anotada con un conjunto de atributos que son cruciales para el entrenamiento y la evaluación. El polígono delimitador se define mediante una lista de puntos, lo que permite una localización precisa del texto que puede estar curvado o rotado. El campo de transcripción contiene la cadena exacta de caracteres, que se utiliza para tareas de reconocimiento. El atributo de legibilidad indica si el texto es legible por un humano; el texto ilegible a menudo se incluye para probar la robustez de los modelos contra texto ruidoso o parcialmente oscurecido.

Además, cada instancia de texto se clasifica en una de tres categorías: 'impreso por máquina', 'escrito a mano' u 'otros'. Esta clasificación ayuda a analizar el rendimiento del modelo en diferentes tipos de texto. El conjunto de datos también proporciona metadatos a nivel de imagen, como el ID de imagen COCO original, lo que permite a los investigadores hacer referencias cruzadas con otras anotaciones de COCO (por ejemplo, etiquetas de detección de objetos) para el aprendizaje multitarea.

Uso como punto de referencia

COCO-Text se utiliza ampliamente como punto de referencia para tareas de detección y reconocimiento de texto. Ha sido adoptado en varias competiciones internacionales, incluida la Competición de Lectura Robusta de ICDAR (Conferencia Internacional sobre Análisis y Reconocimiento de Documentos). El conjunto de datos proporciona scripts de evaluación que calculan métricas estándar como precisión, recall y medida F para la detección, y precisión de palabras para el reconocimiento. Estas métricas se calculan en el conjunto de prueba, que tiene anotaciones ocultas para evitar el sobreajuste.

Los investigadores han utilizado COCO-Text para entrenar y evaluar una variedad de modelos, desde métodos tradicionales de visión por computadora hasta enfoques modernos de Neural network. En particular, los modelos de Deep learning basados en redes neuronales convolucionales (CNN) y redes neuronales recurrentes (RNN) han logrado un rendimiento de vanguardia en este conjunto de datos. El conjunto de datos también se ha utilizado para estudiar el aprendizaje por transferencia, donde los modelos preentrenados en conjuntos de datos de imágenes a gran escala se ajustan para la detección de texto.

Conjuntos de datos relacionados y extensiones

COCO-Text es parte de una familia más amplia de conjuntos de datos de texto en escenas, incluidos ICDAR 2013, ICDAR 2015 y Total-Text. Sin embargo, COCO-Text se distingue por su escala e integración con el ecosistema COCO. Desde su lanzamiento, se han propuesto varias extensiones y variantes. Por ejemplo, el conjunto de datos COCO-Text-OCR, introducido más tarde, proporciona anotaciones adicionales para el reconocimiento de texto, incluidos los cuadros delimitadores a nivel de carácter. Estas extensiones han aumentado aún más la utilidad de COCO-Text para la investigación.

Además, COCO-Text se ha utilizado junto con otros conjuntos de datos para crear puntos de referencia más completos. Por ejemplo, el conjunto de datos Open Images incluye anotaciones de texto que complementan a COCO-Text, lo que permite un entrenamiento a mayor escala. La disponibilidad de tales conjuntos de datos ha acelerado el progreso en el campo de la comprensión de texto en escenas, que es un componente crítico de aplicaciones como la conducción autónoma, la tecnología de asistencia y la búsqueda de imágenes.

Desafíos y limitaciones

A pesar de sus fortalezas, COCO-Text tiene ciertas limitaciones. El conjunto de datos está sesgado hacia el texto en inglés, ya que la mayoría de las anotaciones están en inglés. Esto limita su aplicabilidad a escenarios multilingües. Además, el proceso de anotación, aunque minucioso, puede contener errores, particularmente en la transcripción de texto pequeño o distorsionado. El conjunto de datos tampoco incluye información temporal, por lo que no se puede utilizar para tareas de detección de texto basadas en video.

Otro desafío es el desequilibrio en las categorías de texto: el texto impreso por máquina domina, mientras que el texto escrito a mano es relativamente raro. Esto puede llevar a modelos que funcionan bien con texto impreso pero mal con escritura a mano. Los investigadores a menudo necesitan aumentar COCO-Text con otros conjuntos de datos para abordar estas brechas. Sin embargo, COCO-Text sigue siendo un recurso fundamental para la comunidad de visión por computadora, y su impacto es evidente en los numerosos artículos y sistemas que lo citan.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:computer-vision·dataset·text-detection·benchmark
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial