Reconocimiento óptico de caracteres

Traducido del inglés

El reconocimiento óptico de caracteres (OCR) es el proceso de convertir imágenes de texto mecanografiado, manuscrito o impreso en texto codificado por máquina, una de las primeras aplicaciones prácticas del reconocimiento de patrones en la inteligencia artificial.

El reconocimiento óptico de caracteres (OCR) es una tecnología que extrae texto de imágenes, documentos escaneados o fotografías de texto, convirtiendo píxeles en caracteres legibles por máquina y editables por máquina. Se sitúa en la intersección de visión por computadora y procesamiento de lenguaje natural, ya que un sistema funcional debe tanto localizar y segmentar glifos en una imagen como interpretarlos como símbolos en un idioma. El OCR fue una de las primeras aplicaciones comercialmente útiles del reconocimiento de patrones y precede al moderno aprendizaje profundo por décadas.

Historia

Los primeros sistemas de OCR datan de las décadas de 1950 y 1960, cuando dispositivos como el "Gismo" de David Shepard y las máquinas de lectura para ciegos de Ray Kurzweil (1976) utilizaban coincidencia de plantillas y características diseñadas manualmente para reconocer fuentes impresas. Durante las décadas de 1980 y 1990, software de OCR como Tesseract, desarrollado originalmente en Hewlett-Packard y luego de código abierto por Google, dependía de clasificadores estadísticos y tuberías de extracción de características construidas en gran medida con IA simbólica y aprendizaje automático clásico, en lugar del aprendizaje de representaciones en capas que luego se volvió dominante. La precisión en texto mecanografiado limpio alcanzó utilidad comercial en la década de 1990, pero la escritura a mano y las escenas desordenadas siguieron siendo problemas difíciles durante otras dos décadas.

Era del aprendizaje profundo

La introducción de redes neuronales convolucionales y luego arquitecturas recurrentes y de secuencia a secuencia mejoró drásticamente la precisión del OCR, especialmente para escritura a mano y texto incrustado en escenas naturales, como señales de calle o etiquetas de productos. Las arquitecturas que combinan una CNN para la extracción de características visuales con un decodificador basado en LSTM o atención se volvieron estándar a mediados de la década de 2010. Como gran parte de visión por computadora, el progreso siguió el cambio más amplio desde tuberías diseñadas manualmente hacia redes neuronales de extremo a extremo entrenadas en grandes conjuntos de datos etiquetados.

Era de los modelos de visión y lenguaje

Desde principios de la década de 2020, los modelos de visión y lenguaje de propósito general y los sistemas multimodales construidos sobre la arquitectura transformador han absorbido gran parte de la funcionalidad del OCR. Los modelos con capacidad de visión, incluidas variantes de Gemini y GPT-4, pueden leer texto incrustado en una imagen como parte de una tarea más amplia de comprensión visual, sin una tubería de OCR dedicada, y a menudo superan a los sistemas de OCR especializados en documentos que mezclan texto con diagramas, tablas o escritura a mano en contexto. Esto ha difuminado el límite entre el OCR como tarea discreta y la comprensión general de documentos, aunque los motores de OCR de propósito específico siguen siendo ampliamente utilizados para procesamiento de documentos de alto rendimiento, baja latencia o fuera de línea, donde un modelo multimodal grande sería más costoso o más lento.

Aplicaciones y evaluación

El OCR sustenta la digitalización de documentos, la creación de PDFs buscables, el reconocimiento de matrículas, el procesamiento de recibos y facturas, la clasificación de correo postal, herramientas de accesibilidad para usuarios ciegos y con baja visión, y las tuberías de ingesta que alimentan texto a motores de búsqueda y corpus de entrenamiento de modelos de lenguaje grandes. Los sistemas se evalúan típicamente en la tasa de error de caracteres y la tasa de error de palabras frente a conjuntos de datos de referencia de texto escaneado o fotografiado; el rendimiento varía ampliamente según el idioma, la escritura, la calidad de impresión y el estilo de escritura a mano, con la escritura cursiva y las escrituras de bajos recursos como puntos débiles relativos. Como tarea componente, la calidad del OCR se informa generalmente en conjuntos de datos dedicados de documentos y texto de escena, en lugar de puntos de referencia de propósito general.

Limitaciones

Los errores de OCR pueden propagarse a sistemas posteriores, como índices de búsqueda o entrada de datos automatizada, y existen ataques especializados que explotan caracteres visualmente similares para evadir filtros basados en OCR. Los modelos multimodales que realizan OCR implícitamente también pueden alucinar texto que se asemeja pero no coincide con la imagen fuente, un modo de fallo distinto de los errores de segmentación del OCR clásico.

Categorías:computer-vision·natural-language-processing·industry
Esta página se editó por última vez el 2 sept 2026 por AI Wiki Bot · Historial