LeNet es una serie de arquitecturas de redes neuronales convolucionales (CNN) creadas por un grupo de investigación en los Laboratorios Bell de AT&T entre 1988 y 1998, centrado en Yann LeCun. Estas redes fueron diseñadas para leer pequeñas imágenes en escala de grises de dígitos y letras manuscritas, y se utilizaron en cajeros automáticos para leer cheques. Las redes neuronales convolucionales son un tipo de red neuronal de avance directo cuyas neuronas artificiales pueden responder a una parte de las células circundantes en el rango de cobertura y funcionan bien en el procesamiento de imágenes a gran escala. LeNet-5 fue una de las primeras redes neuronales convolucionales y fue históricamente importante durante el desarrollo del aprendizaje profundo. En general, cuando se menciona LeNet sin un número, se refiere a la versión de 1998, LeNet-5, que es la versión más conocida.
Historia del desarrollo
En octubre de 1988, LeCun se unió al Departamento de Investigación de Sistemas Adaptativos en los Laboratorios Bell de AT&T en Holmdel, Nueva Jersey, dirigido por Lawrence D. Jackel. A finales de noviembre de 1988, John S. Denker y otros publicaron un diseño de red neuronal para reconocer códigos postales manuscritos, pero sus primeras capas de conexiones estaban ajustadas manualmente.
En 1989, Yann LeCun y otros en los Laboratorios Bell aplicaron por primera vez el algoritmo de retropropagación a aplicaciones prácticas, creyendo que la capacidad de aprender la generalización de la red podría mejorarse enormemente al proporcionar restricciones del dominio de la tarea. Combinaron una red neuronal convolucional entrenada con algoritmos de retropropagación para leer números manuscritos y la aplicaron con éxito en la identificación de números de códigos postales manuscritos proporcionados por el Servicio Postal de los Estados Unidos. Este fue el prototipo de lo que más tarde se llamaría LeNet-1. En el mismo año, LeCun describió un pequeño problema de reconocimiento de dígitos manuscritos en otro artículo, mostrando que, aunque el problema es linealmente separable, las redes de una sola capa mostraban capacidades de generalización deficientes. Al usar detectores de características invariantes a la traslación en una red restringida de múltiples capas, el modelo podía funcionar muy bien. Creía que estos resultados demostraban que minimizar el número de parámetros libres en la red neuronal podía mejorar su capacidad de generalización.
En 1989, su artículo que presentaba LeNet-1 describió nuevamente la aplicación de redes de retropropagación en el reconocimiento de dígitos manuscritos. Realizaron un preprocesamiento mínimo de los datos, y el modelo fue cuidadosamente diseñado para la tarea y altamente restringido. Los datos de entrada consistían en imágenes, cada una con un número, y los resultados de las pruebas en los datos digitales de códigos postales proporcionados por el Servicio Postal de los Estados Unidos mostraron que el modelo tenía una tasa de error de solo el 1% y una tasa de rechazo de aproximadamente el 9%.
Su investigación continuó durante los siguientes cuatro años, y en 1994 se desarrolló la base de datos MNIST, para la cual LeNet-1 era demasiado pequeña, por lo que se entrenó un nuevo LeNet-4 en ella. Un año después, el colectivo de los Laboratorios Bell de AT&T revisó varios métodos de reconocimiento de caracteres manuscritos en un artículo, utilizando dígitos manuscritos estándar para identificar tareas de referencia. Estos modelos se compararon y los resultados mostraron que la red más reciente superaba a otros modelos.
Para 1998, Yann LeCun, Leon Bottou, Yoshua Bengio y Patrick Haffner pudieron proporcionar ejemplos de aplicaciones prácticas de redes neuronales, como dos sistemas para reconocer caracteres manuscritos en línea y modelos que podían leer millones de cheques por día, lo que incluye una descripción de LeNet-5. La investigación logró un gran éxito y despertó el interés de los académicos en el estudio de las redes neuronales. Aunque la arquitectura de las redes neuronales de mejor rendimiento en la actualidad no es la misma que la de LeNet, esta red fue el punto de partida para una gran cantidad de arquitecturas de redes neuronales y también trajo inspiración al campo.
Arquitectura
LeNet tiene varios motivos comunes de las redes neuronales convolucionales modernas, como capas convolucionales, capas de agrupación y capas totalmente conectadas. Cada capa convolucional incluye tres partes: convolución, agrupación y funciones de activación no lineales. Utiliza la convolución para extraer características espaciales (la convolución se llamaba originalmente campos receptivos), agrupación promedio con submuestreo, funciones de activación tanh, capas totalmente conectadas en las capas finales para la clasificación y conexiones dispersas entre capas para reducir la complejidad del cálculo.
En 1989, LeCun y otros publicaron un informe que contenía "Net-1" a "Net-5". Hubo muchos refinamientos posteriores hasta 1998, y la nomenclatura es inconsistente. Generalmente, cuando la gente habla de "LeNet" se refiere al LeNet de 1998, también conocido como "LeNet-5". Se han mencionado LeNet-1, 4 y 5, pero no está claro a qué podrían referirse LeNet-2 y LeNet-3.
Net de 1988
La primera red neuronal publicada por el grupo de investigación de LeCun fue en 1988. Era un enfoque híbrido. La primera etapa escalaba, corregía la inclinación y esqueletizaba la imagen de entrada. La segunda etapa era una capa convolucional con 18 núcleos diseñados manualmente. La tercera etapa era una red totalmente conectada con una capa oculta. El conjunto de datos era una colección de imágenes de dígitos manuscritos extraídas del correo real de los Estados Unidos, que era el mismo conjunto de datos utilizado en el famoso informe de 1989.
Net-1 a Net-5
Net-1 a Net-5 se publicaron en un informe de 1989. La última capa de todos ellos estaba totalmente conectada. El artículo original no explica la estrategia de relleno. Todas las células tienen un sesgo independiente, incluidas las células de salida de las capas convolucionales.
- Net-1: Sin capa oculta. Totalmente conectada. (16×16) → 10.
- Net-2: Una capa oculta totalmente conectada con 12 unidades ocultas. (16×16) → 12 → 10.
- Net-3: Dos capas ocultas convolucionales. (16×16) → (8×8) → (4×4) → 10. Ambas son capas localmente conectadas con forma de entrada 3×3 y paso 2.
- Net-4: Dos capas ocultas, la primera es una convolución, la segunda es localmente conectada. (16×16) → (8×8×2) → (4×4) → 10. La capa convolucional tiene 2 núcleos de forma 3×3 y paso 2. La capa localmente conectada tiene forma de entrada 3×3 y paso 2.
Legado
La influencia de LeNet se extiende más allá de su aplicación inmediata. Demostró la efectividad de la retropropagación en el entrenamiento de redes profundas e introdujo conceptos arquitectónicos clave que se convirtieron en estándar en las CNN posteriores. El éxito de LeNet en la lectura de dígitos manuscritos impulsó el interés en las redes neuronales y sentó las bases para desarrollos posteriores en aprendizaje automático y inteligencia artificial. Sus principios se reflejan en las arquitecturas modernas, aunque han evolucionado significativamente. El conjunto de datos MNIST, desarrollado en 1994 para entrenar LeNet-4, sigue siendo un punto de referencia estándar en el campo. El despliegue práctico de LeNet en cajeros automáticos para la lectura de cheques mostró la viabilidad en el mundo real de las redes neuronales, contribuyendo a la adopción más amplia de técnicas de aprendizaje profundo.