LeNet-5 es una arquitectura de red neuronal convolucional desarrollada por un grupo de investigación en los Laboratorios Bell de AT&T, centrado en Yann LeCun, y publicada en 1998. Es la versión más conocida de la serie LeNet, diseñada para leer pequeñas imágenes en escala de grises de dígitos y letras manuscritas. LeNet-5 es históricamente importante por ser una de las primeras redes neuronales convolucionales y una contribución fundamental al desarrollo del aprendizaje profundo, influyendo en muchas arquitecturas modernas.
Las redes neuronales convolucionales son un tipo de red neuronal de avance directo cuyas neuronas artificiales pueden responder a una parte de las células circundantes en el rango de cobertura, funcionando bien en el procesamiento de imágenes a gran escala. LeNet-5 ejemplifica esto mediante el uso de capas convolucionales para extraer características espaciales, capas de agrupación para el submuestreo y capas totalmente conectadas para la clasificación. Su éxito en aplicaciones prácticas, como la lectura de millones de cheques al día, demostró la viabilidad de las redes neuronales en tareas del mundo real.
Historia del Desarrollo
Los orígenes de LeNet se remontan a 1988, cuando Yann LeCun se unió al Departamento de Investigación de Sistemas Adaptativos en los Laboratorios Bell de AT&T en Holmdel, Nueva Jersey, dirigido por Lawrence D. Jackel. A finales de noviembre de 1988, John S. Denker y sus colegas publicaron un diseño de red neuronal para reconocer códigos postales manuscritos, aunque sus primeras capas estaban ajustadas manualmente. En 1989, LeCun y su equipo aplicaron por primera vez el algoritmo de retropropagación a aplicaciones prácticas, combinando redes neuronales convolucionales con retropropagación para leer números manuscritos. Este prototipo, más tarde llamado LeNet-1, se aplicó con éxito para identificar códigos postales manuscritos del Servicio Postal de los Estados Unidos, logrando una tasa de error de solo el 1% con una tasa de rechazo de aproximadamente el 9%.
Durante los siguientes cuatro años, la investigación continuó, lo que llevó al desarrollo de la base de datos MNIST en 1994. LeNet-1 era demasiado pequeña para este nuevo conjunto de datos, lo que impulsó la creación de LeNet-4. Para 1998, Yann LeCun, Leon Bottou, Yoshua Bengio y Patrick Haffner describieron LeNet-5 en un artículo que también mostró aplicaciones prácticas, incluidos sistemas para reconocer caracteres manuscritos y modelos que podían leer millones de cheques al día. Este trabajo despertó un interés generalizado en la investigación de redes neuronales, y aunque las arquitecturas modernas difieren, LeNet sirvió como punto de partida para muchos diseños posteriores.
Arquitectura
LeNet-5 incorpora varios motivos comunes en las redes neuronales convolucionales modernas, incluidas capas convolucionales, capas de agrupación y capas totalmente conectadas. Cada capa convolucional incluye tres partes: convolución, agrupación y una función de activación no lineal, típicamente la función tanh. La red utiliza la convolución para extraer características espaciales, con el concepto de campos receptivos, y emplea agrupación promedio para el submuestreo. Las capas finales están totalmente conectadas para la clasificación, y las conexiones dispersas entre capas reducen la complejidad computacional.
El informe de 1989 de LeCun et al. introdujo redes etiquetadas como Net-1 hasta Net-5, con varios refinamientos que llevaron a LeNet-5 en 1998. La nomenclatura es inconsistente, y no está claro a qué podrían referirse LeNet-2 y LeNet-3. LeNet-1, LeNet-4 y LeNet-5 están bien documentadas, pero las versiones intermedias no lo están.
Prototipos Tempranos
La primera red neuronal publicada por el grupo de LeCun en 1988 fue un enfoque híbrido. Su primera etapa escalaba, enderezaba y esqueletizaba la imagen de entrada. La segunda etapa utilizaba una capa convolucional con 18 núcleos diseñados manualmente, y la tercera etapa era una red totalmente conectada con una capa oculta. El conjunto de datos consistía en imágenes de dígitos manuscritos extraídas del correo real de los Estados Unidos, el mismo conjunto de datos utilizado en el famoso informe de 1989.
Net-1 a Net-5
El informe de 1989 detallaba Net-1 hasta Net-5, todas con capas finales totalmente conectadas. El artículo original no explica la estrategia de relleno, y todas las células tienen sesgos independientes, incluidas las células de salida de las capas convolucionales.
- Net-1: Sin capa oculta, totalmente conectada, mapeando (16×16) a 10 salidas.
- Net-2: Una capa oculta totalmente conectada con 12 unidades ocultas, mapeando (16×16) a 12 a 10.
- Net-3: Dos capas ocultas convolucionales, mapeando (16×16) a (8×8) a (4×4) a 10, con capas localmente conectadas que usan formas de entrada de 3×3 y paso de 2.
- Net-4: Dos capas ocultas, la primera convolucional y la segunda localmente conectada, mapeando (16×16) a (8×8×2) a (4×4) a 10, con la capa de convolución teniendo 2 núcleos de forma 3×3 y paso de 2.
- Net-5: La versión final, LeNet-5, refinó estos conceptos en una arquitectura más profunda con múltiples capas convolucionales y de agrupación, culminando en capas totalmente conectadas para la clasificación.
Impacto y Legado
Los principios de diseño de LeNet-5, como la extracción de características convolucionales y el submuestreo, se convirtieron en fundamentales en el aprendizaje profundo. Demostró que minimizar el número de parámetros libres en una red neuronal podía mejorar la generalización, una idea clave para arquitecturas posteriores. El éxito de la red en la lectura de cheques manuscritos en cajeros automáticos y códigos postales influyó tanto en la investigación académica como en las aplicaciones comerciales. Aunque las redes neuronales modernas han evolucionado significativamente, LeNet-5 sigue siendo un hito histórico, a menudo citado como precursor de los modelos contemporáneos de aprendizaje profundo y un catalizador para la adopción más amplia de enfoques de red neuronal en aprendizaje automático y inteligencia artificial.