Una red neuronal convolucional, o CNN, es una arquitectura de red neuronal construida en torno a capas convolucionales que aplican filtros pequeños y compartidos a través de una entrada, lo que la hace especialmente efectiva para datos estructurados en cuadrícula, como imágenes, donde los píxeles cercanos están relacionados y patrones útiles, como bordes o texturas, pueden aparecer en cualquier parte del encuadre. Al reutilizar los mismos pesos de filtro en cada ubicación espacial, las CNN necesitan muchos menos parámetros que una red totalmente conectada de tamaño comparable y codifican naturalmente la suposición de que el significado de una imagen cambia poco al trasladar su contenido, una propiedad conocida como invariancia a la traslación.
Historia
Las raíces conceptuales de la arquitectura se remontan al neocognitrón de Kunihiko Fukushima, un modelo jerárquico de la corteza visual de 1980, descrito por Kunihiko Fukushima, que introdujo la detección de características en capas sin usar aún retropropagación para el entrenamiento. Yann LeCun combinó capas convolucionales con retropropagación a finales de la década de 1980, produciendo LeNet, que a mediados de la década de 1990 podía leer dígitos manuscritos en cheques bancarios en despliegue comercial, uno de los primeros éxitos prácticos del aprendizaje profundo. Las CNN siguieron siendo una herramienta especializada durante aproximadamente dos décadas hasta 2012, cuando AlexNet, diseñada por Alex Krizhevsky con Ilya Sutskever y Geoffrey Hinton, ganó la competencia ILSVRC-2012 de ImageNet por un amplio margen usando una CNN profunda entrenada en GPUs, un evento ampliamente acreditado por iniciar el auge moderno del aprendizaje profundo.
Arquitectura
Una CNN típica apila capas convolucionales alternadas, que detectan patrones locales usando filtros aprendidos, y capas de agrupación, que reducen la resolución espacial mientras retienen las características más fuertes detectadas, construyendo progresivamente desde patrones de bajo nivel como bordes y colores en capas tempranas hasta conceptos semánticos de alto nivel como rostros u objetos en capas más profundas. Las capas finales suelen ser totalmente conectadas, mapeando las características extraídas a clases de salida. Arquitecturas posteriores como VGGNet, ResNet e Inception llevaron la profundidad mucho más lejos, con la introducción en 2015 de las conexiones residuales, o de salto, de ResNet, que resolvieron el problema del gradiente evanescente que antes dificultaba entrenar CNN muy profundas con descenso de gradiente ordinario.
Aplicaciones
Las CNN se convirtieron en la arquitectura predeterminada para tareas de visión por computadora que incluyen clasificación de imágenes, detección de objetos, segmentación semántica y reconocimiento facial, y sustentan componentes de sistemas de percepción para conducción autónoma, análisis de imágenes médicas y diseños tempranos de redes generativas antagónicas, donde las CNN típicamente formaban tanto el generador como el discriminador. También se han aplicado fuera de la visión, por ejemplo a espectrogramas de audio y algunas tareas de clasificación de texto, dondequiera que los datos tengan una estructura local similar a una cuadrícula que un filtro compartido pueda explotar.
Declive en dominancia relativa
Desde aproximadamente 2020, los Transformers de Visión, que adaptan la arquitectura transformador y su mecanismo de atención a parches de imagen en lugar de filtros convolucionales, han igualado o superado el rendimiento de las CNN en muchos puntos de referencia de visión a gran escala, particularmente cuando se entrenan con conjuntos de datos muy grandes, lo que ha provocado un debate sobre si las suposiciones espaciales incorporadas en la convolución siguen siendo necesarias una vez que hay suficientes datos y cómputo disponibles. Las CNN no obstante siguen siendo ampliamente utilizadas en la práctica, especialmente en entornos con recursos limitados o de IA en el borde, porque sus sesgos inductivos las hacen más eficientes en datos que los transformadores cuando los datos de entrenamiento son limitados, y continúan sirviendo como codificadores dentro de sistemas multimodales más grandes.