Red neuronal convolucional

Traducido del inglés

Una red neuronal convolucional (CNN) es una red neuronal de alimentación directa que aprende características mediante la optimización de filtros, utilizada comúnmente para datos de tipo cuadrícula, como imágenes. Emplea capas convolucionales, de agrupación y totalmente conectadas para procesar y predecir a partir de diversos tipos de datos.

Una red neuronal convolucional (CNN) es un tipo de red neuronal feedforward que aprende características mediante la optimización de filtros (o núcleos). Este tipo de red de aprendizaje profundo se ha aplicado para procesar y hacer predicciones a partir de muchos tipos diferentes de datos, incluyendo texto, imágenes y audio. Las CNN son el estándar de facto en los enfoques de aprendizaje profundo para visión por computadora y procesamiento de imágenes, y solo recientemente han sido reemplazadas en algunos casos por arquitecturas más nuevas como el transformador.

Las CNN también se conocen como redes neuronales artificiales invariantes al desplazamiento o invariantes al espacio, basadas en la arquitectura de pesos compartidos de los núcleos o filtros de convolución que se deslizan a lo largo de las características de entrada y proporcionan respuestas equivariantes a la traslación conocidas como mapas de características. De manera contraintuitiva, la mayoría de las redes neuronales convolucionales no son invariantes a la traslación, debido a la operación de submuestreo que aplican a la entrada.

Arquitectura

Una red neuronal convolucional consta de una capa de entrada, capas ocultas y una capa de salida. En una red neuronal convolucional, las capas ocultas incluyen una o más capas que realizan convoluciones. Típicamente, esto incluye una capa que realiza un producto punto del núcleo de convolución con la matriz de entrada de la capa. Este producto suele ser el producto interno de Frobenius, y su función de activación es comúnmente ReLU. A medida que el núcleo de convolución se desliza a lo largo de la matriz de entrada para la capa, la operación de convolución genera un mapa de características, que a su vez contribuye a la entrada de la siguiente capa. Esto es seguido por otras capas como capas de agrupación, capas totalmente conectadas y capas de normalización.

Capas convolucionales

En una CNN, la entrada es un tensor con forma: (número de entradas) × (altura de entrada) × (ancho de entrada) × (canales de entrada). Después de pasar por una capa convolucional, la imagen se abstrae a un mapa de características, también llamado mapa de activación, con forma: (número de entradas) × (altura del mapa de características) × (ancho del mapa de características) × (canales del mapa de características). Las capas convolucionales convolucionan la entrada y pasan su resultado a la siguiente capa. Esto es similar a la respuesta de una neurona en la corteza visual a un estímulo específico. Cada neurona convolucional procesa datos solo para su campo receptivo.

Aunque las redes neuronales feedforward totalmente conectadas pueden usarse para aprender características y clasificar datos, esta arquitectura es generalmente poco práctica para entradas más grandes (por ejemplo, imágenes de alta resolución), que requerirían cantidades masivas de neuronas porque cada píxel es una característica de entrada relevante. Una capa totalmente conectada para una imagen de tamaño 100 × 100 tiene 10,000 pesos para cada neurona en la segunda capa. La convolución reduce el número de parámetros libres, permitiendo que la red sea más profunda. Por ejemplo, usar una región de mosaico de 5 × 5, cada una con los mismos pesos compartidos, requiere solo 25 neuronas. Usar pesos compartidos significa que hay muchos menos parámetros, lo que ayuda a evitar los problemas de gradientes desvanecientes y gradientes explosivos vistos durante la retropropagación en redes neuronales anteriores.

Para acelerar el procesamiento, las capas convolucionales estándar pueden reemplazarse por capas convolucionales separables en profundidad, que se basan en una convolución en profundidad seguida de una convolución puntual. La convolución en profundidad es una convolución espacial aplicada independientemente sobre cada canal del tensor de entrada, mientras que la convolución puntual es una convolución estándar restringida al uso de núcleos de 1 × 1.

Capas de agrupación

Las redes convolucionales pueden incluir capas de agrupación locales y/o globales junto con capas convolucionales tradicionales. Las capas de agrupación reducen las dimensiones de los datos combinando las salidas de grupos de neuronas en una capa en una sola neurona en la siguiente capa. La agrupación local combina pequeños grupos, con tamaños de mosaico como 2 × 2 comúnmente usados. La agrupación global actúa sobre todas las neuronas del mapa de características. Hay dos tipos comunes de agrupación en uso popular: máximo y promedio. La agrupación máxima usa el valor máximo de cada grupo local de neuronas en el mapa de características, mientras que la agrupación promedio toma el valor promedio.

Capas totalmente conectadas

Las capas totalmente conectadas conectan cada neurona en una capa con cada neurona en otra capa. Esto es lo mismo que una red neuronal perceptrón multicapa tradicional (MLP). Cada neurona en la capa totalmente conectada recibe entrada de todas las neuronas en la capa anterior. Estas entradas se ponderan y suman con los sesgos correspondientes, y luego se pasan a través de una función de activación para realizar una transformación no lineal, generando la salida. La matriz aplanada pasa a través de una capa totalmente conectada para clasificar las imágenes.

Inspiración Biológica

Las redes convolucionales se inspiraron en procesos biológicos en el sentido de que el patrón de conectividad entre neuronas se asemeja a la organización de la corteza visual animal. Las neuronas corticales individuales responden a estímulos solo en una región restringida del campo visual conocida como campo receptivo. Los campos receptivos de diferentes neuronas se superponen parcialmente de modo que cubren todo el campo visual. Esta analogía biológica motivó el diseño de capas convolucionales, donde cada neurona procesa entrada de una región local, imitando la estructura del campo receptivo.

Regularización y Sobreajuste

Las redes neuronales feedforward son generalmente redes totalmente conectadas, es decir, cada neurona en una capa está conectada a todas las neuronas en la siguiente capa. La "conectividad completa" de estas redes las hace propensas a sobreajustar los datos. Las formas típicas de regularización, o prevención del sobreajuste, incluyen penalizar parámetros durante el entrenamiento (como la disminución de pesos) o recortar la conectividad (conexiones omitidas, dropout, etc.). Los conjuntos de datos robustos también aumentan la probabilidad de que las CNN aprendan los principios generalizados que caracterizan un conjunto de datos dado en lugar de los sesgos de un conjunto mal poblado. Además, la arquitectura de pesos compartidos de las CNN reduce inherentemente el número de parámetros, proporcionando una forma de regularización que ayuda a mitigar el sobreajuste.

Aplicaciones

Algunas aplicaciones de las CNN incluyen reconocimiento de imágenes y video, sistemas de recomendación, clasificación de imágenes, segmentación de imágenes, análisis de imágenes médicas, procesamiento de lenguaje natural, interfaces cerebro-computadora y series temporales financieras. En visión por computadora, las CNN se han utilizado ampliamente para tareas como detección de objetos, reconocimiento facial y conducción autónoma. En procesamiento de lenguaje natural, las CNN se han aplicado a la clasificación de texto y análisis de sentimientos, aunque han sido en gran medida superadas por modelos basados en transformadores en muchas de estas tareas. La versatilidad de las CNN proviene de su capacidad para aprender características jerárquicas, desde bordes de bajo nivel hasta conceptos semánticos de alto nivel.

Ventajas y Limitaciones

Las CNN usan relativamente poco preprocesamiento en comparación con otros algoritmos de clasificación de imágenes. Esto significa que la red aprende a optimizar los filtros (o núcleos) mediante aprendizaje automatizado, mientras que en algoritmos tradicionales estos filtros se diseñan manualmente. Esto simplifica y automatiza el proceso, mejorando la eficiencia y escalabilidad, superando los cuellos de botella de la intervención humana. Sin embargo, las CNN no son inherentemente invariantes a la traslación debido a las operaciones de submuestreo, lo que puede ser una limitación en ciertas tareas. Además, aunque las CNN han sido dominantes en visión por computadora, arquitecturas más nuevas como los transformadores han comenzado a reemplazarlas en algunas aplicaciones, particularmente cuando hay datos a gran escala y recursos computacionales disponibles.

Relación con Otros Tipos de Redes Neuronales

Las CNN son una forma especializada de red neuronal y un subconjunto de arquitecturas de aprendizaje profundo. Se diferencian de las redes totalmente conectadas en su uso de capas convolucionales y de agrupación, que reducen el número de parámetros y permiten la extracción jerárquica de características. En comparación con los transformadores, que se basan en mecanismos de atención, las CNN usan campos receptivos locales y pesos compartidos, lo que las hace más eficientes en parámetros para datos similares a cuadrículas, pero menos capaces de capturar dependencias de largo alcance sin modificaciones adicionales. A pesar del auge de los transformadores, las CNN siguen siendo una arquitectura fundamental en aprendizaje automático y continúan usándose en modelos híbridos que combinan componentes convolucionales y basados en atención.

Direcciones Futuras

La investigación continúa mejorando las CNN, incluyendo desarrollos en convoluciones separables en profundidad para eficiencia, conexiones residuales para abordar gradientes desvanecientes e integración con otras arquitecturas. Técnicas como normalización por lotes y Dropout se usan comúnmente para estabilizar el entrenamiento y prevenir el sobreajuste. A partir de principios de la década de 2020, las CNN siguen siendo una herramienta estándar en visión por computadora, pero su dominio está siendo desafiado por modelos basados en transformadores, especialmente en entornos a gran escala. El trabajo en curso tiene como objetivo combinar las fortalezas de ambos enfoques, lo que lleva a modelos más robustos y eficientes para una amplia gama de aplicaciones.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·computer-vision·neural-networks
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial