Capa convolucional

Traducido del inglés

Una capa convolucional es un bloque fundamental de las redes neuronales convolucionales que aplica filtros aprendibles a los datos de entrada, detectando patrones locales como bordes o texturas. Utiliza pesos compartidos y ventanas deslizantes para reducir parámetros y permitir la invariancia a la traslación.

Una capa convolucional es un componente central de muchas redes neuronales, particularmente aquellas utilizadas para el procesamiento de imágenes y señales. A diferencia de las capas totalmente conectadas, que conectan cada neurona de entrada con cada neurona de salida, una capa convolucional aplica un conjunto de filtros aprendibles (también llamados núcleos) a través de la entrada de manera deslizante. Esta operación, conocida como convolución, detecta características locales como bordes, esquinas o texturas, y produce mapas de características que resaltan dónde ocurren estos patrones. El diseño de la capa reduce el número de parámetros en comparación con las capas densas y proporciona invariancia a la traslación, lo que significa que un patrón puede reconocerse independientemente de su posición en la entrada.

Las capas convolucionales se inspiraron en la investigación biológica de la corteza visual, notablemente por David Hubel y Torsten Wiesel en la década de 1960, quienes descubrieron que las neuronas en el sistema visual del gato responden a estímulos localizados. Las primeras implementaciones artificiales incluyen el neocognitrón de Kunihiko Fukushima en 1980, y más tarde la arquitectura LeNet de Yann LeCun en la década de 1990, que utilizó capas convolucionales para el reconocimiento de dígitos manuscritos. Desde entonces, las capas convolucionales se han vuelto omnipresentes en el aprendizaje profundo, impulsando aplicaciones desde imágenes médicas hasta conducción autónoma.

Operación e Hiperparámetros

Una capa convolucional toma un tensor de entrada (por ejemplo, una imagen 2D con múltiples canales de color) y aplica un conjunto de filtros. Cada filtro es una pequeña matriz de pesos, típicamente de 3x3 o 5x5, que se desliza a través de la entrada con un paso (tamaño de zancada) especificado. En cada posición, la capa calcula el producto punto entre los pesos del filtro y el parche de entrada correspondiente, produciendo un único valor de salida. El resultado es un mapa de activación 2D para cada filtro, y apilar estos mapas a lo largo de la dimensión de profundidad forma el tensor de salida.

Los hiperparámetros clave incluyen el tamaño del filtro, el paso, el relleno y el número de filtros. El relleno (a menudo relleno con ceros) controla las dimensiones espaciales de la salida, permitiendo que la capa preserve el tamaño de entrada o lo reduzca. El paso afecta el submuestreo; pasos más grandes reducen la resolución de salida. El número de filtros determina la profundidad de los mapas de características de salida, con cada filtro aprendiendo a detectar un tipo diferente de característica. Después de la convolución, se aplica típicamente una función de activación como ReLU (Unidad Lineal Rectificada) para introducir no linealidad.

Compartición de Parámetros y Conectividad Local

Dos propiedades distinguen las capas convolucionales de las capas totalmente conectadas: conectividad local y compartición de parámetros. La conectividad local significa que cada neurona de salida solo se conecta a una pequeña región de la entrada, reflejando la idea de que los píxeles cercanos están más correlacionados que los distantes. La compartición de parámetros significa que los mismos pesos de filtro se utilizan en todas las ubicaciones espaciales, reduciendo drásticamente el número de parámetros aprendibles. Por ejemplo, un filtro de 3x3 con 3 canales de entrada y 64 filtros de salida tiene solo 333*64 = 1,728 pesos, mientras que una capa totalmente conectada que procesa una imagen de 256x256 requeriría millones de pesos. Esta eficiencia hace que las capas convolucionales sean factibles para entradas de alta dimensión y ayuda a prevenir el sobreajuste.

Rol en Arquitecturas Modernas

Las capas convolucionales son la base de muchas arquitecturas de red clásicas y contemporáneas. La Red Residual (ResNet), introducida por Kaiming He y colegas en 2015, utiliza capas convolucionales con conexiones de salto para entrenar redes muy profundas (por ejemplo, 50, 101 o 152 capas) y logró resultados de última generación en ImageNet. La arquitectura U-Net, diseñada para la segmentación de imágenes biomédicas, emplea capas convolucionales en una estructura de codificador-decodificador con conexiones de salto para preservar detalles espaciales. Además, las capas convolucionales a menudo se combinan con normalización por lotes para estabilizar el entrenamiento y con abandono para regularización.

Más allá de las imágenes, las capas convolucionales se aplican a audio (por ejemplo, espectrogramas), texto (por ejemplo, convolución a nivel de caracteres) y datos de series temporales. También se utilizan en modelos híbridos que incorporan transformadores o atención de múltiples cabezas para tareas como subtitulado de imágenes. Aunque los transformadores han ganado prominencia en muchos dominios, las capas convolucionales siguen siendo esenciales para tareas que requieren extracción de características locales y procesamiento eficiente de entradas de alta resolución.

Entrenamiento y Optimización

Las capas convolucionales se entrenan mediante retropropagación, donde los gradientes se calculan con respecto a los pesos de los filtros y se propagan a través de la red. El optimizador estándar es descenso de gradiente estocástico (SGD) o sus variantes como Adam (ver optimizador Adam). Hiperparámetros como programa de tasa de aprendizaje y inicialización de pesos afectan significativamente la convergencia. Técnicas como aumento de datos (por ejemplo, recortes aleatorios, volteos) ayudan a mejorar la generalización. Durante el entrenamiento, los filtros aprenden gradualmente a detectar características cada vez más complejas: las capas tempranas capturan bordes y colores, mientras que las capas más profundas combinan estos en partes de objetos y objetos completos.

Limitaciones y Alternativas

Las capas convolucionales tienen limitaciones, incluido un campo receptivo fijo que solo crece con la profundidad, lo que puede ser ineficiente para capturar dependencias de largo alcance. También requieren un ajuste cuidadoso de hiperparámetros y pueden ser computacionalmente intensivas, especialmente para entradas grandes. Las alternativas y mejoras incluyen convoluciones dilatadas (que expanden el campo receptivo sin aumentar parámetros), convoluciones separables en profundidad (utilizadas en MobileNet para eficiencia) y mecanismos de atención que ponderan dinámicamente posiciones espaciales. A pesar de estas alternativas, las capas convolucionales siguen siendo un bloque de construcción robusto y ampliamente utilizado en sistemas de aprendizaje profundo, respaldado por optimizaciones de hardware de empresas como NVIDIA y Google Cloud.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:deep-learning·neural-networks·computer-vision·convolutional-neural-networks
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial