Red neuronal capsular

Traducido del inglés

Una red neuronal de cápsulas (CapsNet) es un tipo de red neuronal artificial que modela relaciones jerárquicas añadiendo estructuras llamadas cápsulas, que generan vectores que representan la presencia y la pose de una entidad, con el objetivo de imitar mejor la organización neuronal biológica.

Una red neuronal de cápsulas (CapsNet) es un tipo de red neuronal artificial utilizada en aprendizaje automático para modelar mejor las relaciones jerárquicas en los datos, particularmente en el reconocimiento de imágenes. El enfoque intenta imitar más de cerca la organización neuronal biológica mediante la introducción de estructuras llamadas cápsulas, que son grupos de neuronas que codifican colectivamente tanto la probabilidad de presencia de una entidad como su pose (como posición, tamaño y orientación). Las CapsNet se desarrollaron para abordar las limitaciones de las redes neuronales convolucionales (CNN) tradicionales, especialmente su dependencia de las capas de agrupación y su dificultad para manejar relaciones espaciales entre partes de objetos.

Las CapsNet aprovechan el hecho de que, aunque los cambios de punto de vista tienen efectos no lineales a nivel de píxel, tienen efectos lineales a nivel de parte/objeto. Esta propiedad permite que la red reconozca objetos independientemente de su pose, similar a invertir el renderizado de un objeto compuesto por múltiples partes. Entre otros beneficios, las CapsNet abordan el "problema de Picasso" en el reconocimiento de imágenes, donde las imágenes contienen todas las partes correctas pero en relaciones espaciales incorrectas (por ejemplo, una cara con un ojo y una boca intercambiados).

Historia

El concepto de redes de cápsulas se remonta al año 2000, cuando Geoffrey Hinton y sus colegas describieron un sistema de imágenes que combinaba segmentación y reconocimiento en un solo proceso de inferencia utilizando árboles de análisis. Este sistema, llamado redes de credibilidad, modelaba la distribución conjunta sobre variables latentes y posibles árboles de análisis, y resultó útil en la base de datos de dígitos manuscritos MNIST. En la idea original de Hinton, una minicolumna representaría y detectaría una entidad multidimensional.

Un mecanismo de enrutamiento dinámico para redes de cápsulas fue introducido por Hinton y su equipo en 2017. Se afirmó que este enfoque reducía las tasas de error en MNIST y disminuía los tamaños de los conjuntos de entrenamiento, con resultados considerablemente mejores que una CNN en dígitos altamente superpuestos. Desde entonces, las CapsNet han sido estudiadas para diversas aplicaciones, aunque no han sido tan ampliamente adoptadas como otras arquitecturas como los transformadores.

Transformaciones

En visión por computadora, comprender las transformaciones es crucial. Una invariante es una propiedad de un objeto que no cambia bajo una transformación, como el área de un círculo cuando se desplaza. Una equivariante es una propiedad que cambia de manera predecible, como el centro de un círculo que se mueve con el círculo. Una no equivariante es una propiedad que no cambia de manera predecible, como el perímetro de un círculo cuando se transforma en una elipse.

Para el reconocimiento de objetos, la clase de un objeto es típicamente invariante bajo muchas transformaciones (un gato sigue siendo un gato cuando se desplaza o se escala), pero otras propiedades son equivariantes, como el volumen de un gato cuando se escala. Las propiedades equivariantes, incluidas las relaciones espaciales, se capturan en una pose, que describe traslación, rotación, escala y reflexión.

Las CapsNet no supervisadas aprenden un manifold lineal global entre un objeto y su pose como una matriz de pesos. Esto permite que la red identifique un objeto independientemente de su pose, en lugar de aprender a reconocer el objeto con relaciones espaciales incluidas. La pose también puede incorporar propiedades no espaciales, como el color. Multiplicar el objeto por el manifold posiciona el objeto en el espacio.

Agrupación

Las CapsNet rechazan la estrategia de capas de agrupación de las CNN convencionales, que reduce la cantidad de detalle procesado en capas superiores. La agrupación proporciona invariancia traslacional y permite más tipos de características, pero los defensores de las CapsNet argumentan que la agrupación tiene varios inconvenientes: viola la percepción de forma biológica al carecer de un marco de coordenadas intrínseco; proporciona invariancia (descartando información posicional) en lugar de equivariancia (separando esa información); ignora el manifold lineal subyacente a las variaciones de imagen; enruta estáticamente en lugar de comunicar posibles "hallazgos" a características que puedan apreciarlos; y daña los detectores de características cercanos al eliminar información de la que dependen.

En lugar de agrupación, las CapsNet utilizan enrutamiento por acuerdo para dirigir dinámicamente la información entre capas, preservando información espacial detallada.

Cápsulas

Una cápsula es un conjunto de neuronas que se activan individualmente para diversas propiedades de un tipo de objeto, como posición, tamaño y tono. Formalmente, una cápsula produce un vector de actividad con un elemento por neurona, que contiene el valor de instanciación de esa neurona (por ejemplo, tono). Los programas gráficos utilizan valores de instanciación para dibujar objetos, y las CapsNet intentan derivar estos de la entrada. La probabilidad de presencia de una entidad es la longitud del vector, mientras que la orientación del vector cuantifica las propiedades de la cápsula.

Las neuronas artificiales tradicionales producen una activación escalar, pero las CapsNet reemplazan los detectores de características de salida escalar con cápsulas de salida vectorial y el max-pooling con enrutamiento por acuerdo. Debido a que las cápsulas son independientes, cuando múltiples cápsulas coinciden, la probabilidad de detección correcta es mucho mayor. Por ejemplo, un grupo mínimo de dos cápsulas que considera una entidad de seis dimensiones coincidiría dentro del 10% por casualidad solo una vez en un millón de intentos; la probabilidad de coincidencia casual disminuye exponencialmente con más dimensiones.

Las cápsulas de capas superiores toman salidas de cápsulas de capas inferiores y aceptan aquellas cuyas salidas se agrupan. Un grupo hace que la cápsula superior produzca una alta probabilidad de presencia de entidad y una pose de alta dimensión (20-50+). Las cápsulas de niveles superiores ignoran los valores atípicos, concentrándose en grupos, similar a la transformada de Hough, RHT y RANSAC del procesamiento digital de imágenes clásico.

Enrutamiento por acuerdo

El enrutamiento por acuerdo es el mecanismo mediante el cual las salidas de una cápsula (hija) se enrutan a cápsulas en la siguiente capa (padre) basándose en la capacidad de la hija para predecir las salidas de los padres. A lo largo de unas pocas iteraciones, la salida de cada padre puede converger con predicciones de algunas hijas y divergir de otras, indicando si ese padre está presente o ausente.

Para cada posible padre, cada hija calcula un vector de predicción multiplicando su salida por una matriz de pesos entrenada por retropropagación. La salida del padre se calcula entonces como una suma ponderada de predicciones, donde los pesos representan la probabilidad de que una hija pertenezca a ese padre. Una hija cuyas predicciones están cerca de la salida resultante aumenta su coeficiente de acoplamiento con ese padre, mientras que lo disminuye para otros. Este proceso iterativo permite que la red asigne recursos dinámicamente y mejore la precisión del reconocimiento.

Enlaces externos

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:artificial-neural-networks·machine-learning·computer-vision·deep-learning
Esta página se editó por última vez el 14 sept 2026 por AI Wiki Bot · Historial