Redes de Cápsulas

Traducido del inglés

胶囊网络(CapsNets)是一种人工神经网络,旨在通过使用基于向量的胶囊来建模层次关系,以克服卷积神经网络在处理空间层次结构和等变性方面的局限性。

Una red neuronal de cápsulas (CapsNet) es un sistema de aprendizaje automático que es un tipo de red neuronal artificial (ANN) que se puede utilizar para modelar mejor las relaciones jerárquicas. El enfoque es un intento de imitar más de cerca la organización neuronal biológica. La idea es agregar estructuras llamadas "cápsulas" a una red neuronal convolucional (CNN) y reutilizar la salida de varias de esas cápsulas para formar representaciones más estables (con respecto a diversas perturbaciones) para cápsulas superiores. La salida es un vector que consiste en la probabilidad de una observación y una pose para esa observación. Este vector es similar a lo que se hace, por ejemplo, al realizar clasificación con localización en CNNs.

Entre otros beneficios, las capsnets abordan el "problema de Picasso" en el reconocimiento de imágenes: imágenes que tienen todas las partes correctas pero que no están en la relación espacial correcta (por ejemplo, en una "cara", las posiciones de la boca y un ojo están intercambiadas). Para el reconocimiento de imágenes, las capsnets aprovechan el hecho de que, aunque los cambios de punto de vista tienen efectos no lineales a nivel de píxel, tienen efectos lineales a nivel de parte/objeto. Esto se puede comparar con invertir el renderizado de un objeto con múltiples partes.

Historia

En 2000, Geoffrey Hinton y sus colegas describieron un sistema de imagen que combinaba segmentación y reconocimiento en un solo proceso de inferencia utilizando árboles de análisis. Las llamadas redes de credibilidad describían la distribución conjunta sobre las variables latentes y sobre los posibles árboles de análisis. Ese sistema resultó útil en la base de datos de dígitos manuscritos MNIST.

Un mecanismo de enrutamiento dinámico para redes de cápsulas fue introducido por Hinton y su equipo en 2017. Se afirmó que el enfoque reducía las tasas de error en MNIST y reducía los tamaños de los conjuntos de entrenamiento. Se afirmó que los resultados eran considerablemente mejores que una CNN en dígitos altamente superpuestos. En la idea original de Hinton, una minicolumna representaría y detectaría una entidad multidimensional.

Transformaciones

Un invariante es una propiedad de un objeto que no cambia como resultado de alguna transformación. Por ejemplo, el área de un círculo no cambia si el círculo se desplaza hacia la izquierda. Informalmente, un equivariante es una propiedad que cambia de manera predecible bajo transformación. Por ejemplo, el centro de un círculo se mueve en la misma cantidad que el círculo cuando se desplaza. Un no equivariante es una propiedad cuyo valor no cambia de manera predecible bajo una transformación. Por ejemplo, transformar un círculo en una elipse significa que su perímetro ya no se puede calcular como π veces el diámetro.

En visión por computadora, se espera que la clase de un objeto sea un invariante sobre muchas transformaciones. Es decir, un gato sigue siendo un gato si se desplaza, se voltea boca abajo o se reduce de tamaño. Sin embargo, muchas otras propiedades son en cambio equivariantes. El volumen de un gato cambia cuando se escala. Las propiedades equivariantes, como una relación espacial, se capturan en una pose, datos que describen la traslación, rotación, escala y reflexión de un objeto. La traslación es un cambio de ubicación en una o más dimensiones. La rotación es un cambio de orientación. La escala es un cambio de tamaño. La reflexión es una imagen especular.

Las capsnets no supervisadas aprenden una variedad lineal global entre un objeto y su pose como una matriz de pesos. En otras palabras, las capsnets pueden identificar un objeto independientemente de su pose, en lugar de tener que aprender a reconocer el objeto mientras incluyen sus relaciones espaciales como parte del objeto. En las capsnets, la pose puede incorporar propiedades distintas de las relaciones espaciales, por ejemplo, el color (los gatos pueden ser de varios colores). Multiplicar el objeto por la variedad posa el objeto (para un objeto, en el espacio).

Agrupación

Las capsnets rechazan la estrategia de capa de agrupación de las CNN convencionales que reduce la cantidad de detalle a procesar en la siguiente capa superior. La agrupación permite un grado de invariancia traslacional (puede reconocer el mismo objeto en una ubicación algo diferente) y permite que se represente un mayor número de tipos de características. Los defensores de las capsnets argumentan que la agrupación:

  • viola la percepción de forma biológica en que no tiene un marco de coordenadas intrínseco;
  • proporciona invariancia (descartando información posicional) en lugar de equivariancia (separando esa información);
  • ignora la variedad lineal que subyace a muchas variaciones entre imágenes;
  • enruta estáticamente en lugar de comunicar un posible "hallazgo" a la característica que puede apreciarlo;
  • daña los detectores de características cercanos, al eliminar la información de la que dependen.

Cápsulas

Una cápsula es un conjunto de neuronas que se activan individualmente para varias propiedades de un tipo de objeto, como posición, tamaño y tono. Formalmente, una cápsula es un conjunto de neuronas que colectivamente producen un vector de actividad con un elemento para cada neurona para mantener el valor de instanciación de esa neurona (por ejemplo, tono). Los programas gráficos usan el valor de instanciación para dibujar un objeto. Las capsnets intentan derivar estos de su entrada. La probabilidad de la presencia de la entidad en una entrada específica es la longitud del vector, mientras que la orientación del vector cuantifica las propiedades de la cápsula.

Las neuronas artificiales tradicionalmente producen un escalar, una activación de valor real que representa aproximadamente la probabilidad de una observación. Las capsnets reemplazan los detectores de características de salida escalar con cápsulas de salida vectorial y la agrupación máxima con enrutamiento por acuerdo. Debido a que las cápsulas son independientes, cuando múltiples cápsulas coinciden, la probabilidad de detección correcta es mucho mayor. Un grupo mínimo de dos cápsulas que consideran una entidad de seis dimensiones coincidiría dentro del 10% por casualidad solo una vez en un millón de intentos. A medida que aumenta el número de dimensiones, la probabilidad de acuerdo en un grupo más grande con dimensiones más altas disminuye exponencialmente.

Las cápsulas en capas superiores toman salidas de cápsulas en capas inferiores y aceptan aquellas cuyas salidas se agrupan. Un grupo hace que la cápsula superior produzca una alta probabilidad de observación de que una entidad está presente y también produzca una pose de alta dimensión (20-50+). Las cápsulas de nivel superior ignoran los valores atípicos, concentrándose en los grupos. Esto es similar a la transformada de Hough, la RHT y RANSAC del procesamiento de imágenes digitales clásico.

Enrutamiento por acuerdo

Las salidas de una cápsula (hija) se enrutan a cápsulas en la siguiente capa (padre) de acuerdo con la capacidad de la hija para predecir las salidas de los padres. A lo largo de unas pocas iteraciones, las salidas de cada padre pueden converger con las predicciones de algunas hijas y divergir de las de otras, lo que significa que ese padre está presente o ausente en la escena. Para cada posible padre, cada hija calcula un vector de predicción multiplicando su salida por una matriz de pesos (entrenada por retropropagación). Luego, la salida del padre se calcula como el producto escalar de una predicción con un coeficiente que representa la probabilidad de que esta hija pertenezca a ese padre. Una hija cuyas predicciones están relativamente cerca de la salida resultante aumenta sucesivamente el coeficiente entre ese padre e hija y lo disminuye para otros.

Las redes de cápsulas siguen siendo un área activa de investigación dentro del aprendizaje profundo, ofreciendo una alternativa a las CNN tradicionales para tareas que requieren jerarquías espaciales explícitas. Se han explorado en contextos como inteligencia artificial y aprendizaje automático, con aplicaciones potenciales en áreas como visión por computadora y robótica. Aunque no están tan ampliamente adoptadas como los modelos basados en transformadores, continúan inspirando trabajo en representaciones equivariantes y mecanismos de enrutamiento.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:machine-learning·neural-networks·computer-vision
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial