译自英文

胶囊网络(CapsNets)是一种人工神经网络,旨在通过使用基于向量的胶囊来建模层级关系,以克服卷积神经网络在处理空间层级和平等变换方面的局限性。

胶囊神经网络(CapsNet)是一种机器学习系统,属于人工神经网络(ANN)的一种,可用于更好地建模层次关系。该方法试图更紧密地模拟生物神经组织。其理念是在卷积神经网络(CNN)中添加称为“胶囊”的结构,并复用多个此类胶囊的输出,以形成更稳定(相对于各种扰动)的高层胶囊表示。输出是一个向量,包含观测的概率以及该观测的位姿。该向量类似于在CNN中进行带定位分类时所采用的方式。

在其他优点中,胶囊网络解决了图像识别中的“毕加索问题”:即图像具有所有正确部件但空间关系不正确(例如,在“人脸”中,嘴巴和一只眼睛的位置被交换)。对于图像识别,胶囊网络利用了这样一个事实:虽然视点变化在像素级别具有非线性效应,但在部件/对象级别具有线性效应。这可以比作对多部件对象渲染的逆过程。

历史

2000年,杰弗里·辛顿等人描述了一种成像系统,该系统使用解析树将分割和识别合并为单一推理过程。所谓的可信度网络描述了潜在变量和可能解析树上的联合分布。该系统在MNIST手写数字数据库上被证明是有用的。

2017年,辛顿及其团队引入了胶囊网络的动态路由机制。该方法据称能降低MNIST上的错误率并减少训练集规模。据称,在高度重叠的数字上,其结果明显优于CNN。在辛顿的原始构想中,一个小柱状结构将表示并检测一个多维实体。

变换

不变量是对象在某种变换下不改变的性质。例如,圆的面积在圆向左移动时不会改变。非正式地,等变量是在变换下可预测变化的性质。例如,圆的中心在移动时与圆移动相同的量。非等变量是其值在变换下不可预测变化的性质。例如,将圆变换为椭圆意味着其周长不能再计算为π乘以直径。

在计算机视觉中,对象的类别预期在许多变换下是不变量。即,猫在移动、翻转或缩小时仍然是猫。然而,许多其他性质反而是等变量的。猫的体积在缩放时会改变。诸如空间关系之类的等变量性质被捕获在位姿中,这是描述对象平移、旋转、缩放和反射的数据。平移是位置在一个或多个维度上的变化。旋转是方向的变化。缩放是尺寸的变化。反射是镜像。

无监督胶囊网络学习对象与其位姿之间的全局线性流形,作为权重矩阵。换句话说,胶囊网络可以独立于位姿识别对象,而不必在识别对象时将其空间关系作为对象的一部分来学习。在胶囊网络中,位姿可以包含除空间关系之外的性质,例如颜色(猫可以有各种颜色)。将对象乘以流形即可对对象进行位姿设定(对于对象,在空间中)。

池化

胶囊网络摒弃了传统CNN中减少下一层处理细节的池化层策略。池化允许一定程度的平移不变性(它可以在略有不同的位置识别同一对象),并允许表示更多类型的特征。胶囊网络的支持者认为池化:

  • 违反生物形状感知,因为它没有内在的坐标框架;
  • 提供不变性(丢弃位置信息)而不是等变性(解开该信息);
  • 忽略图像间许多变化所基于的线性流形;
  • 静态路由,而不是将潜在的“发现”传达给能够利用它的特征;
  • 通过删除邻近特征检测器所依赖的信息来损害它们。

胶囊

胶囊是一组神经元,它们各自针对某类对象的各种属性(如位置、大小和色调)激活。形式上,胶囊是一组神经元,它们共同产生一个活动向量,每个神经元对应一个元素,以保存该神经元的实例化值(例如,色调)。图形程序使用实例化值来绘制对象。胶囊网络试图从其输入中推导出这些值。实体在特定输入中存在的概率是向量的长度,而向量的方向量化了胶囊的属性。

人工神经元传统上输出标量、实值激活,大致表示观测的概率。胶囊网络用向量输出胶囊替换标量输出特征检测器,并用按协议路由替换最大池化。由于胶囊是独立的,当多个胶囊一致时,正确检测的概率要高得多。一个考虑六维实体的最小两胶囊簇,偶然在10%内一致的概率仅为百万分之一。随着维度数量的增加,更大簇中更高维度的一致概率呈指数下降。

高层胶囊接收低层胶囊的输出,并接受那些输出聚类的胶囊。聚类导致高层胶囊输出高概率的实体存在观测,并输出高维(20-50+)的位姿。高层胶囊忽略异常值,专注于聚类。这类似于经典数字图像处理中的霍夫变换、RHT和RANSAC。

按协议路由

一个胶囊(子)的输出根据其预测父胶囊输出的能力,被路由到下一层(父)的胶囊。在几次迭代过程中,每个父胶囊的输出可能与其某些子胶囊的预测收敛,而与其他子胶囊的预测发散,这意味着该父胶囊在场景中存在或不存在。对于每个可能的父胶囊,每个子胶囊通过将其输出乘以权重矩阵(通过反向传播训练)来计算预测向量。接下来,父胶囊的输出计算为预测与表示该子胶囊属于该父胶囊概率的系数的标量积。预测相对接近最终输出的子胶囊会逐渐增加该父胶囊与子胶囊之间的系数,并减少其他胶囊的系数。

胶囊网络仍然是Deep learning领域内的一个活跃研究领域,为需要显式空间层次结构的任务提供了传统CNN的替代方案。它们已在Artificial intelligenceMachine learning等背景下得到探索,并在Computer visionRobotics等领域具有潜在应用。虽然不如基于Transformer (architecture)的模型那样广泛采用,但它们继续激发关于等变表示和路由机制的研究。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·neural-networks·computer-vision
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史