译自英文

Perceiver是一种深度学习模型架构,通过使用固定大小的潜在数组处理任意输入模态,借助交叉注意力和迭代处理,实现对大型输入的高效扩展。

Perceiver是一种由Google DeepMind的研究人员于2021年提出的神经网络架构。它旨在处理多种输入类型,包括图像、音频、视频和点云,而无需特定领域的预处理。与标准transformer随输入长度二次方扩展不同,Perceiver使用固定大小的潜在数组实现线性计算复杂度,使其适用于高维数据,如原始像素或音频波形。

该架构首次在2021年3月由Andrew Jaegle、Felix Gimeno、Andrew Brock及其同事发表的论文“Perceiver: General Perception with Iterative Attention”中描述。该模型基于Transformer (architecture)框架,但将全输入上的自注意力替换为两阶段过程:从潜在数组到输入的交叉注意力,随后是潜在数组内的自注意力。这种设计使模型能够处理任意长度的输入,同时保持恒定的内存占用。

架构

Perceiver由三个主要组件组成:输入编码器、潜在数组和解码器。输入编码器将原始数据转换为特征向量序列,通常使用简单的傅里叶特征映射来提供位置信息。潜在数组是一组固定的学习向量(通常为256或512个),作为输入的压缩表示。交叉注意力层允许每个潜在向量关注所有输入位置,而随后的自注意力层使潜在向量之间能够交互。这一迭代过程重复多次,潜在数组在多次传递中逐步细化对输入的理解。

一个关键创新是使用傅里叶特征进行位置编码,这使得模型无需显式位置嵌入即可处理不同维度和分辨率的输入。Perceiver还采用了跨迭代的“权重共享”技术,即重复使用相同的交叉注意力和自注意力权重,从而减少参数数量并改善泛化性能。

变体与扩展

原始Perceiver之后是Perceiver IO,于2021年6月推出,它将架构扩展为处理任意输出结构,如分类标签、分割掩码或语言标记。Perceiver IO使用查询数组解码任意形状的输出,使其成为通用序列到序列模型。另一个变体Perceiver AR将架构适配为自回归生成,使其能够生成文本或音频等序列输出。

这些变体已应用于图像分类、光学字符识别和多模态学习等任务。Perceiver直接处理原始音频波形而无需频谱图预处理的能力已在音频分类基准测试中得到验证,取得了与专门模型相当的结果。

应用

Perceiver模型已在多个实际领域中使用。在计算机视觉中,它们被应用于图像分类和物体检测,通常在ImageNet等标准数据集上达到或超过卷积网络的性能。在音频处理中,Perceiver可以处理长音频序列,使其适用于语音识别和音乐生成。该架构也被探索用于强化学习,处理摄像头馈送和激光雷达数据等高维感官输入。

人工智能研究背景下,Perceiver因其通用性而著称,因为它不依赖卷积或循环等特定领域的归纳偏置。这与向统一模型发展的更广泛趋势一致,该趋势也由大型语言模型和多模态系统所追求。

与其他架构的比较

与标准transformer相比,Perceiver在处理长输入时具有显著的计算优势。具有N个输入标记的transformer需要O(N^2)次注意力操作,而Perceiver将其减少到O(N * L),其中L是潜在大小(通常远小于N)。这使得在单个GPU上处理具有数百万标记的输入(如高分辨率图像或长音频片段)成为可能。

然而,对于短输入,Perceiver的迭代注意力过程由于多次传递的开销在实践中可能较慢。它还需要仔细调整潜在大小和迭代次数。与ResNet等卷积网络相比,Perceiver缺乏空间局部性,这可能使其在小数据集上样本效率较低,但它在输入格式的灵活性方面弥补了这一点。

影响与遗产

Perceiver影响了后续在高效注意力机制和通用感知模型方面的研究。其思想已被纳入后来的架构中,例如多模态模型中的Perceiver组件以及在其他领域使用潜在瓶颈。虽然在生产系统中不如transformer广泛部署,但Perceiver仍然是处理深度学习中任意数据类型的重要参考点。

截至2025年,Perceiver主要用于学术研究和专业应用,大型科技公司没有重大商业部署。其原理继续为机器学习领域中可扩展和模态无关模型的工作提供信息。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deep-learning·neural-network·transformer·google-deepmind
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史