El Perceiver es una red neuronal arquitectura introducida por investigadores de Google DeepMind en 2021. Está diseñado para manejar una amplia gama de tipos de entrada - incluyendo imágenes, audio, video y nubes de puntos - sin requerir preprocesamiento específico del dominio. A diferencia de los transformadores estándar que escalan cuadráticamente con la longitud de la entrada, el Perceiver utiliza un arreglo latente de tamaño fijo para lograr una complejidad computacional lineal, lo que lo hace adecuado para datos de alta dimensionalidad como píxeles crudos o formas de onda de audio.
La arquitectura fue descrita por primera vez en el artículo "Perceiver: General Perception with Iterative Attention", publicado en marzo de 2021 por Andrew Jaegle, Felix Gimeno, Andrew Brock y colegas. El modelo se basa en el marco transformador pero reemplaza la auto-atención sobre la entrada completa con un proceso de dos etapas: atención cruzada desde el arreglo latente hacia la entrada, seguida de auto-atención dentro del arreglo latente. Este diseño permite al modelo procesar entradas de longitud arbitraria mientras mantiene una huella de memoria constante.
Arquitectura
El Perceiver consta de tres componentes principales: un codificador de entrada, un arreglo latente y un decodificador. El codificador de entrada transforma los datos crudos en una secuencia de vectores de características, a menudo utilizando un mapeo de características de Fourier simple para la información posicional. El arreglo latente es un conjunto fijo de vectores aprendidos (típicamente 256 o 512) que sirven como una representación comprimida de la entrada. Las capas de atención cruzada permiten que cada vector latente atienda a todas las posiciones de entrada, mientras que las capas subsiguientes de auto-atención habilitan interacciones entre los vectores latentes. Este proceso iterativo se repite varias veces, con el arreglo latente refinando su comprensión de la entrada a través de múltiples pasadas.
Una innovación clave es el uso de características de Fourier para la codificación posicional, lo que permite al modelo manejar entradas de dimensiones y resoluciones variables sin incrustaciones posicionales explícitas. El Perceiver también incorpora una técnica llamada "compartición de pesos" a través de iteraciones, donde los mismos pesos de atención cruzada y auto-atención se reutilizan, reduciendo el número de parámetros y mejorando la generalización.
Variantes y Extensiones
El Perceiver original fue seguido por el Perceiver IO, introducido en junio de 2021, que extiende la arquitectura para manejar estructuras de salida arbitrarias, como etiquetas de clasificación, máscaras de segmentación o tokens de lenguaje. Perceiver IO utiliza un arreglo de consulta para decodificar salidas de cualquier forma, convirtiéndolo en un modelo de secuencia a secuencia de propósito general. Otra variante, Perceiver AR, adapta la arquitectura para la generación autorregresiva, permitiéndole producir salidas secuenciales como texto o audio.
Estas variantes se han aplicado a tareas como clasificación de imágenes, reconocimiento óptico de caracteres y aprendizaje multimodal. La capacidad del Perceiver para procesar formas de onda de audio crudas directamente, sin preprocesamiento de espectrograma, se ha demostrado en puntos de referencia de clasificación de audio, logrando resultados competitivos con modelos especializados.
Aplicaciones
Los modelos Perceiver se han utilizado en varios dominios prácticos. En visión por computadora, se han aplicado a la clasificación de imágenes y la detección de objetos, a menudo igualando o superando el rendimiento de redes convolucionales en conjuntos de datos estándar como ImageNet. En procesamiento de audio, el Perceiver puede manejar secuencias de audio largas, lo que lo hace útil para el reconocimiento de voz y la generación de música. La arquitectura también se ha explorado para el aprendizaje por refuerzo, donde procesa entradas sensoriales de alta dimensionalidad como transmisiones de cámara y datos de lidar.
En el contexto de la investigación en inteligencia artificial, el Perceiver es notable por su generalidad, ya que no depende de sesgos inductivos específicos del dominio como la convolución o la recurrencia. Esto se alinea con la tendencia más amplia hacia modelos unificados que pueden manejar múltiples modalidades, una dirección también perseguida por grandes modelos de lenguaje y sistemas multimodales.
Comparación con Otras Arquitecturas
En comparación con los transformadores estándar, el Perceiver ofrece ventajas computacionales significativas para entradas largas. Un transformador con N tokens de entrada requiere operaciones de atención O(N^2), mientras que el Perceiver reduce esto a O(N * L), donde L es el tamaño latente (típicamente mucho menor que N). Esto hace factible procesar entradas con millones de tokens, como imágenes de alta resolución o clips de audio largos, en una sola GPU.
Sin embargo, el proceso de atención iterativa del Perceiver puede ser más lento en la práctica para entradas cortas debido a la sobrecarga de múltiples pasadas. También requiere un ajuste cuidadoso del tamaño latente y el número de iteraciones. En comparación con redes convolucionales como ResNet, el Perceiver carece de localidad espacial, lo que puede hacerlo menos eficiente en muestras en conjuntos de datos pequeños, pero compensa con flexibilidad en formatos de entrada.
Impacto y Legado
El Perceiver ha influido en investigaciones posteriores sobre mecanismos de atención eficientes y modelos de percepción de propósito general. Sus ideas se han incorporado en arquitecturas posteriores, como los componentes basados en Perceiver en modelos multimodales y el uso de cuellos de botella latentes en otros dominios. Aunque no está tan ampliamente desplegado como los transformadores en sistemas de producción, el Perceiver sigue siendo un punto de referencia importante para manejar tipos de datos arbitrarios en aprendizaje profundo.
A partir de 2025, el Perceiver se utiliza principalmente en investigación académica y aplicaciones especializadas, sin despliegues comerciales importantes por parte de grandes empresas tecnológicas. Sus principios continúan informando el trabajo sobre modelos escalables y agnósticos a la modalidad en el campo del aprendizaje automático.