Traduit de l'anglais

Le Perceiver est une architecture de modèle d'apprentissage profond qui traite des modalités d'entrée arbitraires à l'aide d'un tableau latent de taille fixe, permettant une mise à l'échelle efficace vers de grandes entrées via l'attention croisée et un traitement itératif.

Le Perceiver est une architecture de réseau de neurones introduite par des chercheurs de Google DeepMind en 2021. Elle est conçue pour traiter une large gamme de types d'entrées - notamment les images, l'audio, la vidéo et les nuages de points - sans nécessiter de prétraitement spécifique au domaine. Contrairement aux transformers standard qui évoluent de manière quadratique avec la longueur de l'entrée, le Perceiver utilise un tableau latent de taille fixe pour atteindre une complexité computationnelle linéaire, ce qui le rend adapté aux données de haute dimension telles que les pixels bruts ou les formes d'onde audio.

L'architecture a été décrite pour la première fois dans l'article « Perceiver: General Perception with Iterative Attention », publié en mars 2021 par Andrew Jaegle, Felix Gimeno, Andrew Brock et leurs collègues. Le modèle s'appuie sur le cadre du Transformer (architecture) mais remplace l'auto-attention sur l'entrée complète par un processus en deux étapes : une attention croisée du tableau latent vers l'entrée, suivie d'une auto-attention au sein du tableau latent. Cette conception permet au modèle de traiter des entrées de longueur arbitraire tout en maintenant une empreinte mémoire constante.

Architecture

Le Perceiver se compose de trois composants principaux : un encodeur d'entrée, un tableau latent et un décodeur. L'encodeur d'entrée transforme les données brutes en une séquence de vecteurs de caractéristiques, utilisant souvent une simple cartographie de caractéristiques de Fourier pour les informations positionnelles. Le tableau latent est un ensemble fixe de vecteurs appris (généralement 256 ou 512) qui servent de représentation compressée de l'entrée. Les couches d'attention croisée permettent à chaque vecteur latent de prêter attention à toutes les positions d'entrée, tandis que les couches d'auto-attention ultérieures permettent des interactions entre les vecteurs latents. Ce processus itératif est répété plusieurs fois, le tableau latent affinant sa compréhension de l'entrée à travers plusieurs passages.

Une innovation clé est l'utilisation de caractéristiques de Fourier pour l'encodage positionnel, ce qui permet au modèle de gérer des entrées de dimensions et de résolutions variées sans embeddings positionnels explicites. Le Perceiver intègre également une technique appelée « partage de poids » à travers les itérations, où les mêmes poids d'attention croisée et d'auto-attention sont réutilisés, réduisant le nombre de paramètres et améliorant la généralisation.

Variantes et extensions

Le Perceiver original a été suivi par le Perceiver IO, introduit en juin 2021, qui étend l'architecture pour gérer des structures de sortie arbitraires, telles que des étiquettes de classification, des masques de segmentation ou des jetons de langage. Le Perceiver IO utilise un tableau de requêtes pour décoder des sorties de toute forme, ce qui en fait un modèle séquence-à-séquence polyvalent. Une autre variante, le Perceiver AR, adapte l'architecture pour la génération autorégressive, lui permettant de produire des sorties séquentielles comme du texte ou de l'audio.

Ces variantes ont été appliquées à des tâches telles que la classification d'images, la reconnaissance optique de caractères et l'apprentissage multimodal. La capacité du Perceiver à traiter directement des formes d'onde audio brutes, sans prétraitement par spectrogramme, a été démontrée dans des benchmarks de classification audio, obtenant des résultats compétitifs avec des modèles spécialisés.

Applications

Les modèles Perceiver ont été utilisés dans plusieurs domaines pratiques. En vision par ordinateur, ils ont été appliqués à la classification d'images et à la détection d'objets, atteignant souvent ou dépassant les performances des réseaux convolutifs sur des ensembles de données standard comme ImageNet. En traitement audio, le Perceiver peut gérer de longues séquences audio, ce qui le rend utile pour la reconnaissance vocale et la génération musicale. L'architecture a également été explorée pour l'apprentissage par renforcement, où elle traite des entrées sensorielles de haute dimension telles que les flux de caméras et les données lidar.

Dans le contexte de la recherche en intelligence artificielle, le Perceiver est remarquable pour sa généralité, car il ne repose pas sur des biais inductifs spécifiques au domaine comme la convolution ou la récurrence. Cela s'aligne avec la tendance plus large vers des modèles unifiés capables de gérer plusieurs modalités, une direction également poursuivie par les grands modèles de langage et les systèmes multimodaux.

Comparaison avec d'autres architectures

Comparé aux transformers standard, le Perceiver offre des avantages computationnels significatifs pour les entrées longues. Un transformer avec N jetons d'entrée nécessite O(N^2) opérations d'attention, tandis que le Perceiver réduit cela à O(N * L), où L est la taille latente (généralement beaucoup plus petite que N). Cela rend possible le traitement d'entrées avec des millions de jetons, comme des images haute résolution ou de longs clips audio, sur un seul GPU.

Cependant, le processus d'attention itératif du Perceiver peut être plus lent en pratique pour les entrées courtes en raison du surcoût des multiples passages. Il nécessite également un réglage minutieux de la taille latente et du nombre d'itérations. Comparé aux réseaux convolutifs comme ResNet, le Perceiver manque de localité spatiale, ce qui peut le rendre moins efficace en termes d'échantillons sur de petits ensembles de données, mais il compense par sa flexibilité dans les formats d'entrée.

Impact et héritage

Le Perceiver a influencé les recherches ultérieures sur les mécanismes d'attention efficaces et les modèles de perception polyvalents. Ses idées ont été intégrées dans des architectures plus récentes, telles que les composants basés sur le Perceiver dans les modèles multimodaux et l'utilisation de goulots d'étranglement latents dans d'autres domaines. Bien qu'il ne soit pas aussi largement déployé que les transformers dans les systèmes de production, le Perceiver reste un point de référence important pour le traitement de types de données arbitraires en apprentissage profond.

En 2025, le Perceiver est principalement utilisé dans la recherche académique et des applications spécialisées, sans déploiements commerciaux majeurs par les grandes entreprises technologiques. Ses principes continuent d'informer les travaux sur les modèles évolutifs et indépendants de la modalité dans le domaine du apprentissage automatique.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:deep-learning·neural-network·transformer·google-deepmind
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique