Edge AI désigne l'exécution de charges de travail d'intelligence artificielle, le plus souvent l'inférence de modèles, directement sur des appareils locaux, tels que les smartphones, les caméras, les voitures et les capteurs embarqués, plutôt que d'envoyer les données vers un centre de données cloud distant pour traitement. Cela contraste avec l'IA cloud, où un appareil envoie des données à un serveur exécutant un grand modèle et reçoit le résultat via un réseau.
Motivation
L'Edge AI est motivée par plusieurs contraintes pratiques que l'inférence cloud ne résout pas bien. Les applications sensibles à la latence, comme la détection d'objets par caméra dans une voiture autonome ou le traitement vocal en temps réel, ne peuvent pas tolérer le délai aller-retour d'un appel réseau. Le fonctionnement hors ligne est important pour les appareils sans connectivité fiable. La confidentialité est un moteur majeur : traiter des données telles que des photos, de la voix ou des signaux de santé localement signifie que les données personnelles brutes n'ont jamais à quitter l'appareil, une propriété de plus en plus commercialisée par les fabricants de téléphones. Le coût et la bande passante favorisent également l'edge, car diffuser en continu des données de capteurs vers le cloud pour chaque inférence est coûteux à grande échelle. Le compromis réside dans la capacité : les appareils edge disposent de beaucoup moins de calcul et de mémoire qu'un cluster de GPU de centre de données, donc l'Edge AI dépend fortement de la quantification, de la distillation de modèles et d'autres techniques de réduction de taille pour faire tenir un modèle performant dans une empreinte mémoire et énergétique réduite.
Matériel et techniques
L'Edge AI fonctionne sur des puces spécialisées à faible consommation : des unités de traitement neuronal intégrées aux systèmes sur puce des smartphones modernes, des accélérateurs d'inférence dédiés comme l'Edge TPU de Google, un parent plus petit de son TPU de centre de données, et des GPU embarqués de plus en plus performants. Les modèles déployés à l'edge sont généralement des versions compressées de modèles plus grands : quantifiés à une précision numérique inférieure, comme des poids en 8 bits ou 4 bits au lieu de 16 ou 32 bits, élagués pour supprimer les paramètres inutiles, ou produits via une distillation de connaissances à partir d'un modèle de fondation plus grand vers un réseau étudiant plus petit. Des frameworks tels que TensorFlow Lite, construit sur TensorFlow, et Core ML prennent en charge ce chemin de déploiement, d'un modèle pleine taille à un modèle optimisé pour l'edge.
Applications et perspectives
Les applications courantes de l'Edge AI incluent les assistants vocaux sur appareil qui traitent un mot de réveil localement avant d'invoquer le cloud, la photographie computationnelle et le déverrouillage facial sur les smartphones, les capteurs de maintenance prédictive dans les équipements industriels, et les systèmes de perception en robotique et dans les voitures autonomes qui ne peuvent pas dépendre de la connectivité réseau. À partir du milieu des années 2020, des modèles de langage petits et performants avec quelques milliards de paramètres, rendus pratiques par une quantification et une distillation agressives, ont étendu l'Edge AI au-delà des tâches de perception étroites vers l'exécution de modèles de chat et de raisonnement à usage général directement sur les téléphones et les ordinateurs portables, dans le cadre d'une poussée industrielle plus large vers l'IA générative sur appareil, présentée par certains comme un contrepoids axé sur la confidentialité et le coût aux modèles de frontière hébergés dans le cloud.