AWQ (Quantification de poids sensible à l'activation) est une méthode de compression de modèles conçue pour les grands modèles de langage (LLM) qui réduit l'empreinte mémoire et le coût computationnel de l'inférence sans nécessiter un réentraînement complet du modèle. Développée par des chercheurs du MIT CSAIL et de Carnegie Mellon University en 2023, AWQ identifie les poids les plus importants d'un réseau de neurones en analysant les statistiques d'activation plutôt que les seules magnitudes des poids, et préserve ces poids critiques à une précision plus élevée tout en quantifiant le reste à des largeurs de bits inférieures. Cette approche permet aux LLM de fonctionner sur du matériel grand public, des appareils mobiles et des plateformes de calcul en périphérie avec une dégradation minimale de la qualité de sortie.
AWQ repose sur le principe que tous les poids d'un réseau de neurones entraîné ne contribuent pas de manière égale aux performances du modèle. En observant quels poids sont activés par des données d'entrée représentatives, la méthode détermine un facteur d'échelle par canal qui protège les poids saillants des erreurs de quantification. Contrairement aux techniques de quantification antérieures qui reposent sur une recherche exhaustive ou une optimisation basée sur le gradient, AWQ utilise un processus simple mais efficace, sans données ou piloté par des données de calibration, ce qui le rend computationnellement efficace et facile à intégrer dans les pipelines d'inférence existants.
Fondements techniques
L'innovation centrale d'AWQ réside dans son utilisation des statistiques d'activation pour guider la quantification des poids. Les méthodes traditionnelles de quantification post-entraînement, telles que l'arrondi au plus proche (RTN), traitent tous les poids de manière uniforme, ce qui entraîne souvent une perte de précision significative à de faibles largeurs de bits. AWQ calcule plutôt la magnitude d'activation pour chaque canal de poids sur un petit ensemble de données de calibration, généralement quelques centaines d'échantillons, et dérive un facteur d'échelle qui amplifie l'importance des canaux critiques. Cette mise à l'échelle est appliquée avant la quantification, et la mise à l'échelle inverse est appliquée après la déquantification, garantissant que la distribution de sortie du modèle reste stable.
La méthode prend en charge diverses largeurs de bits, y compris la quantification à 4 bits et 3 bits, et peut être combinée avec d'autres techniques de compression telles que l'élagage et la distillation des connaissances. Dans les tests de référence sur des modèles comme LLaMA et OPT, AWQ a atteint des performances quasi sans perte à une précision de 4 bits, avec une augmentation de la perplexité de moins de 0,1 par rapport à la référence en pleine précision. À une précision de 3 bits, la dégradation était plus prononcée mais restait compétitive avec d'autres méthodes de pointe.
Développement et publication
AWQ a été introduit dans un article intitulé « AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration » par Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen, Wei-Chen Wang, Guangxuan Xiao, Xingyu Dang, Chuang Gan et Song Han, présenté à la conférence 2024 sur l'apprentissage automatique et les systèmes (MLSys). La recherche a été menée au MIT CSAIL et à Carnegie Mellon University, avec des contributions de Samsung Research et d'autres institutions. Les auteurs ont publié une implémentation open source, y compris une bibliothèque appelée awq et une intégration avec des frameworks d'inférence populaires tels que vLLM et Hugging Face Transformers.
Le projet a rapidement gagné en popularité dans la communauté du apprentissage automatique, le dépôt GitHub accumulant des milliers d'étoiles en quelques mois. La méthode a été adoptée par plusieurs fournisseurs de matériel et de logiciels, notamment AMD, Intel et Qualcomm, qui ont intégré AWQ dans leurs boîtes à outils d'optimisation de modèles pour les déploiements en périphérie et dans les centres de données.
Applications et impact
AWQ a été largement utilisé pour déployer des LLM sur des appareils aux ressources limitées. Par exemple, Apple et Samsung Electronics ont exploré AWQ pour des applications de IA générative sur appareil, telles que la synthèse de texte et la complétion de code, où la mémoire et les contraintes de batterie sont critiques. Les fournisseurs de cloud, y compris Amazon Web Services et Google Cloud, ont intégré AWQ dans leurs plateformes de service de modèles pour réduire les coûts d'inférence et augmenter le débit.
La technique permet également l'exécution de modèles qui nécessiteraient autrement des GPU haut de gamme sur du matériel grand public. Un modèle de 7 milliards de paramètres quantifié avec AWQ à une précision de 4 bits peut fonctionner sur un ordinateur portable avec 8 Go de RAM, rendant la recherche et l'expérimentation sur les grands modèles de langage plus accessibles aux développeurs individuels et aux petites organisations.
Comparaison avec d'autres méthodes
AWQ est souvent comparé à GPTQ (Quantification GPT), une autre méthode populaire de quantification post-entraînement. Alors que GPTQ utilise des informations de second ordre pour minimiser l'erreur de quantification, AWQ repose sur des statistiques d'activation, qui sont moins coûteuses à calculer et nécessitent moins de données de calibration. En pratique, AWQ tend à être plus rapide à appliquer et plus robuste aux variations des ensembles de données de calibration, tandis que GPTQ atteint parfois une perplexité légèrement inférieure sur certains modèles. Les deux méthodes sont complémentaires et peuvent être utilisées ensemble, AWQ servant d'étape de prétraitement avant GPTQ.
Une autre approche connexe est SmoothQuant, qui déplace la difficulté de quantification des activations vers les poids. AWQ diffère en se concentrant exclusivement sur la quantification des poids, ce qui le rend plus simple à implémenter et plus adapté aux accélérateurs matériels qui ne prennent pas en charge les activations en précision mixte.
Orientations futures
Alors que les LLM continuent de croître en taille, une inférence efficace reste un défi critique. Les principes d'AWQ ont été étendus à d'autres modalités, y compris les modèles vision-langage et les modèles de diffusion, avec des résultats prometteurs. Les chercheurs explorent également des schémas de quantification adaptatifs qui ajustent dynamiquement les largeurs de bits en fonction de la complexité de l'entrée, ainsi que des implémentations sensibles au matériel qui exploitent des instructions spécialisées dans les puces fabriquées par Arm Holdings et TSMC.
La nature open source d'AWQ a favorisé un écosystème dynamique d'outils et de références, et il est désormais un composant standard dans de nombreux flux de travail d'optimisation de modèles. Son succès a inspiré d'autres recherches sur les techniques sensibles à l'activation pour l'élagage, la distillation et la recherche d'architecture, consolidant sa place en tant que contribution fondamentale à l'inférence efficace en apprentissage profond.