Amir Gholami est un informaticien et chercheur dans le domaine de l'intelligence artificielle, se concentrant sur l'amélioration de l'efficacité des modèles de apprentissage profond en termes de calcul, de mémoire et de consommation d'énergie. Ses travaux abordent l'écart croissant entre la taille grandissante des modèles de réseaux de neurones et les ressources matérielles limitées disponibles pour l'entraînement et l'inférence. Gholami est particulièrement connu pour ses contributions à l'élagage de modèles, à la quantification et aux techniques d'entraînement distribué qui permettent de faire fonctionner des systèmes d'IA à grande échelle sur du matériel standard et des appareils de périphérie.
Les recherches de Gholami ont été publiées dans des conférences et des revues de premier plan, notamment NeurIPS, ICML et CVPR. Il a également été un contributeur actif à l'open source, publiant des outils et des bibliothèques largement adoptés par le monde académique et l'industrie. Son travail se situe à l'intersection des systèmes d'apprentissage automatique et des mathématiques appliquées, s'appuyant sur des techniques d'algèbre linéaire numérique et d'optimisation.
Formation et début de carrière
Gholami a obtenu son baccalauréat en génie électrique à l'Université de technologie de Sharif à Téhéran, en Iran, en 2011. Il a ensuite déménagé aux États-Unis pour ses études supérieures, obtenant une maîtrise en génie électrique et informatique à l'Université du Texas à Austin en 2013. Il a complété son doctorat en mathématiques computationnelles et appliquées à l'Université du Texas à Austin en 2017, sous la supervision de George Biros. Sa thèse de doctorat portait sur des algorithmes évolutifs pour résoudre des équations aux dérivées partielles sur des systèmes de calcul haute performance, ce qui a jeté les bases de son intérêt ultérieur pour l'apprentissage automatique efficace.
Pendant son doctorat, Gholami a travaillé sur des algorithmes numériques parallèles pour des problèmes de dynamique des fluides computationnelle et d'imagerie médicale. Cette expérience lui a donné une compréhension approfondie de la co-conception matériel-logiciel et de l'importance des schémas d'accès mémoire pour atteindre des performances élevées, des compétences qui se sont révélées cruciales dans ses recherches en IA.
Recherche postdoctorale à UC Berkeley
De 2017 à 2020, Gholami a été chercheur postdoctoral au laboratoire Berkeley AI Research de l'Université de Californie à Berkeley, où il a travaillé avec Kurt Keutzer et Michael Mahoney. Cette période a été formatrice pour sa transition vers l'apprentissage profond efficace. À Berkeley, il a participé au développement du cadre Deep Compression et a contribué à la conception de l'architecture SqueezeNet, qui a démontré que les réseaux de neurones convolutifs pouvaient atteindre une haute précision avec beaucoup moins de paramètres.
Les travaux postdoctoraux de Gholami ont également exploré les fondements théoriques de la quantification. Il a publié des articles influents sur les effets de différents schémas de quantification sur la précision des modèles, y compris une étude systématique des techniques de quantification post-entraînement. Cette recherche a aidé à établir des pratiques exemplaires pour convertir des modèles en pleine précision en représentations à bits inférieurs sans perte significative de performance.
Contributions à l'apprentissage profond efficace
Les contributions les plus significatives de Gholami se situent dans le domaine de la compression et de l'accélération des modèles. Il a développé des méthodes pour réduire l'empreinte mémoire et le coût computationnel des réseaux de neurones profonds, les rendant déployables sur des téléphones mobiles, des systèmes embarqués et d'autres plateformes à ressources limitées.
L'un de ses travaux notables est le développement d'un cadre pour la quantification en précision mixte, qui détermine automatiquement la largeur de bits optimale pour chaque couche d'un réseau de neurones. Cette approche, basée sur la résolution d'un problème d'optimisation sous contraintes, peut atteindre une compression jusqu'à 4x avec une dégradation minimale de la précision par rapport à la quantification uniforme. La méthode a été adoptée dans plusieurs chaînes d'outils commerciales pour l'IA de périphérie.
Gholami a également contribué à la compréhension de la relation entre la taille du modèle et la dynamique d'entraînement. Ses recherches sur le « bon dimensionnement » des taux d'apprentissage pour l'entraînement par lots de grande taille ont été largement citées, fournissant des conseils pratiques pour l'entraînement distribué sur des grappes de GPU. Il a montré que le taux d'apprentissage devrait être mis à l'échelle linéairement avec la taille du lot jusqu'à un certain point, après quoi des schémas plus sophistiqués sont nécessaires.
Travail sur les grands modèles de langage
Avec l'essor des grands modèles de langage et des architectures transformers, Gholami a tourné son attention vers les défis uniques posés par ces modèles. Il a étudié des techniques pour quantifier les poids et les activations des transformers, qui sont particulièrement sensibles à la précision numérique en raison de la présence de valeurs aberrantes dans les activations. Ses travaux sur la quantification consciente des valeurs aberrantes ont été essentiels pour permettre le déploiement de modèles comme GPT et BERT sur du matériel grand public.
Gholami a également exploré des méthodes pour réduire la surcharge mémoire des mécanismes d'attention, qui évoluent quadratiquement avec la longueur de séquence. Il a contribué au développement de schémas d'attention éparse et d'approximations de rang faible qui maintiennent la précision tout en réduisant la complexité computationnelle. Ces techniques sont pertinentes pour traiter des documents longs, des séquences génomiques et d'autres données avec un contexte étendu.
En outre, Gholami a rédigé des enquêtes complètes sur l'entraînement et l'inférence efficaces des grands modèles de langage, synthétisant l'état de l'art dans des domaines tels que l'élagage, la distillation et la conception consciente du matériel. Ces enquêtes sont devenues des lectures essentielles pour les chercheurs entrant dans le domaine.
Postes académiques et rôles dans l'industrie
En 2020, Gholami a rejoint le corps professoral du Département de génie électrique et des sciences informatiques de l'Université de Californie à Berkeley en tant que professeur adjoint. Il dirige le Laboratoire d'IA efficace et évolutive, où il supervise des étudiants diplômés travaillant sur des sujets allant de la quantification à faible bits à l'apprentissage fédéré. Il a reçu plusieurs prix pour son enseignement et ses recherches, y compris le prix NSF CAREER en 2022.
Gholami a également maintenu des liens étroits avec l'industrie. Il a occupé des postes de chercheur invité chez Google DeepMind et Samsung Research, où il a collaboré sur des projets liés à l'IA sur appareil. Il a servi de consultant pour plusieurs startups se concentrant sur l'inférence de périphérie, et ses bibliothèques open source, telles que le Deep Compression Toolkit, sont utilisées par des entreprises comme Intel et Qualcomm pour optimiser leurs accélérateurs de réseaux de neurones.
Publications sélectionnées et impact
Gholami a rédigé plus de 80 articles évalués par des pairs, accumulant plus de 20 000 citations en 2024. Certaines de ses œuvres les plus influentes comprennent :
- « A Survey of Quantization Methods for Efficient Neural Network Inference » (2021), qui fournit une taxonomie complète des techniques de quantification et a été cité plus de 1 500 fois.
- « Mixed-Precision Quantization of CNNs via Limited Range Parameterization » (2021), introduisant une paramétrisation novatrice qui améliore le compromis entre la largeur de bits et la précision.
- « Outlier Suppression: Pushing the Limit of Low-bit Transformer Language Models » (2022), un article qui aborde le défi des valeurs aberrantes d'activation dans les transformers.
Ses recherches ont été reconnues par des prix du meilleur article à la Conférence internationale sur les représentations d'apprentissage (ICLR) et à la Conférence sur la vision par ordinateur et la reconnaissance de formes (CVPR). Il a également été invité à donner des conférences principales lors de grandes conférences industrielles, notamment le AI Hardware Summit et l'atelier Efficient Deep Learning.
Enseignement et mentorat
À Berkeley, Gholami enseigne des cours de troisième cycle sur l'apprentissage automatique efficace et le calcul parallèle. Il est connu pour son approche pratique, encourageant les étudiants à implémenter des algorithmes à partir de zéro et à les évaluer sur du matériel réel. Plusieurs de ses étudiants au doctorat ont poursuivi des postes de recherche dans des laboratoires d'IA de premier plan tels que OpenAI et Anthropic.
Gholami est également un défenseur de la recherche reproductible. Il a rendu public le code et les données de la plupart de ses articles, et il tient un blog où il explique des sujets complexes dans un langage accessible. Il a organisé plusieurs ateliers sur l'apprentissage profond efficace à NeurIPS et ICML, favorisant une communauté de chercheurs dédiés à une IA durable.
Directions de recherche actuelles
En 2025, les recherches de Gholami se concentrent sur trois domaines principaux : (1) le développement de méthodes d'entraînement conscientes de la quantification pour les grands modèles de langage, (2) la conception de stratégies de co-optimisation matériel-logiciel écoénergétiques pour l'IA de périphérie, et (3) l'application de l'apprentissage profond efficace au calcul scientifique, comme la résolution d'équations aux dérivées partielles avec des opérateurs neuronaux.
Il est également impliqué dans des projets visant à réduire l'empreinte carbone de l'entraînement de l'IA. Ses travaux sur la précision adaptative et les mécanismes de sortie précoce ont montré un potentiel pour réduire la consommation d'énergie jusqu'à 30 % sans sacrifier la qualité du modèle. Gholami collabore avec des fabricants de matériel comme AMD et Arm Holdings pour garantir que ses algorithmes s'alignent sur les capacités des processeurs de prochaine génération.
Reconnaissance et prix
Gholami a reçu de nombreux honneurs tout au long de sa carrière. En plus du prix NSF CAREER, il a été nommé boursier de recherche Sloan en 2023. Il a été répertorié parmi les « AI 2000 Most Influential Scholars » dans le domaine de l'apprentissage automatique pendant trois années consécutives. Ses contributions au logiciel open source ont été reconnues avec le prix Google Open Source Peer Bonus en 2021.
Il siège aux comités de programme des grandes conférences et est rédacteur associé pour l'IEEE Transactions on Pattern Analysis and Machine Intelligence. Ses travaux ont été présentés dans des médias populaires, y compris des articles dans IEEE Spectrum et MIT Technology Review, soulignant l'impact pratique de ses méthodes sur le déploiement réel de l'IA.
Vie personnelle et intérêts
En dehors de la recherche, Gholami est un randonneur et photographe passionné. Il combine souvent ces intérêts lors de ses voyages à des conférences académiques, capturant des paysages et des scènes urbaines. Il est également mentor pour des étudiants de première génération et participe à des programmes de sensibilisation pour encourager les groupes sous-représentés à poursuivre des carrières dans les STEM.
Gholami maintient une présence active sur les réseaux sociaux, où il partage des idées sur des articles récents et fournit des conseils de carrière aux chercheurs en herbe. Il est connu pour son esprit collaboratif et sa volonté de s'engager avec des chercheurs juniors, co-écrivant souvent des articles avec des étudiants d'autres universités.
Héritage et perspectives d'avenir
Le domaine de l'apprentissage profond efficace a connu une croissance rapide, et Gholami est considéré comme l'une de ses figures de proue. Ses travaux ont non seulement fait progresser les connaissances académiques, mais ont également permis des applications pratiques dans des domaines tels que la conduite autonome, l'imagerie médicale et la traduction linguistique en temps réel. Alors que les modèles d'IA continuent de croître en taille, l'importance de la recherche sur l'efficacité est susceptible d'augmenter, et les contributions de Gholami resteront pertinentes pour les années à venir.
Il explore actuellement l'intersection de l'apprentissage profond efficace et de l'IA générative, visant à rendre les modèles de diffusion et d'autres architectures génératives plus accessibles sur les appareils mobiles. Sa vision à long terme est de créer des systèmes d'IA qui sont non seulement puissants mais aussi durables et inclusifs, capables de fonctionner sur les milliards d'appareils déjà utilisés dans le monde.