Luke Zettlemoyer est professeur à la Paul G. Allen School of Computer Science & Engineering de l'Université de Washington et chercheur scientifique principal chez Meta AI. Ses recherches portent sur le traitement automatique des langues (TAL), en particulier sur le développement de méthodes pour l'analyse sémantique, la compréhension du langage ancré et l'entraînement efficace des grands modèles de langage. Il est connu pour ses contributions à l'apprentissage faiblement supervisé et pour avoir co-développé l'architecture de modèle DeBERTa, qui a obtenu des résultats de pointe sur plusieurs références de TAL.
Zettlemoyer a obtenu son doctorat au Massachusetts Institute of Technology en 2007, où il a travaillé sous la supervision de Michael Collins. Avant de rejoindre l'Université de Washington en 2013, il était professeur adjoint à l'Université de l'Illinois à Urbana-Champaign. Il a également occupé des postes de recherche chez Microsoft Research et Amazon AI.
Contributions à la recherche
Les premiers travaux de Zettlemoyer se sont concentrés sur l'apprentissage d'analyseurs sémantiques à partir d'énoncés en langage naturel. Il a introduit l'utilisation des grammaires catégorielles combinatoires (CCG) pour l'analyse sémantique faiblement supervisée, permettant aux modèles d'apprendre à partir d'annotations au niveau de la phrase plutôt que de formes logiques détaillées. Cette ligne de recherche a influencé les travaux ultérieurs sur l'acquisition du langage ancré et la réponse aux questions.
Dans les années 2010, il a contribué au développement de modèles basés sur les réseaux de neurones pour le TAL, y compris des travaux sur les mécanismes d'attention et les réseaux à mémoire augmentée. Son groupe à l'Université de Washington a produit des articles influents sur l'apprentissage multitâche, l'adaptation de domaine et l'inférence efficace pour les modèles de séquences.
Grands modèles de langage et Meta AI
Chez Meta AI, Zettlemoyer dirige une équipe travaillant sur les modèles de langage à grande échelle. Il a été un contributeur clé aux familles de modèles OPT et LLaMA, qui sont des grands modèles de langage open source publiés par Meta. Ces modèles ont été largement adoptés par les chercheurs et les praticiens en raison de leurs performances compétitives et de leur accessibilité ouverte. Les travaux de Zettlemoyer sur les méthodes d'entraînement efficaces, telles que FlashAttention et le checkpointing de gradient, ont contribué à réduire le coût de calcul de l'entraînement des grands modèles.
Il a également participé à des efforts visant à améliorer l'exactitude factuelle et les capacités de raisonnement des modèles de langage, y compris des travaux sur la génération augmentée par récupération et le prompting par chaîne de pensée.
Enseignement et mentorat
À l'Université de Washington, Zettlemoyer enseigne des cours de troisième cycle sur le traitement automatique des langues et l'apprentissage automatique. Il a encadré de nombreux étudiants au doctorat qui ont ensuite occupé des postes dans le milieu universitaire et l'industrie, y compris des chercheurs chez OpenAI, Google DeepMind et Anthropic. Son style de mentorat met l'accent sur l'expérimentation rigoureuse et la communication claire des idées de recherche.
Prix et reconnaissance
Zettlemoyer a reçu plusieurs prix pour ses recherches, notamment un prix CAREER de la National Science Foundation et une bourse de recherche Sloan. Il est fréquemment président de section pour les grandes conférences de TAL telles que ACL et EMNLP, et il a siégé au comité éditorial des Transactions of the Association for Computational Linguistics. Ses travaux ont été cités des dizaines de milliers de fois, reflétant leur large impact sur le domaine.
Publications sélectionnées
Parmi ses articles les plus cités figurent « DeBERTa: Decoding-enhanced BERT with Disentangled Attention » (2021), qui a introduit un mécanisme d'attention novateur améliorant les performances sur la référence SuperGLUE, et « OPT: Open Pre-trained Transformer Language Models » (2022), qui détaille l'entraînement et la publication d'une suite de modèles de langage open source. Il a également publié des travaux influents sur l'analyse sémantique, notamment « Learning to Map Sentences to Logical Form » (2007) et « Weakly Supervised Learning of Semantic Parsers » (2012).
Zettlemoyer continue d'être un chercheur actif, avec des intérêts récents pour les modèles multimodaux et l'alignement des modèles de langage avec les valeurs humaines. Son travail fait le pont entre la recherche académique et le déploiement industriel, faisant de lui une figure éminente de la communauté de l'intelligence artificielle.