Alexander Rush est un professeur à l'université Cornell, spécialisé dans le traitement automatique des langues (TAL) et l'apprentissage automatique. Il est largement reconnu pour ses contributions à l'apprentissage profond pour le texte, notamment en tant que co-auteur du modèle séquence-à-séquence (seq2seq) et du Stanford Question Answering Dataset (SQuAD). Ses recherches ont influencé le développement des grands modèles de langage modernes et des architectures basées sur le transformer.
Les travaux de Rush font le pont entre la recherche algorithmique fondamentale et les applications pratiques en TAL, avec un accent sur l'inférence efficace, la prédiction structurée et l'interprétabilité. Il a publié abondamment dans des conférences et des revues de premier plan, et ses recherches ont été citées des dizaines de milliers de fois. Il est également connu pour ses contributions en logiciels open-source et ses efforts pédagogiques dans le domaine.
Début de carrière et formation
Rush a terminé ses études de premier cycle en informatique et en mathématiques, puis a obtenu un doctorat en informatique au laboratoire d'informatique et d'intelligence artificielle du MIT (CSAIL). Durant son travail doctoral, il s'est concentré sur la traduction automatique statistique et la prédiction structurée, posant les bases de ses contributions ultérieures aux modèles neuronaux séquentiels. Après son doctorat, il a occupé des postes de recherche chez Google DeepMind et Facebook AI Research (désormais Meta AI), où il a collaboré sur les premières approches de réseaux de neurones pour le TAL.
Seq2seq et SQuAD
En 2014, Rush a co-écrit l'article « Sequence to Sequence Learning with Neural Networks » avec Ilya Sutskever et Oriol Vinyals, qui a introduit le modèle seq2seq. Cette architecture, basée sur des réseaux de neurones récurrents avec une structure encodeur-décodeur, est devenue un composant fondamental pour la traduction automatique, le résumé de texte et les systèmes de dialogue. Le modèle seq2seq a été un précurseur du mécanisme d'attention et des modèles transformer ultérieurs.
En 2016, Rush a co-créé SQuAD, un ensemble de données de compréhension de lecture à grande échelle composé de questions posées par des travailleurs participatifs sur un ensemble d'articles Wikipédia. SQuAD est devenu une référence pour évaluer les systèmes de réponse aux questions, stimulant des progrès rapides dans le domaine. L'ensemble de données a été utilisé dans de nombreuses compétitions et articles de recherche, et il reste un outil d'évaluation standard pour les modèles de TAL.
Carrière académique et contributions de recherche
Rush a rejoint le corps professoral de l'université Cornell en tant que professeur assistant en 2017, puis a été promu professeur associé. À Cornell, il dirige un groupe de recherche axé sur le TAL et l'apprentissage automatique, avec des projets couvrant l'étiquetage de séquences, la génération de texte et la compression de modèles. Ses travaux sur l'inférence efficace ont été particulièrement influents, notamment des méthodes pour l'optimisation du recherche en faisceau et la distillation de connaissances.
Rush a également contribué au développement de logiciels open-source pour le TAL, notamment la bibliothèque TorchText et des outils pour la traduction automatique neuronale. Il a servi comme président de section et président principal de section pour des conférences majeures telles que ACL, EMNLP et NeurIPS, et il est un conférencier invité fréquent lors d'événements académiques et industriels.
Impact sur les grands modèles de langage
Les premiers travaux de Rush sur seq2seq et les mécanismes d'attention ont directement influencé la conception des modèles transformer, introduits en 2017. Les transformers, qui reposent entièrement sur l'attention, sont devenus l'épine dorsale des grands modèles de langage tels que GPT et BERT. Les recherches de Rush sur les transformers efficaces et l'attention éparse ont contribué à rendre ces modèles plus pratiques pour des applications réelles.
En plus de son travail académique, Rush a collaboré avec des laboratoires industriels, notamment OpenAI et Google AI, sur des projets liés à la mise à l'échelle des modèles et à l'interprétabilité. Il a également participé à des efforts visant à améliorer la reproductibilité et la transparence de la recherche en TAL, plaidant pour des références partagées et des codes ouverts.
Enseignement et vulgarisation
À Cornell, Rush enseigne des cours sur l'apprentissage automatique et le TAL, et il a développé des supports de cours populaires largement utilisés dans d'autres institutions. Il est connu pour ses explications claires de sujets complexes, et ses tutoriels sur seq2seq et l'attention ont été visionnés par des milliers d'étudiants et de praticiens. Rush a également encadré de nombreux doctorants et postdoctorants qui ont ensuite occupé des postes dans le milieu académique et industriel.
Prix et reconnaissance
Rush a reçu plusieurs prix pour ses recherches, notamment un prix NSF CAREER et des prix du meilleur article lors de grandes conférences en TAL. Son travail sur SQuAD a été reconnu par un prix test-of-time, et il a été nommé titulaire d'une chaire IA CIFAR. Il est membre du réseau ELLIS et siège à des comités consultatifs pour plusieurs organisations de recherche en IA.
Publications sélectionnées
- Sutskever, I., Vinyals, O., & Le, Q. V. (2014). Sequence to Sequence Learning with Neural Networks. NeurIPS.
- Rajpurkar, P., Zhang, J., Lopyrev, K., & Liang, P. (2016). SQuAD: 100,000+ Questions for Machine Comprehension of Text. EMNLP.
- Rush, A. M., et al. (2015). A Neural Attention Model for Abstractive Sentence Summarization. EMNLP.
- Wiseman, S., & Rush, A. M. (2016). Sequence-to-Sequence Learning as Beam-Search Optimization. EMNLP.
Liens externes
Catégories
- natural-language-processing
- machine-learning
- deep-learning
- cornell-university