Jack Rae est un informaticien spécialisé dans le apprentissage automatique et les grands modèles de langage. Il est surtout connu pour son travail chez Google DeepMind, où il a été un contributeur clé aux lois de mise à l'échelle de Chinchilla, une étude marquante qui a remodelé la manière dont les chercheurs abordent la mise à l'échelle des modèles et des données dans le apprentissage profond. Ses recherches ont influencé la conception des systèmes d'IA générative ultérieurs et le domaine plus large de l'intelligence artificielle.
La carrière de Rae couvre à la fois la recherche académique et l'application industrielle. Il a été affilié à des organisations de premier plan en IA, notamment DeepMind et, à partir du milieu des années 2020, Anthropic, où il a continué à travailler sur l'avancement des capacités et de la sécurité des grands modèles de langage. Ses contributions sont fréquemment citées dans les discussions sur l'entraînement efficace et les compromis entre la taille du modèle et la taille de l'ensemble de données.
Lois de mise à l'échelle de Chinchilla
En 2022, Rae a co-écrit l'article « Training Compute-Optimal Large Language Models », qui a introduit le modèle Chinchilla. L'étude a démontré que pour un budget de calcul donné, la taille optimale du modèle et le nombre de jetons d'entraînement évoluent à peu près de manière égale, ce qui signifie que de nombreux modèles existants étaient significativement sur-paramétrés et sous-entraînés. Cette découverte a conduit à un changement dans le domaine, avec des modèles ultérieurs comme Chinchilla étant entraînés sur plus de données avec moins de paramètres pour obtenir de meilleures performances par unité de calcul. Ce travail est devenu une référence fondamentale pour l'entraînement des modèles basés sur transformers, influençant à la fois la recherche académique et les pratiques industrielles dans des entreprises comme OpenAI et Anthropic.
Contributions de recherche
Au-delà de Chinchilla, Rae a travaillé sur divers aspects des réseaux de neurones et de la modélisation de séquences. Ses premières recherches comprenaient des travaux sur les mécanismes d'attention éparse et les architectures à mémoire augmentée, qui visent à améliorer l'efficacité et la gestion des dépendances à longue portée des transformers. Il a également exploré des sujets tels que les encodages positionnels et les variantes de attention multi-têtes, contribuant à une compréhension plus approfondie de la manière dont ces composants affectent les performances du modèle. Ses publications mettent souvent l'accent sur l'analyse empirique et les améliorations pratiques plutôt que sur des avancées purement théoriques.
Carrière et affiliations
Rae a obtenu son doctorat en informatique à l'Université de Toronto, où il a travaillé sous la supervision d'Aaron Courville et d'autres. Ses recherches doctorales se sont concentrées sur l'apprentissage profond pour les données séquentielles, posant les bases de ses travaux ultérieurs sur les modèles de langage. Après avoir obtenu son diplôme, il a rejoint DeepMind à Londres, où il est devenu chercheur scientifique principal. Chez DeepMind, il a dirigé ou contribué à plusieurs projets à fort impact, notamment les modèles Gopher et Chinchilla. En 2024, il a rejoint Anthropic, où il a participé au développement et à l'alignement de grands modèles de langage, en mettant l'accent sur la sécurité et la fiabilité.
Impact sur le développement de l'IA
Les lois de mise à l'échelle de Chinchilla ont eu un impact profond sur l'industrie de l'IA générative. En soulignant l'importance de l'efficacité des données, elles ont encouragé les organisations à investir davantage dans la collecte et la curation de données plutôt que de simplement augmenter la taille des modèles. Cela a influencé les stratégies d'entraînement des principaux laboratoires d'IA, notamment Google DeepMind, OpenAI et Anthropic, ainsi que les fournisseurs de cloud offrant une infrastructure d'IA comme Amazon Web Services et Google Cloud. Les principes de l'article sont désormais des considérations standard dans la conception des grands modèles de langage, affectant tout, des programmes de taux d'apprentissage aux techniques de élagage de modèles.
Travaux sélectionnés et reconnaissance
Rae est co-auteur de plusieurs articles influents, notamment « Scaling Language Models: Methods, Analysis & Insights from Training Gopher » et « Training Compute-Optimal Large Language Models ». Ses travaux ont été présentés lors de grandes conférences telles que NeurIPS et ICML, et il a été invité à s'exprimer lors d'événements académiques et industriels. Bien qu'il n'ait pas reçu de prix largement médiatisés, ses recherches sont très citées et ont été reconnues comme une contribution clé au domaine de l'intelligence artificielle. Il est également connu pour sa communication claire d'idées complexes, expliquant souvent les lois de mise à l'échelle et l'entraînement des modèles en termes accessibles pour des publics techniques et généraux.
Orientations futures
À partir du milieu des années 2020, Rae continue de travailler sur l'amélioration de l'efficacité et de la sécurité des grands modèles de langage. Ses intérêts actuels incluent le développement de méthodes pour une meilleure sélection des données, la réduction de l'impact environnemental de l'entraînement et la garantie que les systèmes d'IA s'alignent sur les valeurs humaines. Son passage chez Anthropic signale une focalisation sur ces derniers aspects, car l'organisation est dédiée à la recherche sur la sécurité de l'IA. Étant donné l'évolution rapide du domaine, les contributions continues de Rae sont susceptibles de rester influentes dans la manière dont les futurs modèles seront entraînés et déployés.