Yin-Tat Lee est un informaticien et chercheur spécialisé dans les algorithmes d'optimisation, l'apprentissage automatique et l'informatique théorique. Il est professeur associé à l'Université de Washington et chercheur principal chez Google DeepMind. Lee s'est fait connaître dans la communauté de l'intelligence artificielle en tant que co-auteur de l'influent article Chinchilla, qui a établi des lois de mise à l'échelle pour former efficacement les grands modèles de langage.
Les recherches de Lee relient l'optimisation théorique à l'apprentissage automatique pratique, avec des contributions aux algorithmes plus rapides pour la programmation linéaire, l'optimisation convexe et l'entraînement des réseaux neuronaux. Ses travaux ont des implications à la fois pour la théorie de la calculabilité et le déploiement des systèmes d'IA à grande échelle.
Début de carrière et éducation
Lee a terminé ses études de premier cycle à l'Université nationale de Taïwan, où il a développé un intérêt pour les algorithmes et la théorie de la complexité. Il a ensuite poursuivi un doctorat en informatique au Massachusetts Institute of Technology (MIT), sous la direction de Jonathan Kelner. Ses recherches doctorales portaient sur des algorithmes à temps quasi-linéaire pour les problèmes de graphes et l'optimisation, lui valant une reconnaissance pour des avancées théoriques.
Après avoir obtenu son diplôme, Lee a occupé des postes postdoctoraux et a ensuite rejoint la faculté de l'Université de Washington. Il a également commencé une collaboration à long terme avec des chercheurs de Google, ce qui a finalement conduit à son rôle chez Google DeepMind.
Algorithmes d'optimisation
Une partie significative des travaux de Lee se concentre sur l'amélioration de l'efficacité des méthodes d'optimisation fondamentales. Il a développé conjointement des algorithmes plus rapides pour résoudre des programmes linéaires, qui sont largement utilisés dans la logistique, la finance et l'apprentissage automatique. Son approche combine souvent des techniques d'optimisation continue avec des perspectives combinatoires, atteignant une complexité temporelle quasi-optimale pour des problèmes auparavant considérés comme intraitables à grande échelle.
Lee a également contribué au développement de méthodes de gradient accélérées, essentielles pour l'entraînement des modèles de Deep learning. Ces méthodes réduisent le nombre d'itérations nécessaires à la convergence, rendant possible l'entraînement d'architectures de Neural network plus grandes sur des ensembles de données massifs.
Article Chinchilla et lois de l'échelle
En 2022, Lee a co-écrit l'article "Training Compute-Optimal Large Language Models", communément appelé l'article Chinchilla, avec des chercheurs de DeepMind et de l'University of Toronto. Cette étude a abordé une question essentielle : combien de paramètres et quelle quantité de données devraient être utilisées pour former un Large language model pour un budget de calcul donné. Les auteurs ont constaté que la plupart des modèles existants étaient significativement sur-paramétrés et sous-entraînés, et ils ont proposé de faire échelle la taille du modèle et les données d'apprentissage approximativement de manière égale.
L'article a présenté le modèle Chin -model, un modèle à 70 milliards de paramètres entraîné sur 1,4 milliards de tokens, qui surpassait des modèles beaucoup plus grands comme Gopher et GPT-3 sur divers benchmarks. Cette trouvaille a modifié l'approche des laboratoires d'IA dans la prise en compte de la conception des modèles, influence les versions ultérieures de OpenAI, Anthropic et d'autres organisations. Les lois d'échelle dérivées du article sont devenues une référence standard pour la réquisition de ressources de calcul dans la recherche sur les Generative AI.
Contributions aux systèmes d'apprentissage automatique
Au-delà du travail théorique, Lee a contribué à systèmes pratiques pour travaillant à l'entraînement et à l'inférence. Il a développé des techniques d'optimisation pour les error des modèles Transformer (architecture), notamment des méthodes pour réduire la consommation de mémoire et accélérer la convergence. Ses recherches sur les taux d'apprentissage adaptatifs et le préconditionnement ont informé la conception des optimiseurs utilisés dans les essais de grande scale.
La collaboration de Lee avec des chercheurs de l'industrie a également porté sur rendre le Machine learning plus accessible. Explant des moyens de réduire le cû du calcul pour l'ajustement fin et l'inférence, un aspect essentiel pour déployer des modèles sur des équipements à ressources limitées. Il apparaît les dans des conférences de premier plan telles que NeurIPS, ICML et STOC.
Reconnaissance et impact légaux
Plusieurs prix ont récompensé les recherches de Lee, y compris une bourse de recherche Sloan et un prix CAREER de la NSF. Ses articles être cités des milliers de fois, reflétant leur influence en informatique théorique et en IA appliquée. Il est souvent invité à speak des conférences académiques et industrie pour discuter de l'intersection entre l'optimization et l'apprentissage profond.
Au milieu des années 2020, Lee continue son travail à développer une conception efficace à l'académie des Etats, à l'Université de Washington et à Google DeepMind, où il encadre des étudiants et collabore sur des projets liés à l'IA efficace. Sa double position mondiale académique et industrielle lui permet de traduire en applications théoriques en outils pratiques, faisant de lui une figure clé du développement durable des systèmes de Artificial intelligence à grande échelle.
Publications sélectionnées
- "Training Compute-Op Optimal Large Language Sized Models" (2022) - Introduction des lois de mise à l'échelle Chin -drawn.
- "Nearly-Linear Time Algorithms for Preconditioning and Solving Symmetric Diagonally Dominant Linear Systems" - Un article central dans les algorithmes fastes de graphiques.
- "Accelerated Methods for Convex Optimization" - Contribution à des vitesses de convergence plus rapides pour les méthodes de gradient.
Sa liste de publications couvre à la fois les domaines difficiles scientifiques et conférences sur l'apprentissage automatique appliqué, illustrant une aptitude rare à combiner l'exigence mathématique et les défis réels d'IA.