Caleb Kaplan est un informaticien et chercheur dans le domaine de l'intelligence artificielle. Il est surtout connu pour avoir co-écrit l'article présentant GPT-3, un grand modèle de langage développé par OpenAI, et pour ses contributions à la compréhension des lois d'échelle dans les réseaux neuronaux. Ses travaux ont influencé le développement des systèmes modernes d'IA générative.
Les recherches de Kaplan portent sur le comportement empirique des modèles d'apprentissage automatique à grande échelle, en particulier sur la manière dont les performances s'améliorent avec l'augmentation de la taille du modèle, des données et de la puissance de calcul. Ses conclusions ont façonné la manière dont les laboratoires d'IA allouent leurs ressources pour entraîner de grands modèles.
Début de carrière et formation
Kaplan a terminé ses études de premier cycle en informatique, bien que les dates et institutions spécifiques ne soient pas documentées publiquement. Il a ensuite rejoint OpenAI, où il est devenu membre de l'équipe de recherche travaillant sur les modèles de langage. Ses premiers travaux portaient sur l'analyse de la dynamique d'entraînement des transformeurs et d'autres architectures de réseaux neuronaux.
GPT-3 et lois d'échelle
En 2020, Kaplan a co-écrit l'article « Language Models are Few-Shot Learners », qui a présenté GPT-3, un modèle de 175 milliards de paramètres. Ces travaux ont démontré que l'augmentation de la taille du modèle améliorait considérablement les performances sur une large gamme de tâches en langage naturel, sans nécessiter de réglage fin spécifique à la tâche. Cet article est devenu une référence dans le domaine de l'apprentissage profond.
Avant cela, en 2020, Kaplan a également contribué à l'étude « Scaling Laws for Neural Language Models », qui proposait que les performances du modèle suivent une relation de loi de puissance avec la puissance de calcul, la taille du jeu de données et le nombre de paramètres. Ces lois d'échelle ont fourni un cadre prédictif pour entraîner efficacement de grands modèles.
Contributions à la recherche en IA
Les recherches de Kaplan ont été largement citées dans la communauté de l'IA. Ses travaux sur les lois d'échelle ont éclairé la conception de modèles de langage de grande taille ultérieurs, y compris ceux développés par d'autres organisations. Il a également exploré des sujets tels que l'interprétabilité des modèles et les implications éthiques du déploiement de l'IA.
Chez OpenAI, Kaplan a collaboré avec des chercheurs tels que Jakob Uszkoreit et Lukasz Kaiser, qui étaient également impliqués dans le développement de l'architecture des transformeurs. Ses idées sur la stabilité de l'entraînement et l'optimisation ont été intégrées dans des pipelines d'entraînement pratiques.
Travaux ultérieurs et impact dans l'industrie
Après son passage chez OpenAI, la trajectoire de carrière de Kaplan est moins documentée publiquement. Il n'a pas été associé à de grandes entreprises d'IA comme Anthropic ou Google DeepMind en date de 2025. Ses contributions académiques restent une référence pour les chercheurs étudiant la mise à l'échelle et l'efficacité des modèles.
Les travaux de Kaplan ont indirectement influencé la conception du matériel, car des entreprises comme Nvidia et AMD ont optimisé leurs puces pour les charges de travail d'entraînement à grande échelle. Cependant, il n'a pas occupé de rôles consultatifs officiels dans ces entreprises.
Héritage et reconnaissance
L'article sur GPT-3 a été cité des milliers de fois et est considéré comme un travail fondateur dans l'IA générative. La co-auteur de Kaplan le place parmi un groupe de chercheurs qui ont fait progresser les capacités pratiques des grands modèles de langage. Son analyse des lois d'échelle reste un outil standard pour estimer les besoins en puissance de calcul dans la recherche en IA.
Les contributions de Kaplan sont souvent discutées aux côtés de celles de David Kaplan, un autre chercheur dans le domaine, bien qu'il s'agisse de personnes distinctes. Ses travaux continuent d'être enseignés dans les cours sur l'apprentissage automatique et l'éthique de l'IA.