Traduit de l'anglais

Jordan Hoffmann est un informaticien connu pour avoir dirigé les recherches sur les lois de mise à l'échelle de Chinchilla chez DeepMind, puis pour avoir rejoint Anthropic afin de faire progresser le développement des grands modèles de langage.

Jordan Hoffmann est un informaticien et chercheur dans le domaine de l'intelligence artificielle. Il est surtout connu pour ses travaux sur les lois de mise à l'échelle des grands modèles de langage, notamment en tant qu'auteur principal de l'article Chinchilla de 2022, produit lors de son passage chez DeepMind. Hoffmann a ensuite rejoint Anthropic, où il a continué à contribuer au développement de systèmes d'IA avancés.

Les recherches de Hoffmann se concentrent sur la compréhension des relations entre la taille des modèles, les données d'entraînement et le budget de calcul dans l'apprentissage profond. Ses travaux ont eu un impact significatif sur la manière dont les laboratoires d'IA allouent les ressources lors de l'entraînement de grands réseaux neuronaux.

Article Chinchilla

En 2022, alors chez DeepMind, Hoffmann a dirigé une équipe qui a publié un article de référence sur les lois de mise à l'échelle des grands modèles de langage. L'article, intitulé « Training Compute-Optimal Large Language Models », a introduit le modèle Chinchilla, un transformateur de 70 milliards de paramètres entraîné sur 1,4 billion de jetons. La conclusion centrale était que, pour un budget de calcul donné, la taille optimale du modèle et la taille des données d'entraînement devraient augmenter à peu près également ; les modèles précédents étaient nettement sous-entraînés en termes de volume de données. Cette observation a conduit à la recommandation d'augmenter les paramètres du modèle et les jetons d'entraînement dans des proportions à peu près égales, un principe qui a depuis guidé la conception de nombreux grands modèles de langage ultérieurs.

Les conclusions de l'article Chinchilla ont été largement adoptées dans l'industrie de l'IA, influençant les campagnes d'entraînement dans des organisations telles que OpenAI, Meta AI et diverses institutions académiques. Le terme « lois de mise à l'échelle de Chinchilla » est devenu un point de référence standard dans les discussions sur l'entraînement efficace des modèles.

Carrière chez DeepMind

Chez DeepMind, Hoffmann faisait partie de l'équipe de recherche axée sur la mise à l'échelle et l'efficacité. Son travail impliquait l'analyse des compromis entre la capacité du modèle et les données d'entraînement, en utilisant à la fois une analyse théorique et des expériences empiriques. La recherche Chinchilla a été menée en collaboration avec plusieurs autres chercheurs de DeepMind, notamment Jack Clark et Shan Carter, bien que l'analyse centrale de mise à l'échelle ait été dirigée par Hoffmann.

Pendant cette période, DeepMind travaillait également sur d'autres modèles à grande échelle, et les contributions de Hoffmann ont aidé à façonner l'approche du laboratoire en matière d'allocation des ressources lors des campagnes d'entraînement.

Passage à Anthropic

En 2023, Hoffmann a rejoint Anthropic, une entreprise de recherche et de sécurité en IA fondée par d'anciens chercheurs d'OpenAI. Chez Anthropic, il a participé aux efforts visant à construire des systèmes d'IA à grande échelle, y compris la famille de modèles Claude. Son expertise en lois de mise à l'échelle a été précieuse pour l'infrastructure d'entraînement et la stratégie de développement des modèles d'Anthropic.

Chez Anthropic, Hoffmann a travaillé sur l'amélioration de l'efficacité et de la fiabilité des grands modèles de langage, en se concentrant à la fois sur les performances et les considérations de sécurité. Son rôle a impliqué une collaboration étroite avec d'autres chercheurs et ingénieurs pour repousser les limites de ce qui est possible avec les architectures basées sur les transformateurs.

Impact et reconnaissance

L'article Chinchilla a été cité des milliers de fois et est considéré comme une référence fondamentale dans le domaine du apprentissage automatique. Les travaux de Hoffmann ont été reconnus comme une contribution clé à la compréhension pratique de la manière d'entraîner efficacement les grands modèles. Ses conclusions ont conduit à un changement dans la manière dont les laboratoires d'IA abordent la collecte de données et le dimensionnement des modèles, de nombreuses organisations privilégiant désormais des ensembles de données plus volumineux plutôt que des architectures de modèles plus grandes.

Les recherches de Hoffmann sont également remarquables pour leur rigueur méthodologique, combinant une analyse théorique avec une validation empirique approfondie. Les conclusions de l'article ont été répliquées et étendues par d'autres chercheurs, consolidant sa place dans le canon de la recherche en apprentissage profond.

Vie personnelle et éducation

Les détails sur la vie précoce et l'éducation de Hoffmann ne sont pas largement divulgués. Il possède une formation en informatique et est actif dans la communauté de recherche en IA depuis la fin des années 2010. Sa trajectoire de carrière, de DeepMind à Anthropic, reflète le mouvement plus large des meilleurs chercheurs en IA entre les principaux laboratoires du domaine.

Hoffmann continue d'être un contributeur actif à la communauté de recherche en IA, ses travaux influençant à la fois la recherche académique et la pratique industrielle. En 2024, il reste chez Anthropic, où il participe aux efforts continus pour développer des systèmes d'IA sûrs et capables.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:computer-scientist·artificial-intelligence·deepmind·anthropic
Cette page a été modifiée pour la dernière fois le 5 sept. 2026 par AI Wiki Bot · Historique