Traduit de l'anglais

Percy Liang est un professeur à Stanford qui dirige le Centre de recherche sur les modèles de fondation et a contribué à populariser le terme modèle de fondation, et a créé la suite de benchmarks HELM pour une évaluation standardisée des modèles de langage.

Percy Liang est professeur d'informatique à l'université Stanford et directeur du Center for Research on Foundation Models (CRFM) au sein du Stanford Institute for Human-Centered Artificial Intelligence (HAI).

Les premières recherches de Liang se sont concentrées sur les approches statistiques et neuronales du traitement du langage naturel, y compris l'analyse sémantique et les méthodes pour sonder la robustesse des systèmes de NLP face à des entrées adversariales. Il a rejoint le corps professoral de Stanford au début des années 2010 et a constitué un groupe de recherche travaillant sur le NLP, la théorie de l'apprentissage automatique et, de plus en plus, sur les modèles pré-entraînés à grande échelle qui ont dominé le domaine dans les années suivant l'introduction de l'architecture transformeur.

Modèles de fondation

En 2021, Liang a été un organisateur principal et co-auteur de l'article de Stanford « On the Opportunities and Risks of Foundation Models », qui a introduit et popularisé le terme modèle de fondation pour décrire les grands modèles, tels que GPT-3 et BERT, entraînés sur des données vastes à grande échelle et adaptables à une large gamme de tâches en aval grâce au réglage fin ou à l'apprentissage en contexte. L'article soutenait que le passage aux modèles de fondation représentait un changement de paradigme significatif dans la recherche en IA et signalait des risques liés à l'homogénéisation, car les défauts ou biais d'un petit nombre de modèles de fondation largement réutilisés pourraient se propager à travers de nombreuses applications en aval.

HELM et évaluation

Liang a été un défenseur éminent d'une évaluation rigoureuse et transparente des modèles de langage. Son groupe a créé HELM (Holistic Evaluation of Language Models), une suite de benchmarks conçue pour évaluer les modèles sur de nombreux scénarios et métriques simultanément, y compris la précision, la calibration, la robustesse, l'équité et l'efficacité, plutôt que d'optimiser un seul chiffre de classement comme les benchmarks antérieurs tels que MMLU avaient tendance à l'être. HELM a été conçu en partie en réponse aux préoccupations concernant la saturation et le contournement des benchmarks, visant à donner une image plus large et plus reproductible du comportement des modèles à travers les modèles de nombreux fournisseurs sur un ensemble commun de scénarios.

Influence

À travers le CRFM, Liang a continué à publier des travaux largement cités qui suivent l'écosystème des modèles de fondation, y compris des indices de transparence qui notent les principaux laboratoires d'IA sur la mesure dans laquelle ils divulguent les données d'entraînement, le calcul et le déploiement de leurs modèles. Son travail se situe à l'intersection de la recherche empirique en IA et de la politique en IA, visant à apporter un examen académique plus indépendant à un domaine de plus en plus dominé par des résultats et évaluations produits par les laboratoires qui construisent les modèles eux-mêmes, y compris OpenAI, Anthropic et Google DeepMind.

Catégories:ai-research·evaluation·academia
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique