Percy Liang ist Informatikprofessor an der Stanford University und Direktor des Center for Research on Foundation Models (CRFM) innerhalb des Stanford Institute for Human-Centered Artificial Intelligence (HAI).
Liangs frühe Forschung konzentrierte sich auf statistische und neuronale Ansätze zur Verarbeitung natürlicher Sprache, einschließlich semantischer Analyse und Methoden zur Untersuchung der Robustheit von NLP-Systemen gegenüber adversarischen Eingaben. Er trat der Fakultät in Stanford in den frühen 2010er Jahren bei und baute eine Forschungsgruppe auf, die sich mit NLP, maschineller Lerntheorie und zunehmend mit den groß angelegten vortrainierten Modellen befasste, die das Feld in den Jahren nach der Einführung der Transformer-Architektur dominierten.
Grundlagenmodelle
Im Jahr 2021 war Liang ein führender Organisator und Koautor des Stanford-Papiers „On the Opportunities and Risks of Foundation Models", das den Begriff Grundlagenmodell einführte und populär machte, um große Modelle wie GPT-3 und BERT zu beschreiben, die auf breiten Daten in großem Maßstab trainiert und durch Feinabstimmung oder In-Context-Lernen an eine Vielzahl nachgelagerter Aufgaben anpassbar sind. Das Papier argumentierte, dass die Verschiebung hin zu Grundlagenmodellen einen bedeutenden Paradigmenwechsel in der KI-Forschung darstelle, und wies auf Risiken der Homogenisierung hin, da Fehler oder Verzerrungen in einer kleinen Anzahl weit verbreiteter Grundlagenmodelle sich über viele nachgelagerte Anwendungen ausbreiten könnten.
HELM und Evaluierung
Liang hat sich prominent für eine rigorose und transparente Evaluierung von Sprachmodellen eingesetzt. Seine Gruppe erstellte HELM (Holistic Evaluation of Language Models), eine Benchmark-Suite, die darauf ausgelegt ist, Modelle gleichzeitig über viele Szenarien und Metriken zu bewerten, einschließlich Genauigkeit, Kalibrierung, Robustheit, Fairness und Effizienz, anstatt sich auf eine einzelne Leaderboard-Zahl zu optimieren, wie es bei früheren Benchmarks wie MMLU üblich war. HELM wurde teilweise als Reaktion auf Bedenken hinsichtlich Benchmark-Sättigung und -Gaming entwickelt, mit dem Ziel, ein breiteres und reproduzierbareres Bild des Modellverhaltens über viele Anbieter hinweg auf einer gemeinsamen Reihe von Szenarien zu geben.
Einfluss
Über CRFM hat Liang weiterhin viel zitierte Arbeiten veröffentlicht, die das Ökosystem der Grundlagenmodelle verfolgen, einschließlich Transparenzindizes, die große KI-Labore danach bewerten, wie viel sie über die Trainingsdaten, Rechenleistung und Bereitstellung ihrer Modelle offenlegen. Seine Arbeit liegt an der Schnittstelle von empirischer KI-Forschung und KI-Politik und zielt darauf ab, mehr unabhängige, akademische Prüfung in ein Feld zu bringen, das zunehmend von Ergebnissen und Evaluierungen dominiert wird, die von den Laboren selbst produziert werden, die die Modelle bauen, einschließlich OpenAI, Anthropic und Google DeepMind.