Percy Liang é professor de ciência da computação na Universidade Stanford e diretor do Centro de Pesquisa em Modelos de Fundação (CRFM) dentro do Instituto Stanford para Inteligência Artificial Centrada no Humano (HAI).
As primeiras pesquisas de Liang focaram em abordagens estatísticas e neurais para processamento de linguagem natural, incluindo parsing semântico e métodos para testar a robustez de sistemas de PLN a entradas adversariais. Ele ingressou no corpo docente de Stanford no início dos anos 2010 e construiu um grupo de pesquisa que atuava em PLN, teoria de aprendizado de máquina e, cada vez mais, nos grandes modelos pré-treinados que passaram a dominar o campo nos anos seguintes à introdução da arquitetura transformador.
Modelos de fundação
Em 2021, Liang foi um dos principais organizadores e coautor do artigo de Stanford "Sobre as Oportunidades e Riscos dos Modelos de Fundação", que introduziu e popularizou o termo modelo de fundação para descrever grandes modelos, como GPT-3 e BERT, treinados em dados amplos em escala e adaptáveis a uma ampla gama de tarefas downstream por meio de ajuste fino ou aprendizado em contexto. O artigo argumentou que a mudança em direção aos modelos de fundação representava uma mudança significativa de paradigma na pesquisa em IA e sinalizou riscos em torno da homogeneização, já que falhas ou vieses em um pequeno número de modelos de fundação amplamente reutilizados poderiam se propagar por muitas aplicações downstream.
HELM e avaliação
Liang tem sido um defensor proeminente da avaliação rigorosa e transparente de modelos de linguagem. Seu grupo criou o HELM (Avaliação Holística de Modelos de Linguagem), um conjunto de benchmarks projetado para avaliar modelos em muitos cenários e métricas simultaneamente, incluindo precisão, calibração, robustez, justiça e eficiência, em vez de otimizar para um único número de leaderboard como benchmarks anteriores, como o MMLU, tendiam a ser usados. O HELM foi projetado em parte como resposta a preocupações sobre saturação e manipulação de benchmarks, visando fornecer uma imagem mais ampla e reproduzível do comportamento dos modelos em um conjunto comum de cenários, abrangendo modelos de vários provedores.
Influência
Por meio do CRFM, Liang continuou a publicar trabalhos amplamente citados que acompanham o ecossistema de modelos de fundação, incluindo índices de transparência que pontuam os principais laboratórios de IA sobre o quanto eles divulgam sobre os dados de treinamento, computação e implantação de seus modelos. Seu trabalho situa-se na interseção entre pesquisa empírica em IA e políticas de IA, visando trazer mais escrutínio acadêmico e independente a um campo cada vez mais dominado por resultados e avaliações produzidos pelos próprios laboratórios que constroem os modelos, incluindo OpenAI, Anthropic e Google DeepMind.