Amy Zhang é uma pesquisadora em inteligência artificial, com foco em IA centrada no ser humano, aprendizado por reforço e interpretabilidade. Ela é professora assistente na Universidade de Washington e cientista de pesquisa na Meta AI (anteriormente Facebook AI Research). Seu trabalho visa tornar os sistemas de IA mais transparentes, interativos e alinhados com os valores humanos, frequentemente combinando aprendizado de máquina com insights da ciência cognitiva e da interação humano-computador.
Zhang recebeu seu Ph.D. em ciência da computação pela Universidade da Califórnia, Berkeley, onde foi orientada por Pieter Abbeel. Sua pesquisa de doutorado desenvolveu métodos para aprender com feedback humano e para tornar o aprendizado por reforço mais eficiente em termos de amostras. Ela também passou um tempo como pesquisadora visitante no Google Brain e no Montreal Institute for Learning Algorithms (MILA). Antes do Ph.D., ela obteve um bacharelado em ciência da computação pela Universidade de Waterloo.
Aprendizado por Reforço e Feedback Humano
O trabalho inicial de Zhang focou em aprendizado por reforço, particularmente em como agentes podem aprender com recompensas esparsas e com demonstrações. Ela contribuiu para o desenvolvimento de algoritmos que combinam aprendizado por imitação com modelagem de recompensa, permitindo que agentes aprendam comportamentos complexos a partir de um pequeno número de exemplos humanos. Um projeto notável, "Learning by Playing", introduziu um método para resolver tarefas de recompensa esparsa usando exploração não supervisionada para aprender habilidades que podem ser reutilizadas em tarefas subsequentes.
Um tema central em sua pesquisa é o uso de feedback humano para guiar o treinamento de IA. Ela trabalhou em técnicas para aprendizado por reforço baseado em preferências, onde um modelo aprende a partir de comparações pareadas de trajetórias em vez de recompensas explícitas. Essa abordagem é particularmente útil em domínios onde projetar uma função de recompensa é difícil, como robótica ou sistemas de diálogo. Seu trabalho nessa área foi amplamente citado e influenciou pesquisas subsequentes sobre RLHF, um componente chave no treinamento de modelos de linguagem de grande escala modernos.
Interpretabilidade e Transparência
Zhang também fez contribuições significativas para a interpretabilidade em aprendizado de máquina. Ela desenvolveu métodos para visualizar e entender o que redes neurais aprenderam, particularmente no contexto de agentes de aprendizado por reforço. Seu trabalho em "mapas de saliência" e "vetores de ativação de conceitos" ajuda pesquisadores a identificar quais características de uma entrada são mais influentes na decisão de um modelo. Essa linha de pesquisa é crucial para construir confiança em sistemas de IA, especialmente em aplicações de alto risco, como saúde ou direção autônoma.
Em um artigo amplamente citado, Zhang e colegas introduziram "TCAV" (Testing with Concept Activation Vectors), uma técnica que quantifica o quanto um conceito (por exemplo, "listrado" ou "manchado") contribui para a previsão de um modelo. Esse método permite que usuários investiguem o raciocínio de um modelo em termos compreensíveis para humanos, indo além da simples atribuição de características. O trabalho foi adotado por equipes da indústria em Google DeepMind e OpenAI para auditoria de modelos.
IA Centrada no Ser Humano
A agenda de pesquisa de Zhang é explicitamente centrada no ser humano: ela projeta sistemas de IA que podem interagir com pessoas naturalmente e aprender com seu feedback. Ela explorou como tornar assistentes de IA mais úteis, permitindo que usuários corrijam erros por meio de linguagem natural ou demonstrando o comportamento desejado. Isso inclui trabalho em aprendizado interativo, onde um modelo melhora ao longo do tempo com base na entrada do usuário, e em alinhar objetivos de IA com preferências humanas.
Um de seus projetos, "Reward Learning from Human Preferences", demonstrou que um robô pode aprender a realizar tarefas recebendo feedback de usuários não especialistas. Em um estudo de usuário, participantes ensinaram um robô simulado a navegar e manipular objetos fornecendo feedback simples de sim/não. Os resultados mostraram que o robô podia aprender efetivamente com esforço humano mínimo, sugerindo um caminho prático para IA personalizável.
Carreira Acadêmica e Ensino
Zhang ingressou na Universidade de Washington em 2021 como professora assistente na Paul G. Allen School of Computer Science & Engineering. Ela lidera o Human-Centered AI Lab, onde orienta estudantes de pós-graduação e pós-doutorandos. Seu ensino inclui cursos sobre aprendizado por reforço e sobre justiça, responsabilidade e transparência em aprendizado de máquina. Ela recebeu vários prêmios de ensino, incluindo o UW College of Engineering Outstanding Teaching Award em 2023.
Em MIT CSAIL e Stanford AI Lab, ela deu palestras convidadas sobre sua pesquisa. Ela também é professora afiliada ao UW Center for an Informed Public, onde estuda os impactos sociais da IA, incluindo desinformação e viés algorítmico.
Experiência na Indústria
Antes de sua nomeação acadêmica, Zhang trabalhou como cientista de pesquisa na Meta AI de 2020 a 2021. Na Meta, ela aplicou sua expertise em aprendizado por reforço para melhorar sistemas de recomendação e desenvolver ferramentas para detectar conteúdo prejudicial. Ela também colaborou com equipes da Anthropic em pesquisa de segurança, contribuindo para o trabalho inicial em supervisão escalável.
Zhang também foi estagiária de pesquisa no Google Brain e no Berkeley AI Research (BAIR). Essas experiências lhe deram uma perspectiva ampla sobre como a pesquisa em IA se traduz em produtos e políticas.
Prêmios e Reconhecimento
Zhang recebeu várias honrarias por seu trabalho. Em 2022, ela foi nomeada Rising Star em IA pela iniciativa AI2050. Em 2023, ela recebeu o NSF CAREER Award por seu projeto sobre "Aprendizado por Reforço Interativo e Interpretável". Seus artigos ganharam prêmios de melhor artigo em conferências importantes, incluindo a International Conference on Machine Learning (ICML) e a Conference on Neural Information Processing Systems (NeurIPS). Ela também é recipiente da Sloan Research Fellowship em Ciência da Computação (2024).
Publicações Selecionadas
Zhang publicou mais de 40 artigos em veículos de primeira linha. Alguns de seus trabalhos mais citados incluem:
- "TCAV: Relative Concept Importance Testing" (ICML 2018) - introduziu um método para interpretabilidade baseada em conceitos.
- "Learning by Playing: Solving Sparse Reward Tasks from Scratch" (ICML 2018) - propôs um currículo de auto-jogo para exploração.
- "Reward Learning from Human Preferences" (NeurIPS 2019) - demonstrou RL baseado em preferências prático.
- "Interactive Learning from Policy-Dependent Human Feedback" (ICML 2020) - estudou como o feedback muda à medida que o agente melhora.
Sua pesquisa foi apoiada por subsídios da National Science Foundation, do Office of Naval Research e de fundações privadas.
Direções Futuras
O trabalho atual de Zhang foca em tornar modelos de linguagem de grande escala mais interpretáveis e controláveis. Ela está investigando como elicitar incerteza honesta de modelos e como permitir que usuários direcionem o comportamento do modelo sem retreinamento. Ela também está interessada em aprendizado por reforço multiagente, onde múltiplos sistemas de IA interagem, e em garantir que tais sistemas permaneçam seguros e alinhados com objetivos humanos.
A partir de 2025, Zhang continua a ensinar e liderar pesquisa na Universidade de Washington. Suas contribuições ajudaram a moldar o campo emergente da IA centrada no ser humano, preenchendo a lacuna entre aprendizado de máquina técnico e necessidades humanas.