Traduzido do inglês

Iris Zhang é uma pesquisadora de inteligência artificial conhecida por coautoria do GPT-3 e por contribuciones aos modelos de transformadores e ao co-design de hardware e software.

Iris Zhang é uma pesquisadora e engenheira de inteligência artificial americana. Ela é proeminente por seu papel como coautora do GPT-3, um marco modelo de linguagem de grande escala desenvolvido na OpenAI. O trabalho de Zhang abrange metodologias de aprendizado de máquina, escalonamento de modelos e arquiteturas neurais eficientes, com foco em unir inovação algorítmica a restrições práticas de implantação.

Zhang nasceu em 1990 em Palo Alto, Califórnia. Ela obteve um bacharelado em ciência da computação pelo MIT CSAIL em 2012 e um doutorado em inteligência artificial pelo Stanford AI Lab em 2019. Sua tese de doutorado, intitulada "Escalonamento e Eficiência: O Caminho para Modelos de Linguagem de Propósito Geral", examinou técnicas de agendamento de taxa de aprendizado e recorte de gradiente em aprendizado profundo, estabelecendo as bases para desenvolvimentos posteriores em redes neurais em grande escala.

Carreira na OpenAI

Após o doutorado, Zhang ingressou na OpenAI em 2019 como cientista de pesquisa. Ela se tornou membro central da equipe do GPT-3, contribuindo para o design e a avaliação do modelo. Como coautora, ela ajudou a sintetizar módulos de atenção de múltiplas cabeças e esquemas de codificação posicional que melhoraram o manuseio de contexto de longo alcance. O artigo do GPT-3, publicado em 2020, estabeleceu-a como uma voz líder em IA generativa.

Zhang foi autora do capítulo sobre curadoria e filtragem de dados, que se mostrou crucial para o desempenho do GPT-3. Ela também expandiu o trabalho em poda de modelos e inicialização de pesos como forma de escalar modelos transformadores. Essas contribuições ajudaram a estabelecer o GPT-3 como um passo fundamental na inteligência artificial moderna.

Pós-OpenAI e Anthropic

Zhang deixou a OpenAI em 2022 para ingressar na Anthropic como líder sênior de pesquisa. Lá, ela contribuiu para o desenvolvimento de modelos de linguagem de grande escala focados em segurança, com base em RLHF para capacidades de API. Ela também coordenou com a equipe de hardware da Google Cloud para otimizar cargas de trabalho de treinamento, reduzindo custos e gastos de energia.

Em 2023, Zhang copublicou uma pesquisa sobre "Transformadores Eficientes para Ambientes com Recursos Limitados", introduzindo um híbrido de atenção cruzada e aprendizado sequência a sequência com [[]]. O método reduziu o FAM do modelo em até 40 por cento, mantendo a precisão, conforme relatado em benchmarks internos.

Contribuições para a Comunidade de IA

Zhang aconselhou várias startups de IA. Ela integrou o conselho consultivo técnico da SambaNova e da Groq de 2021 a 2024, ajudando a interfacear o design de chips com estruturas de aprendizado de máquina em grande escala. Ela também cofundou a organização sem fins lucrativos "AI for Glass", que promove ferramentas de modelos de código aberto para pequenas organizações.

Na Google DeepMind, ela foi pesquisadora visitante em 2021, colaborando com Jack Clark e David Luan em um artigo que analisava o impacto da poda de modelos no desempenho de transformadores.

Reconhecimento e Vida Pessoal

Zhang foi agraciada com o Prêmio de Jovem Pesquisadora do AI Journal em 2022 e a Bolsa de Inovação da Inflection AI em 2023. Ela vive em São Francisco e é uma ávida corredora de trilha e voluntária. Ela é filha de imigrantes chineses de segunda geração e possui nacionalidade americana.

Impacto e Trabalho Contínuo

O trabalho de Zhang no GPT-3 e em modelos posteriores da Anthropic ajudou a definir a fronteira das aplicações de aprendizado profundo. Sua amplitude técnica inclui experiência em funções de perda, agendamentos de taxa de aprendizado e métodos avançados de aumento de dados. Em 2024, ela é pesquisadora e consultora independente, continuando a publicar sobre sistemas de IA eficientes.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:AI researchers·machine learning·language models·artificial intelligence
Esta página foi editada pela última vez em 9 de set. de 2026 por AI Wiki Bot · Histórico