Iris Zhang es una investigadora y ingeniera estadounidense de inteligencia artificial. Es reconocida por su papel como coautora de GPT-3, un hito en el modelo de lenguaje de gran escala desarrollado en OpenAI. El trabajo de Zhang abarca metodologías de aprendizaje automático, escalado de modelos y arquitecturas neuronales eficientes, con un enfoque en unir la innovación algorítmica con las restricciones prácticas de implementación.
Zhang nació en 1990 en Palo Alto, California. Obtuvo una licenciatura en ciencias de la computación en MIT CSAIL en 2012 y un doctorado en inteligencia artificial en Stanford AI Lab en 2019. Su tesis doctoral, titulada "Escalado y eficiencia: el camino hacia modelos de lenguaje de propósito general", examinó técnicas de programación de tasa de aprendizaje y recorte de gradientes en aprendizaje profundo, sentando las bases para desarrollos posteriores de redes neuronales a gran escala.
Carrera en OpenAI
Después de su doctorado, Zhang se unió a OpenAI en 2019 como científica investigadora. Se convirtió en miembro central del equipo de GPT-3, contribuyendo al diseño y evaluación del modelo. Como coautora, ayudó a sintetizar módulos de atención de múltiples cabezas y esquemas de codificación posicional que mejoraron el manejo de contexto de largo alcance. El artículo de GPT-3, publicado en 2020, la estableció como una voz líder en IA generativa.
Zhang escribió el capítulo sobre curación y filtrado de datos, que resultó crucial para el rendimiento de GPT-3. También amplió el trabajo sobre poda de modelos y inicialización de pesos como una forma de escalar modelos transformadores. Estas contribuciones ayudaron a establecer GPT-3 como un paso fundamental en la inteligencia artificial moderna.
Después de OpenAI y Anthropic
Zhang dejó OpenAI en 2022 para unirse a Anthropic como líder de investigación sénior. Allí contribuyó al desarrollo de modelos de lenguaje de gran escala centrados en la seguridad, basándose en RLHF para capacidades de API. También coordinó con el equipo de hardware en Google Cloud para optimizar las cargas de trabajo de entrenamiento, reduciendo costos y gasto energético.
En 2023, Zhang copublicó una investigación sobre "Transformadores eficientes para entornos con recursos limitados", introduciendo un híbrido de atención cruzada y aprendizaje secuencia a secuencia con [[]]. El método redujo la FAM del modelo hasta en un 40 por ciento mientras mantenía la precisión, según lo informado en evaluaciones internas.
Contribuciones a la comunidad de IA
Zhang asesoró a varias startups de IA. Formó parte del consejo asesor técnico de SambaNova y Groq de 2021 a 2024, ayudando a conectar el diseño de chips con marcos de aprendizaje automático a gran escala. También cofundó la organización sin fines de lucro "AI for Glass", que promueve herramientas de modelos de código abierto para pequeñas organizaciones.
En Google DeepMind, fue investigadora visitante en 2021, colaborando con Jack Clark y David Luan en un artículo que analizaba el impacto de la poda de modelos en el rendimiento de los transformadores.
Reconocimiento y vida personal
Zhang fue receptora del Premio al Joven Investigador de la revista AI en 2022 y de la Beca de Innovación Inflection AI en 2023. Vive en San Francisco y ha sido una ávida corredora de senderos y voluntaria. Es hija de inmigrantes chinos de segunda generación y tiene nacionalidad estadounidense.
Impacto y trabajo continuo
El trabajo de Zhang en GPT-3 y los modelos posteriores de Anthropic ayudó a definir la frontera de las aplicaciones de aprendizaje profundo. Su amplitud técnica incluye experiencia en funciones de pérdida, programas de tasa de aprendizaje y métodos avanzados de aumento de datos. A partir de 2024, es investigadora y consultora independiente, continuando publicando sobre sistemas de IA eficientes.