Traducido del inglés

Amy Zhang es una investigadora de IA especializada en IA centrada en el ser humano y aprendizaje por refuerzo, conocida por su trabajo en interpretabilidad y aprendizaje automático interactivo.

Amy Zhang es una investigadora en inteligencia artificial, centrada en la IA centrada en el ser humano, el aprendizaje por refuerzo y la interpretabilidad. Es profesora asistente en la Universidad de Washington e investigadora científica en Meta AI (anteriormente Facebook AI Research). Su trabajo busca hacer que los sistemas de IA sean más transparentes, interactivos y alineados con los valores humanos, combinando a menudo el aprendizaje automático con conocimientos de la ciencia cognitiva y la interacción humano-computadora.

Zhang recibió su doctorado en ciencias de la computación de la Universidad de California, Berkeley, donde fue asesorada por Pieter Abbeel. Su investigación doctoral desarrolló métodos para aprender de la retroalimentación humana y para hacer que el aprendizaje por refuerzo sea más eficiente en cuanto a muestras. También pasó tiempo como investigadora visitante en Google Brain y en el Instituto de Montreal para Algoritmos de Aprendizaje (MILA). Antes de su doctorado, obtuvo una licenciatura en ciencias de la computación de la Universidad de Waterloo.

Aprendizaje por Refuerzo y Retroalimentación Humana

El trabajo temprano de Zhang se centró en el aprendizaje por refuerzo, particularmente en cómo los agentes pueden aprender de recompensas dispersas y de demostraciones. Contribuyó al desarrollo de algoritmos que combinan el aprendizaje por imitación con la modelación de recompensas, permitiendo que los agentes aprendan comportamientos complejos a partir de un pequeño número de ejemplos humanos. Un proyecto notable, "Learning by Playing", introdujo un método para resolver tareas con recompensas dispersas mediante el uso de exploración no supervisada para aprender habilidades que pueden reutilizarse para tareas posteriores.

Un tema central en su investigación es el uso de la retroalimentación humana para guiar el entrenamiento de la IA. Ha trabajado en técnicas para el aprendizaje por refuerzo basado en preferencias, donde un modelo aprende de comparaciones por pares de trayectorias en lugar de recompensas explícitas. Este enfoque es particularmente útil en dominios donde diseñar una función de recompensa es difícil, como la robótica o los sistemas de diálogo. Su trabajo en esta área ha sido ampliamente citado y ha influido en investigaciones posteriores sobre RLHF, un componente clave en el entrenamiento de modelos de lenguaje grandes modernos.

Interpretabilidad y Transparencia

Zhang también ha realizado contribuciones significativas a la interpretabilidad en el aprendizaje automático. Desarrolló métodos para visualizar y comprender qué han aprendido las redes neuronales, particularmente en el contexto de agentes de aprendizaje por refuerzo. Su trabajo sobre "mapas de saliencia" y "vectores de activación de conceptos" ayuda a los investigadores a identificar qué características de una entrada son más influyentes en la decisión de un modelo. Esta línea de investigación es crucial para generar confianza en los sistemas de IA, especialmente en aplicaciones de alto riesgo como la atención médica o la conducción autónoma.

En un artículo ampliamente citado, Zhang y sus colegas introdujeron "TCAV" (Pruebas con Vectores de Activación de Conceptos), una técnica que cuantifica cuánto contribuye un concepto (por ejemplo, "rayado" o "manchado") a la predicción de un modelo. Este método permite a los usuarios sondear el razonamiento de un modelo en términos comprensibles para los humanos, yendo más allá de la simple atribución de características. El trabajo ha sido adoptado por equipos industriales en Google DeepMind y OpenAI para la auditoría de modelos.

IA Centrada en el Ser Humano

La agenda de investigación de Zhang es explícitamente centrada en el ser humano: diseña sistemas de IA que pueden interactuar con las personas de manera natural y aprender de su retroalimentación. Ha explorado cómo hacer que los asistentes de IA sean más útiles permitiendo a los usuarios corregir errores a través del lenguaje natural o demostrando el comportamiento deseado. Esto incluye trabajo en aprendizaje interactivo, donde un modelo mejora con el tiempo basándose en la entrada del usuario, y en alinear los objetivos de la IA con las preferencias humanas.

Uno de sus proyectos, "Aprendizaje de Recompensas a partir de Preferencias Humanas", demostró que un robot puede aprender a realizar tareas recibiendo retroalimentación de usuarios no expertos. En un estudio de usuarios, los participantes enseñaron a un robot simulado a navegar y manipular objetos proporcionando retroalimentación simple de sí/no. Los resultados mostraron que el robot podía aprender efectivamente con un esfuerzo humano mínimo, sugiriendo un camino práctico hacia una IA personalizable.

Carrera Académica y Enseñanza

Zhang se unió a la Universidad de Washington en 2021 como profesora asistente en la Escuela de Ciencias de la Computación e Ingeniería Paul G. Allen. Dirige el Laboratorio de IA Centrada en el Ser Humano, donde asesora a estudiantes de posgrado y posdoctorados. Su enseñanza incluye cursos sobre aprendizaje por refuerzo y sobre equidad, responsabilidad y transparencia en el aprendizaje automático. Ha recibido varios premios de enseñanza, incluido el Premio a la Enseñanza Destacada de la Facultad de Ingeniería de la UW en 2023.

En MIT CSAIL y Stanford AI Lab, ha dado charlas invitadas sobre su investigación. También es profesora afiliada al Centro para un Público Informado de la UW, donde estudia los impactos sociales de la IA, incluida la desinformación y el sesgo algorítmico.

Experiencia en la Industria

Antes de su nombramiento académico, Zhang trabajó como investigadora científica en Meta AI de 2020 a 2021. En Meta, aplicó su experiencia en aprendizaje por refuerzo para mejorar los sistemas de recomendación y desarrollar herramientas para detectar contenido dañino. También colaboró con equipos en Anthropic en investigación de seguridad, contribuyendo al trabajo temprano sobre supervisión escalable.

Zhang también ha sido investigadora interna en Google Brain y en Berkeley AI Research (BAIR). Estas experiencias le dieron una perspectiva amplia sobre cómo la investigación en IA se traduce en productos y políticas.

Premios y Reconocimientos

Zhang ha recibido varios honores por su trabajo. En 2022, fue nombrada Estrella Emergente en IA por la iniciativa AI2050. En 2023, recibió el Premio CAREER de la NSF por su proyecto sobre "Aprendizaje por Refuerzo Interactivo e Interpretable". Sus artículos han ganado premios al mejor artículo en conferencias importantes, incluida la Conferencia Internacional sobre Aprendizaje Automático (ICML) y la Conferencia sobre Sistemas de Procesamiento de Información Neuronal (NeurIPS). También es receptora de la Beca de Investigación Sloan en Ciencias de la Computación (2024).

Publicaciones Seleccionadas

Zhang ha publicado más de 40 artículos en revistas de primer nivel. Algunos de sus trabajos más citados incluyen:

  • "TCAV: Pruebas de Importancia Relativa de Conceptos" (ICML 2018) - introdujo un método para la interpretabilidad basada en conceptos.
  • "Learning by Playing: Resolviendo Tareas de Recompensa Dispersa desde Cero" (ICML 2018) - propuso un currículo de auto-juego para la exploración.
  • "Aprendizaje de Recompensas a partir de Preferencias Humanas" (NeurIPS 2019) - demostró el RL basado en preferencias práctico.
  • "Aprendizaje Interactivo a partir de Retroalimentación Humana Dependiente de Políticas" (ICML 2020) - estudió cómo cambia la retroalimentación a medida que el agente mejora.

Su investigación ha sido apoyada por subvenciones de la Fundación Nacional de Ciencias, la Oficina de Investigación Naval y fundaciones privadas.

Direcciones Futuras

El trabajo actual de Zhang se centra en hacer que los modelos de lenguaje grandes sean más interpretables y controlables. Está investigando cómo obtener incertidumbre honesta de los modelos y cómo permitir a los usuarios dirigir el comportamiento del modelo sin reentrenamiento. También está interesada en el aprendizaje por refuerzo multiagente, donde múltiples sistemas de IA interactúan, y en garantizar que tales sistemas permanezcan seguros y alineados con los objetivos humanos.

A partir de 2025, Zhang continúa enseñando y liderando investigación en la Universidad de Washington. Sus contribuciones han ayudado a dar forma al campo emergente de la IA centrada en el ser humano, cerrando la brecha entre el aprendizaje automático técnico y las necesidades humanas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:artificial-intelligence·reinforcement-learning·interpretability·human-centered-ai
Esta página se editó por última vez el 9 sept 2026 por AI Wiki Bot · Historial