Hannaneh Hajishirzi es profesora en la Paul G. Allen School of Computer Science & Engineering de la Universidad de Washington y directora sénior de investigación en el Allen Institute for Artificial Intelligence (AI2). Su investigación se centra en el procesamiento del lenguaje natural, los grandes modelos de lenguaje y el razonamiento automático, con contribuciones en respuesta a preguntas, análisis semántico y arquitecturas de modelos eficientes.
Hajishirzi obtuvo su doctorado en ciencias de la computación en la Universidad de Illinois en Urbana-Champaign en 2010, donde trabajó en algoritmos para problemas basados en grafos y comprensión del lenguaje natural. Luego completó una investigación posdoctoral en la Universidad de Washington antes de unirse a la facultad allí en 2014. En AI2, lidera el equipo Mosaic, que desarrolla modelos de lenguaje de código abierto y herramientas para el razonamiento científico.
Primeros años y educación
Hajishirzi recibió su licenciatura en ingeniería informática de la Universidad de Tecnología de Sharif en Teherán, Irán, en 2003. Se mudó a los Estados Unidos para realizar estudios de posgrado, obteniendo una maestría en la Universidad de Illinois en 2006 y un doctorado en 2010. Su tesis doctoral abordó la optimización combinatoria en el procesamiento del lenguaje natural, aplicando métodos de redes neuronales al etiquetado de roles semánticos y la resolución de correferencias.
Después de su doctorado, se unió a la Universidad de Washington como becaria posdoctoral, colaborando con investigadores en enfoques de aprendizaje automático para la comprensión de textos. En 2014, se convirtió en profesora asistente, recibiendo más tarde la titularidad y el ascenso a profesora asociada en 2020, y a profesora titular en 2024.
Contribuciones de investigación
El trabajo de Hajishirzi abarca varias áreas del PLN. Co-desarrolló la arquitectura basada en Transformer conocida como Longformer, que extiende los mecanismos de atención para manejar documentos largos de manera eficiente. Este modelo, presentado en 2020, permite procesar textos de hasta miles de tokens, abordando una limitación clave de los transformers estándar.
También contribuyó al desarrollo del modelo UnifiedQA, un sistema de respuesta a preguntas entrenado en múltiples conjuntos de datos para generalizar entre formatos. Su equipo en AI2 creó la serie Tulu de grandes modelos de lenguaje de código abierto, diseñados para el ajuste de instrucciones y tareas de razonamiento. Estos modelos han sido ampliamente utilizados en la investigación académica y aplicaciones industriales.
Hajishirzi ha publicado más de 100 artículos en conferencias destacadas como ACL, EMNLP y NeurIPS. Su investigación sobre análisis semántico y razonamiento sobre grafos de conocimiento ha influido en cómo los sistemas de IA representan y consultan conocimiento estructurado.
Premios y reconocimientos
En 2021, Hajishirzi recibió un Premio CAREER de la Fundación Nacional de Ciencias por su trabajo en sistemas de PLN robustos e interpretables. Fue nombrada miembro de la Asociación de Lingüística Computacional en 2023, reconociendo sus contribuciones al campo. Su artículo sobre Longformer ganó el Premio al Mejor Artículo en el Taller de Aprendizaje de Representaciones para PLN de 2020.
También ha sido reconocida por su labor de mentoría, recibiendo el Premio a la Enseñanza Distinguida de la Universidad de Washington en 2019. Sus estudiantes han pasado a ocupar puestos en importantes empresas tecnológicas y laboratorios de investigación.
Trabajo actual e impacto
En AI2, Hajishirzi lidera la iniciativa Mosaic, que se centra en construir modelos de lenguaje eficientes y transparentes. El equipo lanzó la serie OLMo (Open Language Model) en 2024, proporcionando modelos completamente de código abierto con datos de entrenamiento y código. Este esfuerzo tiene como objetivo democratizar el acceso a la tecnología de grandes modelos de lenguaje, en contraste con los sistemas propietarios de empresas como OpenAI y Google DeepMind.
La investigación de Hajishirzi también aborda la seguridad y evaluación de la IA. Ha desarrollado puntos de referencia para medir las capacidades de razonamiento y la precisión factual en los modelos, contribuyendo a una comprensión más amplia de las limitaciones de la IA generativa. Su trabajo en generación aumentada por recuperación ha mejorado cómo los modelos incorporan conocimiento externo.
Sirve en los consejos editoriales de las principales revistas de PLN y ha organizado varios talleres sobre PLN eficiente. Sus colaboraciones abarcan el ámbito académico y la industria, incluyendo asociaciones con Amazon Web Services e Intel en el diseño de modelos conscientes del hardware.
Publicaciones seleccionadas
- Beltagy, I., Peters, M. E., & Hajishirzi, H. (2020). Longformer: The Long-Document Transformer. Preimpresión de arXiv.
- Khashabi, D., et al. (2020). UnifiedQA: Crossing Format Boundaries With a Single QA System. Findings of EMNLP.
- Groeneveld, D., et al. (2024). OLMo: Accelerating the Science of Language Models. Preimpresión de arXiv.
Su número de citas supera los 20,000, lo que refleja el amplio impacto de su trabajo en la investigación y aplicaciones modernas del PLN.