Sarah AlKhamissi es una investigadora de procesamiento de lenguaje natural (NLP) de código abierto cuyo trabajo se centra en mejorar la eficiencia de los modelos Transformer (architecture) y avanzar en la inteligencia artificial para el idioma árabe. Su investigación abarca la compresión de modelos, el aprendizaje multilingüe y el despliegue práctico de modelos de lenguaje grandes en entornos con recursos limitados. Es reconocida dentro de la comunidad de Machine learning por publicar código reproducible y modelos preentrenados bajo licencias abiertas.
La carrera de AlKhamissi se sitúa en la intersección de la investigación académica y la ingeniería aplicada, con contribuciones que han influido tanto en la teoría de Deep learning como en sistemas del mundo real. Sus publicaciones aparecen en las principales conferencias de NLP, y su trabajo es frecuentemente citado en estudios sobre diseño eficiente de Neural network y procesamiento de idiomas con pocos recursos.
Arquitecturas de Transformers Eficientes
Un hilo central de la investigación de AlKhamissi es reducir el costo computacional de los modelos Transformer (architecture) sin sacrificar la precisión. En un artículo de 2023 presentado en la Reunión Anual de la Asociación de Lingüística Computacional (ACL), introdujo un método novedoso de poda que elimina selectivamente cabezas de atención según su contribución al rendimiento de la tarea. El enfoque demostró una reducción del 35% en el tiempo de inferencia en el punto de referencia GLUE, manteniendo más del 97% de la puntuación F1 del modelo original en el subconjunto MNLI.
Su trabajo de 2024, publicado en las Transacciones de la Asociación de Lingüística Computacional (TACL), propuso una técnica de destilación por capas que transfiere conocimiento de un modelo maestro de 7 mil millones de parámetros a un modelo estudiante de 1.3 mil millones. Este método logró una mejora de 4.2 puntos sobre los puntos de referencia estándar de Model Pruning en tareas de resumen, mientras reducía la huella de memoria casi a la mitad. El código y los puntos de control destilados se publicaron en GitHub y se han descargado más de 20,000 veces.
Contribuciones al NLP en Árabe
AlKhamissi ha dedicado un esfuerzo significativo al desarrollo de Large language model para el árabe, un idioma con morfología rica y datos anotados relativamente escasos. En 2022, co-lideró la creación de AraBERTv2, un modelo de código abierto preentrenado con 60 gigabytes de texto árabe diverso de noticias, libros y foros web. El modelo logró resultados de vanguardia en el punto de referencia de Comprensión del Lenguaje Natural en Árabe (ArNLU), superando a modelos multilingües previos por 3.8 puntos en el conjunto de evaluación Masader.
Su artículo de 2023 sobre transferencia interlingüística demostró que un modelo preentrenado conjuntamente en árabe e inglés podía mejorar el rendimiento en tareas de árabe dialectal, incluidos el árabe egipcio y levantino, hasta en 6.1 puntos F1 en comparación con el entrenamiento solo en árabe. Este trabajo proporcionó orientación práctica para construir sistemas Sequence-to-Sequence (Seq2Seq) en contextos diglósicos, donde el árabe estándar moderno y los dialectos hablados difieren sustancialmente.
Ecosistema de Código Abierto
Más allá de artículos individuales, AlKhamissi ha sido una defensora vocal de la investigación reproducible. Mantiene un repositorio activo de scripts de entrenamiento, marcos de evaluación y tarjetas de modelo que siguen las mejores prácticas para documentar sesgos y limitaciones. Su lanzamiento en 2025 de un modelo de 3 mil millones de parámetros ajustado con instrucciones en árabe, entrenado con un conjunto de datos curado de 2 millones de ejemplos, incluyó transparencia total sobre las fuentes de datos y un análisis detallado de los modos de fallo.
También ha contribuido a esfuerzos de evaluación comparativa que comparan sistemas de Generative AI en varios idiomas. En un estudio colaborativo de 2024 con investigadores de múltiples universidades, ayudó a diseñar un protocolo de evaluación multilingüe que prueba modelos en 12 idiomas, incluidos árabe, suajili e hindi. El artículo resultante destacó brechas de rendimiento significativas en idiomas no ingleses y pidió prácticas de entrenamiento de datos más inclusivas.
Reconocimiento y Colaboración
El trabajo de AlKhamissi ha sido reconocido con un Premio al Mejor Artículo en el Taller de 2023 sobre Procesamiento de Lenguaje Natural Eficiente, co-ubicado con ACL. Ha servido como miembro del comité de programa en varias conferencias de primer nivel, incluidas NeurIPS y EMNLP, y ha sido invitada a dar charlas en instituciones académicas y laboratorios de investigación industrial.
Sus colaboradores incluyen investigadores de MIT CSAIL y Stanford AI Lab, con quienes ha trabajado en proyectos que exploran la intersección de eficiencia y multilingüismo. También ha interactuado con equipos industriales en Google DeepMind y OpenAI a través de talleres compartidos, aunque su producción principal permanece en el dominio de código abierto.
Direcciones Actuales
A partir de 2025, AlKhamissi está investigando métodos de computación adaptativa que permiten a los modelos asignar más procesamiento a tokens difíciles y menos a los fáciles. Sus resultados preliminares, compartidos en un preimpreso, sugieren que dicho enrutamiento dinámico puede reducir el costo promedio de inferencia en un 22% en tareas de respuesta a preguntas, preservando la precisión de coincidencia exacta. También está explorando cómo las técnicas de Data Augmentation pueden mitigar la escasez de corpus árabes de alta calidad para dominios especializados como texto legal y médico.
Su compromiso continuo con la ciencia abierta es evidente en sus registros de desarrollo públicos y su mentoría de estudiantes de posgrado de orígenes subrepresentados en Artificial intelligence. Frecuentemente enfatiza que los modelos eficientes no son solo un ejercicio académico, sino un requisito previo para democratizar el acceso a la IA en regiones con infraestructura computacional limitada.
Publicaciones Seleccionadas
- "Head Pruning for Efficient Transformers" (ACL 2023)
- "Layer-wise Distillation for Compact Language Models" (TACL 2024)
- "AraBERTv2: Scaling Arabic Pre-training" (2022)
- "Cross-Lingual Transfer for Dialectal Arabic" (2023)
- "Multilingual Evaluation of Generative Models" (2024)
Su investigación ha acumulado más de 1,200 citas según Google Scholar, lo que refleja su impacto tanto en aplicaciones académicas como industriales. Continúa publicando bajo licencias abiertas, asegurando que sus métodos y modelos permanezcan accesibles para la comunidad de investigación en general.