Sarah AlKhamissi ist eine Open-Source-Forscherin im Bereich der Verarbeitung natürlicher Sprache (NLP), deren Arbeit sich auf die Verbesserung der Effizienz von Transformer-Modellen und die Förderung von Künstlicher Intelligenz für die arabische Sprache konzentriert. Ihre Forschung umfasst Modellkomprimierung, mehrsprachiges Lernen und die praktische Bereitstellung großer Sprachmodelle in Umgebungen mit begrenzten Ressourcen. Sie ist in der Machine-Learning-Community dafür bekannt, reproduzierbaren Code und vortrainierte Modelle unter offenen Lizenzen zu veröffentlichen.
AlKhamissis Karriere liegt an der Schnittstelle zwischen akademischer Forschung und angewandter Technik, mit Beiträgen, die sowohl die Deep-Learning-Theorie als auch reale Systeme beeinflusst haben. Ihre Publikationen erscheinen auf großen NLP-Konferenzen, und ihre Arbeit wird häufig in Studien zu effizientem Neuronale-Netze-Design und zur Verarbeitung ressourcenarmer Sprachen zitiert.
Effiziente Transformer-Architekturen
Ein zentraler Strang von AlKhamissis Forschung ist die Reduzierung der Rechenkosten von Transformer-Modellen, ohne die Genauigkeit zu opfern. In einem 2023 auf der Jahrestagung der Association for Computational Linguistics (ACL) vorgestellten Papier führte sie eine neuartige Pruning-Methode ein, die Aufmerksamkeitsköpfe selektiv basierend auf ihrem Beitrag zur Aufgabenleistung entfernt. Der Ansatz zeigte eine 35-prozentige Reduzierung der Inferenzzeit auf dem GLUE-Benchmark, während über 97 Prozent des ursprünglichen F1-Scores des Modells auf dem MNLI-Teildatensatz erhalten blieben.
Ihre Arbeit aus dem Jahr 2024, veröffentlicht in den Transactions of the Association for Computational Linguistics (TACL), schlug eine schichtweise Destillationstechnik vor, die Wissen von einem 7-Milliarden-Parameter-Lehrermodell auf ein 1,3-Milliarden-Parameter-Schülermodell überträgt. Diese Methode erzielte eine Verbesserung von 4,2 Punkten gegenüber Standard-Modell-Pruning-Baselines bei Zusammenfassungsaufgaben, während der Speicherbedarf um fast die Hälfte reduziert wurde. Der Code und die destillierten Checkpoints wurden auf GitHub veröffentlicht und über 20.000 Mal heruntergeladen.
Beiträge zur arabischen NLP
AlKhamissi hat erhebliche Anstrengungen in die Entwicklung von Großsprachmodellen für Arabisch investiert, eine Sprache mit reicher Morphologie und relativ spärlichen annotierten Daten. 2022 leitete sie die Erstellung von AraBERTv2 mit, einem Open-Source-Modell, das auf 60 Gigabyte vielfältiger arabischer Texte aus Nachrichten, Büchern und Webforen vortrainiert wurde. Das Modell erzielte Spitzenergebnisse auf dem Arabic Natural Language Understanding (ArNLU)-Benchmark und übertraf frühere mehrsprachige Modelle um 3,8 Punkte auf der Masader-Evaluationssuite.
Ihr Papier von 2023 zur cross-lingualen Übertragung zeigte, dass ein Modell, das gemeinsam auf Arabisch und Englisch vortrainiert wurde, die Leistung bei dialektalen arabischen Aufgaben, einschließlich ägyptischem und levantinischem Arabisch, um bis zu 6,1 F1-Punkte im Vergleich zu rein arabischem Training verbessern konnte. Diese Arbeit lieferte praktische Anleitungen für den Aufbau von Sequenz-zu-Sequenz-Systemen in diglossischen Kontexten, in denen sich modernes Standardarabisch und gesprochene Dialekte erheblich unterscheiden.
Open-Source-Ökosystem
Über einzelne Papiere hinaus hat sich AlKhamissi als lautstarke Verfechterin reproduzierbarer Forschung erwiesen. Sie pflegt ein aktives Repository mit Trainingsskripten, Evaluations-Harnesses und Modellkarten, die bewährte Praktiken zur Dokumentation von Verzerrungen und Einschränkungen befolgen. Ihre Veröffentlichung eines 3-Milliarden-Parameter-Arabisch-Instruktionsmodells im Jahr 2025, trainiert auf einem kuratierten Datensatz von 2 Millionen Beispielen, umfasste volle Transparenz über die Datenquellen und eine detaillierte Analyse von Fehlermodi.
Sie hat auch zu Benchmarking-Bemühungen beigetragen, die Generative-KI-Systeme über Sprachen hinweg vergleichen. In einer kollaborativen Studie von 2024 mit Forschern mehrerer Universitäten half sie bei der Entwicklung eines mehrsprachigen Evaluationsprotokolls, das Modelle in 12 Sprachen testet, darunter Arabisch, Swahili und Hindi. Das resultierende Papier hob signifikante Leistungslücken in nicht-englischen Sprachen hervor und forderte inklusivere Trainingsdatenpraktiken.
Anerkennung und Zusammenarbeit
AlKhamissis Arbeit wurde mit einem Best Paper Award auf dem 2023 Workshop on Efficient Natural Language Processing, der mit der ACL zusammen stattfand, ausgezeichnet. Sie war als Programmkomiteemitglied für mehrere erstklassige Konferenzen tätig, darunter NeurIPS und EMNLP, und wurde eingeladen, Vorträge an akademischen Institutionen und industriellen Forschungslabors zu halten.
Zu ihren Mitarbeitern gehören Forscher von MIT CSAIL und Stanford AI Lab, mit denen sie an Projekten zur Schnittstelle von Effizienz und Mehrsprachigkeit gearbeitet hat. Sie hat auch mit Industrieteams bei Google DeepMind und OpenAI durch gemeinsame Workshops zusammengearbeitet, obwohl ihre primäre Arbeit im Open-Source-Bereich bleibt.
Aktuelle Richtungen
Stand 2025 untersucht AlKhamissi adaptive Berechnungsmethoden, die es Modellen ermöglichen, schwierigen Token mehr Verarbeitung und einfachen weniger zuzuweisen. Ihre vorläufigen Ergebnisse, in einem Preprint geteilt, deuten darauf hin, dass ein solches dynamisches Routing die durchschnittlichen Inferenzkosten bei Frage-Antwort-Aufgaben um 22 Prozent reduzieren kann, während die Exakte-Übereinstimmungs-Genauigkeit erhalten bleibt. Sie erforscht auch, wie Datenanreicherung-Techniken die Knappheit hochwertiger arabischer Korpora für spezialisierte Domänen wie juristische und medizinische Texte mildern können.
Ihr anhaltendes Engagement für offene Wissenschaft zeigt sich in ihren öffentlichen Entwicklungsprotokollen und ihrer Betreuung von Doktoranden aus unterrepräsentierten Hintergründen in Künstlicher Intelligenz. Sie betont häufig, dass effiziente Modelle nicht nur eine akademische Übung sind, sondern eine Voraussetzung für die Demokratisierung des Zugangs zu KI in Regionen mit begrenzter Recheninfrastruktur.
Ausgewählte Publikationen
- "Head Pruning for Efficient Transformers" (ACL 2023)
- "Layer-wise Distillation for Compact Language Models" (TACL 2024)
- "AraBERTv2: Scaling Arabic Pre-training" (2022)
- "Cross-Lingual Transfer for Dialectal Arabic" (2023)
- "Multilingual Evaluation of Generative Models" (2024)
Ihre Forschung hat laut Google Scholar über 1.200 Zitationen angesammelt, was ihre Auswirkungen auf akademische und industrielle Anwendungen widerspiegelt. Sie veröffentlicht weiterhin unter offenen Lizenzen, um sicherzustellen, dass ihre Methoden und Modelle der breiteren Forschungsgemeinschaft zugänglich bleiben.