Naman Goyal ist ein Informatiker und Forscher auf dem Gebiet der künstlichen Intelligenz. Bekannt wurde er vor allem als Mitautor von BART, einem Denoising-Autoencoder für das Vortraining von Sequenz-zu-Sequenz-Modellen, sowie durch seine Beiträge zu Fairseq, einer weit verbreiteten Open-Source-Bibliothek für Deep Learning. Seine Arbeit hat die Entwicklung moderner Large Language Models beeinflusst.
Goyals Forschung ist im Bereich des maschinellen Lernens angesiedelt, insbesondere in Bezug auf Sequenz-zu-Sequenz-Lernen und Vortraining. Seine Beiträge verbinden grundlegende Architekturen mit praktischen Werkzeugen für das Training großer Modelle.
BART und Vortraining
Goyal war Teil des Teams, das BART im Jahr 2019 veröffentlichte. Die BART-Architektur kombiniert einen bidirektionalen Encoder mit einem autoregressiven Decoder und nutzt ein Denoising-Ziel, um auf korrupten Texten vortrainiert zu werden. Dieser Ansatz ermöglichte es dem Modell, qualitativ hochwertige Ausgaben für Aufgaben wie Zusammenfassung und Übersetzung zu erzeugen. Das Papier stellte das Modell mit bis zu 400 Millionen Parametern vor, und es erreichte Spitzenergebnisse bei mehreren Benchmarks, darunter der Stanford Question Answering Dataset und GLUE.
BART war ein bedeutender Schritt im Vortraining, da es Ideen früherer Modelle wie BERT und GPT vereinte und erweiterte. Anstatt nur ein standardmäßiges Sprachmodellziel zu verwenden, korrumpierte BART Texte mit verschiedenen Rauschfunktionen, einschließlich Token-Maskierung und Permutation der Reihenfolge. Goyals Rolle trug zum empirischen Erfolg des Ansatzes bei, der zeigte, dass Sequenz-zu-Sequenz-Vortraining ebenso effektiv sein kann wie reine Encoder- oder Decoder-Modelle.
Fairseq-Toolkit
Parallel dazu trug Goyal zu Fairseq bei, einer Softwarebibliothek, die bei Meta AI (ehemals Facebook AI Research) entwickelt wurde. Fairseq unterstützt das Training von Modellen für Übersetzung, Zusammenfassung und andere Sequenzaufgaben. Es verwendet PyTorch und bietet effiziente Implementierungen für Transformer und andere Architekturen. Die Bibliothek wurde als Open Source veröffentlicht und in der akademischen Welt sowie in anderen Labors weitgehend übernommen.
Fairseq führte Techniken wie Gewichtsinitialisierung, Schichtnormalisierung und Lernratenpläne ein, die das Training tiefer Netzwerke stabiler machten. Goyals Beteiligung an Fairseq half bei der technischen Umsetzung und den Experimenten, was dazu führte, dass es zu einem Standardwerkzeug für die Forschung wurde.
Beiträge zur Skalierung von Modellen
In verwandten Arbeiten untersuchte Goyal Themen wie Gradienten-Clipping und Top-p-Sampling. Er beteiligte sich auch an Forschung zu Skalierung und Training mit großen Batches, die die Herangehensweise von Praktikern an das Vortraining beeinflusste. Beispielsweise zeigte eine Arbeit aus dem frühen Jahr 2020 zu Modellskalierungsgesetzen für neuronale Sprachmodelle, dass Rechenleistung, Daten und Parameter im Gleichgewicht sein müssen; diese Forschungsrichtung beeinflusste das Design großer Modelle.
Goyal gehörte auch zu den Forschern, die den Natural Questions-Datensatz über die Gemeinschaft veröffentlichten, obwohl andere Forscher die Zuordnung verwalteten. Viele seiner Veröffentlichungen wurden jedoch später in der Literatur zum Deep Learning zitiert.
Auswirkungen
Seine Arbeit an BART und Fairseq half, eine Grundlage für bedingte Generierung durch Übersetzung zu schaffen. Die Modelle beeinflussten auch das Design von Text-zu-Sprache-Systemen und die Forschung zu effizienterem Training.
Das Vermächtnis setzt sich in späteren Veröffentlichungen und unzähligen Trainings fort. Ab 2024 ist BART ein Standardmodell in mehreren Bibliotheken. Goyals Beiträge wurden durch Zitierzahlen und Teilnahme an führenden Konferenzen anerkannt. Er hat auch mit Forschern wie Yann Lecun und Mikel Artetxe zusammengearbeitet.