Yinfei Yang ist ein Informatiker und Forschungswissenschaftler bei Google, bekannt für seine Mitautorenschaft an BERT, einem auf Transformer (architecture) basierenden Modell, das das Repräsentationslernen in der Verarbeitung natürlicher Sprache vorangebracht hat. Seine Forschungsinteressen umfassen natürliche Sprachgenerierung, Sequence-to-Sequence (Seq2Seq)-Modellierung und Machine learning. Er hat sowohl zu den theoretischen Grundlagen als auch zu den praktischen Anwendungen von Artificial intelligence im Sprachverständnis beigetragen.
Karriere und Forschung
Yang arbeitet bei Google Research, wo er sich auf das Verständnis und die Generierung natürlicher Sprache konzentriert hat. Er war Mitautor des Papiers von 2018, das BERT einführte, das zu einem grundlegenden Modell für große Sprachmodelle wurde. Weitere bemerkenswerte Arbeiten umfassen den Universal Sentence Encoder, ein Modell zum Lernen von Satzeinbettungen, das in Produktionssystemen weit verbreitet ist. Er hat auch zur Forschung an Textgenerierung beigetragen, einschließlich Arbeiten zu Encoder-Decoder Architecture-Architekturen und Multi-Head Attention-Mechanismen. Seine Forschung beinhaltet oft neuronale Netze, die in großem Maßstab trainiert werden.
BERT und bidirektionales Repräsentationslernen
BERT, kurz für Bidirectional Encoder Representations from Transformers, wurde in dem 2018 veröffentlichten Papier "BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding" eingeführt. Das Modell verwendet einen Transformer-Encoder mit Positionskodierungen, Schichtnormalisierung, Residualverbindungen und Dropout während des Trainings. Es wurde auf einem großen Korpus mit maskierter Sprachmodellierung und Zielen zur Vorhersage des nächsten Satzes vortrainiert. BERT-base enthält 110 Millionen Parameter, während BERT-large 340 Millionen Parameter enthält. Das Modell erzielte state-of-the-art Ergebnisse bei mehreren Benchmarks zur Verarbeitung natürlicher Sprache, einschließlich des GLUE-Scores und der SQuAD-Fragebeantwortungsaufgabe. Sein bidirektionaler Trainingsansatz ermöglichte es, Kontext aus beiden Richtungen zu erfassen, was die Leistung bei Aufgaben verbesserte, die das Verständnis von Wortbeziehungen erfordern. Das Training solcher Modelle erforderte sorgfältiges Lernraten-Scheduling und die Verwendung des Adam-Optimierers.
Universal Sentence Encoder
Yang war Mitautor des Universal Sentence Encoder, eines Modells, das Sätze auf Vektoren fester Länge abbildet. Das Modell basiert auf einer Transformer-Architektur und wurde mit einer Vielzahl von Datenquellen trainiert, darunter Webnachrichten, Frage-Antwort-Seiten und Diskussionsforen. Es unterstützt Transferlernen für Aufgaben wie semantische Ähnlichkeit, Textklassifikation und Clustering. Der Universal Sentence Encoder wurde als Werkzeug für Entwickler und Forscher veröffentlicht und ermöglicht effiziente Satzrepräsentationen ohne die Notwendigkeit eines aufgabenspezifischen Trainings. Diese Arbeit war einflussreich im Bereich der Satzeinbettung und semantischen Suche.
Natürliche Sprachgenerierung und Auswirkungen
Yangs Beiträge zur natürlichen Sprachgenerierung umfassen Arbeiten zu Sequence-to-Sequence-Modellen und Techniken zur Erzeugung kohärenter und kontextrelevanter Texte. In diesem Bereich werden Dekodierungsstrategien wie Beamsuche häufig verwendet, um die Ausgabequalität zu verbessern. Seine Arbeit wurde auf Aufgaben wie Zusammenfassung, Dialogsysteme und Fragebeantwortung angewendet. Die von ihm mitentwickelten Methoden des Repräsentationslernens, insbesondere BERT, hatten einen nachhaltigen Einfluss auf das Feld. Sie ermöglichten ein effektiveres Feintuning für nachgelagerte Aufgaben und dienten als Bausteine für nachfolgende große Sprachmodelle und generative KI-Systeme. Seine Arbeit an Satzeinbettungen beeinflusste auch Ansätze zur semantischen Textähnlichkeit und zum Abruf.