Beispielbasierte maschinelle Übersetzung (EBMT) ist eine Methode der maschinellen Übersetzung, die auf einem zweisprachigen Korpus paralleler Texte als ihrer wichtigsten Wissensbasis zur Laufzeit beruht. Sie ist im Wesentlichen eine Übersetzung durch Analogie und kann als eine Implementierung eines fallbasierten Reasoning-Ansatzes für maschinelles Lernen betrachtet werden. Im Gegensatz zu regelbasierten Systemen, die eine tiefe linguistische Analyse erfordern, übersetzt EBMT, indem sie einen Quellsatz in Phrasen zerlegt, diese Phrasen mithilfe von Beispielen aus dem Korpus übersetzt und die übersetzten Fragmente dann zu einem Zielsatz zusammensetzt.
Der Ansatz wurde erstmals 1984 von Makoto Nagao vorgeschlagen, der argumentierte, dass er besonders für die Übersetzung zwischen zwei sehr unterschiedlichen Sprachen wie Englisch und Japanisch geeignet ist. In solchen Fällen kann ein einzelner Satz auf mehrere gut strukturierte Sätze in der Zielsprache abgebildet werden, was eine tiefe linguistische Analyse weniger nützlich macht. EBMT wurde seitdem als Alternative zu statistischen und regelbasierten Methoden untersucht und teilt mit der statistischen maschinellen Übersetzung die Nutzung zweisprachiger Korpora.
Übersetzung durch Analogie
Das Kernprinzip von EBMT ist die Übersetzung durch Analogie. Diese Idee lehnt die Vorstellung ab, dass menschliche Übersetzer eine tiefe linguistische Analyse jedes Satzes durchführen. Stattdessen nimmt sie an, dass Übersetzer einen Satz in Phrasen zerlegen, jede Phrase durch Analogie zu zuvor gesehenen Übersetzungen übersetzen und die übersetzten Phrasen dann zu einem kohärenten Ganzen zusammensetzen. In EBMT wird dieses Prinzip durch die im Trainingskorpus gespeicherten Beispielübersetzungen kodiert. Das System ruft analoge Beispiele aus dem Korpus ab, um die Übersetzung neuer Eingaben zu leiten.
Geschichte und Entwicklung
Makoto Nagao führte EBMT 1984 ein und hob dessen Potenzial für Sprachpaare mit sehr unterschiedlichen Strukturen wie Englisch und Japanisch hervor. Seine Einsicht war, dass für solche Paare ein Satz oft als mehrere gut strukturierte Sätze in der Zielsprache wiedergegeben werden kann, was eine tiefe linguistische Analyse weniger effektiv macht als beispielbasierte Methoden. In den folgenden Jahrzehnten wurde EBMT entwickelt und verfeinert, mit Beiträgen von Forschern wie Michael Carl und Andy Way, die den Band Recent Advances in Example-Based Machine Translation von 2003 herausgaben. Obwohl EBMT in den letzten Jahren weitgehend von neuronalen Netzen-basierten Ansätzen in den Schatten gestellt wurde, beeinflussen seine Ideen zur Nutzung paralleler Korpora und Analogie weiterhin die moderne Forschung zur maschinellen Übersetzung.
Wie EBMT funktioniert
EBMT-Systeme werden auf zweisprachigen parallelen Korpora trainiert, die Satzpaare enthalten, wie zum Beispiel:
- "How much is that red umbrella?" ↔ "Ano akai kasa wa ikura desu ka."
- "How much is that small camera?" ↔ "Ano chiisai kamera wa ikura desu ka."
Aus solchen Minimalpaaren lernt das System Übersetzungseinheiten: Zum Beispiel entspricht "red umbrella" "akai kasa" und "small camera" "chiisai kamera". Diese Einheiten können zusammengesetzt werden, um neuartige Übersetzungen zu erzeugen. Wenn das System beispielsweise Sätze wie "President Kennedy was shot dead during the parade" und "The convict escaped on July 15th" gesehen hat, kann es "The convict was shot dead during the parade" übersetzen, indem es die entsprechenden Teile ersetzt.
Phrasalverben und Subsprachphänomene
EBMT ist besonders gut für Subsprachphänomene wie Phrasalverben geeignet, die stark kontextabhängige Bedeutungen haben. Phrasalverben im Englischen bestehen aus einem Verb, gefolgt von einem Adverb oder einer Präposition (dem Partikel), und ihre Bedeutungen können oft nicht aus den einzelnen Wörtern abgeleitet werden. Zum Beispiel kann das Phrasalverb "put on" "einschalten" bedeuten (wie in "Ram put on the lights") oder "tragen" (wie in "Ram put on a cap"). Im Hindustani entsprechen diese Bedeutungen verschiedenen Verben: "jalana" bzw. "pahenna". EBMT kann solche Mehrdeutigkeiten behandeln, indem es Beispiele abruft, die zum Kontext passen, anstatt sich auf eine Wort-für-Wort-Übersetzung zu verlassen.
Beziehung zu anderen Ansätzen
EBMT ist einer von mehreren datengetriebenen Ansätzen zur maschinellen Übersetzung. Es unterscheidet sich von regelbasierter maschineller Übersetzung, indem es eine tiefe linguistische Analyse vermeidet und stattdessen einen Korpus von Beispielen verwendet. Es unterscheidet sich auch von der statistischen maschinellen Übersetzung, die probabilistische Modelle über großen Korpora verwendet, obwohl beide auf zweisprachigen Daten beruhen. In den 2010er Jahren haben Deep-Learning- und Transformer-basierte Modelle, wie sie in großen Sprachmodellen verwendet werden, EBMT in praktischen Anwendungen weitgehend abgelöst. Dennoch bleibt EBMTs Betonung von Analogie und Beispielabruf relevant, und Open-Source-Plattformen wie Cunei haben hybride Ansätze untersucht, die EBMT mit statistischen Methoden kombinieren.