例ベース機械翻訳(EBMT)は、実行時に並列テキストのバイリンガルコーパスを主な知識ベースとして利用する機械翻訳の手法である。これは本質的に類推による翻訳であり、機械学習への事例ベース推論アプローチの実装と見なすことができる。深い言語分析を必要とするルールベースシステムとは異なり、EBMTはソース文をフレーズに分解し、コーパスからの例を用いてそれらのフレーズを翻訳し、翻訳された断片をターゲット文に合成することで翻訳を行う。
このアプローチは1984年に長尾真によって最初に提案され、彼は英語と日本語のような非常に異なる2つの言語間の翻訳に特に適していると主張した。そのような場合、単一の文がターゲット言語の複数の構造化された文に対応することがあり、深い言語分析はあまり有用ではない。EBMTは以来、統計的およびルールベースの手法の代替として探求されており、統計的機械翻訳とバイリンガルコーパスの使用を共有している。
類推による翻訳
EBMTの核となる原理は類推による翻訳である。この考え方は、人間の翻訳者がすべての文に対して深い言語分析を行うという概念を否定する。代わりに、翻訳者は文をフレーズに分解し、各フレーズを以前に遭遇した翻訳との類推によって翻訳し、翻訳されたフレーズを一貫した全体に合成すると仮定する。EBMTでは、この原理はトレーニングコーパスに格納された例の翻訳を通じてコード化される。システムはコーパスから類似の例を取得して、新しい入力の翻訳を導く。
歴史と発展
長尾真は1984年にEBMTを導入し、英語と日本語のような非常に異なる構造を持つ言語ペアに対するその可能性を強調した。彼の洞察は、そのようなペアでは、文がしばしばターゲット言語の複数の構造化された文として表現できるため、深い言語分析よりも例ベースの手法が効果的であるというものだった。その後の数十年間で、EBMTは開発および洗練され、2003年の巻『Recent Advances in Example-Based Machine Translation』を編集したMichael CarlやAndy Wayなどの研究者からの貢献があった。近年、EBMTはニューラルネットワークベースのアプローチに大きく影を落とされているが、並列コーパスと類推の使用に関するその考え方は、現代の機械翻訳研究に影響を与え続けている。
EBMTの仕組み
EBMTシステムは、文ペアを含むバイリンガル並列コーパスでトレーニングされる。例えば:
- 「How much is that red umbrella?」↔「Ano akai kasa wa ikura desu ka.」
- 「How much is that small camera?」↔「Ano chiisai kamera wa ikura desu ka.」
このような最小ペアから、システムは翻訳単位を学習する:例えば、「red umbrella」は「akai kasa」に対応し、「small camera」は「chiisai kamera」に対応する。これらの単位は合成して新しい翻訳を生成できる。例えば、システムが「President Kennedy was shot dead during the parade」や「The convict escaped on July 15th」のような文を見たことがあれば、適切な部分を置き換えることで「The convict was shot dead during the parade」を翻訳できる。
句動詞とサブ言語現象
EBMTは、句動詞のような文脈依存性の高い意味を持つサブ言語現象に特に適している。英語の句動詞は動詞に続いて副詞または前置詞(小詞)で構成され、その意味は個々の単語から導出できないことが多い。例えば、句動詞「put on」は「switch on」(「Ram put on the lights」のように)または「wear」(「Ram put on a cap」のように)を意味することができる。ヒンディー語では、これらの意味は異なる動詞「jalana」と「pahenna」にそれぞれ対応する。EBMTは、単語ごとの翻訳に依存するのではなく、文脈に一致する例を取得することで、このような曖昧さを処理できる。
他のアプローチとの関係
EBMTは、機械翻訳へのデータ駆動型アプローチの1つである。これはルールベース機械翻訳とは異なり、深い言語分析を避け、代わりに例のコーパスを使用する。また、大規模コーパス上の確率モデルを使用する統計的機械翻訳とも異なるが、両者はバイリンガルデータに依存する点で共通している。2010年代には、深層学習およびトランスフォーマーベースのモデル(大規模言語モデルで使用されるものなど)が、実用的なアプリケーションでEBMTをほぼ取って代わった。しかし、類推と例の取得に対するEBMTの強調は依然として関連性があり、Cuneiのようなオープンソースプラットフォームは、EBMTと統計的手法を組み合わせたハイブリッドアプローチを探求してきた。