ニューラル機械翻訳

英語からの翻訳

ニューラル機械翻訳(NMT)は、人工ニューラルネットワークを用いて文全体を単一の統合モデルでモデル化し、単語列の可能性を予測する機械翻訳のアプローチである。今日では支配的な翻訳手法であり、高リソース言語においては人間の出力に匹敵する翻訳を生成できる。

ニューラル機械翻訳(NMT)は、人工ニューラルネットワークを用いて単語の並びの尤度を予測する機械翻訳のアプローチであり、典型的には文全体を単一の統合モデルでモデル化する。文を句に分割し、別々のコンポーネントを適用する従来の統計的手法とは異なり、NMTは翻訳をエンドツーエンドの学習問題として扱い、ニューラルネットワークがソース文をターゲット文に直接マッピングするように訓練される。このアプローチは機械翻訳における支配的なパラダイムとなり、高リソース言語間の特定の条件下での翻訳では、人間の翻訳に匹敵する出力を生成できる。しかし、高品質なデータが限られた言語、訓練データと実世界のテキスト間のドメインシフト、そして直訳を生み出す傾向など、課題は依然として残っている。

NMTシステムは、潜在的な翻訳に確率を割り当て、最も可能性の高い出力を探索する。ほとんどのモデルは自己回帰型であり、つまり一度に1つのターゲットトークンを生成し、各予測をソース文とそれまでに生成されたトークンに条件付ける。翻訳全体の確率は、これらの個々のトークン確率の積である。アーキテクチャ的には、ほとんどのNMTモデルはエンコーダー・デコーダー設計に従う。エンコーダーはソース文をベクトルまたは行列表現に処理し、デコーダーはその表現と自身の以前の出力を使用して、ターゲット文をトークンごとに生成する。このプロセスは、特別な文末トークンが生成されるまで続く。

歴史的発展

NMTのルーツは1980年代後半に遡る。1987年、ロバート・B・アレンは、31語の限られた語彙を持つ自動生成された英語の文をスペイン語に翻訳するためのフィードフォワードニューラルネットワークを実証した。ネットワークには可変長シーケンスを処理するメカニズムがなかったため、入力層と出力層は各言語の最長文に対応するようにサイズ設定された。アレンはまた、エンコードとデコードに自己連想モデルを使用することを提案した。

1991年、ロニー・クリスマンは、ジョーダン・B・ポラックによって開発された再帰的自己連想記憶(RAAM)ネットワークをソース言語とターゲット言語それぞれに訓練することで、この研究を拡張した。これらのネットワークは任意の長さの文を固定サイズの隠れ表現にエンコードし、それをデコードして戻すもので、さらに2つのネットワークが隠れ表現を共有するという制約があり、翻訳を可能にした。1997年、フォルカダとニェコはこれを再帰的ヘテロ連想記憶に簡素化し、ソースエンコーダーとターゲットデコーダーを直接訓練した。また1997年、カスターニョとカサクベルタは、小規模な翻訳タスクにエルマンのリカレントニューラルネットワークを使用した。

これらの初期の進歩にもかかわらず、当時の計算リソースは実世界の翻訳に必要な大規模データセットには不十分だった。その結果、1990年代から2000年代にかけて、統計的機械翻訳が最先端となった。

ハイブリッドアプローチ

統計的機械翻訳の時代、一部の研究者はニューラル手法を既存の枠組みに統合した。例えば、ホルガー・シュベンクらは、従来のn-gram言語モデルをニューラル言語モデルに置き換え、フィードフォワードネットワークを使用して句翻訳確率を推定した。これらのハイブリッドシステムは、統計的アプローチに典型的な特徴の対数線形結合を保持しつつ、ニューラルコンポーネントを活用して特定のサブ問題を改善した。

seq2seqのブレークスルー

エンドツーエンドNMTの現代は2013年から2014年に始まった。カルフブレナーとブランソムはソースのエンコードに畳み込みニューラルネットワーク(CNN)を使用し、チョらとサツキーバーらは独立にリカレントニューラルネットワーク(RNN)を採用した。3つすべてが、ソースの固定エンコードに条件付けられたRNNデコーダーを使用した。しかし、これらのモデルは長い文では性能が悪く、この制限は2014年にバダナウらによるアテンションの導入によって対処された。各デコードステップで、アテンションはデコーダーがソース文の異なる部分に焦点を当てることを可能にし、特に長い入力に対して翻訳品質を向上させるコンテキストベクトルを動的に計算した。

現代のアーキテクチャと進歩

アテンションメカニズムは、その後のNMTシステムの基盤コンポーネントとなった。2017年、バスワニらによって導入されたトランスフォーマーアーキテクチャは、リカレント層と畳み込み層をマルチヘッドアテンションメカニズムに置き換え、並列処理と長距離依存関係のより良い処理を可能にした。トランスフォーマーはすぐにNMTの標準となり、大規模言語モデルの開発を支え、大規模コーパスでの事前学習を通じて翻訳能力をさらに向上させた。

現代のNMTシステムは、デコードのためのビームサーチ、ロバスト性向上のためのデータ拡張、効率性のためのモデルプルーニングなどの技術をしばしば組み込んでいる。これらは、Google CloudAmazon Web ServicesAzureなどの主要クラウドプロバイダーや、専門のAI企業によって展開されている。これらの進歩にもかかわらず、NMTは低リソース言語とドメイン適応に関する課題に依然として直面しており、その出力は過度に直訳的で、慣用的または文化的にニュアンスのある表現を見逃すことがある。

評価と影響

NMTシステムは通常、BLEUなどの自動評価指標を使用して評価され、生成された翻訳を参照翻訳と比較するが、流暢さと適切性を評価するためには人間による評価が依然として重要である。NMTの影響は翻訳ツールを超えて広がり、生成AI人工知能などの分野に影響を与え、エンドツーエンド学習の力を実証している。2020年代半ば現在、NMTは進化を続けており、効率性の向上、多言語シナリオの処理、外部知識の統合による限界への対処に焦点を当てた研究が行われている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-translation·neural-networks·natural-language-processing·deep-learning
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴