自然言語処理において、単語埋め込みとは、単語の意味を符号化した実数値ベクトルとしての表現である。核となる考え方は、ベクトル空間内で近い位置にある単語は意味も類似していると期待され、意味関係の定量的な分析を可能にするというものである。単語埋め込みは通常、言語モデリングや特徴学習の手法を通じて取得され、語彙内の単語やフレーズを数値のベクトルにマッピングする。これらの表現は、入力特徴として使用すると、構文解析や感情分析などのタスクで性能を向上させることが示されている。
単語埋め込みを生成する方法には、ニューラルネットワーク、単語共起行列に対する次元削減、確率モデル、文脈の明示的表現などがある。このアプローチは、初期の意味空間モデルから現代の深層学習技術へと進化し、自然言語理解システムの基盤となっている。
発展と歴史
「単語は、その付き合う相手によって特徴づけられる」という根本的な考え方は、1957年にジョン・ルパート・ファースが発表した論文で提唱され、分布意味論に根ざしている。情報検索のためのベクトル空間モデルなどの初期の意味空間モデルは、単語をスパースで高次元の空間で表現していた。特異値分解による次元削減は、1980年代後半に潜在意味解析へとつながった。2000年には、ヨシュア・ベンジオらが、単語の分散表現を学習するニューラル確率言語モデルを導入し、次元を削減した。2002年のNeurIPSの研究では、バイリンガルコーパスにカーネルCCAを適用し、単語埋め込みのための自己教師あり学習の初期の例を示した。
ベンジオらによる基礎的な研究の後、2005年頃以降の新しい手法のほとんどはニューラルネットワークアーキテクチャに依存していた。2013年には、トーマス・ミコロフ率いるGoogleのチームがword2vecを開発した。これは、従来のアプローチよりも高速にベクトル空間モデルを訓練するツールキットであり、単語埋め込みを広く普及させた。その後の研究には、単語を部分的に文字n-gramで表現するfastTextなどがある。
多義性と同音異義語
静的単語埋め込みの重要な限界は、複数の意味を持つ単語が単一のベクトルに統合され、多義性や同音異義語を処理できないことである。例えば、「club」はサンドイッチ、クラブハウス、ゴルフクラブを指す可能性がある。多義語埋め込みは、異なる意味に異なるベクトルを割り当てることでこの問題に対処する。アプローチには、単語の意味判別と埋め込みを同時に行うMulti-Sense Skip-Gram(MSSG)や、単語ごとに可変数の意味を許容するNon-Parametric Multi-Sense Skip-Gram(NP-MSSG)などがある。Most Suitable Sense Annotation(MSSA)は、WordNetなどの語彙データベースと単語義曖昧性解消を自己改善的な方法で組み合わせる。
多義語埋め込みは、品詞タグ付け、意味関係の識別、感情分析などのタスクで性能を向上させる。2010年代後半以降、ELMoやBERTなどの文脈に応じた意味を持つ埋め込みは、トークンレベルの表現を提供し、単語の各出現が独自の埋め込みを持つため、多義性の性質をよりよく反映している。
生物学的配列
単語埋め込みは、バイオインフォマティクス応用のために、DNA、RNA、タンパク質などの生物学的配列にも拡張されている。Asgariらは、生物学的配列内のn-gramに埋め込み手法を適用するBioVectorsを提案し、機能的および構造的類似性の分析を可能にした。
応用と影響
単語埋め込みは、Machine learningやDeep learningモデルで広く使用され、テキスト分類、機械翻訳、質問応答などのタスクの入力表現として機能する。これらは、トークンレベルの埋め込みに基づくLarge language modelやTransformer (architecture)アーキテクチャに不可欠である。この手法は、University of TorontoやStanford AI Labなどの研究機関での研究に影響を与え、Google DeepMindやOpenAIなどの企業のツールに実装されている。
今後の方向性
希少語の埋め込み改善、言語横断的アライメント、ドメイン固有の応用に関する研究が続いている。文脈埋め込みへの移行は、多くの応用で静的埋め込みをほぼ取って代わったが、静的埋め込みは効率性と解釈可能性の点で依然として有用である。