意味付きコーパスの自動獲得とは、大規模なテキスト集合内の単語の出現に対して、人間の注釈のみに頼らず、計算手法を用いて正しい語義を割り当てるプロセスを指す。自然言語処理において、意味付きコーパスとは、曖昧な単語(例えば「bank」が金融機関か川岸かを指す場合)のそれぞれが、その文脈で意図された特定の意味でラベル付けされたデータセットである。手動でのタグ付けは正確だが費用がかかり時間も要するため、コーパスの規模が制限される。自動獲得は、アルゴリズム、統計モデル、そしてますますMachine learningの技術を活用してこれらのラベルを大規模に生成し、堅牢な語義曖昧性解消システムの訓練を可能にする。
この分野は、WordNetのような構造化された語義目録を提供する初期の語彙資源から生まれた。初期のアプローチでは手書きの規則や辞書定義を用いたが、これらは脆いことが判明した。1990年代の教師あり学習の登場、特に小さな手動注釈付きシードコーパスで訓練された分類器の登場が転機となった。しかし、ボトルネックは注釈コストのままであった。自動獲得手法は、限られたシードからのブートストラッピング、知識ベースの利用、または半教師あり・教師なしパラダイムによるラベルなしデータの活用を目的とする。
ブートストラッピングと半教師あり手法
ブートストラッピングは、自動意味付きコーパス獲得の要である。このアプローチは、対象単語の各語義について、手動でタグ付けされた小さな例(シードデータ)の集合から始まる。分類器がこれらのシードで訓練され、その後、大規模なラベルなしコーパスに適用される。高信頼度の予測が訓練集合に追加され、このプロセスが反復される。自己訓練や共訓練とも呼ばれるこの手法は、適度な初期労力でコーパスを数百から数百万のタグ付き事例に拡張できる。
注目すべき変種として、Yarowskyアルゴリズム(1995年)があり、決定リストと、談話内単一語義およびコロケーション内単一語義の仮定を用いた。これらの仮定は、文書内または特定のコロケーションと共起する場合に単語が単一の語義を持つ傾向を利用する。このアルゴリズムは英語コーパスで高い精度を達成し、多くの単語において自動獲得が手動品質に匹敵し得ることを示した。その後の研究では、Neural network分類器を用いてこれを洗練し、ドメイン横断的な堅牢性を向上させた。
知識ベースおよび辞書駆動アプローチ
ラベル付きシードを必要とする代わりに、知識ベース手法は外部資源から語義ラベルを導出する。例えば、Leskアルゴリズム(1986年)は、単語の文脈とその語義の辞書定義との重なりを比較する。元々は曖昧性解消に用いられたが、このアルゴリズムをすべての曖昧なトークンに適用することでコーパスのタグ付けに適応できる。より現代的なアプローチでは、WordNetのような意味ネットワークを用い、グラフベースの尺度(例えばWordNetグラフ上のPageRank)を用いて文脈語と語義のグロスとの類似性を計算する。
これらの手法は完全に自動であり、手動注釈を必要としないが、その精度は通常、教師ありアプローチよりも低い。シードコーパスが利用できない低資源言語やドメインにとって価値がある。ハイブリッドシステムは、知識ベースのスコアリングとブートストラッピングを組み合わせ、辞書定義を用いて初期の擬似ラベルを生成し、それを教師あり分類器で洗練する。
教師なしおよびクラスタリングベースの獲得
教師なし手法は、事前定義された語義目録なしに、生テキストから直接語義の区別を発見することを目的とする。クラスタリングアルゴリズムは、文脈特徴(周囲の単語、構文依存関係など)に基づいて単語の出現をグループ化する。各クラスタは異なる語義を表すと仮定される。このアプローチは外部資源なしで意味付きコーパスを生成できるが、結果として得られる語義クラスタはWordNetのような人間が定義した語義と一致しない場合がある。
潜在ディリクレ配分法(LDA)やニューラル埋め込み(例えばTransformer (architecture)ベースの文脈埋め込み)などの技術が、単語の文脈を表現するために用いられてきた。これらの埋め込みをクラスタリングすると、しばしば一貫した語義グループが得られる。しかし、ゴールドスタンダードがないため評価は困難である。教師なし獲得は、探索的分析や、後に標準的な目録にマッピングされる候補語義を生成する前処理ステップとしてよく用いられる。
評価と課題
自動獲得された意味付きコーパスの評価には、Senseval/Semevalコンペティションなどの手動注釈付きゴールドスタンダードとの比較が必要である。指標には、単語ごとの適合率、再現率、F1スコアが含まれる。精度は大きく変動する:明確な文脈手がかりを持つ一般的な曖昧語では、自動手法は90%を超える精度を達成できるが、稀な語義や文脈依存性の高い単語では性能が大幅に低下する。
主な課題には、ドメイン適応(ニュースで訓練されたモデルが生物医学テキストで失敗する場合)、語義の粒度(粗い語義よりも細かい語義の方が難しい)、および複合語表現の存在が含まれる。さらに、自動獲得は、ブートストラッピングが初期の誤りを強化すると誤りを伝播させる可能性がある。Large language model埋め込みやDeep learningアーキテクチャを用いた最近の進歩により性能は向上したが、完全に自動で高品質な語義タグ付けは未解決の問題のままである。2020年代半ば現在、最先端のシステムは教師ありシードと大規模な事前訓練モデルを組み合わせ、一般的な単語のベンチマークデータセットで人間に近い性能を達成している一方、稀な語義には依然として人間の介入が必要である。
応用
意味付きコーパスは、語義曖昧性解消システムの訓練と評価の基礎であり、機械翻訳(正しい対象言語の単語の選択)、情報検索(クエリ用語の曖昧性解消)、および辞書編纂(辞書の編纂)に用いられる。また、意味役割付与やオントロジー学習も支援する。大規模な自動獲得コーパスの利用可能性により、より正確な言語理解モデルの開発が可能となり、Artificial intelligenceや自然言語処理の進歩に貢献している。
要約すると、意味付きコーパスの自動獲得は、注釈ボトルネックに対する実用的な解決策であり、計算手法を活用して大規模なラベル付きデータを生成する。完璧ではないが、語彙意味論における重要な進歩を可能にし、特に現代のニューラルアーキテクチャの統合により、活発な研究分野であり続けている。