英語からの翻訳

n-gram(エヌグラム)は、与えられたテキストや音声サンプルから得られる、n個の連続した項目の並びであり、自然言語処理や計算生物学において、統計的分析や系列データのモデリングに使用される。

n-gram(エヌグラム)とは、与えられたテキストまたは音声のサンプルから得られる、n個の項目からなる連続した並びのことである。項目には、文字、音節、単語、音素、あるいはゲノム中の塩基対のような生物学的配列も含まれ得る。n-gramはテキストコーパスや音声コーパスから収集され、統計的自然言語処理の基盤を成し、モデルが系列データにおける局所的なパターンや依存関係を捉えることを可能にする。

この用語はラテン語の数詞に由来する。ユニグラムは1つの項目からなる並び、バイグラム(またはダイグラム)は2つ、トライグラムは3つ、といった具合である。より大きなサイズについては、英語の基数詞が用いられ、例えばフォーグラムやファイブグラムと呼ばれる。計算生物学では、同様の配列はk-merと呼ばれ、モノマー、ダイマー、トリマーといったギリシャ語の接頭辞や、ワンマー、ツーマーのような英語形が使われる。項目が単語である場合、n-gramはシャングルと呼ばれることもある。

歴史的発展

言語におけるn-gramモデルの概念は1951年に遡り、クロード・シャノンが情報理論の文脈でこれについて論じた。シャノンは、文字レベルおよび単語レベルのn-gramモデルが、観測された系列の確率分布からサンプリングすることによって、もっともらしい英語のテキストを生成できることを示した。例えば、3-gram文字モデルは「in no ist lat whey cratict froure birs grocid pondenome」のようなテキストを生成し得る一方、2-gram単語モデルは「the head and in frontal attack on an english writer」を生成できた。これらの初期の実験は、n-gramを言語を統計的にモデル化するための実用的なツールとして確立した。

自然言語処理における応用

自然言語処理において、n-gramはbag-of-wordsモデルが、そうでなければ失われる単語順の情報を捉えることを可能にする。伝統的なbag-of-words表現は文書を順序のない単語の集合として扱うが、n-gram特徴は局所的な文脈を保持する。この能力は、言語モデリング、スペル訂正、機械翻訳、テキスト分類などのタスクに不可欠である。n-gram言語モデルは、直前のn-1個の単語が与えられたときの単語の確率を推定し、ニューラルネットワークの台頭以前の多くの統計的アプローチの基盤を形成した。

トランスフォーマーアーキテクチャに基づく現代の大規模言語モデルは、多くのタスクにおいて明示的なn-gramモデルをほぼ取って代わったが、n-gramは著者帰属、文体計量学、バイオインフォマティクスなどの分野で依然として重要である。数百万冊のデジタル化された書籍にわたるn-gramの頻度を図示するGoogle Books Ngram Viewerは、文化的・言語的分析におけるその継続的な有用性を示している。

計算生物学

ゲノミクスにおいて、k-mer(n-gramの生物学的相当物)はDNAおよびRNA配列の解析に使用される。k-merは長さkの連続した部分配列であり、k-mer頻度解析はゲノムアセンブリ、配列アラインメント、品質管理の標準的な手法である。例えば、DNAシーケンシングプロジェクトのアルゴリズムは、k-mer分布を用いてエラーを検出したり、ゲノムサイズを推定したりすることが多い。kの選択は感度と特異性に影響を与える。より小さなk-merはより豊富であるが特異性が低く、より大きなk-merはよりユニークな一致を提供するが、シーケンシングエラーにより存在しない可能性がある。

統計的性質と変種

n-gramモデルは、未観測の系列を扱うために平滑化することができ、加算平滑化や、Kneser-Ney平滑化のようなより高度な手法が用いられる。また、Google n-gramコーパスに見られるように、頻度によって重み付けすることもできる。このコーパスは、「serve as the independent」(794件)や「ceramics collectables fine」(130件)のようなフレーズのカウントを提供する。これらの頻度分布は確率的予測を可能にし、予測テキスト入力から音声認識に至るまでのアプリケーションで使用されている。

限界と拡張

n-gramの主な限界は、固定されたウィンドウサイズを超える長距離依存関係を捉えられないことである。nを増やすと文脈は改善されるが、多くの可能な系列がトレーニングデータに現れないため、データスパース性につながる。この問題に対処するため、研究者はバックオフモデル、補間法、および分散表現を学習するニューラル言語モデルを開発してきた。それでもなお、n-gramは単純で解釈可能なベースラインとして残り、機械学習手法と併用したハイブリッドシステムでしばしば使用される。

テキストや音声に加えて、n-gramは音楽分析にも応用されており、音符やコードの並びが項目として扱われる。また、ネットワークセキュリティではパケット系列の異常検出に使用される。その汎用性により、n-gramは系列データを扱う多様な分野で多用途なツールとなっている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:natural-language-processing·statistics·computational-linguistics·bioinformatics
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴