英語からの翻訳

トークン化は、テキストをトークンと呼ばれる離散的なサブワード単位に分割するプロセスであり、言語モデルの基本的な入力・出力語彙を構成します。通常、バイトペア符号化や類似の手法を用いて生成されます。

トークン化とは、テキストをトークンと呼ばれる離散的な単位に分割するプロセスであり、トークンは大規模言語モデルが入力として読み取り、出力として生成する基本語彙として機能する。トークンは通常、単語全体や個々の文字ではなく、サブワード単位であり、この設計選択は語彙サイズとシーケンス長のバランスを取るものである。

単語や文字では不十分な理由

テキストを単語全体に分割する場合、モデルが対応するすべての言語のすべての語形(まれな単語、誤字、名前を含む)をカバーするのに十分な大きさの語彙が必要となり、それでも真に新しい単語が出現したときには対応できない。テキストを個々の文字に分割すれば、その語彙問題は回避できるが、モデルが処理するシーケンスがはるかに長くなり、トランスフォーマー注意機構がシーケンス長に対してスケーリングが不十分であることを考えると、コストがかかる。サブワードトークン化はその妥協点であり、一般的な単語は通常1つのトークンとして表現される一方、まれな単語はより小さな再利用可能な部分に分割され、まったく未知の文字の組み合わせでも既知のサブワード単位のシーケンスとして表現できる。

手法

最も広く使用されているサブワードトークン化手法はバイトペア符号化であり、1994年のデータ圧縮アルゴリズムから言語モデル用に適応され、訓練中に見られない単語を扱うための初期の統計的自然言語処理技術に基づいている。これは個々の文字またはバイトから始まり、最も頻繁に共起するペアを反復的に新しいトークンに統合し、大規模な訓練コーパスで観察された最も有用なサブワード単位の固定サイズの語彙を構築する。SentencePieceやWordPieceなどの変種は、同様の統合ロジックを異なる前処理と空白の扱いで使用する。結果として得られる語彙(通常は数万トークン)は、モデルが訓練されると固定され、再訓練なしでは変更できない。

トークンから数値へ

テキストがトークンに分割されると、各トークンは整数インデックスにマッピングされ、次に埋め込みと呼ばれる学習されたベクトル表現に変換される。これがニューラルネットワークが実際に処理するものである。GPT-2GPT-3はどちらもバイトレベルのバイトペア符号化トークナイザーを使用しており、その後のほとんどの大規模言語モデルも同様のアプローチを採用し、非英語言語とコードをより適切に表現するために語彙を拡張することがある。

実用的な影響

トークン化には、技術的な背景がなくても言語モデルのユーザーに見えるいくつかの結果がある。モデルのコンテキストウィンドウ(一度に処理できる最大テキスト量)は、単語や文字ではなくトークンで測定され、商用APIは通常トークン単位で課金するため、トークン化はコストに直接関係する。主に英語のテキストで訓練されたトークン化スキームは、非英語テキスト(特に異なる文字体系を持つ言語)を英語よりも単語あたりのトークン数が多い形に分割する傾向があり、これによりモデルの使用コストが高くなり、それらの言語の話者にとって利用可能なコンテキストウィンドウが実質的に縮小する可能性がある。トークン化はまた、単語内の文字を数えるなど、個々の文字についての推論を必要とするタスクで驚くべき動作を引き起こすことがある。なぜなら、モデルは単語が構成文字に分割された形をまったく見ない可能性があるからだ。

カテゴリ:large-language-models·fundamentals
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴