英語からの翻訳

Top-pサンプリングは、核サンプリングとも呼ばれ、累積確率が閾値pを超える高確率トークンの動的にサイズが決まる集合からサンプリングするテキスト生成のための確率的デコード戦略であり、2019年にテキスト品質を向上させるために導入された。

Top-pサンプリングは、別名nucleusサンプリングとも呼ばれ、自己回帰型確率モデルからシーケンスを生成するために使用される確率的デコード戦略であり、特に自然言語生成において用いられる。この手法は、2019年にAri Holtzman、Yejin Choiらによって、ビームサーチのような決定論的デコード手法が生成する反復的で無意味なテキストの問題に対処するために最初に提案された。この技術はその後、タンパク質工学や地球物理学などの他の科学分野にも応用されている。

Top-pサンプリングでは、確率しきい値pが設定され、シーケンス内の次の項目は、累積確率がpを超える最小の高確率候補セットからのみサンプリングされる。この手法は、モデルの確信度に基づいて候補プールのサイズを適応させるため、固定数の候補からサンプリングするtop-kサンプリングよりも柔軟である。その有効性から、top-pサンプリングは多くのLarge language modelアプリケーションで広く使用されている。

手法

テキスト生成プロセスの各ステップにおいて、言語モデルは語彙全体に対する次のトークンの確率分布を計算する。最も高い確率を持つトークンを単純に選択する(貪欲探索)か、高確率シーケンスの限定されたセットを選択する(ビームサーチ)ことも可能だが、これらの決定論的手法はしばしば退屈で反復的、または無意味なテキストを生成する。Top-pサンプリングは、これらの問題を回避しながら品質を維持するためにランダム性を導入する。

核となるアイデアは、各ステップでnucleusと呼ばれる、より信頼性の高いトークンの小さなセットからサンプリングすることである。このnucleusには、累積確率がしきい値pをちょうど超える最も可能性の高い次のトークンが含まれる。この動的にサイズが変わるグループからのみサンプリングすることで、モデルはさまざまな状況に適応できる。モデルが次のトークンについて確信している場合(例えば、1つのトークンの確率が非常に高い場合)、nucleusは小さくなる。モデルが不確かな場合(確率がより均等に分布している場合)、nucleusは大きくなり、より多様性が可能になる。

各ステップのプロセスは以下の通りである:

  1. モデルはすべての可能な次のトークンの確率を計算する。
  2. トークンは確率の降順でソートされる。
  3. 累積確率が事前定義されたしきい値pを超えるまで、リストの先頭からトークンを選択してnucleusを形成する。
  4. このnucleus内のトークンの確率は、合計が1になるように再スケーリングされる。nucleus外のすべてのトークンは破棄される(確率0が与えられる)。
  5. 最終的な次のトークンは、この新しいより小さな分布からランダムにサンプリングされる。

形式的には、nucleus \(V^{(p)} \subseteq V\) は、次の条件を満たす最小のトークンセットとして定義される:

\[\sum_{x \in V^{(p)}} P(x|x_1, \dots, x_{t-1}) \geq p\]

この式において、\(P(x|x_1, \dots, x_{t-1})\) は、先行するトークン \(x_1, \dots, x_{t-1}\) が与えられたときのトークン \(x\) の確率を表す。

あるステップで、言語モデルが5つの単語 [the, a, cat, dog, eats] の語彙を持ち、以下の確率を生成すると想像する:

  • the: 0.5
  • a: 0.2
  • cat: 0.1
  • dog: 0.1
  • eats: 0.1

\(p = 0.8\) を設定した場合:

  1. トークンは確率順にソートされる:[the, a, cat, dog, eats]。
  2. 累積確率が計算される:
    • the: 0.5
    • the + a: 0.5 + 0.2 = 0.7
    • the + a + cat: 0.7 + 0.1 = 0.8
  3. nucleusは累積確率が0.8以上となる最小のセットであり、\(V^{(0.8)} = \{\text{the, a, cat}\}\) となる。
  4. このセットの確率は合計が1になるように再スケーリングされる:
    • P(the) = 0.5 / 0.8 = 0.625
    • P(a) = 0.2 / 0.8 = 0.25
    • P(cat) = 0.1 / 0.8 = 0.125
  5. 次のトークンはこの新しい分布からサンプリングされ、dogとeatsが選択される確率は0%となる。

Top-kサンプリング

Top-kサンプリングは、候補トークンのプールが最も可能性の高い\(k\)個のトークンに制限される類似の手法である。Top-pの主な利点はその適応性である。モデルが次のトークンについて非常に確信している場合(ピークのある分布)、nucleus \(V^{(p)}\) は非常に小さくなり得る。モデルが不確かな場合(平坦な分布)、nucleusははるかに大きくなり、より多様性が可能になる。対照的に、top-kは常に固定数のトークンからサンプリングするため、文脈によっては制限が強すぎたり、広すぎたりする可能性がある。

応用

Top-pサンプリングは、大規模言語モデルのデコード戦略として最も有名であるが、確率モデルからのシーケンシャルデータの生成や分析を伴う他の科学分野にも適応されている。

自然言語生成

元々の自然言語生成の分野では、top-pサンプリングは決定論的手法と比較して、より多様で一貫性のあるテキストを生成できる点で評価されている。自動質問生成などのタスクでは、サンプルの多様性が質問応答モデルの効果的なトレーニングデータを作成するために重要であり、この手法が有益であることが示されている。

薬物およびタンパク質設計

Top-pサンプリングは、計算生物学において、専門の言語モデルから新規の分子およびタンパク質配列を生成するために使用される。デノボ薬物設計では、分子構造でトレーニングされた化学言語モデルが、nucleusサンプリングを使用して新しい有効な薬物候補の焦点を絞ったライブラリを生成する。同様に、タンパク質言語モデルはtop-pサンプリングを活用して、望ましい特性を持つ新規のタンパク質配列を提案し、タンパク質工学の取り組みを支援する。

地球物理学

地球物理学では、top-pサンプリングは地質イベントのシーケンスを生成したり、地下構造をモデル化したりするために適用されている。例えば、地震インバージョンや貯留層特性評価において、地下特性を予測する確率モデルからサンプリングするために使用され、地質学的解釈における不確実性の定量化に役立つ。

実装と使用法

実際には、top-pサンプリングは温度スケーリングなどの他のデコード戦略と組み合わせて、生成テキストのランダム性と品質を微調整することが多い。温度スケーリングは、top-pを適用する前に確率分布の鋭さを調整し、多様性をさらに制御できるようにする。多くのMachine learningフレームワークやライブラリはtop-pサンプリングの組み込みサポートを提供しており、既存のパイプラインへの統合が容易である。

Top-pサンプリングは、OpenAIAnthropicGoogle DeepMindなどの主要AI企業のAPIや、Hugging FaceのTransformersなどのオープンソースライブラリの標準機能である。通常、テキスト生成関数のパラメータ(例:top_p)として指定され、バランスの取れた出力には0.9から0.95の一般的な値が使用される。

pの選択は出力に大きく影響する。低いp(例:0.5)はモデルをより保守的にし、高確率トークンに焦点を当てる一方、高いp(例:0.99)はより多様性を可能にするが、一貫性のリスクが増加する可能性がある。研究者や実践者は、特定のタスクと望ましい出力特性に基づいてpを調整することが多い。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:natural-language-processing·machine-learning·text-generation
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴