Zeroショットプロンプティング

英語からの翻訳

Zero-shot promptingは、人工知能における技術であり、モデルが例を与えられずにタスクを実行し、事前学習された知識と指示に依存する手法である。これは大規模言語モデルの主要な能力である。

ゼロショットプロンプティングは、人工知能機械学習における手法であり、モデルに例やデモンストレーションを一切提供せずにタスクを実行するよう求められる。モデルは、事前学習済みの知識とプロンプト内の指示のみに依存して、正しい出力を生成しなければならない。これは、モデルを導くためにプロンプトに少数の例を含めるフューチョットプロンプティングとは対照的である。ゼロショットプロンプティングは、現代の大規模言語モデル(LLM)の基本的な能力であり、タスク固有のデータを最小限に抑えて幅広いタスクを処理できるようにする。

この概念は、機械学習における問題設定であるゼロショット学習(ZSL)に由来し、学習者がトレーニング中に見られなかったクラスからのサンプルを観察し、そのクラスを予測する必要がある。この名称は、コンピュータビジョンで以前に導入されたワンショット学習の概念に基づく言葉遊びである。ゼロショット手法は一般に、観察可能な識別特性を符号化する補助情報を通じて、観察されたクラスと観察されていないクラスを関連付けることで機能する。例えば、馬を認識するように訓練されたモデルは、シマウマを一度も見たことがなくても、シマウマが縞模様の馬のように見えることを知っていれば、シマウマを認識できる。プロンプティングの文脈では、ゼロショットプロンプティングはモデルの内部表現と意味理解を活用して、未見のタスクに一般化する。

背景と歴史

自然言語処理におけるゼロショット学習に関する最初の論文は、2008年にChang、Ratinov、Roth、SrikumarによってAAAI'08で「dataless classification」という名称で発表された。コンピュータビジョンにおけるゼロショット学習に関する最初の論文は、同じ会議で「zero-data learning」という名称で発表された。「ゼロショット学習」という用語自体は、2009年にPalatucci、Hinton、Pomerleau、MitchellによってNIPS'09で発表された論文で初めて登場した。この用語は、コンピュータビジョンで数年早く導入されたワンショット学習の派生として広く受け入れられた。

コンピュータビジョンでは、ゼロショット学習モデルは、見られたクラスのパラメータとそのクラス表現を学習し、クラスラベル間の表現的類似性に依存して、推論時にインスタンスを新しいクラスに分類できるようにした。自然言語処理では、主要な技術的方向性は「ラベルを理解する」能力、つまりラベルを分類対象のドキュメントと同じ意味空間で表現することに基づいていた。これにより、注釈付きデータなしで単一の例を分類することが可能となり、これはゼロショット分類の最も純粋な形態である。元の論文ではExplicit Semantic Analysis(ESA)表現が使用されたが、後の論文では密な表現が使用された。このアプローチは多言語領域、細かいエンティティタイピング、その他の問題に拡張された。表現のみに依存するのではなく、計算アプローチは、テキスト含意や質問応答などの他のタスクからの転移に依存するように拡張された。

ゼロショットクラスの前提情報

ゼロショット学習では、未見のクラスに関する補助情報が必要である。いくつかの種類の補助情報が存在する:

  • 属性による学習:クラスには、事前に定義された構造化された記述が付随する。例えば、鳥の記述には「赤い頭」や「長いくちばし」などが含まれる場合がある。これらの属性はしばしば構造化された構成方法で整理され、その構造を考慮することで学習が向上する。このアプローチは主にコンピュータビジョンで使用され、自然言語処理でもいくつかの例がある。
  • テキスト記述からの学習:クラスラベルは意味を持つと見なされ、クラスのWikipedia記述などの定義や自由文による自然言語記述で拡張されることが多い。これは自然言語処理における主要な方向性となっている。
  • クラス間類似性:クラスは連続空間に埋め込まれる。ゼロショット分類器は、サンプルがその空間のどこかの位置に対応することを予測でき、最も近い埋め込みクラスが予測クラスとして使用される。たとえそのようなサンプルがトレーニング中に存在しなくてもである。

ゼロショットプロンプティングの文脈では、補助情報は事前学習中にモデルのパラメータに暗黙的にエンコードされる。モデルは膨大な量のテキストを学習し、概念間の関連性を獲得しているため、明示的な例なしで指示を理解し、適切な応答を生成できる。

一般化ゼロショット学習

標準的なゼロショット学習設定では、テスト時にゼロショットサンプル(未見のクラスからのもの)のみが与えられると想定される。一般化ゼロショット学習では、新しいクラスと既知のクラスの両方からのサンプルがテスト時に現れる可能性がある。これは、与えられたサンプルが新しいか既知かを推定することが難しいため、課題を提起する。これを扱うアプローチには以下が含まれる:

  • ゲーティングモジュール:特定のサンプルが新しいクラスか古いクラスかを判断するように訓練され、推論時にはハードまたはソフトな確率的決定を出力する。
  • 生成モジュール:未見のクラスの特徴表現を生成するように訓練され、見られたクラスと見られていないクラスの両方のサンプルで標準的な分類器を訓練できるようにする。

ゼロショットプロンプティングでは、モデルは通常、見られたクラスと見られていないクラスを区別する必要なく単一のタスクを実行するように求められるため、一般化ゼロショット学習はあまり関連しない。しかし、一般化の根本的な課題は、堅牢なパフォーマンスにとって依然として重要である。

応用分野

ゼロショット学習とゼロショットプロンプティングは、幅広い分野に適用されている:

  • 画像分類:トレーニング中に見られなかったオブジェクトやシーンを認識する。
  • セマンティックセグメンテーション:画像内のピクセルにラベルを割り当てる。未見のカテゴリも含む。
  • 画像生成:明示的にトレーニングされていない概念の画像を生成する。
  • オブジェクト検出:未見のクラスのオブジェクトを検出する。
  • 自然言語処理:タスク固有のトレーニングデータなしでのテキスト分類、感情分析、質問応答。
  • 計算生物学:タンパク質機能などの生物学的エンティティの特性を予測する。
  • 抽象推論:新しい状況への一般化を必要とする推論タスクを解決する。

大規模言語モデルの時代では、ゼロショットプロンプティングは標準的な評価方法となっている。OpenAIAnthropicGoogle DeepMindによって開発されたモデルは、さまざまなベンチマークでゼロショット性能がテストされることが多い。この能力は、大規模なコーパスでのトレーニングとトランスフォーマーアーキテクチャの直接的な結果であり、モデルが膨大な知識を内部化し、指示に従うことを可能にする。

課題と限界

ゼロショットプロンプティングには限界がある。モデルは、専門知識や推論を必要とするタスクで、もっともらしいが不正確な出力を生成する可能性がある。プロンプトの質は重要であり、不適切な指示は最適でない結果につながる可能性がある。さらに、ゼロショット性能は、フューチョットショットやファインチューニングされた性能よりも低いことが多く、モデルが出力を調整するための明示的な例がないためである。研究者は、より良いプロンプトエンジニアリング、チェーン・オブ・ソート推論、指示チューニングなど、ゼロショット能力を向上させる方法を引き続き探求している。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-learning·natural-language-processing·prompting
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴