プロンプトエンジニアリングとは、生成AIモデルに与える自然言語の入力を設計・洗練させ、望ましい出力を確実に得るための実践である。これは、大規模言語モデルの広範な採用に伴い、独自のスキルとして、そして一時的には職種としても登場した。なぜなら、同じ基盤モデルでも、タスクの表現方法、構造、枠組みによって結果が著しく異なる可能性があるからである。
技術
一般的なプロンプトエンジニアリングの技術には、プロンプト内に直接、動作例を提供する方法(Few-shot learningとして知られる)や、指示のみを与える方法(Zero-shot learningとして知られる)がある。2022年の論文で導入されたChain-of-thoughtプロンプティングは、モデルに最終回答の前の中間推論ステップを生成するよう求めるもので、十分に大規模なモデルにおいて算術的・論理的なタスクの性能を大幅に向上させることが示された。その他の技術には、モデルにペルソナや役割を割り当てる、明示的な出力形式を指定する、複雑なタスクを一連の小さなプロンプトに分割する、といったものがある。これらの技術の多くは、In-context learning、すなわち言語モデルが基盤となる重みを変更することなく、プロンプト内に存在する情報に基づいてその振る舞いを調整する能力に依存している。
分野としての出現
プロンプトエンジニアリングへの関心は、2020年のGPT-3のリリース後に急速に高まった。その強力な少数ショット性能により、モデルを再トレーニングすることなくアプリケーションを構築するための実用的な手段としてプロンプト設計が重要になったためである。さらに、2022年のChatGPTのローンチにより、会話型プロンプティングが大衆に普及し、その関心は一層加速した。アシスタントのペルソナや制約を設定する構造化されたSystem promptから、複雑なタスクを通じてReasoning modelやAI agentシステムを誘導するための精巧な多段階プロンプトまで、さまざまなユースケースに応じて個別の技術が発展してきた。
持続性に関する議論
コメンテーターたちは、プロンプトエンジニアリングが永続的な分野を構成するのか、それともモデルが通常の言語からユーザーの意図を推測する能力を向上させるにつれて衰退していく過渡的なスキルなのかについて論争してきた。支持者は、モデルにより多くのツール、より長いコンテキスト、より高い自律性が与えられるにつれて、指示、制約、成功基準を正確に指定することの重要性は増すばかりだと主張する。懐疑論者は、初期の能力の低いモデルでプロンプトエンジニアリングと見なされていたものの多く、例えば精巧なロールプレイの枠組みや繰り返しの強調などは、新しいモデルが平易な指示をより確実に従うようになるにつれて不要になったと反論する。2025年までに、一部の実践者は、単一のプロンプトだけでなく、モデルが利用する情報、例、ツールアクセスの完全なセットをキュレーションする分野を説明するために、より広い用語であるContext engineeringを使い始めた。これは、単一のやり取りではなく、複数のターンにわたって動作するエージェント型システムへの移行を反映している。
セキュリティの側面
プロンプトはモデルの動作を指示する主要なチャネルであるため、プロンプトエンジニアリングには、防御的な側面として、敵対的な技術であるJailbreak (AI)が存在する。これは、正当なタスクを達成するためではなく、モデルの安全性トレーニングを回避するために意図的に作成されたプロンプトである。