ガードレールは、AIシステムにおいて、モデルの周囲に入力、出力、またはその両方に層状に配置される安全性および制御メカニズムであり、モデル自身のトレーニングによって達成されるものを超えて、その動作を制約するものである。アライメントやRLHFなどのトレーニング中にモデルの動作を形成する技術とは異なり、ガードレールはデプロイメント時に機能する。つまり、ユーザー入力をフィルタリングまたは書き換え、生成された出力をスクリーニングまたはブロックし、トレーニングだけでは保証できない、より厳格で、より最新で、より監査可能なアプリケーション固有のポリシーを強制する。
ガードレールは、チャットボットやAIエージェントが2022年以降、研究デモから顧客向け製品へと移行するにつれて、本番AIシステムの標準的な一部となった。これは、攻撃的、虚偽、または法的リスクのある出力を生成するチャットボットなどの注目を集めた失敗と、汎用モデルを特定のビジネスユースケースの範囲内に保つという実用的なニーズの両方によって推進された。
ガードレールの種類
ガードレールの実装は多岐にわたるが、一般的にいくつかのカテゴリに分類される。入力ガードレールは、モデルに到達する前に、許可されていないコンテンツ、試みられたジェイルブレイク、またはプロンプトインジェクション攻撃がないか、受信プロンプトをスクリーニングする。出力ガードレールは、ポリシー違反、個人を特定できる情報、有害な言葉、または引用や免責事項をトリガーすべき事実上の主張がないか、生成されたテキストをチェックし、場合によっては、分類器または判定者として、別のより小さなモデルを使用する。トピックガードレールは、デプロイされたアシスタントを定義された範囲に制限する。例えば、カスタマーサービスボットが無関係な質問に答えたり、医療または法的アドバイスを提供したりするのを防ぐ。構造的ガードレールは、出力形式を制約する。例えば、ダウンストリームシステムのために有効なJSONを強制する。
実装アプローチ
ガードレールは、MetaのLlama GuardやOpenAIのモデレーションエンドポイントなどの個別の分類器モデルとして、キーワードリストや正規表現を使用したルールベースのフィルターとして、または、ユーザーに表示される前に最初のモデルの出力を批評または承認するように求められる、同じまたは別の大規模モデルへの2回目の呼び出しとして実装できる。NVIDIAのNeMo GuardrailsやGuardrails AIなどのオープンソースフレームワークがこのパターンを標準化するために登場し、開発者が各チェックを手動でコーディングするのではなく、許可されるトピック、必要な出力構造、およびフォールバック動作を宣言的に定義できるようにした。
限界と批判
ガードレールは不完全であると広く認識されている。それらは通常、モデルの基礎となる能力を変更するのではなく、モデルの周囲のパターンマッチングまたは分類レイヤーとして機能するため、十分に創造的なジェイルブレイクの試みによって打ち負かされる可能性があり、過度に積極的なガードレールは、正当なリクエストをブロックする誤検知を生成し、ユーザーを苛立たせ、批評家は、システムを有意義に安全にすることなく、時には役に立たなくすると主張する。ガードレールは一般に、Constitutional AIやより広範なAI安全性の実践などのトレーニング時の安全性作業の補完物であり、代替物ではないと見なされている。なぜなら、基礎となるモデルに直接到達できる決意のある攻撃者は、ガードレールを完全に迂回するからである。
影響
2020年代半ばまでに、ガードレールはエンタープライズAIデプロイメントチェックリストの標準的な項目となり、明確な製品カテゴリとなった。ベンダーは、アプリケーションと基礎となる基盤モデルの間のミドルウェアとしてガードレールプラットフォームを提供している。EU AI法などの規制枠組みは、出力監視とコンテンツ管理をコンプライアンス要件としてますます参照しており、デプロイされたAIシステムの期待されるインフラストラクチャとしてガードレールをさらに組み込んでいる。