レッドチーミングをAIに適用した場合、モデルやシステムに有害、安全でない、偏った、またはその他の望ましくない挙動を意図的に探る実践であり、通常は公開展開前に、問題を事前に発見して修正することを目的とする。この用語は軍事およびサイバーセキュリティの実践に由来し、レッドチームはシステムを防御するブルーチームに対して敵対者の役割を果たす。AI研究所は、この枠組みを採用して、有毒または偏った出力などの短期的な害から、兵器情報の生成支援、サイバー攻撃の可能化、または欺瞞的な挙動の示現などのより深刻なリスクまで、モデルに対する体系的な敵対的テストを説明した。
レッドチーミングは、2022年から2023年頃にかけて、AI開発ライフサイクルの標準的、一部の法域では法的に期待される部分となった。これは、OpenAIやAnthropicなどの研究所がレッドチーミングプロセスの詳細を公開し、政府が政策で言及し始めたためである。
方法
AIレッドチーミングの方法は、手動から完全自動まで多岐にわたる。手動レッドチーミングでは、人間のテスター(場合によってはバイオセキュリティ、サイバーセキュリティ、児童安全などの分野の専門家)が、脱獄やプロンプトインジェクションなどの技術を用いて、有害な出力を引き出そうと創造的に試みる。自動レッドチーミングでは、別のAIモデルや検索アルゴリズムを使用して、大量の敵対的プロンプトを生成し、成功するものを特定することで、人間のテスターだけでは達成できない範囲をカバーする。外部レッドチーミングでは、独立した研究者や専門企業を招き、肯定的な結果への利害関係を持たずに、内部チームが見逃したり報告をためらったりする可能性のある問題を表面化させることを目的とする。
主要研究所での実践
Anthropic、OpenAI、Google DeepMindはそれぞれ、モデルリリース文書(しばしばシステムカードと呼ばれる)の一部として、レッドチーミング手法と、場合によっては結果を公開している。OpenAIのGPT-4の2023年リリースには、バイオ兵器支援やサイバーセキュリティ悪用などの危険な能力に関するテストを説明するレッドチーミングセクションが含まれており、一部は早期アクセス下で外部専門家によって実施された。2023年のブレッチリー・パークサミット後に設立された政府関連のAI安全研究所は、主要研究所によるフロンティアモデルの展開前レッドチーミング評価を自主的に実施し始め、特に国家安全保障関連のリスクをテストしている。
他の安全実践との関係
レッドチーミングは一般に、他のAI安全作業の代替ではなく補完と理解されている。モデルやシステムに問題が存在した後にそれを見つけるのに対し、RLHFや憲法的AIなどの技術はトレーニング中に挙動を形成することを目的とし、ガードレールは実行時防御を追加する。レッドチーミング演習からの発見は、通常、さらなるトレーニング、追加のガードレール、または文書化された事例では、モデルのリリースを遅延または制限する決定にフィードバックされる。批評家は、テスターがすべての可能な悪用を予測できないため、レッドチーミングのカバレッジは必然的に不完全であり、その実践の有用性は、発見がコンプライアンス目的で単に文書化されるのではなく、どれだけ真剣に行動に移されるかに大きく依存すると指摘している。