레드 팀링(Red teaming)을 AI에 적용하는 것은, 일반적으로 공개 배포 전에 모델이나 시스템이 유해하거나, 안전하지 않거나, 편향되거나, 그 외 바람직하지 않은 행동을 보이는지 의도적으로 조사하여 문제를 사전에 발견하고 해결하는 관행이다. 이 용어는 군사 및 사이버 보안 관행에서 유래했으며, 여기서 레드 팀은 시스템을 방어하는 블루 팀에 맞서 적대자의 역할을 수행한다. AI 연구소는 독성 또는 편향된 출력과 같은 단기적 피해부터 무기 정보 생성 지원, 사이버 공격 가능화, 또는 기만적 행동 표출과 같은 더 심각한 위험에 이르기까지, 모델에 대한 체계적인 적대적 테스트를 설명하기 위해 이 프레임워크를 채택했다.
레드 팀링은 약 2022년부터 2023년까지 AI 개발 수명 주기의 표준이자 일부 관할권에서는 법적으로 기대되는 부분이 되었다. 이는 OpenAI 및 Anthropic을 포함한 연구소들이 레드 팀링 프로세스에 대한 세부 정보를 공개하고, 정부가 정책에서 이를 언급하기 시작했기 때문이다.
방법
AI 레드 팀링 방법은 수동에서 완전 자동화까지 다양하다. 수동 레드 팀링은 인간 테스터를 사용하며, 때로는 생물 안전, 사이버 보안 또는 아동 안전과 같은 분야의 도메인 전문가가 탈옥 및 프롬프트 주입을 포함한 기술을 사용하여 창의적으로 유해한 출력을 유도하려고 시도한다. 자동화된 레드 팀링은 다른 AI 모델이나 검색 알고리즘을 사용하여 대량의 적대적 프롬프트를 생성하고 어떤 것이 성공하는지 식별하여, 인간 테스터만으로는 달성할 수 있는 것보다 훨씬 더 넓은 범위를 포괄할 수 있게 한다. 외부 레드 팀링은 긍정적인 결과에 이해관계가 없는 독립 연구자나 전문 회사를 참여시켜, 내부 팀이 놓치거나 보고하기를 꺼릴 수 있는 문제를 표면화하는 것을 목표로 한다.
주요 연구소에서의 관행
Anthropic, OpenAI 및 Google DeepMind는 각각 모델 출시 문서(종종 시스템 카드라고 함)의 일부로 레드 팀링 방법론과 경우에 따라 결과를 공개했다. OpenAI의 GPT-4 2023년 출시에는 생물 무기 지원 및 사이버 보안 오용과 같은 위험한 능력에 대한 테스트를 설명하는 레드 팀링 섹션이 포함되었으며, 이는 부분적으로 조기 액세스 권한을 가진 외부 전문가에 의해 수행되었다. 2023년 블레츨리 파크 정상 회담 이후 설립된 정부 소속 AI 안전 연구소는 주요 연구소의 프론티어 모델에 대한 사전 배포 레드 팀링 평가를 자발적으로 수행하기 시작했으며, 특히 국가 안보 관련 위험을 테스트했다.
다른 안전 관행과의 관계
레드 팀링은 일반적으로 다른 AI 안전 작업을 대체하는 것이 아니라 보완하는 것으로 이해된다. 레드 팀링은 모델이나 시스템에 문제가 이미 존재한 후에 문제를 발견하는 반면, RLHF 및 헌법적 AI와 같은 기술은 훈련 중에 행동을 형성하는 것을 목표로 하고, 가드레일은 런타임 방어를 추가한다. 레드 팀링 연습에서 얻은 결과는 일반적으로 추가 훈련, 추가 가드레일 또는 일부 문서화된 사례에서 모델 출시 지연 또는 제한 결정에 피드백된다. 비평가들은 테스터가 모든 가능한 오용을 예측할 수 없기 때문에 레드 팀링 범위가 필연적으로 불완전하며, 이 관행의 유용성은 결과가 단순히 규정 준수를 위해 문서화되는 것이 아니라 얼마나 진지하게 조치되는지에 크게 의존한다고 지적했다.