영어에서 번역됨

탈옥(jailbreak)은 AI 모델의 안전 훈련이나 가드레일을 우회하여, 훈련 중 거부하도록 학습된 콘텐츠를 생성하도록 유도하는 프롬프트 또는 기법입니다.

AI 맥락에서의 탈옥(jailbreak)은 모델의 안전 훈련이나 가드레일을 우회하고, 폭력 지침, 증오 발언 또는 기타 금지된 자료와 같이 모델이 거부하도록 훈련되거나 지시된 콘텐츠를 생성하도록 유도하기 위해 설계된 프롬프트 또는 기술이다. 이 용어는 스마트폰과 콘솔에서 제조업체 제한을 제거하는 관행에서 차용되었으며, AI 시스템에 적용될 때에도 기존 소프트웨어 버그를 악용하기보다는 내장된 제한을 우회하는 것과 유사하기 때문이다.

일옥은 ChatGPT가 2022년 11월에 출시된 직후부터 공개적인 활동으로 급속히 부상하였으며, 온라인 커뮤니티가 프롬프트를 공유하고 개선하면서 시작되었고, 이후 사용자가 취약점을 탐색하고 랩이 알려진 기술에 대해 모델과 시스템을 패치하는 지속적인 공격-방어 군비 경쟁으로 이어졌다.

일반적인 기술

문서화된 일옥 기술에는 역할극 프레임링이 포함되며, 사용자가 모델이 일반적인 제한에서 자유롭다고 주장하는 페르소나를 채택하도록 요청하는데, 널리 유포된 "Do Anything Now"의 약자인 DAN 프롬프트가 대표적이다. 또한 가설 또는 허구 프레임링은 모델이 스토리나 사고 실험의 일부로 사용을 요구하며, 점진적으로 맥락을 전환하는 다단계 프롬프트, 그리고 요청을 암호, 외국어 또는 특이한 포맷으로 모호화하여 키워드 기반 필터를 우회하는 인코딩 트릭이 포함된다. 연구자들은 또한 최적화 알고리즘이나 다른 AI 모델을 사용하여 대상 모델의 방어를 신뢰성 있게 우회하는 프롬프트 접미사 집합을 자동으로 생성하는 일옥 생성 시스템도 시연했다.

프롬프트 인젝션 및 레드 팀링과의 관계

일옥은 프롬프트 인젝션과 밀접한 관계가 있지만 구별된다. 일옥은 일반적으로 사용자가 직접 대화하고 있는 모델을 조작하려는 시도인 반면, 프롬프트 인젝션은 사용자 대신 처리하는 타사 콘텐츠에 숨겨진 악의적 지침을 포함한다. 둘 다 레드 팀링의 광범위한 실천 아래에서 연구되며, 랩과 독립 연구자들이 배포 전후에 이러한 실패 모드를 모델에서 의도적으로 탐색한다.

방어 및 전망

AI 랩은 알려진 일탈에 대응하여, 거부를 더 견고하게 만드는 추가 인간 피드백 기반 강화 학습헌법적 AI 스타일의 훈련, 생성 전후을 잡아내는 외부 가드레일과 분류기, 그리고 공개적으로 유통되는 새로운 기술에 대한 지속적인 모니터링 등의 조합을 사용한다. 그럼에도 불구하고 보안 연구자들은 배포된 대형 언어 모델이 완전히 저항할 수 있는 것으로 증명되지 않았으며, 능력 개선이 자동으로 대립 프롬프트에 대한 견고성으로 이어지지 않음을 보여주었다. AI 시스템이 도구 사용과 자동 활동을 통해 실제 세계의 역량을 강화함에 따라, 성공적인 일탈의 실질적 위협은 금지된 텍스트 생성에서 유해한 실세계 행동을 촉발할 가능성으로 높아졌다.

분류:ai-safety·security
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사