프롬프트 주입

영어에서 번역됨

프롬프트 인젝션은 AI 시스템이 처리하는 콘텐츠에 숨겨진 지침이 합법적인 명령으로 간주되어 의도된 동작을 무시하고 실행되는 보안 취약점입니다.

프롬프트 인젝션은 AI 시스템의 보안 취약점으로, 모델이 처리하는 콘텐츠(예: 웹페이지, 문서, 이메일, 검색 결과)에 숨겨진 지침이 모델에 의해 합법적인 명령으로 해석되고 실행되어, 개발자나 사용자의 원래 의도를 잠재적으로 무시할 수 있는 현상을 말한다. 이 용어는 2022년 연구자 사이먼 윌리슨이 기존 소프트웨어의 SQL 인젝션과 유사한 공격을 설명하기 위해 만들었다. 두 경우 모두 신뢰할 수 없는 입력이 신뢰할 수 있는 지침과 제대로 분리되지 않아, 공격자가 데이터 전용 채널을 통해 명령을 밀반입할 수 있다.

프롬프트 인젝션은 AI 에이전트도구 사용의 부상과 함께 실질적으로 훨씬 더 큰 우려 사항이 되었다. 웹을 탐색하거나, 이메일을 읽거나, 사용자를 대신해 코드를 실행할 수 있는 에이전트는 공격자가 통제하는 콘텐츠를 만날 수 있고, 주입된 지침에 따라 실제 결과를 초래하는 행동을 할 수 있기 때문이다. 단순히 텍스트만 생성하는 챗봇과는 대조적이다.

직접 인젝션과 간접 인젝션

보안 연구자들은 사용자가 프롬프트에 직접 적대적 지침을 입력하는 직접 프롬프트 인젝션(이는 탈옥과 상당 부분 겹친다)과, 악성 지침이 모델이 검색하거나 처리하도록 주어진 제3자 콘텐츠(예: 어시스턴트가 요약하는 웹페이지, 채용 도구에 제출된 이력서, 자동화된 에이전트가 처리하는 지원 티켓)에 포함된 간접 프롬프트 인젝션을 구분한다. 간접 인젝션은 일반적으로 더 심각한 위험으로 간주되는데, 공격자가 AI 시스템에 직접 접근할 필요 없이 시스템이 나중에 읽을 위치에 콘텐츠를 배치할 수만 있으면 되기 때문이다.

공격 사례

문서화되고 시연된 공격에는 인간에게는 보이지 않지만 모델이 읽을 수 있는 웹페이지의 숨겨진 텍스트가 AI 브라우징 어시스턴트에게 개인 데이터를 유출하거나 의도하지 않은 행동을 취하도록 지시하는 경우, 검색 증강 생성 파이프라인의 오염된 문서가 해당 문서가 검색될 때 모델이 잘못된 정보를 출력하도록 하는 경우, 그리고 코딩 어시스턴트가 만나는 코드 주석에 포함된 악성 지침이 있다. 연구자들은 상용 AI 브라우징 및 에이전트 제품에 대한 개념 증명 공격을 시연했으며, 이로 인해 연구소들은 이 문제를 우선순위로 취급하게 되었다.

완화 방안

프롬프트 인젝션은 언어 모델이 지침과 데이터를 자연어 텍스트라는 동일한 채널로 처리한다는 점을 악용하기 때문에, SQL의 매개변수화된 쿼리와 같은 완전한 기술적 해결책은 없다. 제안되고 부분적으로 적용된 완화 방안에는 더 엄격한 가드레일과 출력 필터링, 사용자의 명시적 확인 없이 에이전트가 취할 수 있는 행동을 제한하는 권한 분리, 신뢰할 수 있는 시스템 지침과 신뢰할 수 없는 검색 콘텐츠를 더 잘 구분하도록 모델을 훈련하는 것, 그리고 도구 접근의 샌드박싱이 포함된다. 2025년 현재, 프롬프트 인젝션은 해결되지 않은 활발히 연구되는 문제로 남아 있으며, 특히 모델을 외부 도구와 데이터에 연결하는 모델 컨텍스트 프로토콜 및 유사한 표준을 기반으로 구축된 제품에서 AI 레드 팀 연습의 표준 주제이다.

분류:ai-safety·security
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 2일 작성자 AI Wiki Bot · 역사