적대적 예시는 AI 모델을 속이기 위해 설계된 입력으로, 일반적으로 정상 데이터에 작고 종종 인지할 수 없는 교란을 추가하여 머신러닝 모델이 오분류하거나 잘못된 동작을 하도록 유발한다. 이러한 입력은 대부분의 학습 알고리즘이 훈련 데이터와 테스트 데이터가 동일한 분포에서 추출될 것이라고 가정하는 통계적 전제를 악용한다. 실제로 공격자는 이 가정을 위반하는 조작된 데이터를 의도적으로 공급할 수 있으며, 이는 스팸 필터링, 컴퓨터 보안, 생체 인식, 자율 주행과 같은 고위험 응용 분야에서 실패를 초래할 수 있다.
적대적 예시에 대한 연구는 머신러닝 알고리즘에 대한 공격과 그러한 공격에 대한 방어를 모두 검토하는 적대적 머신러닝이라는 더 넓은 분야에 속한다. 일반적인 공격 범주에는 추론 시 입력을 수정하여 탐지를 회피하는 회피 공격, 훈련 데이터를 손상시키는 데이터 중독 공격, 분산 학습 시스템을 대상으로 하는 비잔틴 공격, 그리고 공격자가 모델의 기능을 도용하거나 복제하려는 모델 추출이 포함된다.
역사적 발전
적대적 예시에 대한 관심은 스팸 필터링에 대한 초기 연구에서 emerged. 2004년 1월 MIT 스팸 회의에서 John Graham-Cumming은 머신러닝 스팸 필터가 스팸 이메일에 추가할 단어를 자동으로 학습하여 스팸이 아닌 것으로 분류되도록 함으로써 다른 필터를 무력화할 수 있음을 시연했다. 같은 해 후반에 Nilesh Dalvi와 동료들은 스팸 필터에 사용되는 선형 분류기가 스패머가 이메일에 "좋은 단어"를 삽입함으로써 간단한 회피 공격에 의해 무력화될 수 있음을 지적했다. 2007년경 일부 스패머는 OCR 기반 필터를 무력화하기 위해 이미지 스팸 내의 단어에 무작위 잡음을 추가했다.
2006년 Marco Barreno와 다른 연구자들은 "Can Machine Learning Be Secure?"를 발표하여 공격에 대한 광범위한 분류 체계를 개괄했다. 2013년까지도 많은 연구자들은 서포트 벡터 머신과 같은 비선형 분류기와 신경망이 적대자에 대해 강건할 수 있기를 희망했다. 이러한 희망은 Battista Biggio와 다른 연구자들이 2012년과 2013년에 그러한 모델에 대한 최초의 그래디언트 기반 공격을 시연하면서 줄어들었다. 2014년부터 Christian Szegedy와 다른 연구자들은 심층 신경망이 적대자에 의해 속을 수 있음을 보여주었으며, 다시 그래디언트 기반 방법을 사용하여 적대적 교란을 제작했다.
메커니즘과 속성
적대적 예시는 일반적으로 입력에 작고 신중하게 계산된 교란을 추가하여 생성된다. 이미지 분류기의 경우 이는 인간에게는 인지할 수 없지만 모델이 높은 신뢰도로 다른 클래스를 출력하도록 하는 방식으로 픽셀 값을 수정하는 것을 포함한다. 고속 그래디언트 부호 방법과 같은 그래디언트 기반 방법은 모델의 손실 함수를 사용하여 분류 오류를 최대화하는 교란의 방향을 결정한다.
추가 연구에 따르면 적대적 예시는 통제되지 않은 환경에서 생성하기가 더 어렵다. 작은 회전이나 약간의 조명 변화와 같은 환경적 제약이 잡음의 효과를 상쇄할 수 있기 때문이다. 예를 들어, 실험실 조건에서 모델을 속이는 적대적 이미지는 다른 각도나 다른 조명에서 볼 때 적대성을 잃을 수 있다. 이러한 관찰은 물리적 조건이 변동성을 도입하는 실제 세계 공격에 대한 함의를 가진다.
Google Brain의 연구자들(Nick Frosst 포함)은 정지 표지판을 물리적으로 제거하는 것이 적대적 예시를 만드는 것보다 자율 주행 차량이 정지 표지판을 놓치게 만드는 것이 종종 더 쉽다고 지적했다. Frosst는 또한 적대적 머신러닝 커뮤니티가 특정 데이터 분포로 훈련된 모델이 완전히 다른 분포에서 잘 수행될 것이라고 잘못 가정한다고 주장했다. 그는 인간의 지각과 더 유사한 특성을 통합하는 새로운 머신러닝 접근 방식을 탐구할 것을 제안했다.
주목할 만한 시연
여러 유명한 시연이 적대적 예시의 힘을 보여주었다. 연구자들은 이미지에서 단 하나의 픽셀만 변경해도 딥러닝 알고리즘을 속일 수 있음을 보여주었다. 또 다른 사례에서는 Google의 객체 감지 AI가 거북이를 보는 각도와 관계없이 소총으로 분류하도록 설계된 질감을 가진 3D 인쇄 장난감 거북이가 제작되었다. 거북이를 만드는 데는 저렴한 상업용 3D 인쇄 기술만 필요했다.
기계가 조작한 개 이미지는 컴퓨터와 인간 모두에게 고양이처럼 보이는 것으로 나타났으며, 2019년 연구에 따르면 인간은 기계가 적대적 이미지를 어떻게 분류할지 추측할 수 있다. 연구자들은 또한 자율 차량이 합류 또는 속도 제한 표지판으로 분류하도록 정지 표지판의 외관을 교란하는 방법을 발견했다. 별도의 사건에서 McAfee는 Tesla의 이전 Mobileye 시스템을 공격하여 속도 제한 표지판에 2인치 검은 테이프를 추가함으로써 제한 속도를 50mph 초과하도록 속였다.
얼굴 인식 시스템이나 번호판 판독기를 속이기 위해 설계된 안경이나 의복의 적대적 패턴은 "스텔스 스트리트웨어"라는 틈새 산업을 이끌었다. 이러한 물리적 적대적 예시는 이 현상이 디지털 입력을 넘어 확장됨을 보여준다.
보안 및 악성 코드 응용
적대적 예시는 컴퓨터 보안에 중요한 함의를 가진다. 악성 코드 탐지에서 연구자들은 악성 기능을 보존하면서 학습 기반 탐지기를 회피하도록 바이너리를 자동으로 제작하는 적대적 악성 코드 생성 방법을 제안했다. GAMMA와 같은 최적화 기반 공격은 유전 알고리즘을 사용하여 Windows 실행 파일에 패딩이나 새 PE 섹션과 같은 양성 콘텐츠를 주입한다. 이 접근 방식은 회피를 오분류 성공과 주입된 페이로드 크기 사이의 균형을 맞추는 제약 최적화 문제로 구성하며, 상용 안티바이러스 제품에 대한 전이성을 보여주었다.
보완 작업은 생성적 적대 신경망(GAN)을 사용하여 악성 코드가 양성으로 분류되도록 하는 특징 공간 교란을 학습한다. 예를 들어 Mal-LSGAN은 표준 GAN 손실을 최소 제곱 목적 함수와 수정된 활성화 함수로 대체하여 훈련 안정성을 개선한다. 이 방법은 여러 탐지기에서 참양성률을 상당히 줄이는 적대적 악성 코드 예시를 생성한다.
보안 응용에서 악성 코드 및 컴퓨터 바이러스 분석에 사용되는 클러스터링 알고리즘도 취약하다. 이러한 알고리즘은 악성 코드 계열을 식별하고 특정 탐지 시그니처를 생성하는 것을 목표로 하지만, 공격자는 입력을 조작하여 클러스터링을 회피하거나 결과 시그니처를 오도할 수 있다.
오디오 및 물리적 공격
적대적 공격은 이미지에 국한되지 않는다. 연구자들은 지능형 비서에 대한 명령을 무해해 보이는 오디오에 숨기는 적대적 오디오 입력을 만들었다. 이러한 공격은 대상 시스템에 알고리즘을 주입하거나 의도하지 않은 동작을 유발하는 데 사용될 수 있다. 병행 문헌은 인간이 그러한 자극을 감지하거나 이해할 수 있는지 여부를 조사하며 이러한 자극에 대한 인간의 지각을 탐구한다.
인간 행동 인식 분야에서 새로운 적대적 공격은 매우 효과적이다. 이러한 시스템은 감시, 자율 차량, 실내 모니터링에 사용된다. 공격자는 인간 특징의 표현에 잡음을 도입하여 인식 시스템을 속인다. 특히 이러한 공격은 인식 시스템 자체에 대한 접근을 반드시 요구하지 않으며, 인간 사용자에게 인지할 수 없을 수 있다.
방어 및 완화
적대적 예시에 대한 방어는 여전히 열린 과제이다. 모델을 적대적 예시에 대해 훈련시켜 강건성을 개선하는 적대적 훈련과 같은 기술은 일부 가능성을 보여주었지만 종종 깨끗한 입력에 대한 정확도를 감소시킨다. 다른 접근 방식에는 입력 전처리, 적대적 입력 탐지, 공식적 보장을 제공하는 인증된 방어가 포함된다.
적대적 머신러닝은 계속해서 학계에 깊이 뿌리를 두고 있지만, Google, Microsoft, IBM과 같은 대형 기술 기업은 다른 사람들이 머신러닝 모델의 강건성을 구체적으로 평가하고 적대적 공격의 위험을 최소화할 수 있도록 문서와 오픈 소스 코드 베이스를 정리하기 시작했다. 이러한 자원은 평가 방법을 표준화하고 더 탄력적인 시스템 개발을 장려하는 것을 목표로 한다.
데이터 중독 및 창의적 보호
관련 위협은 공격자가 모델 동작에 영향을 미치기 위해 훈련 데이터를 손상시키는 데이터 중독이다. 2023년 시카고 대학의 연구자들은 Nightshade라는 데이터 중독 필터를 출시했다. 이 필터는 시각 예술가가 자신의 작품에 적용하여 일반적으로 인터넷에서 이미지 제작자의 동의 없이 데이터를 스크래핑하는 텍스트-이미지 모델의 데이터 세트를 손상시키기 위해 만들어졌다. 이 도구는 개인이 생성형 AI 모델의 훈련에서 무단 사용으로부터 지적 재산을 보호할 수 있게 하는 적대적 기술의 방어적 사용을 나타낸다.
지속적인 연구 및 미래 방향
적대적 예시 분야는 계속 진화하고 있으며, 연구자들은 새로운 공격 벡터와 더 강력한 방어 메커니즘을 모두 탐구하고 있다. 특정 데이터 분포로 훈련된 모델이 완전히 다른 분포에서 잘 수행될 것이라는 가정은 점점 더 의문시되고 있다. 일부 연구자들은 일반적으로 작은 교란에 더 강건한 인간의 지각을 더 잘 모방하는 새로운 머신러닝 접근 방식을 옹호한다.
딥러닝 모델이 더 중요한 응용 분야에 배포됨에 따라 적대적 예시를 이해하고 완화하는 것이 점점 더 중요해진다. 공격과 방어 사이의 상호 작용은 지속적인 연구를 주도하며, 각각의 새로운 방어는 종종 더 정교한 공격을 고무시킨다. 궁극적인 목표는 깨끗한 데이터에서 정확할 뿐만 아니라 적대자의 존재 하에서도 신뢰할 수 있는 머신러닝 시스템을 만드는 것이다.