적대적 예시

영어에서 번역됨

적대적 예제는 기계 학습 모델을 속여 잘못된 예측을 하도록 의도적으로 설계된 입력으로, 종종 인간에게는 인지되지 않는다. 이는 적대적 기계 학습 연구의 핵심 초점이다.

적대적 예시는 기계 학습 모델이 오류를 내도록 의도적으로 설계된 입력이다. 이러한 입력은 일반적으로 합법적인 데이터에 작고 종종 인지할 수 없는 교란을 적용하여 생성되는데, 예를 들어 이미지에 노이즈를 추가하거나 텍스트의 몇 단어를 변경하는 방식이 있다. 적대적 예시의 존재는 많은 기계 학습 시스템이 훈련 데이터와 테스트 데이터가 동일한 통계적 분포에서 온다고 가정하는 근본적인 취약점을 드러낸다. 그러나 실제로는 사용자나 공격자가 이 가정을 위반하는 조작된 데이터를 제공할 수 있으며, 이는 보안, 자율 주행, 생체 인식과 같은 고위험 애플리케이션에서 잘못된 예측을 초래한다.

이러한 공격과 이에 대한 방어에 대한 연구는 적대적 기계 학습 분야에 속한다. 이 분야는 모델이 어떻게 속임을 당할 수 있는지, 그리고 어떻게 더 견고하게 만들 수 있는지를 조사한다. 적대적 예시는 무작위 노이즈나 낮은 일반화로 인해 발생하는 다른 유형의 모델 오류와는 구별되는데, 이는 모델의 결정 경계에 있는 특정 약점을 악용하도록 의도적으로 최적화되기 때문이다.

역사

적대적 예시의 개념은 스팸 필터링에 대한 초기 연구에서 등장했다. 2004년 1월 MIT 스팸 회의에서 존 그레이엄-커밍은 기계 학습 스팸 필터를 사용하여 다른 스팸 필터를 무력화할 수 있음을 시연했는데, 이는 스팸 이메일에 추가할 단어를 자동으로 학습하여 스팸이 아닌 것으로 분류되도록 하는 방식이었다. 같은 해에 닐레시 달비와 동료들은 스팸 필터에 사용되는 선형 분류기가 스패머가 이메일에 정상적인 단어를 삽입하는 단순한 회피 공격으로 무력화될 수 있다고 지적했다. 2007년경 일부 스패머는 OCR 기반 필터를 무력화하기 위해 이미지 스팸 내의 퍼지 단어에 무작위 노이즈를 추가했다.

2006년에 마르코 바레노와 다른 연구자들은 "머신 러닝은 안전할 수 있는가?"라는 논문을 발표하여 공격에 대한 광범위한 분류 체계를 제시했다. 2013년까지도 많은 연구자들은 서포트 벡터 머신과 신경망과 같은 비선형 분류기가 적대자에게 견고할 수 있기를 희망했다. 이 희망은 바티스타 비지오와 다른 연구자들이 2012-2013년에 그러한 모델에 대한 최초의 경사 기반 공격을 시연하면서 무너졌다. 2014년에 크리스티안 세게디와 동료들은 심층 신경망이 경사 기반 방법을 사용하여 적대적 교란을 만들어 속일 수 있음을 보여주었다. 이 연구는 공격과 방어 모두에 대한 연구의 급증을 촉발했다.

추가 연구에 따르면 적대적 공격은 통제되지 않은 환경에서 생성하기가 더 어려우며, 작은 회전이나 조명 변화가 적대적 효과를 파괴할 수 있다. 구글 브레인의 닉 프로스트와 같은 연구자들은 자율 주행 자동차에 대한 신뢰할 수 있는 적대적 예시를 만드는 것보다 물리적으로 정지 표지판을 제거하는 것이 더 쉬운 경우가 많다고 지적했다. 프로스트는 또한 커뮤니티가 한 데이터 분포에서 훈련된 모델이 다른 분포에서도 잘 수행될 것이라고 잘못 가정한다고 주장하며, 인간의 지각을 모방하는 새로운 접근 방식의 필요성을 제안했다. 이 분야는 학계에 뿌리를 두고 있지만, 구글, 마이크로소프트, IBM과 같은 대형 기술 기업들은 모델 견고성을 평가하고 공격 위험을 최소화하기 위한 문서와 오픈 소스 코드 기반을 관리하기 시작했다.

공격 유형

적대적 기계 학습은 몇 가지 일반적인 공격 범주를 포함한다. 회피 공격은 테스트 시점에 발생하며, 공격자가 입력을 수정하여 오분류되도록 하는 것으로, 예를 들어 정지 표지판 이미지에 노이즈를 추가하여 속도 제한 표지판으로 인식되게 하는 방식이다. 데이터 중독 공격은 훈련 중에 발생하며, 공격자가 훈련 세트에 악성 데이터를 주입하여 모델의 동작을 손상시킨다. 비잔틴 공격은 분산 훈련 시스템을 표적으로 삼아 손상된 노드가 잘못된 업데이트를 보내도록 한다. 모델 추출 공격은 모델을 쿼리하고 대체 모델을 훈련하여 모델의 기능을 훔치는 것을 목표로 한다.

악성 코드 탐지 맥락에서 연구자들은 악성 기능을 유지하면서 학습 기반 탐지기를 회피하도록 이진 파일을 자동으로 제작하는 적대적 악성 코드 생성 방법을 제안했다. GAMMA와 같은 최적화 기반 공격은 유전 알고리즘을 사용하여 Windows 실행 파일에 패딩이나 새 PE 섹션과 같은 정상 콘텐츠를 주입한다. 이 접근 방식은 회피를 오분류 성공과 페이로드 크기의 균형을 맞추는 제약 최적화 문제로 구성하며 상용 안티바이러스 제품에 대한 전이성을 보여준다. 보완 연구는 생성적 적대 신경망(GAN)을 사용하여 악성 코드가 정상으로 분류되도록 하는 특징 공간 교란을 학습한다. 예를 들어 Mal-LSGAN은 표준 GAN 손실을 최소 제곱 목적 함수로 대체하여 훈련 안정성을 개선하고 여러 탐지기에서 참양성 비율을 줄인다.

실제 사례

적대적 예시는 많은 영역에서 시연되었다. 연구자들은 단 한 픽셀만 변경해도 딥러닝 알고리즘을 속일 수 있음을 보여주었다. 다른 연구자들은 구글의 객체 감지 AI가 보는 각도와 관계없이 소총으로 분류하도록 설계된 텍스처를 가진 장난감 거북이를 3D 프린팅했으며, 저렴한 상용 3D 프린팅 기술만 사용했다. 기계가 조정한 개 이미지는 컴퓨터와 인간 모두에게 고양이처럼 보이는 것으로 나타났다. 2019년 연구에 따르면 인간은 기계가 적대적 이미지를 어떻게 분류할지 추측할 수 있다.

자율 주행 분야에서 연구자들은 차량이 합류 또는 속도 제한 표지판으로 분류하도록 정지 표지판의 외관을 교란하는 방법을 발견했다. 맥아피는 테슬라의 이전 모빌아이 시스템을 공격하여 속도 제한 표지판에 2인치 검은 테이프를 붙여 차량이 속도 제한을 50mph 초과하도록 속였다. 얼굴 인식 시스템이나 번호판 판독기를 속이기 위해 설계된 안경이나 의복의 적대적 패턴은 스텔스 거리 의류의 틈새 산업을 이끌었다.

적대적 오디오 입력은 지능형 비서에 대한 명령을 무해해 보이는 오디오에 숨길 수 있다. 생체 인식 분야에서 가짜 특성은 합법적인 사용자를 사칭하거나 템플릿 갤러리를 손상시킬 수 있다. 감시 및 자율 주행 차량에 사용되는 인간 행동 인식 시스템에도 새로운 공격이 효과적이며, 공격자는 인식 시스템 자체에 접근할 필요 없이 인간 특징 표현에 노이즈를 주입하여 시스템을 속인다.

방어 및 완화

적대적 예시에 대한 방어에는 모델을 적대적 예시로 훈련하여 견고성을 개선하는 적대적 훈련, 노이즈 제거나 특징 압축과 같은 입력 전처리, 그리고 의심스러운 입력을 표시하는 탐지 방법이 포함된다. 그러나 보편적인 방어는 존재하지 않으며, 공격자는 계속해서 새로운 기술을 개발한다. 2023년 시카고 대학 연구자들이 출시한 나이트셰이드 데이터 중독 필터는 시각 예술가가 동의 없이 데이터를 스크랩하는 텍스트-이미지 모델의 데이터 세트를 손상시킬 수 있게 하여, 중독이 방어적으로 어떻게 사용될 수 있는지 보여준다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:adversarial-machine-learning·machine-learning-security·artificial-intelligence·cybersecurity
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사