모델 강건성은 머신 러닝 시스템이 섭동, 분포 이동 또는 적대적 입력에 직면했을 때 일관된 성능을 유지하는 능력을 설명하는 속성이다. 컴퓨터 과학에서 강건성은 일반적으로 시스템이 실행 중 오류와 잘못된 입력을 처리하는 능력을 의미한다. 머신 러닝 모델의 경우, 이는 테스트 오류가 훈련 오류와 일관되게 유지되거나, 데이터셋에 노이즈가 추가된 후에도 성능이 안정적으로 유지되어야 한다는 요구로 해석된다. 강건성은 특히 자율 주행, 의료, 금융과 같은 안전이 중요한 분야에 모델이 점점 더 많이 배포됨에 따라 AI 시스템 배포의 핵심 관심사가 되었다.
머신 러닝에서의 강건성 개념은 강건한 프로그래밍과 내결함성 시스템 설계의 일반적인 원칙에서 비롯된다. 전통적인 소프트웨어 강건성은 퍼즈 테스트와 오류 주입과 같은 기법을 통해 예상치 못한 입력을 우아하게 처리하는 것을 강조한다. 머신 러닝에서 강건성은 이 개념을 모델의 통계적이고 확률적인 특성으로 확장하며, 여기서 입력은 단순한 이산 값이 아니라 이미지, 오디오, 텍스트와 같은 고차원 데이터이다. 강건한 모델은 훈련 분포에서 좋은 성능을 보일 뿐만 아니라 자연적인 변동성이나 의도적인 공격으로 인해 발생하는 보이지 않는 변형에도 일반화되어야 한다.
역사적 배경
모델 강건성에 대한 연구는 2010년대에 두드러지게 부상했으며, 이는 신경망이 적대적 예제에 놀라울 정도로 취약하다는 발견에 의해 주도되었다. 적대적 예제는 입력에 대한 작고 종종 눈에 띄지 않는 섭동으로, 극적인 오분류를 유발한다. 이 현상은 2013년 Christian Szegedy와 동료들에 의해 처음으로 체계적으로 문서화되었고, 이후 Ian Goodfellow의 적대적 공격 및 방어에 대한 연구로 대중화되었다. 최첨단 모델이 이미지에 아주 작은 노이즈를 추가하는 것만으로 속일 수 있다는 사실은 딥 러닝 시스템의 신뢰성에 대한 근본적인 의문을 제기했다.
초기 연구는 신경망이 왜 이러한 취약성을 보이는지 이해하는 데 초점을 맞췄다. 한 가지 설명은 모델이 특히 고차원 설정에서 입력 공간의 작은 변화에 매우 민감한 결정 경계를 학습한다는 것이다. 또 다른 설명은 평균 손실을 최소화하는 훈련 목표가 최악의 경우 섭동에 대한 강건성을 명시적으로 장려하지 않는다는 것이다. 이로 인해 모델이 적대적 예제로 훈련되어 강건성을 향상시키는 적대적 훈련이 개발되었다. 이 분야는 이후 무작위 노이즈에 대한 강건성, 분포 이동, 도메인 이동을 포함한 광범위한 강건성 개념으로 확장되었다.
섭동의 유형
모델 강건성은 일반적으로 여러 유형의 섭동에 대해 평가된다. 가장 많이 연구되는 것은 모델을 속이기 위해 의도적으로 제작된 적대적 섭동이다. 이는 Fast Gradient Sign Method(FGSM) 및 Projected Gradient Descent(PGD)와 같은 경사 기반 방법이나 Carlini-Wagner 공격과 같은 최적화 기반 접근법을 사용하여 생성될 수 있다. 적대적 강건성은 모델이 이러한 공격에 얼마나 잘 저항하는지 측정하며, 종종 적대적 예제에 대한 정확도로 정량화된다.
입력에 추가되는 가우시안 노이즈와 같은 무작위 섭동도 또 다른 일반적인 테스트이다. 무작위 노이즈에 강건한 모델은 센서 오류나 데이터의 자연적인 변동에 덜 민감하다. 분포 이동은 훈련과 배포 사이의 기본 데이터 분포 변화를 의미하며, 예를 들어 주간 이미지로 훈련된 모델이 야간 이미지로 테스트되는 경우이다. 분포 이동에 대한 강건성은 모델이 훈련 세트와 다른 데이터를 자주 접하기 때문에 실제 배포에 중요하다. 마지막으로 강건성은 컴퓨터 비전 작업에서 흔한 회전, 이동 또는 스케일링과 같은 변환에 대한 불변성을 의미할 수도 있다.
평가 방법
모델 강건성을 평가하려면 신중한 실험 설계가 필요하다. 일반적인 접근 방식은 원본 데이터의 섭동된 버전을 포함하는 별도의 테스트 세트에서 성능을 측정하는 것이다. 적대적 강건성의 경우, 연구자들은 공격 알고리즘을 사용하여 최악의 경우 섭동을 생성한 다음 이러한 예제에 대한 모델의 정확도를 측정하는 경우가 많다. 그러나 공격 선택은 측정된 강건성에 큰 영향을 미칠 수 있으며, 이는 공격자와 방어자 사이의 고양이와 쥐 게임으로 이어진다.
강건성 평가를 표준화하기 위한 벤치마크가 개발되었다. 예를 들어, ImageNet-C 및 ImageNet-A 데이터셋은 각각 일반적인 손상 및 자연적 적대적 예제에 대한 강건성을 테스트한다. RobustBench 리더보드는 모델과 방어 전반에 걸쳐 적대적 강건성을 비교하기 위한 표준화된 플랫폼을 제공한다. 정확도 외에도 보정 오류 및 예측 불확실성과 같은 다른 지표가 강건성을 평가하는 데 사용된다. 강건한 모델은 정확할 뿐만 아니라 잘 보정되어야 하며, 즉 신뢰도 점수가 실제 정답 가능성을 반영해야 한다.
강건성 향상 기법
모델 강건성을 향상시키기 위해 여러 기법이 개발되었다. Goodfellow 등이 처음 제안한 적대적 훈련은 훈련 중에 생성된 적대적 예제로 훈련 데이터를 증강하는 것을 포함한다. 이 접근법은 증강에 사용된 특정 공격에 대한 강건성을 향상시키는 것으로 나타났지만, 종종 깨끗한 데이터에 대한 정확도 감소를 대가로 한다. TRADES 및 PGD를 사용한 적대적 훈련과 같은 더 고급 변형은 강건성과 정확성 사이의 균형을 목표로 한다.
데이터 증강은 또 다른 널리 사용되는 기법이다. 훈련 이미지에 무작위 잘라내기, 뒤집기 또는 색상 지터와 같은 변환을 적용함으로써 모델은 이러한 변형에 불변하도록 학습한다. 증강에는 노이즈 추가나 블러와 같은 합성 섭동도 포함될 수 있다. 가중치 감쇠, 드롭아웃 및 배치 정규화와 같은 정규화 기법은 과적합을 방지하고 간접적으로 강건성을 향상시킬 수 있다. 최근에는 훈련 예제의 볼록 조합을 생성하는 mixup 및 CutMix와 같은 방법이 특정 유형의 섭동에 대한 강건성을 향상시키는 것으로 나타났다.
아키텍처 선택도 강건성에 영향을 미친다. 예를 들어, 스킵 연결이 있는 잔차 네트워크는 일반적인 심층 네트워크보다 일반적으로 더 강건하다. 트랜스포머 기반 모델, 예를 들어 대규모 언어 모델은 특정 유형의 입력 섭동에 대해 놀라운 강건성을 보여주지만, 적대적 공격에는 여전히 취약하다. 여러 모델을 결합하는 앙상블 방법은 개별 모델 오류를 평균화하여 강건성을 향상시킬 수 있다.
과제와 절충
모델 강건성을 향상시키는 것은 과제가 없는 것이 아니다. 가장 중요한 것 중 하나는 강건성-정확성 절충이다. 적대적 섭동에 더 강건한 모델은 종종 깨끗한 데이터에 대한 정확도가 더 낮다. 이 절충은 광범위하게 연구되었으며, 일부 연구자는 이것이 근본적이라고 주장하는 반면, 다른 연구자는 더 나은 훈련 방법으로 극복할 수 있다고 믿는다. 또 다른 과제는 적대적 예제를 생성해야 하기 때문에 강건한 훈련의 계산 비용이 표준 훈련보다 몇 배 더 비쌀 수 있다는 점이다.
강건성은 또한 고려되는 섭동 집합인 위협 모델에 따라 달라진다. 한 유형의 공격에 강건한 모델은 다른 공격에 취약할 수 있다. 이로 인해 공격자가 방어를 인지하고 이를 우회하기 위해 특별히 설계된 공격을 개발하는 적응형 공격이 개발되었다. 적응형 공격 하에서 강건성을 평가하는 것은 최고 표준으로 간주되지만, 계산 집약적이고 전문성이 필요하다.
더욱이 분포 이동에 대한 강건성은 가능한 이동의 공간이 방대하기 때문에 본질적으로 어렵다. 일반 컴퓨터 과학 문헌에서 언급된 바와 같이, 가능한 입력과 입력 조합의 방대한 양으로 인해 모든 가능한 실패 지점을 포함하는 시스템을 구축하는 것은 어렵다. 머신 러닝에서는 데이터의 고차원적 특성으로 인해 이 문제가 더욱 악화된다. 연구자들은 도메인 적응 및 도메인 일반화와 같은 일반화 기법에 의존하여 보이지 않는 이동을 처리하지만, 이러한 방법에는 한계가 있다.
응용 및 중요성
모델 강건성은 많은 실제 응용 분야에서 중요하다. 자율 주행에서 모델은 다양한 기상 조건, 조명 및 도로 시나리오에서 안정적으로 작동해야 한다. 강건한 모델은 자율 주행 자동차가 예상치 못한 상황을 안전하게 탐색할 수 있도록 보장한다. 의료에서 진단에 사용되는 모델은 의료 영상 장비 및 환자 집단의 변동에 강건해야 한다. 금융에서 사기 탐지 모델은 진화하는 공격 패턴에 적응해야 한다.
강건성은 AI 시스템의 신뢰성에도 중요하다. 모델이 프로덕션에서 예측 불가능하게 실패하면 사용자 신뢰를 훼손하고 비용이 많이 드는 오류를 초래할 수 있다. 유럽 연합의 AI 법과 같은 규제 프레임워크는 고위험 AI 시스템의 핵심 기준으로 강건성을 요구하기 시작했다. AI가 사회에 더욱 통합됨에 따라 강건한 모델에 대한 수요는 더욱 증가할 것이다.
향후 방향
모델 강건성에 대한 연구는 계속 진화하고 있다. 유망한 방향 중 하나는 특정 범위 내의 섭동에 대해 모델이 강건함을 보장하는 인증된 강건성의 개발이다. 이는 무작위 평활화 및 검증 가능한 신경망과 같은 기법을 통해 달성된다. 또 다른 방향은 프롬프트 주입 및 적대적 텍스트와 같은 고유한 취약점을 가진 대규모 언어 모델의 강건성 연구이다. 연구자들은 또한 강건성과 해석 가능성 사이의 연관성을 탐구하고 있으며, 더 해석 가능한 모델이 더 강건할 수 있다는 아이디어를 가지고 있다.
지속적 학습의 맥락에서 분포 이동에 대한 강건성에 대한 관심도 증가하고 있다. 지속적 학습에서는 모델이 이전 지식을 잊지 않고 새로운 데이터에 적응해야 한다. 마지막으로, 이 분야는 적대적 섭동뿐만 아니라 공정성 및 편향과 같은 사회적, 윤리적 고려 사항을 포함하는 보다 전체적인 강건성 개념으로 나아가고 있다. 원본 자료에서 언급된 바와 같이, 강건성은 일반적인 방식으로 달성하기 어렵고, 이는 머신 러닝 커뮤니티의 공개적인 과제로 남아 있다.
같이 보기
- 내결함성
- 방어적 프로그래밍
- 비기능 요구사항