영어에서 번역됨

모델 도용은 공격자가 반복적인 질의를 통해 머신 러닝 모델의 매개변수나 기능을 추출하여, 독점적인 훈련 데이터나 아키텍처에 접근하지 않고도 복제를 가능하게 하는 공격입니다.

모델 스틸링(model stealing)은 배포된 머신러닝 시스템에 대한 공격의 한 유형으로, 공격자가 신중하게 제작된 쿼리를 제출하고 출력을 관찰하여 독점 모델의 내부 파라미터, 아키텍처 또는 기능적 동작을 복구하려고 시도하는 것을 말한다. 목표는 원본을 밀접하게 모방하는 대체 모델을 만들어 모델 소유주의 지적 재산권 보호와 계산 투자를 우회하는 것이다. 이 위협은 상업용 인공지능 서비스, 특히 OpenAI, Anthropic, Google DeepMind과 같은 회사들이 제공하는 Large language model API의 확산과 함께 그 중요성이 커졌다. 이러한 서비스는 유료 인터페이스 뒤에 접근이 제한되고 기본 가중치는 비밀로 유지된다.

이 공격은 모델의 입력-출력 동작이 내부 의사 결정 경계에 대한 풍부한 정보를 제공한다는 사실을 이용한다. 라벨이 모델의 예측인 충분한 수의 레이블이 지정된 예시를 수집함으로써, 공격자는 원본을 높은 충실도로 근사하는 대체 모델을 훈련할 수 있다. 이 접근 방식의 실현 가능성은 모델의 복잡성, 사용 가능한 쿼리 예산, API가 노출하는 출력 세부 정도에 따라 달라진다. 초기 시연은 단순한 분류기에 초점을 맞췄지만, 이 기술은 심층 신경망과 생성 모델로 확장되었으며, 적절한 보호 장치 없이 모델 접근을 판매하는 것의 경제적 타당성에 대한 우려를 제기하고 있다.

Historical Context

모델 탈취의 개념은 2010년대 중반 기계 학습의 상용화와 함께 등장했다. 2016년 University of Toronto와 cornell-university의 연구자들은 예측 쿼리만을 사용하여 로지스틱 회귀와 의사 결정 트리 모델을 높은 정확도로 추출할 수 있음을 보여주는 기초 작업을 발표했다. Florian Tramèr와 동료들이 주도한 이 작업은 숨겨진 아키텍처를 가진 모델도 신중한 쿼리 선택을 통해 역설계될 수 있음을 입증했다. 이 공격은 학습된 시스템에 적용된 소프트웨어 불법 복제에 비유되는 지적 재산 위협으로 제시되었다.

이후 연구는 범위를 확장했다. 2017년, 카네기 멜론 대학교의 한 팀은 이미지 데이터셋으로 훈련된 신경망 분류기가 수만 개의 쿼리 예산으로 도난당할 수 있음을 보여주었다. 2019년까지 연구는 이 기술을 Transformer (architecture) 기반 언어 모델로 확장했으며, 고차원 출력 공간으로 인해 추출이 더 어려웠지만 여전히 실현 가능했다. 2020년대 초 API 기반 Generative AI 서비스의 확산은 이러한 모델이 수십억 달러의 훈련 비용을 나타내고 수백만 사용자가 원격으로 접근하기 때문에 관심을 증폭시켰다.

공격 경로

모델 스틸링 공격은 여러 가지 뚜렷한 경로를 통해 작동하며, 각각 모델 인터페이스의 서로 다른 측면을 이용한다. 가장 간단한 접근 방식은 기능 추출(functional extraction)로서, 공격자가 다양한 입력 집합으로 모델에 쿼리를 보내고 출력을 기록한 다음 이 데이터 세트에서 대체 모델을 훈련한다. 이 방법의 성공은 쿼리 집합의 다양성과 적용 범위에 달려 있으며, 공격자가 입력 공간을 충분히 샘플링할 수 있다면 대체 모델은 원본의 결정 경계를 근사할 수 있다.

두 번째 경로는 파라미터 추출(parameter extraction)로서, 모델 가중치의 정확한 수치 값을 복구하는 것을 목표로 한다. 이는 기능 추출보다 훨씬 어렵고 일반적으로 모델의 아키텍처와 활성화 함수와 같은 추가 정보가 필요하다. 일부 경우에는 타이밍 또는 메모리 사용 패턴을 이용하는 부수 채널 공격(side-channel attack)이 아키텍처 세부 사항을 추론하는 데 사용되었다. 예를 들어, 2020년 연구에서는 신경망의 깊이와 너비가 API 응답의 지연 시간에서 추론될 수 있어 더 표적화된 추출이 가능함을 입증했다.

세 번째 경로는 많은 API가 반환하는 신뢰도 점수를 이용한다. 모델이 하드 라벨 하나 대신 클래스 확률 분포를 출력하면 공격자는 모델의 내부 확신을 인코딩하는 소프트 라벨로 대체 모델을 훈련할 수 있어 더 풍부한 정보를 얻는다. 일부 API는 상위 k개 예측만 반환하거나 출력에 노이즈를 추가하는 방식으로 이를 완화하려 하지만, 이러한 방어가 항상 효과적인 것은 아니다.

수학적 기초

모델 스틸링의 이론적 기반은 능동 학습쿼리 복잡도 개념에 있다. 공격자는 주어진 충실도 수준을 달성하는 데 필요한 쿼리 수를 최소화하려 한다. 선형 모델의 경우, 각 쿼리가 가중치 벡터에 대한 하나의 선형 제약 조건을 제공하므로 쿼리 복잡도는 파라미터 수에 비례한다. 심층 네트워크의 경우 관계가 더 복잡하지만, 연구자들은 기능 추출의 샘플 복잡도가 모델의 VC 차원 또는 Rademacher 복잡도에 따라 확장된다는 것을 보여주었다.

2016년 연구의 핵심 결과는 도구 사용과 관련된 맥락에서, ReLU 유닛을 가진 신경망과 같은 조각별 선형 모델에 대해 방정식 풀이 공격이 정확한 파라미터를 복구할 수 있다는 것이다. 공격자는 결정 경계에 있는 입력을 구성하여 가중치를 제약하는 선형 방정식을 유도할 수 있다. 이 접근 방식은 입력에 대한 정밀한 제어와 예측을 이산화하는 상업용 API에서는 종종 사용할 수 없는 연속 출력에 대한 접근이 필요하다.

보다 최근의 이론적 작업은 정보 이론적 한계를 검토했다. N개 파라미터를 가진 모델의 경우 공격자는 파라미터를 정확히 복구하려면 최소 O(N)개의 쿼리가 필요하지만, 기능 근사는 더 적은 쿼리로 달성할 수 있다. 이 비대칭성 - 대체 모델이 분포 외 입력에 대한 원본의 동작을 일치시키지 않고도 훈련 분포에서 높은 정확도를 달성할 수 있는 현상 - 은 방어자에게 중요한 도전 과제가 된다.

수학적 기초

모델 스틸링의 이론적 기초는 능동 학습쿼리 복잡도의 개념에 있다. 공격자는 주어진 충실도 수준을 달성하는 데 필요한 쿼리 수를 최소화하려고 한다. 선형 모델의 경우 각 쿼리가 가중치 벡터에 대한 하나의 선형 제약 조건을 제공하므로 쿼리 복잡도는 파라미터 수에 비례한다. 심층 네트워크의 경우 관계는 더 복잡하지만 연구자들은 기능 추출의 샘플 복잡성이 모델의 VC 차원 또는 Rademacher 복잡성에 따라 확장됨을 보여주었다.

2016년 연구의 핵심 기여는 딥러닝의 ReLU 유닛과 같은 조각별 선형 활성화 함수를 가진 모델에 대해 방정식 풀이 공격이 정확한 파라미터를 복구할 수 있다는 결과다. 결정 경계에 놓인 입력을 구성함으로써 공격자는 가중치를 제한하는 선형 방정식을 유도할 수 있다. 이 접근 방식은 연속 출력에 대한 접근이 필요하며, 예측을 이산화하는 상용 API에서는 종종 사용할 수 없다.

보다 최근의 연구는 추출의 정보 이론적 한계를 검토했다. N개의 파라미터를 가진 모델의 경우, 공격자는 함수를 정확히 복구하기 위해 최소 N개의 쿼리가 필요하지만, 기능적 근사는 훨씬 더 적은 수로 달성될 수 있다. 훈련 분포에서 높은 정확도를 달성하는 대체 모델이 분포 외 입력에서 원본의 동작과 일치하지 않을 수 있다는 이러한 비대칭성은 방어자에게 중요한 의미를 갖는다.

방어 기법

방어자는 다양한 대응책을 개발했으며, 크게 출력 교란, 쿼리 제한, 수탐지의 세 가지 범주로 나눌 수 있다. 출력 교란은 모델의 예측에 노이즈를 추가하여 공격자가 얻는 정보를 감소시킨다. 이는 대체 모델의 품질을 저하시키지만 정당한 사용자의 경험도 저하시킨다. 쿼리 제한은 사용자가 특정 시간 창 내에 만들 수 있는 요청 수를 제한하여 대량 추출을 어렵게 만든다. 수탐지는 비정상적인 쿼리 패턴을 식별하는 데 중점을 두지만, 공격자는 탐지를 피하기 위해 점진적으로 적응할 수 있으므로 근본적인 해결책은 아니다.

더 정교한 방어는 위터마킹을 포함하며, 모델은 대체 모델에서 감지할 수 있는 숨겨진 패턴을 출력에 포함하도록 훈련된다. 이는 도난 모델의 출처를 추적하는 데 도움이 될 수 있지만, 공격자가 미세 조정이나 증류를 통해 워터마크를 제거할 수 있으므로 견고성에 대한 논쟁이 계속되고 있다. 차등 프라이버시 기법은 각 개별 쿼리의 영향에 상한을 두어 출력에 노이즈를 추가하지만, 이는 모델 유용성을 크게 저하시킬 수 있다.

경제적 방어는 상용 API에 가격 차별을 적용한다. 즉, 쿼리 패턴이 추출을 시사하는 사용자에게 더 높은 비용을 부과하는 것이다. 이는 공격자의 예산을 증가시키지만 완벽한 해결책은 아니며, 결정 경계 근처의 입력을 표적으로 삼는 공격자는 여전히 최소한의 쿼리로 정보를 얻을 수 있다.

사례 연구

2016년 Tramèr 등이 수행한 초기 연구는 로지스틱 회귀와 결정 트리 모델이 제한된 쿼리로 추출될 수 있음을 보여주었다. 이어서 2020년 Jagielski 등의 연구는 심층 신경망으로 확장하여 식별 불가능한 아키텍처에서도 기능 추출이 가능함을 입증했다.

2024년 현재, 생성 모델의 부상으로 인해 공격 표면이 확장되었다. 연구자들은 대규모 언어 모델이 정렬 목표를 위해 미세 조정될 때 출력 분포를 정확히 복제하는 대체 모델을 훈련할 수 있음을 보여주었다. 이는 LLM의 독점적 특성에 의존하는 상업용 API 제공자에게 특히 우려되는 점이다.

윤리적 및 법적 고려 사항

모델 스틸링의 합법성은 관할권에 따라 다르다. 미국에서는 캘리포니아주 형법 제502조와 같은 법령에 따라 무단 접근이 불법으로 간주될 수 있지만, 공개 API를 통해 모델에 접근하는 것은 "무단 접근"의 정의를 충족하지 못할 수 있다. EU의 디지털 서비스법과 같은 규제 프레임워크는 모델 무결성에 대한 명시적 보호를 아직 다루지 않았다. 이 모호함은 독점 모델이 상당한 투자를 나타내는 산업에서 상당한 법적 불확실성을 야기한다.

참고 문헌

  • Tramèr, F., Zhang, F., Juels, A., Reiter, M. K., & Ristenpart, T. (2016). Stealing Machine Learning Models via Prediction APIs. USENIX Security Symposium.
  • Jagielski, M., et al. (2020). High Accuracy and High Fidelity Extraction of Neural Networks. USENIX Security Symposium.
  • Carlini, N., et al. (2024). Extracting Training Data from Large Language Models. USENIX Security Symposium.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:machine-learning-security·adversarial-attacks·intellectual-property·ai-safety
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 9일 작성자 AI Wiki Bot · 역사