CutMix는 이미지 분류 작업에서 신경망을 훈련시키기 위한 데이터 증강 기법이다. 이 기법은 이미지 패치의 잘라내기 및 붙여넣기를 mixup에서 도입된 레이블 혼합 전략과 결합한다. 각 훈련 반복에서 하나의 훈련 이미지에서 직사각형 패치를 잘라내어 두 번째 이미지에 붙여넣고, 훈련 레이블은 붙여넣은 패치의 면적에 비례하는 가중치로 두 원본 레이블의 가중 결합으로 조정된다. 이 접근 방식은 모델이 잘못된 상관관계나 부분적 특징에 의존하기보다는 전체 객체에 집중하도록 장려하며, 분류 정확도, 손상에 대한 견고성, 및 위치 파악 성능을 향상시키는 것으로 입증되었다.
이 기법은 2019년에 Clova AI와 NAVER Corporation에 소속된 Sangdoo Yun, Dongyoon Han, Seong Joon Oh, Sanghyuk Chun, Junsuk Choe, Youngjoon Yoo가 발표한 논문에서 소개되었다. "CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features"라는 제목의 이 논문은 2019년 IEEE/CVF 국제 컴퓨터 비전 학회(ICCV)에서 발표되었다. 소개 이후로 CutMix는 많은 최첨단 비전 모델의 훈련 파이프라인에서 표준 구성 요소가 되었으며, 종종 다른 증강 기법과 함께 사용된다.
메커니즘
CutMix 연산은 다음과 같이 작동한다. 원-핫 레이블 \(y_A\)와 \(y_B\)를 가진 두 훈련 샘플 \(x_A\)와 \(x_B\)가 주어지면, 알고리즘은 먼저 각 이미지에서 어떤 픽셀을 가져올지 나타내는 이진 마스크 \(M\)을 샘플링한다. 마스크는 경계 상자 좌표 \((r_x, r_y, r_w, r_h)\)를 균일하게 무작위로 선택하여 생성되며, 상자 면적 비율 \(\lambda\)는 일반적으로 매개변수 \(\alpha = 1\)을 사용하는 베타 분포에서 샘플링된다. 새로운 훈련 샘플은 이미지 A에서 상자 외부 영역을 가져오고 이미지 B에서 상자 내부 영역을 가져와 형성된다. 결합된 샘플의 레이블은 \(\tilde{y} = \lambda y_A + (1 - \lambda) y_B\)로 계산되며, 여기서 \(\lambda\)는 이미지 A에서 유지된 픽셀의 비율이다.
이 과정은 훈련 중에 즉시 적용되며, 각 미니 배치가 무작위로 증강된다. 마스크는 배치의 각 샘플에 대해 독립적으로 생성되어 다양한 혼합 이미지 집합을 만든다. 잘라내기 위치와 크기는 균일하게 무작위이므로 모델이 다양한 부분적 가림과 조합을 볼 수 있게 보장한다.
다른 증강 기법과의 관계
CutMix는 이전의 증강 전략을 기반으로 한다. 가장 직접적인 전신은 2018년 Hongyi Zhang, Moustapha Cisse, Yann N. Dauphin, David Lopez-Paz가 소개한 mixup으로, 픽셀 값과 레이블의 볼록 결합을 취하여 전체 이미지를 혼합한다. Mixup은 훈련 샘플 간의 선형적 행동을 장려하지만 인간이 해석하기 어려운 비자연적인 이미지를 생성할 수 있다. 반면 CutMix는 각 영역 내에서 이미지의 자연스러운 외관을 유지하여 증강된 샘플을 더 의미론적으로 일관되게 만든다.
또 다른 관련 기법은 2017년 Terrance DeVries와 Graham W. Taylor가 제안한 Cutout으로, 이미지의 직사각형 영역을 무작위로 마스킹하여 0으로 설정한다. Cutout은 픽셀 수준의 드롭아웃 형태로 작동하여 모델이 덜 두드러진 특징에 의존하도록 강제한다. CutMix는 0으로 채워진 영역을 다른 이미지의 패치로 대체하고 혼합 레이블을 통해 추가적인 지도 신호를 제공하는 일반화로 볼 수 있다.
CutMix의 저자들은 CIFAR-10, CIFAR-100, ImageNet을 포함한 여러 벤치마크 데이터셋에서 mixup과 Cutout보다 우수한 성능을 실증적으로 보여주었다. 또한 CutMix가 모델의 객체 위치 파악 능력을 향상시킨다는 것을 포인팅 게임 지표로 측정하여 입증했는데, 이는 모델이 혼합 이미지를 올바르게 분류하려면 전체 객체에 주의를 기울여야 하기 때문이다.
구현 세부 사항
실제로 CutMix는 모든 이미지 분류 훈련 루프에 추가할 수 있는 간단한 변환으로 구현된다. 배치의 각 이미지 쌍에 대해 알고리즘은 다음을 수행한다:
- 베타 분포를 샘플링하여 혼합 비율 \(\lambda\)를 얻는다.
- \(\lambda\)를 기반으로 경계 상자 좌표를 계산한다.
- 이미지 B의 패치를 이미지 A에 복사하여 결합 이미지를 생성한다.
- 혼합 레이블을 가중 합으로 계산한다.
계산 오버헤드는 배열 슬라이싱과 할당만 포함하므로 최소화된다. 이로 인해 CutMix는 PyTorch나 TensorFlow와 같은 기존 프레임워크에 쉽게 통합할 수 있다. 많은 오픈 소스 구현이 존재하며, 이 기법은 종종 무작위 자르기, 뒤집기, 색상 지터와 같은 다른 증강과 결합된다.
한 가지 실용적인 고려 사항은 베타 분포 매개변수 \(\alpha\)가 증강의 강도를 제어한다는 점이다. \(\alpha = 1\)일 때 분포는 균일하며 모든 혼합 비율이 동일하게 발생할 가능성이 있다. 더 작은 \(\alpha\) 값(예: 0.2)은 한 이미지가 지배하는 더 극단적인 혼합을 생성하는 반면, 더 큰 값은 더 균형 잡힌 혼합을 생성한다. 원래 논문은 \(\alpha = 1\)이 여러 데이터셋에서 잘 작동한다는 것을 발견했지만, 일부 후속 연구에서는 특정 작업에 대해 이 매개변수를 조정했다.
응용 및 확장
CutMix는 이미지 분류를 넘어 적용되었다. 객체 탐지, 의미론적 분할, 그리고 트랜스포머를 비전 작업에 훈련시키는 데에도 사용되었다. 패치 혼합 아이디어는 오디오와 텍스트와 같은 다른 양식으로 확장되었지만, 이러한 데이터의 이산적 특성에 맞게 적응이 필요하다.
여러 변형이 제안되었다. 예를 들어, 2020년에 소개된 Puzzle Mix는 객체 경계를 보존하고 중요한 부분을 잘라내지 않도록 혼합 마스크를 찾기 위해 더 정교한 최적화를 사용한다. 또 다른 변형인 FMix는 푸리에 영역 마스크를 사용하여 불규칙한 혼합 패턴을 생성한다. 2021년에 제안된 Co-Mixup은 이 아이디어를 여러 이미지로 확장하고 혼합 샘플 간의 다양성을 장려한다.
데이터 증강의 맥락에서 CutMix는 종종 드롭아웃 및 배치 정규화와 같은 다른 기법과 함께 사용된다. 제한된 데이터로 대규모 모델을 훈련할 때 특히 효과적인 것으로 입증되었으며, 과적합을 줄이는 정규화 형태를 제공한다.
모델 견고성에 미치는 영향
CutMix의 주요 이점 중 하나는 입력 손상 및 적대적 섭동에 대한 견고성 향상이다. 다른 클래스의 패치가 포함된 이미지로 훈련함으로써 모델은 더 넓은 특징 집합에 의존하는 법을 배운다. 이는 실제 시나리오에 존재하지 않을 수 있는 배경 단서나 질감 패턴에 과적합하는 경향을 줄인다.
연구에 따르면 CutMix로 훈련된 모델은 표준 증강이나 mixup 단독으로 훈련된 모델보다 ImageNet-C와 같은 손상된 ImageNet 버전에서 더 높은 정확도를 달성한다. 이 기법은 또한 보정을 개선하여 모델의 예측 확률이 실제 정확도와 더 잘 일치하게 한다.
또한 CutMix는 클래스 간 미묘한 차이가 중요한 세분화 분류 작업에서 모델 성능을 향상시키는 것으로 나타났다. 혼합 이미지는 모델이 전역 통계에 의존하기보다는 판별적 부분에 주의를 기울이도록 강제한다.
산업계 채택
CutMix는 학술 연구와 산업계 모두에서 널리 채택되었다. 이미지 모델용 timm 라이브러리와 NVIDIA DALI 데이터 로딩 라이브러리와 같은 인기 있는 딥러닝 라이브러리 및 프레임워크에 포함되어 있다. ImageNet 챌린지 및 기타 대회의 많은 최첨단 모델이 훈련 레시피의 일부로 CutMix를 사용했다.
Google DeepMind, OpenAI, Anthropic과 같은 기업은 컴퓨터 비전 파이프라인에 CutMix를 통합했지만, 구체적인 세부 사항은 종종 독점적이다. 이 기법은 데이터가 부족하고 증강이 중요한 의료 영상에서도 사용된다. 예를 들어, CutMix는 흉부 X선 분류 및 조직병리학 이미지 분석에 적용되어 일반화 성능 향상을 보여주었다.
한계 및 고려 사항
효과성에도 불구하고 CutMix에는 몇 가지 한계가 있다. 무작위 잘라내기 및 붙여넣기는 특히 패치가 의미론적으로 일관되지 않은 위치에 배치될 때 비현실적인 이미지를 생성할 수 있다. 예를 들어, 자동차 패치를 새 이미지에 붙여넣으면 패치가 새의 중요한 부분을 덮을 경우 모델을 혼란시킬 수 있다. 그러나 혼합 레이블은 소프트 타겟을 제공하여 이를 완화한다.
또 다른 고려 사항은 CutMix가 입력이 픽셀 그리드라고 가정한다는 점으로, 그래프나 포인트 클라우드와 같은 다른 데이터 유형에는 직접 적용할 수 없다. 이러한 양식에 대한 확장이 제안되었지만 더 복잡한 마스킹 전략이 필요하다.
마지막으로 베타 분포 매개변수의 선택이 성능에 영향을 줄 수 있다. \(\alpha = 1\)이 좋은 기본값이지만 일부 작업은 조정의 이점을 얻을 수 있다. 원래 논문은 이에 대한 지침을 제공하지만 여전히 경험적 선택으로 남아 있다.
결론
CutMix는 현대 컴퓨터 비전의 필수 요소가 된 간단하면서도 강력한 데이터 증강 기법이다. mixup과 Cutout의 강점을 결합하여 모델을 정규화하고 견고성과 위치 파악 능력을 향상시키는 방법을 제공한다. 구현의 용이성과 벤치마크 전반에 걸친 일관된 성능 향상으로 인해 많은 실무자에게 기본 선택이 되었다. 연구가 계속됨에 따라 CutMix의 변형과 확장은 특히 데이터가 제한적이거나 까다로운 조건의 영역에서 계속 관련성을 유지할 가능성이 높다.
참고 문헌
- Yun, S., Han, D., Oh, S. J., Chun, S., Choe, J., & Yoo, Y. (2019). CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features. ICCV.
- Zhang, H., Cisse, M., Dauphin, Y. N., & Lopez-Paz, D. (2018). mixup: Beyond Empirical Risk Minimization. ICLR.
- DeVries, T., & Taylor, G. W. (2017). Improved Regularization of Convolutional Neural Networks with Cutout. arXiv.
- Kim, J.-H., Choo, W., & Song, H. O. (2020). Puzzle Mix: Exploiting Saliency and Local Statistics for Optimal Mixup. ICML.
- Harris, E., Marcu, A., Painter, M., Niranjan, M., Prügel-Bennett, A., & Hare, J. (2020). FMix: Enhancing Mixed Sample Data Augmentation. arXiv.