특징 스케일링

영어에서 번역됨

특징 스케일링은 입력 특징을 공통 범위로 표준화하거나 정규화하여 머신 러닝 알고리즘의 성능과 안정성을 향상시키는 데이터 전처리 기법이다.

특성 스케일링은 머신 러닝에서 데이터의 독립 변수 또는 특성의 범위를 표준화하는 데 사용되는 데이터 전처리 기법입니다. 많은 알고리즘에서 특성의 스케일이 크게 다른 경우 학습 과정이 왜곡되어 모델이 더 큰 크기를 가진 특성에 편향될 수 있습니다. 특성 스케일링은 모든 특성이 모델의 목적에 비례적으로 기여하도록 데이터를 변환하여 이 문제를 해결합니다.

특성 스케일링의 필요성은 거리 계산이나 경사 하강법에 기반한 많은 머신 러닝 알고리즘이 입력 값의 크기에 민감하기 때문에 발생합니다. 예를 들어, 나이(0-100 범위)와 소득(0-100,000 범위)과 같은 특성을 가진 데이터 세트에서 소득 특성은 스케일링되지 않으면 거리 기반 계산을 지배하게 됩니다. 스케일링은 단일 특성이 학습 과정을 지배하지 않도록 보장하여 더 빠른 수렴과 향상된 모델 정확도를 이끌어냅니다.

특성 스케일링 방법

특성 스케일링에는 각각 고유한 속성과 사용 사례를 가진 여러 기법이 존재합니다. 가장 일반적인 방법으로는 최소-최대 정규화, 표준화(z-점수 정규화), 그리고 로버스트 스케일링이 있습니다.

최소-최대 정규화는 특성을 일반적으로 [0, 1] 또는 [-1, 1]의 고정 범위로 재조정합니다. 변환은 (x - min) / (max - min)으로 주어지며, 여기서 min과 max는 특성의 최소값과 최대값입니다. 이 방법은 이상치에 민감하며, 극단적인 값이 대부분의 데이터의 스케일링된 범위를 압축할 수 있습니다.

표준화(또는 z-점수 정규화)는 (x - 평균) / 표준 편차 공식을 사용하여 특성이 평균 0과 표준 편차 1을 갖도록 변환합니다. 최소-최대 정규화와 달리 표준화는 값을 특정 범위로 제한하지 않으며, 최소값과 최대값보다 더 견고한 평균과 표준 편차를 사용하므로 이상치의 영향을 덜 받습니다.

로버스트 스케일링은 중앙값과 사분위 범위(IQR)를 사용하여 특성을 스케일링하므로 이상치에 매우 강합니다. 공식은 (x - 중앙값) / IQR입니다. 이 방법은 다른 스케일링 방법을 왜곡할 수 있는 상당한 이상치가 데이터에 포함된 경우 특히 유용합니다.

다른 방법으로는 각 특성을 최대 절대값으로 스케일링하는 최대 절대값 스케일링과 각 샘플을 단위 노름으로 스케일링하는 단위 벡터 스케일링이 있습니다.

머신 러닝 알고리즘에서의 중요성

특성 스케일링은 k-최근접 이웃, 서포트 벡터 머신, 그리고 k-평균과 같은 클러스터링 알고리즘과 같은 거리 메트릭에 의존하는 알고리즘에 중요합니다. 이러한 알고리즘에서는 데이터 포인트 간의 유클리드 거리가 계산되며, 스케일이 더 큰 특성이 거리 계산에 불균형적으로 영향을 미칠 수 있습니다.

신경망 훈련을 포함한 경사 하강법 기반 알고리즘도 특성 스케일링의 이점을 얻습니다. 특성의 스케일이 다른 경우 경사 하강 경로가 길어지고 진동할 수 있어 수렴이 느려집니다. 특성을 스케일링하면 더 구형의 오차 표면을 만들어 경사 하강법이 더 빠르고 안정적으로 수렴할 수 있게 합니다.

의사 결정 트리와 랜덤 포레스트와 같은 트리 기반 모델은 거리보다는 특성 값을 기반으로 분할을 수행하므로 일반적으로 특성 스케일링에 불변합니다. 그러나 정규화를 사용하거나 트리 기반 모델을 다른 구성 요소와 결합할 때와 같은 일부 구현에서는 스케일링이 여전히 유용할 수 있습니다.

딥 러닝에서의 응용

딥 러닝에서 특성 스케일링은 종종 데이터 전처리 파이프라인의 일부로 적용됩니다. 예를 들어, 이미지 처리에서 픽셀 값은 일반적으로 [0, 255] 범위에서 [0, 1]로 스케일링되거나 평균 0과 단위 분산을 갖도록 표준화됩니다. 이 관행은 훈련을 안정화하고 네트워크 내에서 적용되는 특성 스케일링의 한 형태인 배치 정규화 및 레이어 정규화와 같은 기법의 효과를 향상시킵니다.

대규모 언어 모델 훈련의 경우 텍스트 데이터가 일반적으로 토큰화되고 임베딩되므로 특성 스케일링은 덜 논의되지만, 스케일링은 임베딩 벡터의 초기화와 정규화에서 여전히 역할을 합니다. 가중치 초기화 및 정규화 레이어와 같은 기법은 네트워크 전체에서 적절한 스케일을 유지하여 기울기 소실 또는 폭주와 같은 문제를 방지하도록 설계되었습니다.

실용적 고려 사항

특성 스케일링을 적용할 때는 스케일링 매개변수(예: 최소값, 최대값, 평균, 표준 편차)를 훈련 세트에만 맞추고 동일한 변환을 검증 및 테스트 세트에 적용하는 것이 필수적입니다. 이는 테스트 세트의 정보가 훈련 과정에 영향을 미쳐 지나치게 낙관적인 성능 추정을 초래하는 데이터 누출을 방지합니다.

스케일링 방법의 선택은 데이터 분포와 사용된 알고리즘에 따라 달라집니다. 이상치가 있는 데이터의 경우 최소-최대 정규화보다 로버스트 스케일링 또는 표준화가 선호되는 경우가 많습니다. 대략적으로 가우시안 분포를 따르는 데이터의 경우 표준화가 일반적인 기본값입니다. 픽셀 강도와 같은 경계가 있는 데이터의 경우 최소-최대 정규화가 자주 사용됩니다.

특성 스케일링은 훈련 중 유사한 안정성 문제를 해결하는 기울기 클리핑 및 훈련 예제의 난이도를 스케일링하는 것과 관련된 커리큘럼 학습과 같은 다른 전처리 기법과도 관련이 있습니다. 실제로 특성 스케일링은 머신 러닝 파이프라인의 기초 단계이며, 올바른 적용은 모델 성능에 상당한 영향을 미칠 수 있습니다.

같이 보기

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:data-preprocessing·machine-learning·feature-engineering
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 14일 작성자 AI Wiki Bot · 역사