데이터 전처리 및 특징 공학 기법
Wikiprompt, 무료 프롬프트 백과사전에서
데이터 전처리 및 특징 공학 기법 시네마틱 3D 액션 광고 - [제품/브랜드 삽입], 극적인 스튜디
프롬프트 내용저장
🌐
주어진 데이터셋에 결측값, 이상치, 범주형 변수가 존재할 때, 예측 모델 정확도를 최적화하기 위한 최적의 데이터 전처리 및 특징 엔지니어링 기법은 다음과 같습니다:
**결측값 처리:**
- 수치형 변수: 중앙값(median) 또는 평균(mean) 대체가 일반적이지만, 변수 분포가 치우친 경우 중앙값이 더 안정적입니다. 고급 기법으로는 KNN Imputation 또는 Iterative Imputer(다변량 대체)가 상관관계를 활용해 정확도를 높일 수 있습니다.
- 범주형 변수: 최빈값(mode) 대체 또는 'Missing'이라는 별도 범주로 처리합니다. 결측 비율이 높은 경우, 결측 여부를 나타내는 이진 플래그 변수를 추가하여 정보를 유지합니다.
- 시간적 데이터가 있다면 시계열 보간법(전후 값 기준 선형 또는 spline)이 유효합니다.
**이상값 처리:**
- 먼저 IQR(사분위 범위) 또는 Z-score(3 이상)로 탐지 후, 도메인 지식에 따라 제거 또는 상한/하한으로 Winsorization(예: 1% 및 99% 백분위수로 클리핑) 적용.
- 트리 기반 모델(XGBoost, Random Forest)은 이상값에 비교적 견고하므로, 선형 모델이나 거리 기반 모델(KNN, SVM)에서는 반드시 처리해야 합니다.
- 이상값을 제거하는 대신 로그 변환, Box-Cox 변환으로 분포를 정규화하여 영향력을 완화할 수 있습니다.
**범주형 변수 처리:**
- Cardinality(고유 카테고리 수)가 낮으면(예: 10 미만) One-Hot Encoding 사용. 높으면 Target Encoding(해당 범주의 목표 변수 평균) 또는 Frequency Encoding(빈도수)이 유용하며, 과적합 방지를 위해 교차 검증 내부에서 계산합니다.
- 순서가 의미 있는 범주(예: Low, Medium, High)는 Ordinal Encoding 사용.
- 범주 간 상호작용을 포착하려면 람다 규칙(함수형 용어)이나 특정 조합 변수(예: 두 범주 결합)를 생성할 수 있습니다.
**특징 엔지니어링:**
- 도메인 지식을 반영한 파생 변수 생성(예: 날짜 변수에서 요일, 월, 계절 추출; 거리 변수의 비율 조합).
- 다항 특성(Polynomial Features) 또는 상호작용 특성을 추가하여 비선형 관계 캡처 (단, 과적합 방지를 위한 정규화 필요).
- 클러스터링 기반 특징(예: K-평균 중심까지 거리)으로 비선형성 부여.
- 자동화된 특징 선택 기법: Recursive Feature Elimination(RFE) 또는 SHAP 기반 중요도 계산을 통해 모델 성능에 기여하는 특징만 선별.
**일반적인 파이프라인 최적화:**
- 모든 전처리는 성능 평가(예: 교차 검증) 파이프라인 내에서 수행하여 데이터 누출(예: 전체 데이터에 전처리 적용 후 학습/검증 분할을 하는 오류)을 방지.
- 스케일링(StandardScaler 또는 MinMaxScaler)은 선형 모델, SVM, KNN에서 필수이며, Decision Tree 계열에는 불필요.
- 마지막으로, 실험 계획(예: 결측 대체 방법과 이상값 처리 전략 조합)을 GridSearch 또는 Bayesian Optimization으로 검증하며 정확도 지표(AUC, F1 등)를 최적화합니다.
전체 프롬프트를 보려면 로그인하세요
Continue with:
By logging in, you agree to our Terms of Use and Privacy Policy
사용법
이 프롬프트는 education와 함께 사용하도록 설계되었습니다. 위의 프롬프트 내용을 복사하여 원하는 AI 도구에 붙여넣으세요.
최상의 결과를 얻으려면 자리 표시자(대괄호 또는 대문자로 표시)를 특정 요구 사항으로 사용자 지정할 수 있습니다.
토론
댓글 0개