


구축용(training data) 50% : 추정용, 훈련용 데이터라고도 불리며 데이터 마이닝 모델을 만드는데 활용
검정용(validation data) 30% : 구축된 모형의 과대추정 또는 과소추정을 미세 조정을 하는데 활용
시험용(test data) 20% : 테스트 데이터나 과거 데이터를 활용하여 모델의 성능을 검증에 활용
데이터의 양이 충분하지 않거나 입력 변수에 대한 설명이 충분한 경우
(1) 홀드아웃(hold-out) 방법 : 주어진 데이터를 랜덤하게 두 개의 데이터로 구분하여 사용하는 방법으로 주로 학습용과 시험용으로 데이터를 분리하여 사용
(2) 교차확인(cross-validation) 방법 : 주어진 데이터를 k개의 하부집단으로 구분하여, k-1개의 집단을 학습용으로 나머지 하부집단은 검증용으로 설정하여 모형을 학습 K번 반복 측정한 결과를 평균 낸 값을 최종값으로 사용
데이터 마이닝 모형 평가

TP(true positive) : 실제 양성을 양성으로 정확히 예측
TN(true negative) : 실제 음성을 음성으로 정확히 예측
FP(false positive) : 실제 음성을 양성으로 잘못 예측
FN(false negative) : 실제 양성인데 음성으로 잘못 예측
정확도(Accuracy) : 전체 예측 중에서 맞게 예측한 비율
민감도(Sensitivity) : 실제로 양성인 것 중에 모델이 정확하게 양성으로 예측한 비율
특이도(Specificity) : 실제로 음성인 것 중에 모델이 정확하게 음성으로 예측한 비율
정밀도(Precision) : 양성으로 예측한 것 중 진짜 양성
재현율(Recall) : 실제 양성 중 맞춘 비율(전체 양성 수에서 검출 양성 수)
F1 Score : 정밀도와 재현율의 조화평균
민감도와 1-특이도를 가지고 모형을 평가하는데 기준으로 많이 사용하는 방식이 ROC 곡선이다

TPR(True Positive Rate, 민감도) : 1인 케이스에 대한 1로 예측한 비율
FPR(False Positive Rate, 1-특이도) : 0인 케이스에 대한 1로 잘못 예측한 비율
AUROC(Area under ROC) - 정확도의 측정 기준, 곡선 밑으로 영역이 몇 퍼센트(%)가 되는지
0.9 - 1.0 = excellent(A)
0.8 - 0.9 = good(B)
0.7 - 0.8 = fair(C)
0.6 - 0.7 = poor(D)
0.5 - 0.6 = fail(F)

면적을 다 더하면 0.681362이다

