[ADsP] 3과목 정리(9)

전민정·2025년 5월 12일

ADsP 자격증

목록 보기
9/15

5장 정형 데이터 마이닝

1절 데이터 마이닝의 개요

(1) 데이터 마이닝

개요

  • 데이터 마이닝은 대용량 데이터에서 의미 있는 패턴을 파악하거나 예측하여 의사결정에 활용하는 방법
  • 데이터 마이닝의 기법인 분류분석, 예측분석, 군집분석 등을 이해하고 적용해 본다.

통계분석과의 차이점

  • 통계분석
    • 가설이나 가정에 따른 분석이나 검증을 함
  • 데이터 마이닝
    • 데이터 마이닝은 대용량 데이터에서 의미 있는 패턴을 파악하거나 예측하여 의사결정에 활용하는 방법
    • 다양한 수리 알고리즘을 이용해 데이터베이스의 데이터로부터 의미 있는 정보를 찾아내는 방법을 통칭

종류

사용 분야

  • 병원에서 환자 데이터를 이용해서 해당 환자에게 발생 가능성이 높은 병을 예측
  • 기존 환자가 응급실에 왔을 때 어떤 조치를 먼저 해야 하는지를 결정
  • 고객 데이터를 이용해 해당 고객의 우량/불량을 예측해 대출 적격 여부 판단
  • 세관 검사에서 입국자의 이력과 데이터를 이용해 관세 물품 반입 여부를 예측

데이터 마이닝의 최근 환경

  • 최근의 데이터 마이닝 환경
    • 데이터 마이닝 도구가 다양하고 체계화돼 있어 환경에 적합한 제품을 선택하여 활용 가능
    • 알고리즘에 대한 깊은 이해가 없어도 분석에 큰 어려움이 없음
    • 분석 결과의 품질은 분석가의 경험과 역량에 따라 차이가 나기 때문에 복잡성이나 중요도가 높으면 풍부한 경험을 가진 전무가에게 의뢰할 필요가 있음
  • 대한민국의 데이터 마이닝 환경
    • 한국에서 적용된 시기는 1990년대 중반
    • 2000년대에 비즈니스 관점에서 데이터 마이닝이 CRM의 중요한 요소로 부각
    • 대중화를 위해 많은 시도가 있었으나, 통계학 전문가와 대기업 위주로 진행

(2) 데이터 마이닝의 분석 방법

  • Supervised Data : 입력(input) 데이터와 그에 대응되는 정답(label)이 함께 제공되는 데이터
  • Unsupervised Data : 정답(label)이 없는 순수한 입력 데이터만 존재하는 데이터

(3) 분석 목적에 따른 작업 유형과 기법

  • 예측 : Supervised learning
  • 설명 : Unsupervised learning

(4) 데이터 마이닝 추진 단계

1단계:목적 설정

  • 데이터 마이닝을 통해 무엇을 왜 하는지 명확한 목적(이해관계자 모두 동의하고 이해할 수 있는)을 설정
  • 전문가가 참여해 목적에 따라 사용할 모델과 필요한 데이터를 정의

2단계:데이터 준비

  • 고객정보, 거래 정보, 상품 리마스터 정보, 웹로그 데이터, 소셜 네트워크 데이터 등 다양한 데이터를 활용
  • IT 부서와 사전 협의하고 일정을 조율하여 데이터 접근 부하에 유의하여야 하며, 필요시 다른 서버에 저장하여 운영에 지장이 없도록 데이터를 준비
  • 데이터 정제를 통해 데이터의 품질을 보장하고, 필요시 데이터를 보강하여 충분한 양의 데이터를 확보

3단계:가공

  • 모델링 목적에 따라 목적 변수를 정의
  • 필요한 데이터를 데이터 마이닝 소프트웨어에 적용할 수 있는 형식으로 가공

4단계:기법 적용

  • 1단계에서 명확화한 목적에 맞게 데이터 마이닝 기법을 적용하여 정보를 추출

5단계:검증

  • 데이터 마이닝으로 추출된 정보를 검증
  • 테스트 데이터와 과거 데이터를 활용하여 최적의 모델을 선정
  • 검증이 완료되면 IT 부서와 협의해 상시 데이터 마이닝 결과를 업무에 적용하여 보고서를 작성하여 추가 수익과 투자대비성과(ROI)등으로 기대효과를 전파
  • 알고리즘적으로 얼마나 정확한지를 확인하는 것이 아니라 재무적 평가(재무적인 효과)도 이루어진다

(5) 데이터 마이닝을 위한 데이터 분할

데이터 마이닝을 위한 데이터 분할

  • 구축용(training data) 50% : 추정용, 훈련용 데이터라고도 불리며 데이터 마이닝 모델을 만드는데 활용

  • 검정용(validation data) 30% : 구축된 모형의 과대추정 또는 과소추정을 미세 조정을 하는데 활용

    • 과대적합 : 모델이 훈련 데이터에 너무 지나치게 맞춰져서, 새로운 데이터(테스트 데이터)에는 성능이 떨어지는 상태
    • 과소적합 : 모델이 훈련 데이터조차 잘 학습하지 못한 상태로, 전체적으로 성능이 낮음
  • 시험용(test data) 20% : 테스트 데이터나 과거 데이터를 활용하여 모델의 성능을 검증에 활용

  • 데이터의 양이 충분하지 않거나 입력 변수에 대한 설명이 충분한 경우
    (1) 홀드아웃(hold-out) 방법 : 주어진 데이터를 랜덤하게 두 개의 데이터로 구분하여 사용하는 방법으로 주로 학습용과 시험용으로 데이터를 분리하여 사용
    (2) 교차확인(cross-validation) 방법 : 주어진 데이터를 k개의 하부집단으로 구분하여, k-1개의 집단을 학습용으로 나머지 하부집단은 검증용으로 설정하여 모형을 학습 K번 반복 측정한 결과를 평균 낸 값을 최종값으로 사용

  • 데이터 마이닝 모형 평가

    • 현업에서 사용할 수 있을지를 주어진 자료로 모형을 평가
    • 데이터 분할을 통해 확보한 테스트데이터를 통해 오분류율을 구함
    • 오분류율에 따라서 모형을 사용할지 다른 모형을 생성할지를 판단
    • 오분류율은 분석 목적이나 사용되는 용도에 따라 기준이 다르게 적용

(6) 성과분석

혼동행렬을 활용한 평가지표

  • TP(true positive) : 실제 양성을 양성으로 정확히 예측

  • TN(true negative) : 실제 음성을 음성으로 정확히 예측

  • FP(false positive) : 실제 음성을 양성으로 잘못 예측

  • FN(false negative) : 실제 양성인데 음성으로 잘못 예측

  • 정확도(Accuracy) : 전체 예측 중에서 맞게 예측한 비율

    TP+TNTP+TN+FP+FN\frac{TP + TN}{TP + TN + FP + FN}
  • 민감도(Sensitivity) : 실제로 양성인 것 중에 모델이 정확하게 양성으로 예측한 비율

    TPTP+FN\frac{TP}{TP + FN}
  • 특이도(Specificity) : 실제로 음성인 것 중에 모델이 정확하게 음성으로 예측한 비율

    TNFP+TN\frac{TN}{FP + TN}
  • 정밀도(Precision) : 양성으로 예측한 것 중 진짜 양성

    TPTP+FP\frac{TP}{TP + FP}
  • 재현율(Recall) : 실제 양성 중 맞춘 비율(전체 양성 수에서 검출 양성 수)

    TPTP+FN\frac{TP}{TP + FN}
  • F1 Score : 정밀도와 재현율의 조화평균

    F1=2×Precision×RecallPrecision+RecallF1 = 2 × \frac{Precision × Recall}{Precision + Recall}

ROC와 AUC

  • 민감도와 1-특이도를 가지고 모형을 평가하는데 기준으로 많이 사용하는 방식이 ROC 곡선이다

  • TPR(True Positive Rate, 민감도) : 1인 케이스에 대한 1로 예측한 비율

  • FPR(False Positive Rate, 1-특이도) : 0인 케이스에 대한 1로 잘못 예측한 비율

  • AUROC(Area under ROC) - 정확도의 측정 기준, 곡선 밑으로 영역이 몇 퍼센트(%)가 되는지
    0.9 - 1.0 = excellent(A)
    0.8 - 0.9 = good(B)
    0.7 - 0.8 = fair(C)
    0.6 - 0.7 = poor(D)
    0.5 - 0.6 = fail(F)

  • 면적을 다 더하면 0.681362이다

이익도표(Lift Chart)

  • 데이터셋의 각 데이터는 예측 확률을 가진다
  • 전체 데이터셋을 예측 확률에 대해 내림차순으로 정렬한다.
  • 전체 고객 2000명
  • Frequency of "buy" : 200명 중 실제로 구매한 사람
  • % Captured Response : 반응검출율 = 해당 등급의 실제 구매자 / 전체 구매자
  • % response : 반응률 = 해당 등급의 실제 구매자 / 200명
  • Lift : 향상도 = 반응률 / 기본 향상도
    좋은 모델이라면 Lift가 빠른 속도로 감소해야 한다.

0개의 댓글