제로베이스_Machine Learning (8)

KulangK·2023년 8월 25일

Machine Learning

목록 보기
8/13
post-thumbnail

📄 목차

  • Boosting 실습
    • Credit Card Fraud Detection
      1. 데이터 읽고 관찰하기
      2. 분류기 적용해보기
      3. 분류기 성능 비교
      4. 데이터 정리 후 다시 분류
      5. Outlier 확인, 정리 후 다시 분류
      6. SMOTE oversampling 후 분류

Boosting 실습

Credit Card Fraud Detection

  • 신용카드 부정 사용 검출
    • 신용카드 등 금융 데이터들은 획득이 어려움
    • 다루는 것 또한 쉽지 않음
    • 고도로 지능화 되어가는 현대 범죄에 맞춰 사전 이상 징후 검출 등 금융 기관이 많은 노력을 기울임
  • 데이터
    • 출처: Kaggle
    • 신용카드 사기 검출 분류 실습용 데이터
    • class 컬럼이 사기 유무를 뜻함 (1 값)
      • 불균형이 극심함 (0.172%만 1 값을 가짐)
    • 금융 데이터이며, 기업의 기밀 보호 등을 위해 대다수 특성의 이름은 삭제되어 있음

1. 데이터 읽고 관찰하기

2. 분류기 적용해보기

3. 분류기 성능 비교

4. 데이터 정리 후 다시 분류

5. Outlier 확인, 정리 후 다시 분류

6. SMOTE oversampling 후 분류


  • 특정 도메인을 이용하면 비슷한 방식으로 지속 데이터 분석을 하게 될 것으로 보임. 그러나 새로 접하는 데이터의 경우 글쓰기와 같은 방향으로 진행되는 것 같음
    (주제 선정 / 개요 >> 본문으로의 확대 >> 결론으로의 축소)
  • 데이터 분석 >> 다양한 방식으로 데이터 분석 >> 간략한 모델링 >> 모델링 디테일 (데이터 분석 병행) >> 모델의 결과 근거 확보 (데이터 분석 결과 대조 및 이전 모델링들과 비교)
  • 실제 그래프나 지표만으로는 설득력이 떨어질 수 있음
    • 개선된 %에 따라 기존 데이터 대상 어떻게 분류 되는지 값을 보이는 것이 도움이 됨
    • GridSearchCV 등을 통해 모델링 자체의 parameter를 조정하는 것도 모델링 개선에 도움이 됨.
profile
새싹 데이터 분석가 https://github.com/KulangK

0개의 댓글