rs2002.log
로그인
rs2002.log
로그인
제로베이스_Machine Learning (8)
KulangK
·
2023년 8월 25일
팔로우
0
machine learning
제로베이스
Machine Learning
목록 보기
8/13
📄 목차
Boosting 실습
Credit Card Fraud Detection
데이터 읽고 관찰하기
분류기 적용해보기
분류기 성능 비교
데이터 정리 후 다시 분류
Outlier 확인, 정리 후 다시 분류
SMOTE oversampling 후 분류
Boosting 실습
Credit Card Fraud Detection
신용카드 부정 사용 검출
신용카드 등 금융 데이터들은 획득이 어려움
다루는 것 또한 쉽지 않음
고도로 지능화 되어가는 현대 범죄에 맞춰 사전 이상 징후 검출 등 금융 기관이 많은 노력을 기울임
데이터
출처:
Kaggle
신용카드 사기 검출 분류 실습용 데이터
class 컬럼이 사기 유무를 뜻함 (1 값)
불균형이 극심함 (0.172%만 1 값을 가짐)
금융 데이터이며, 기업의 기밀 보호 등을 위해 대다수 특성의 이름은 삭제되어 있음
1. 데이터 읽고 관찰하기
2. 분류기 적용해보기
3. 분류기 성능 비교
4. 데이터 정리 후 다시 분류
5. Outlier 확인, 정리 후 다시 분류
6. SMOTE oversampling 후 분류
특정 도메인을 이용하면 비슷한 방식으로 지속 데이터 분석을 하게 될 것으로 보임. 그러나 새로 접하는 데이터의 경우 글쓰기와 같은 방향으로 진행되는 것 같음
(주제 선정 / 개요 >> 본문으로의 확대 >> 결론으로의 축소)
데이터 분석 >> 다양한 방식으로 데이터 분석 >> 간략한 모델링 >> 모델링 디테일 (데이터 분석 병행) >> 모델의 결과 근거 확보 (데이터 분석 결과 대조 및 이전 모델링들과 비교)
실제 그래프나 지표만으로는 설득력이 떨어질 수 있음
개선된 %에 따라 기존 데이터 대상 어떻게 분류 되는지 값을 보이는 것이 도움이 됨
GridSearchCV 등을 통해 모델링 자체의 parameter를 조정하는 것도 모델링 개선에 도움이 됨.
Github
KulangK
새싹 데이터 분석가 https://github.com/KulangK
팔로우
이전 포스트
제로베이스_Machine Learning (7)
다음 포스트
제로베이스_Machine Learning (9)
0개의 댓글
댓글 작성