RFM은 얼마나 최근에(R), 얼마나 자주(F), 얼마나 많이(M) 구매 활동을 했는가에 대한 정보를 만들고 이를 바탕으로 고객의 상태를 세분화하는 모델이다.
k-평균 알고리즘(K-means clustering algorithm)은 주어진 데이터를 k개의 클러스터로 묶는 알고리즘으로, 각 클러스터와 거리 차이의 분산을 최소화하는 방식으로 동작한다.
출처:
https://ko.wikipedia.org/wiki/K-%ED%8F%89%EA%B7%A0_%EC%95%8C%EA%B3%A0%EB%A6%AC%EC%A6%98
간단히 '동질집단'이라고 불림. 코호트 분석 (cohort analysis)이란 바로 '특정 기간 특정 경험을 공유한 집단 간 행동패턴을 비교 및 분석' 하는 것이라고 볼 수 있다.
출처: https://blog.adobe.com/ko/publish/2019/05/07/cohort-analysis-for-effective-remarketing
고객 세분화(RFM 분석, K-means Clustering) -> 고객 세그먼테이션 -> 잠재적 고객 예측 -> 결론: 고객 세분화 및 고객 세그먼테이션 결과, 영향을 미칠 고객의 특징, 솔루션 제안(마케팅)
참고자료:
고객 세분화 - https://dacon.io/competitions/official/236222/codeshare/9772?page=1&dtype=random
고객 세그먼테이션 - https://dacon.io/competitions/official/236222/codeshare/9775?page=1&dtype=random
2차원 배열로 변환하는 이유?
주로 데이터의 특성과 구조를 보다 효과적으로 분석하고 처리하기 위함. 특히 데이터 분석, 통계 분석, 머신러닝 등의 분야에서 2차원 배열 형태의 데이터 구조는 매우 유용합니다. 다음은 2차원 배열로 변환하는 주요 이유
1. 데이터 구조화
행과 열의 구조: 2차원 배열은 행과 열의 구조를 가지므로 데이터를 행별 또는 열별로 쉽게 관리하고 접근할 수 있습니다. 이를 통해 데이터의 구조를 명확하게 파악하고, 원하는 데이터에 쉽게 접근할 수 있습니다.
2. 데이터 분석 용이성
통계 분석 및 머신러닝 모델 적용: 대부분의 통계 분석 및 머신러닝 알고리즘은 2차원 배열 형태의 입력 데이터를 기대합니다. 따라서 2차원 배열로 데이터를 변환하면 다양한 데이터 분석 및 예측 모델을 쉽게 적용할 수 있습니다.
3. 데이터 시각화
Matplotlib, Seaborn 등의 라이브러리 사용: 대부분의 데이터 시각화 라이브러리는 2차원 배열 형태의 데이터를 입력으로 받습니다. 따라서 2차원 배열로 데이터를 변환하면 다양한 차트와 그래프를 쉽게 생성하고 분석할 수 있습니다.
4. 데이터 전처리 및 가공
데이터 정제 및 가공: 2차원 배열 형태의 데이터는 데이터 전처리 및 가공 작업을 쉽게 수행할 수 있습니다. 예를 들어, 결측치 처리, 이상치 제거, 데이터 변환 등의 작업을 효과적으로 수행할 수 있습니다.
5. 코드의 효율성 및 가독성
코드 작성 및 관리 용이성: 2차원 배열로 데이터를 변환하면 코드의 효율성과 가독성을 높일 수 있습니다. 특히, 반복문을 사용하여 데이터를 처리하거나 다양한 연산을 수행할 때 2차원 배열 형태의 데이터는 코드 작성과 관리를 더욱 간편하게 만듭니다.따라서, 데이터 분석 및 처리의 효율성을 높이고 다양한 분석 및 예측 모델을 적용하기 위해 데이터를 2차원 배열로 변환하는 것은 매우 중요한 과정입니다. 이를 통해 데이터의 특성과 패턴을 명확하게 파악하고, 정확한 분석 및 의사 결정을 수행할 수 있습니다.
로그 변환은 데이터 분포의 왜곡을 줄이고, 데이터의 스케일을 조정하여 다음과 같은 목적으로 사용됩니다.
데이터 분포의 왜곡 해소: 일부 데이터는 극단적으로 큰 값이나 왜곡된 분포를 가질 수 있습니다. 로그 변환은 이러한 왜곡을 줄여 데이터의 분포를 정규 분포에 가깝게 만듭니다.
분석의 안정성 향상: 로그 변환을 통해 데이터의 스케일을 조정하면, 분석 모델의 안정성을 향상시킬 수 있습니다. 특히, 분산이 크거나 분포가 왜곡된 데이터를 사용할 때 유용합니다.
상관 관계 파악: 로그 변환을 적용한 후 데이터 분포의 왜곡을 줄이면, 상관 관계 분석이나 클러스터링 분석에서 더 정확한 결과를 얻을 수 있습니다.
다중공선성(multicollinearity)은 통계학에서 회귀분석을 할 때 독립변수들 사이에 높은 상관관계가 존재하는 경우를 말합니다. 이런 상황에서는 독립변수들이 서로 강하게 연관되어 있기 때문에, 개별 독립변수의 영향력을 정확하게 구분하거나 추정하기 어렵습니다. 다중공선성이 심할 경우, 회귀분석의 신뢰도가 떨어지고, 모델의 예측 성능이 저하될 수 있습니다.