Market‑Basket Model (장바구니 연관 규칙)
어떤 고객이 특정 상품을 살 때, 함께 자주 구매되는 다른 상품이 존재하며,
이를 찾아내는 것이 Market‑Basket Model의 핵심입니다.
예시:
“우유를 사는 고객들은 치즈도 함께 사는 경향이 있음”
1. 기본 개념 정리
Support (지지도)
Support는 특정 아이템 집합(Itemset)이 전체 거래 데이터에서 얼마나 자주 나타나는지를 의미합니다.
→ 비율(%) 혹은 횟수로 표현되며, 분석 목적에 따라 기준은 달라질 수 있습니다.
Confidence (신뢰도)
conf(i → j) = support(i ∧ j) / support(i)
- i를 포함하는 거래 중에서, j도 함께 포함된 거래 비율
- 값이 클수록 "i를 구매한 고객이 j도 함께 구매할 확률"이 높다는 뜻입니다.
2. Confidence만으로는 충분하지 않다: Interest의 필요성
문제점
- 어떤 아이템 x를 사면 milk를 산다는 규칙:
x → milk
- milk 자체가 자주 구매되기 때문에, 어떤 x든 conf는 높게 나올 수 있음
- 하지만 이는 진짜 연관성이 아닐 수 있음
Interest의 정의
interest(i → j) = conf(i → j) – support(j)
- j의 기본 구매율을 빼면, 진정한 연관성 여부를 파악 가능
- j의 구매율이 낮지만 conf가 높다면 → 높은 interest → 마케팅 인사이트
3. 연관 규칙 예시: j → m 분석
트랜잭션 데이터
- 전체 거래: B1, B2, B3, B4, B5, B6 → 6건
j가 포함된 거래: B1, B2, B4, B5, B6 → 5건
j와 m이 모두 포함된 거래: B1, B2, B5 → 3건
계산
conf(j → m) = 3 / 5 = 0.6
support(m) = 3 / 6 = 0.5
interest = 0.6 – 0.5 = 0.1
→ interest = 0.1
→ 단순한 우연이 아니라 상대적으로 유의미한 연관 규칙
4. Frequent Itemset 종류
Maximal Frequent Itemset
- 더 이상 빈발한 superset(상위 집합)이 존재하지 않는 itemset
- 예:
- {A}, {A,B}는 {A,B,D}라는 superset이 있기 때문에 Maximal 아님
- {B,C}는 확장 불가 → Maximal
Closed Frequent Itemset
- 같은 support 값을 가진 빈발 superset이 존재하지 않는 itemset
- 예:
- {A,B,C}가 support 3을 가지고 있고, {A}는 support가 낮다면
→ {A,B,C}는 Closed
- {B}는 더 큰 Closed frequent itemset에 포함되면 제외
5. 연관 규칙 발견 절차 (Association Rule Mining)
Step 1: Frequent Itemset 탐색
- 최소 support 기준을 만족하는 itemset 먼저 추출
Step 2: 연관 규칙 생성
i → j 관계에 대해 아래 항목 계산:
conf(i → j)
interest(i → j)
Step 3: 유의미한 규칙 필터링
- 높은 confidence + 높은 interest 조합이
→ 마케팅적으로 가장 활용 가치 높은 규칙
요약: 연관 규칙 분석의 핵심
- Support: 얼마나 자주 등장하는가?
- Confidence: 함께 등장할 확률은 얼마나 되는가?
- Interest: 진짜 연관성인가, 아니면 단순 인기 아이템인가?
✔️ Confidence와 Interest를 함께 고려하면
→ 실제로 유의미한 상품 연관 규칙을 발굴할 수 있으며,
→ 마케팅, 추천 시스템, 재고 운영 등에 효과적으로 활용 가능합니다.
-이 블로그 내용은 서울대학교 인공지능 학과 청강 데이터마이닝 수업을 기반으로 작성한 블로그 입니다-