[ADsP] 3과목 정리(14)

전민정·2025년 5월 13일

ADsP 자격증

목록 보기
14/15

5장 정형 데이터 마이닝

6절 군집분석

(1) 군집분석

개요

  • Unsupervised learning
  • 각 객체(대상)의 유사성을 측정하여 유사성을 높은 대상 집단을 분류하고, 군집에 속한 객체들의 유사성과 서로 다른 군집에 속한 객체 간의 상이성을 규명하는 분석 방법
  • 특성에 따라 고객을 여러 개의 배타적인 집단으로 나누는 것
  • 군집의 개수나 구조에 대한 가정 없이 데이터로부터 거리를 기준으로 군집화 유도
  • 마케팅 조사에서 소비자들의 상품 구매 행동이나 lifestyle에 따른 소비자군을 분류하여 시장전략 수집 등에 활용

특징

  • 군집분석 목적
    • 데이터를 목적에 따라 적절한 군집으로 나누는 것
    • 각 군집의 특성 군집 간의 차이를 명확히 하고 분석하는 것
  • 요인분석과의 차이점 - 요인분석은 유사한 변수를 함께 묶어주는 것이 목적
  • 판별분석(supervised learning)과의 차이점 - 판별분석은 사전에 집단이 나누어져 있다는 점

(2) 거리

연속형 변수의 경우


(3) 계층적 군집분석

개요

  • 계층적 군집방법은 n개의 군집으로 시작해 점차 군집의 개수를 줄여나가는 방법
    1)최단연결법(single linkage, nearest neighbor)
    • n*n 거리행렬에서 거리가 가장 가까운 데이터를 묶어서 군집을 형성
    • 군집과 군집 또는 데이터와의 거리를 계산 시 최단거리(min)를 거리로 계산하여 거리행렬 수정
    • 수정된 거리행렬에서 거리가 가까운 데이터 또는 군집을 새로운 군집으로 형성
      2)최장연결법(complete linkage, farthest neighbor)
    • 군집과 군집 또는 데이터와의 거리를 계산 시 최장거리(max)를 거리로 계산하여 거리행렬 수정
      3)평균연결법(average linkage)
    • 군집과 군집 또는 데이터와의 거리를 계산 시 평균거리(mean)를 거리로 계산하여 거리행렬 수정
      4)와드연결법(ward linkage)
    • 군집 내 편자들의 제곱합을 고려한 방법
    • 군지 간 정보의 손실을 최소화하기 위해 군집화를 진행

최단연결법

최장연결법

평균연결법


(4) 비계층적 군집분석

  • n개의 개체를 g개의 군집으로 나눌 수 잇는 모든 가능한 방법을 점검해 최적화한 군집을 형성하는 것

(5) K-means

개요

  • K-평균 군집분석(k-means clustering)
    (1)원하는 군집의 개수와 초깃값(seed)들을 정해 seed 중심으로 군집을 형성한다.
    (2)각 데이터를 거리가 가장 가까운 seed가 있는 군집으로 분류한다.
    (3)각 군집의 seed 값을 다시 계산한다.
    (4)모든 개체가 군집으로 할당될 때까지 위 과정들을 반복한다.
  • K-means clustering(예시)

특징

  • 비계층적 군집화의 장점
    • 주어진 데이터의 내부구조에 대한 사전 정보 없이 의미 있는 자료구조를 찾을 수 있음
    • 다양한 형태의 데이터에 적용 가능
    • 분석 방법 적용이 용이
  • 비계층적 군집화의 단점
    • 가중치와 거리 정의가 어려움
    • 초기 군집 수를 결정하기 어려움
    • 사전에 주어진 목적이 없으므로 결과 해석이 어려움

(6) 혼합 분포 군집(Mixture Distribution Clustering)

개요

  • 모형 기반(model-based)의 군집 방법이며, 데이터가 k개의 모수적 모형(흔히 정규분포 또는 다변량 정규분포를 가정함)의 가중합으로 표현되는 모집단 모형으로부터 나왔다는 가정하에서 모수와 함께 가중치를 자료로부터 추정하는 방법을 사용
  • k개의 각 모형은 군집을 의미하며, 각 데이터는 추정된 k개의 모형 중 어느 모형으로부터 나왔을 확률이 높은지에 따라 군집의 분류가 이루어짐
  • 흔히 혼합모형에서의 모수와 가중치의 추정(최대 가능도 추정)에는 EM 알고리즘이 사용됨

혼합 분포모형으로 설명할 수 있는 데이터의 형태

  • (a)는 자료의 분포 형태가 다봉형의 형태를 띠므로 단일 분포로의 적합은 적절하지 않으며, 대략 3개 정도의 정규분포 결합을 통해 설명될 수 있을 것으로 생각할 수 있다.
  • (b)의 경우에도 여러 개의 이변량 정규분포의 결합을 통해 설명될 수 있을 것이다.
  • 두 경우 모두 반드시 정규분포로 제한할 필요는 없다.

SOM(Self Organizing Maps)

개요

  • SOM(자가조직화지도) 알고리즘은 코호넨(Kohonen)에 의해 제시, 개발되었으며 코호넨 맵(Kohonen Maps)이라고 알려져 있음
  • SOM은 비지도 신경망을 고차원의 데이터를 이해하기 쉬운 저차원의 뉴런을 정렬하여 지도의 형태로 형상화함
    이러한 형상화는 입력 변수의 위치 관계를 그대로 보존한다는 특징이 잇ㅇ므
    다시 말해 실제 공간의 입력 변수가 가까이 있으면 지도상에도 가깡누 위치에 있게 됨
  • SOM 모델은 두 개의 인공신경망 층으로 구성되어 있다
    ① 입력층(Inout layer : 입력벡터를 받는 층) : 입력 변수의 개수와 동일하게 뉴런 수가 존재한다
  • 입력층의 자료는 학습을 토하여 경쟁층에 정렬되는데 이를 지도(map)라 부른다
    입력층에 있는 각각의 뉴런은 경쟁층에 있는 각각의 뉴런들과 연결되어 있으먀, 이때 완전 연결(fully connected)되어 있다
    ② 2차원 격차(grid)로 구성된 경쟁층(competitive layer : 입력벡터의 특성에 따라 벡터가 한 점으로 클러스터링 되는 층)

특징

  • SOM은 경쟁 학습으로 각각의 뉴런이 입력 벡터와 얼마나 가까운가를 계산하여 연결 강도(connection weight)를 반복적으로 재조정하여 학습
    이 과정을 거치면서 연결 강도는 입력 패턴과 가장 유사한 경쟁층 뉴런이 승자가 됨
  • 승자 독식 구조로 인해 경쟁층에는 숭자 뉴런만이 나타나며, 승자와 유산한 연결 강도를 갖는 입력 패턴이 동일한 경쟁 뉴런으로 배열
  • SOM을 이용한 군집분석은 역전파(Back Proragation) 알고리즘 등을 이용하는 인공신경망과 달리 단 하나의 전방 패스(feed-forward flow)를 사용함으로써 속도가 매우 빠르다
    따라서, 실시간 학습 처리를 할 수 있는 모형

(8) 다양한 군집분석 기법들

밀도기반 군집(Density-Based Clustering)

  • 밀도기반 군집은 데이터 포인트의 밀도 차이를 이용해 클러스터를 식별하는 방법으로, DBSCAN(Density-Based spatial clustering of applications with noise)이 대표적
  • 밀도가 높은 영역을 클러스터로 간주하며, 밀도가 낮은 데이터는 노이즈로 처리하거나 다른 클러스터와 분리됨
  • 이 기법은 데이터의 모형에 구애 받지 않고 비선형적인 클러스터도 효과적으로 탐지할 수 있어, 복잡한 분포나 잡음이 포함된 데이터에서도 유용함
  • 장점
    • 노이즈에 강함 : DBSCAN은 데이터에 포함된 노이즈를 효과적으로 처리 가능
    • 비구조적 데이터 처리 : 군집의 형태에 구애 받지 않고 다양한 형태의 군집을 찾을 수 있음
    • 자동으로 군집 수 결정 : 사용자가 군집의 수를 미리 지정할 필요가 없음
  • 단점
    • 파라미터 민감성 : ϵ과 MinPts의 값이 군집의 형성에 큰 영향을 미침. 적절한 값을 찾는 것이 중요
    • 고차원 데이터에서 성능 저하 : 차원이 증가함에 따라 데이터 포인트 간의 거리가 유사해져서 밀도를 판단하기 어려워질 수 있음
  • 응용분야 : 지리정보 시스템(GIS)-공간 데이터의 군집화, 이미지 분석 - 이미지 내 객체의 군집화, 자연어 처리(NLP)-군집화 및 주제 탐색에 사용

병합적 군집(Agglomerative Clustering)

  • 계층적 군집 방법 중 하나로 각 데이터를 개별 클러스터로 시작해 점진적으로 유사한 클러스터를 병합하여 계층 구조를 형성
  • 데이터 간의 유사도를 축정하기 위해 유클리드 거리와 같은 거리 측도를 사용하며,
  • 병합 기준으로 단일 연결, 완전 연결, 평균 연결, 중앙 연결 등이 활용됨
  • 결과는 덴드로그램 형태로 표현되며, 데이터의 계층적 관계를 시각적으로 이해하는데 유용하지만, 대규모 데이터에서는 계산 비용이 높을 수 있음
  • 장점
    • 유연성 : 다양한 거리 척도와 병합 기준으로 사용할 수 있어 여러 상황에 적용 가능
    • 계층적 구조 : 계층적 군집 구조를 제공하여 데이터의 조직을 시각적으로 이해하기 쉬움
    • 군집 수 미리 지정 불필요 : 데이터에서 자연스럽게 군집을 형성하므로, 군집 수를 미리 지정할 필요가 없음
  • 단점
    • 계산 복잡도 : 데이터의 수가 많을 경우 계산량이 많아져 시간이 많이 소요
    • 노이즈의 영향 : 노이즈나 이상치에 만감할 수 있어 군집의 품질에 영향을 줄 수 있음

퍼지 군집(Fuzzy Clustering)

  • 데이터가 여러 클러승터에 동시에 속할 수 있도록 허용하는 군집 분석 기법으로, 각 데이터 포인트에 대해 클러스터 소속 확률(혹은 소속도)을 할당함
  • 대표적인 알고리즘은 FCM(Fuzzy C-Means)으로, 각 데이터가 클러스터 중심에서의 거리에 따라 소속도가 결정됨
  • 이 방법은 데이터의 경계가 명확하지 않은 경우 유용하며, 이미지 처리, 패턴 인식 등 여러 분야에서 활용되지만 해석이 복잡하고 초기 매개변수 설정에 민감할 수 있음
  • 장점
    • 유연성 : 데이터 포인트가 여러 군집에 속할 수 있어, 복잡한 데이터 구조를 잘 표현할 수 있음
    • 정보 손실 감소 : 데이터 포인트가 여러 군집에 속할 수 있으므로, 정보의 손실이 적음
    • 소속도 해석 가능 : 각 데이터 포인트의 군집 소속도를 통해 데이터의 군집화 정도를시각적으로 이해가 쉬움
  • 단점
    • 복잡한 계산 : 소속도와 군집 중심을 반복적으로 계산해야 하므로 계산량이 많아질 수 있음
    • 노이즈에 민감함 : 이상치나 노이즈 데이터가 소속도에 영향을 미쳐 군집의 품질을 저하시킬 수 있음
    • 파라미터 설정 : 퍼지 정도를 조절하는 파라미터의 선택이 군집화 결과에 큰 영향을 미칠 수 있음

PAM(Partitioning Around Medoids)

  • K-means와 비슷하지만, 중심적으로 평균 대신 실제 데이터 포인트인 'Medoids'를 선택함
  • 이는 이상치나 노이즈에 더 강한 내성을 가지고 있어, 데이터가 이상치에 민감할 때 유리함
  • PAM은 클러스터를 형성하기 위해 반복적으로 Medoid를 재선택하고, 각 데잍 ㅓ포인트가 가장 가까운 Medoid에 할당되는 방식으로 진행됨
  • 주로 중간 규모의 데이터에서 효과적으며, 계산 비용이 상대적으로 높을 수 있음
  • 장점
    • 강건성: PAM은 평균 대신 실제 데이터 포인트를 사용하여 군집의 중심으로 정의하므로, 이상치에 대해 더 강건
    • 유연성: 다양한 거리 척도를 사용할 수 있어, 여러 유형의 데이터에 적용할 수 있음
  • 단점
    • 계산 복잡도 : PAM은 K-평균 군집화보다 계산 비용이 더 높음. 특히 데이터 포인트가 많을 경우, 메도이드 업데이트 과정에서 O(n^2) 시간 복잡도가 발생할 수 있음
    • 군집 수 사전 설정 : 사용자가 미리 군집으 ㅣ수를 지정해야 하므로, 적절한 군집 수를 찾는 것이 중요

(8) 군집모형 평가지표

실루엣 계수

던 지수

0개의 댓글