
데이터 안에서 하위 집단 (클러스터)을 찾는 기법들의 총칭이다.
집단 내부는 유사, 집단 간은 상이하도록 데이터를 분할한다.


클러스터 결과에서 특정 색상은 의미가 없고, 점들이 다른 색이라는 것은 서로 다른 클러스터에 속해있다는 의미이다.
K-means는 전체 데이터를 K개의 군집으로 나누는 방법이다.
각 군집은 다음처럼 표현할 수 있다.
C₁, C₂, ..., Cₖ
K: 만들 군집의 개수C₁, C₂, ..., Cₖ: 각각의 군집1...K 클러스터를 임시로 부여한다.중심점과의 평균 거리가 계속 줄어들기 때문에 매 반복마다 결과는 더 좋아진다.
하지만 최적 해를 항상 찾는 건 아니다.
→ 초기값에 따라 지역 최솟값으로 수렴 가능하다. (지역 최소값문제라고 부른다.)
┌────────────────────────────┐
│ 1 무작위 클러스터 초기화 │
└────────────────────────────┘
↓
┌────────────────────────────┐
│ 2a 중심 계산 │◀──────────┐
└────────────────────────────┘ │
↓ │ 반복
┌────────────────────────────┐ │
│ 2b 클러스터 재배정 │───────────┘
└────────────────────────────┘
↓
클러스터 변화가 없으면 종료
서로 다른 초기 라벨에서 최종 분할과 목표값 (패널 상단 숫자)이 달라진다.
초기화의 중요성: 여러 번 시도를 권장한다.

K-means는 전체 데이터를 K개의 군집으로 나누는 방법이다.
각 군집은 다음처럼 표현할 수 있다.
C₁, C₂, ..., Cₖ
K: 만들 군집의 개수C₁, C₂, ..., Cₖ: 각각의 군집1...K 클러스터를 임시로 부여한다.중심점과의 평균 거리가 계속 줄어들기 때문에 매 반복마다 결과는 더 좋아진다.
하지만 최적 해를 항상 찾는 건 아니다.
→ 초기값에 따라 지역 최솟값으로 수렴 가능하다. (지역 최소값 문제라고 부른다.)
┌────────────────────────────┐
│ 1 무작위 클러스터 초기화 │
└────────────────────────────┘
↓
┌────────────────────────────┐
│ 2a 중심 계산 │◀──────────┐
└────────────────────────────┘ │
↓ │ 반복
┌────────────────────────────┐ │
│ 2b 클러스터 재배정 │───────────┘
└────────────────────────────┘
↓
클러스터 변화가 없으면 종료
서로 다른 초기 라에서 최종 분할과 목표값 (패널 상단 숫자)이 달라진다.
초기화의 중요성: 여러 번 시도를 권장한다.
!image.png
처음에는 각 데이터를 하나의 군집으로 보고, 가장 비슷한 군집끼리 하나씩 합쳐가는 방식이다.
┌──────────────────────────────────────┐
│ 1. 각 관측치를 하나의 군집으로 시작 │
│ 총 n개의 군집 생성 │
└──────────────────────────────────────┘
↓
┌──────────────────────────────────────┐
│ 2. 모든 군집 사이의 비유사도 계산 │
│ 가장 비슷한 두 군집을 병합 │
└──────────────────────────────────────┘
↓
┌──────────────────────────────────────┐
│ 3. 병합 후 남은 군집 사이의 │
│ 비유사도를 다시 계산 │
└──────────────────────────────────────┘
↓
2번과 3번을 반복
↓
┌──────────────────────────────────────┐
│ 최종적으로 하나의 군집이 될 때 종료 │
└──────────────────────────────────────┘
처음에는 각 데이터를 하나의 군집으로 보고, 가장 가까운 군집끼리 순서대로 합쳐간다.
개별 데이터 → 가까운 데이터끼리 병합 → 작은 군집끼리 병합 → 최종적으로 하나의 군집
이 그림은 계층적 군집이 한 번에 결과를 만드는 것이 아니라, 단계적으로 군집을 합쳐가는 과정임을 보여준다.

두 군집 사이의 거리를 어떤 기준으로 계산할지 결정하는 방법이다.
- Single Linkage(최소 거리)
- 두 군집에 속한 데이터 쌍 중 가장 가까운 거리를 군집 간 거리로 사용한다.
- Complete Linkage(최대 거리)
- 두 군집에 속한 데이터 쌍 중 가장 먼 거리를 군집 간 거리로 사용한다.
- Average Linkage(평균 거리)
- 두 군집에 속한 모든 데이터 쌍의 거리 평균을 군집 간 거리로 사용한다.
