#12 Weekly Paper _high-dimensional clustering

Heidi J.·2026년 6월 12일

Weekly_Paper

목록 보기
29/37
post-thumbnail

데이터 간의 유사도를 계산할 때, feature의 수가 많다면(예: 100개 이상), 이러한 high-dimensional clustering 문제를 해결하기 위한 방법들을 설명해 주세요

고차원 데이터(High-dimensional Data)에서는 단순히 K-Means 같은 군집화를 적용하면 성능이 떨어지는 경우가 많음 -> 차원의 저주(Curse of Dimensionality) 때문

1. 왜 문제가 되는가?

ex:

  • 고객 정보 5개 변수 -> 군집화 쉬움
  • 고객 정보 100개 변수 -> 군집화 어려움

이유 1. 거리의 의미가 사라짐

K-Means는 거리 기반 알고리즘

100차원 공간에서는:

  • 가까운 점
  • 먼 점
    의 차이가 점점 작아짐

모든 데이터가 비슷한 거리에 있는 것처럼 보이는 현상 발생

이유 2. 노이즈 증가

100개 변수 중:

  • 실제로 중요한 변수는 10개
  • 나머지 90개는 의미 없음
    일 수 있음
    그런데 군집화는 모든 변수를 사용하므로 노이즈 때문에 군집 품질이 나빠짐

이유 3. 계산 비용 증가

차원이 증가하면:

  • 거리 계산 증가
  • 메모리 사용 증가
  • 학습 시간 증가

2. 해결 방법

1. 차원 축소(Dimensionality Reduction)

  • 가장 대표적인 방법
  • 불필요한 정보를 제거하고 핵심 정보만 남김

☝️ PCA(주성분 분석): 가장 많이 사용
목표:
100개 변수 -> 10개 변수 -> 정보는 최대한 유지

PCA는:

  • 분산이 큰 방향을 찾고
  • 새로운 축 생성

장점

  • 노이즈 제거
  • 속도 향상
  • 군집 품질 향상

단점

  • 해석이 어려움
  • 원래 변수 의미 일부 손실

2. Feature Selection

  • 변수를 줄이는 방법
  • 차원 축소와 다름

✅ PCA vs. Feature Selection
PCA: 100개 변수 -> 새로운 10개 변수
Feature Selection: 100개 변수 -> 중요한 원래 변수 10개 선택

ex:
제거

  • 고객ID
  • 전화번호
  • 의미 없는 변수

남김

  • 구매금액
  • 방문횟수
  • 가입기간

방법

  • Filter 방식: 상관관계 분석
  • Wrapper 방식: RFE
  • Embedded 방식: 랜덤포레스트 Feature Importance

장점

  • 해석 가능
  • 불필요 변수 제거

3. 적절한 거리 측정 사용

  • 고차원에서는 유클리드 거리만 고집하지 않음
  • Cosine Similarity
    • 텍스트 데이터에서 매우 많이 사용
    • 벡터의 크기보다 방향 비교

ex:
문서 군집화

  • TF-IDF
  • Word Embedding

장점

  • 고차원 희소 데이터에 강함

4. 군집 알고리즘 변경

  • K-Means: 고차원에 약한 편
  • DBSCAN: 밀도 기반, 고차원에서는 성능 저하 가능
  • Spectral Clustering: 복잡한 구조 탐지 가능
  • Gaussian Mixture Model(GMM): 확률 기반 군집화

고차원 군집화에서는 차원의 저주로 인해 거리 기반 유사도가 왜곡되고 노이즈가 증가하는 문제가 발생한다. 이를 해결하기 위해 PCA와 같은 차원 축소 기법이나 Feature Selection을 통해 변수 수를 줄일 수 있으며, 텍스트 데이터의 경우 Cosine Similarity를 사용할 수 있다.
또한 PCA 후 K-Means를 적용하거나, Autoencoder 기반의 차원 축소 및 군집화를 수행하는 방법도 활용된다.

😎

profile
꼬꼬마 데분가😎

0개의 댓글