TIL ADsP 3과목 2 : 데이터분석, 통계, 머신러닝

김덕협·2026년 8월 5일

TIL

목록 보기
41/43

title: "[ADsP] 3과목 데이터 분석 개념 정리 — 측정 척도부터 시계열·군집분석까지"
description: 측정 척도 4종, 혼동 행렬 기반 평가지표, 회귀분석 출력 해석, SOM, 인공신경망, K-means, 카이제곱 검정, 시계열 분해, 덴드로그램까지 ADsP 3과목 정리


PART 1. 개념 정리

1. 4가지 측정 척도 (Nominal / Ordinal / Interval / Ratio)

측정 척도는 '정보량의 많고 적음' 과 '수학적 연산(사칙연산)이 어디까지 가능한가' 에 따라 위계가 나뉜다.

비교 요약

척도 종류분류순서/순위등간격
(차이 비교)
절대 0점
(비율 계산)
예시
1. 명목 척도OXXX성별, 혈액형, 등번호
2. 서열 척도OOXX학점(A, B, C), 직급, 만족도 순위
3. 등간 척도OOOX섭씨온도(∘C^\circ C), IQ, 연도
4. 비율 척도OOOO키, 체중, 소득, 나이, 시간

1) 명목 척도 (Nominal Scale)

  • 개념: 단순히 대상을 구분하거나 분류하기 위해 이름 대신 숫자를 부여한 척도
  • 특징: 숫자의 크기나 순서가 아무런 의미를 갖지 않음
  • 가능한 연산: ==(같다), ≠\neq(다르다) 만 가능 (더하기/빼기 불가능)
  • 예시
    • 성별 (남성 = 1, 여성 = 2)
    • 혈액형 (A, B, O, AB)
    • 축구선수 유니폼 등번호 → 10번이 5번보다 실력이 2배 뛰어난 것이 아님

2) 서열 척도 (Ordinal Scale)

  • 개념: 대상을 구분할 뿐만 아니라 순서나 순위(위계) 까지 나타내는 척도
  • 특징: 순서는 알 수 있지만 격차(간격)가 일정하지 않다.
    → 1위와 2위의 차이가 2위와 3위의 차이와 같지 않음
  • 가능한 연산: ==, ≠\neq 및 >>(크다), <<(작다) 비교 가능
  • 예시
    • 직급 (사원 < 대리 < 과장 < 부장)
    • 학점 (A, B, C, D, F)
    • 영화 별점 / 만족도 조사 순위

3) 등간 척도 (Interval Scale) — 구간 척도

  • 개념: 순서뿐만 아니라 속성 간의 간격(차이)이 일정한 척도
  • 특징: '절대 0점(Absolute Zero Point)'이 없다.
    → 0이라는 수치가 '아무것도 없다'를 의미하지 않는 임의의 0점
  • 가능한 연산: 덧셈(++), 뺄셈(−-) 가능 (곱셈 / 나눗셈은 불가능)
  • 예시
    • 섭씨온도: 0∘C0^\circ C는 온도가 없다는 뜻이 아니며, 20∘C20^\circ C가 10∘C10^\circ C보다 2배 더 따뜻한 것도 아니다. 다만 10∘C10^\circ C와 20∘C20^\circ C의 차이는 20∘C20^\circ C와 30∘C30^\circ C의 차이와 같다.
    • IQ 지수: IQ 0인 상태가 지능이 전혀 없음을 의미하지 않음
    • 서베이 리커트 척도: "매우 불만족(1점) ~ 매우 만족(5점)" (통계 해석상 등간척도로 다룸)

4) 비율 척도 (Ratio Scale)

  • 개념: 등간 척도의 모든 특성 + '절대 0점' 을 가지는 가장 고급 단계의 척도
  • 특징: 0이 '완전한 부재(없음)'를 의미하므로 비율 계산(몇 배인가?) 이 가능
  • 가능한 연산: 사칙연산 전체(+,−,×,÷+, -, \times, \div) 가능
  • 예시
    • 체중 / 키: 0kg0kg은 무게가 아예 없는 상태. 80kg80kg은 40kg40kg보다 정확히 2배 무겁다.
    • 소득, 매출액, 나이, 시간

💡 핵심 구분법

  • 단순히 구분만 되나? → 명목
  • 순서도 알 수 있나? → 서열
  • 순서 간 간격이 일정한가? → 등간
  • 0이 '없음' 을 뜻하여 배수(비율) 계산이 가능한가? → 비율

2. 정밀도 · 민감도 · 재현율 · 특이도

기반이 되는 혼동 행렬 (Confusion Matrix)

실제 값(Actual)과 모델이 예측한 값(Predicted)의 조합에 따라 4가지 결과가 나온다.

예측: 양성 (Positive)예측: 음성 (Negative)
실제: 양성 (Positive)TP (True Positive)
진짜를 진짜로 맞춤
FN (False Negative)
진짜를 가짜로 틀림 (2종 오류)
실제: 음성 (Negative)FP (False Positive)
가짜를 진짜로 틀림 (1종 오류)
TN (True Negative)
가짜를 가짜로 맞춤
  • Positive(양성): 관심 있는 대상 (예: 암 환자, 스팸 메일, 사기 거래)
  • Negative(음성): 일반적인 대상 (예: 정상인, 일반 메일, 정상 거래)

① 정밀도 (Precision)

"모델이 양성(Positive)이라고 예측한 것 중, 실제로 진짜 양성인 비율"

Precision=TPTP+FPPrecision = \frac{TP}{TP + FP}
  • 핵심 질문: "모델이 맞다고 한 것 중에 진짜가 얼마나 돼?"
  • 중요한 상황: 양성이라고 잘못 예측했을 때(FP) 위험이 큰 경우
    • 예시 — 스팸 메일 분류: 일반 메일(Negative)을 스팸 메일(Positive)로 잘못 분류(FP)해서 삭제함에 넣으면 중요한 연락을 놓치게 된다.

② 민감도 (Sensitivity) / 재현율 (Recall)

"실제 진짜 양성(Positive)인 것들 중, 모델이 양성이라고 제대로 맞춘 비율"

Sensitivity=Recall=TPTP+FNSensitivity = Recall = \frac{TP}{TP + FN}
  • 참고: 민감도와 재현율은 같은 개념 / 같은 공식이다.
    의학·생물학 분야에서는 '민감도', 머신러닝·AI 분야에서는 '재현율'이라는 용어를 주로 사용한다.
  • 핵심 질문: "실제 진짜들 중에 모델이 몇 개나 찾아냈어?"
  • 중요한 상황: 실제 양성을 놓쳤을 때(FN) 위험이 매우 큰 경우
    • 예시 — 암 진단 모델, 도난 / 사기 감지: 실제 암 환자(Positive)를 정상(Negative)으로 잘못 판단(FN)하면 환자가 치료 시기를 놓쳐 생명이 위험해진다.

③ 특이도 (Specificity)

"실제 음성(Negative)인 것들 중, 모델이 음성이라고 제대로 맞춘 비율"

Specificity=TNTN+FPSpecificity = \frac{TN}{TN + FP}
  • 핵심 질문: "실제 가짜(정상)들 중에서 모델이 정상이라고 제대로 구별해낸 비율은 얼마야?"
  • 특징: 민감도(재현율)와 대립되는 개념으로, 정상군을 얼마나 잘 가려내는지 측정한다.
    ROC 커브를 그릴 때 1−특이도1 - 특이도 (False Positive Rate) 형태로 자주 활용된다.

지표 한눈에 비교하기

지표분모 (기준)핵심 목적주요 활용 분야
정밀도 (Precision)모델이 Positive라고 한 전체 (TP+FPTP+FP)FP(False Alarm)를 줄이는 것스팸 분류, 검색 엔진, 추천 시스템
민감도/재현율 (Recall)실제 Positive인 전체 (TP+FNTP+FN)FN(놓침)을 줄이는 것질병 진단, 금융 사기(FDS) 감지, 결함 탐지
특이도 (Specificity)실제 Negative인 전체 (TN+FPTN+FP)정상군을 올바르게 음성 판정의학적 검사, 선별 검사 정밀 평가

💡 정밀도와 재현율의 Trade-off

정밀도와 재현율은 상극(Trade-off) 관계에 있다.

  • 모델이 조금만 의심스러워도 전부 양성(Positive)이라고 예측하면 → 재현율은 올라가지만, 정밀도는 떨어진다.
  • 반대로 100% 확실한 것만 양성이라고 매우 보수적으로 예측하면 → 정밀도는 올라가지만, 재현율은 떨어진다.

따라서 두 지표의 균형을 맞추기 위해 조화평균을 낸 F1F_1-Score를 함께 평가 지표로 사용한다.

F1-Score=2×Precision×RecallPrecision+RecallF_1\text{-}Score = 2 \times \frac{Precision \times Recall}{Precision + Recall}

PART 2. 문제 유형별 오답노트

3. R 선형회귀분석 출력 결과로 회귀식 구하기

[문제] 다음은 BMI로 콜레스테롤 수치를 예측하기 위해 R로 단순선형회귀분석을 수행한 결과다. 이때 도출되는 회귀식은?

> summary(lm(formula = chol ~ bmi))

Coefficients:
             Estimate  Std. Error  t value  Pr(>|t|)
(Intercept)   96.0400     2.14558   -0.539    0.5940
bmi            1.9700     0.9214     3.353    0.0023 **

Multiple R-squared: 0.2865

[정답] f(x)=96.04+1.97xf(x) = 96.04 + 1.97x

풀이 과정

출력 결과에서 가장 중요하게 봐야 할 부분은 Coefficients(회귀계수) 표의 Estimate(추정치) 열이다.

  1. 절편 (Y-Intercept)
    • (Intercept) 항목의 Estimate 값 = 96.0400
    • 독립변수(BMI)가 0일 때의 기본값(절편 β0\beta_0)
  2. 기울기 (Slope / 회귀계수)
    • bmi 항목의 Estimate 값 = 1.9700
    • 독립변수(BMI)가 1단위 증가할 때 종속변수(콜레스테롤)가 변화하는 수치(기울기 β1\beta_1)
  3. 회귀식 완성
    • 단순선형회귀 기본 방정식: y=β0+β1xy = \beta_0 + \beta_1 x (또는 f(x)=절편+기울기×xf(x) = 절편 + 기울기 \times x)
    • 대입하면 → f(x)=96.04+1.97xf(x) = 96.04 + 1.97x

함께 알아둘 출력값 해석

출력값해석
lm(formula = chol ~ bmi)chol(콜레스테롤) = 종속변수 yy, bmi = 독립변수 xx
`Pr(>t
Multiple R-squared = 0.2865이 모델이 전체 데이터 분산의 약 28.65%를 설명 (R2R^2, 결정계수)

4. 자기조직화지도 (SOM, Self-Organizing Map)

[문제] 자기조직화지도(SOM)에 대한 설명으로 옳지 않은 것은?
① 고차원의 데이터를 저차원의 데이터로 시각화하기 위한 것이다.
② 역전파 알고리즘을 사용하지 않아 알고리즘 수행속도가 비교적 빠르다.
③ 입력층과 경쟁층은 부분적으로 연결된다.
④ 입력층과 경쟁층의 거리를 보존할 수 있다.

[정답] ③

③이 틀린 이유

SOM의 네트워크 구조는 입력층(Input Layer) 과 경쟁층(Competitive Layer, 격자/지도) 의 두 개 층으로만 구성되어 있으며, 입력층의 모든 노드는 경쟁층의 모든 노드와 완전히 연결(Fully Connected) 되어 있다.
→ 따라서 "부분적으로 연결된다"는 잘못된 설명.

나머지 보기가 맞는 이유

  • ① 저차원 시각화 (O)
    SOM은 대표적인 차원 축소 및 군집화(Clustering) 비지도학습 알고리즘. 고차원의 복잡한 데이터를 보통 2차원 평면(격자)에 시각화하여 패턴을 파악하기 쉽게 해준다.
  • ② 역전파 미사용으로 빠름 (O)
    일반적인 인공신경망(MLP 등)은 오차 역전파(Backpropagation)로 가중치를 학습하지만, SOM은 승자 독식 구조(Winner-take-all) 기반의 경쟁 학습을 하므로 역전파를 쓰지 않아 속도가 빠른 편이다.
  • ④ 거리 보존 (O)
    고차원 공간에서 가까이 있는 데이터들이 저차원 지도(경쟁층)에서도 가까운 위치에 배치되도록 위상적(Topological) 유사성과 거리를 보존한다.

💡 SOM 핵심 포인트

  1. 구조: 입력층 + 경쟁층 (2개 층, 단방향 전결합 / Fully Connected)
  2. 학습 방식: 비지도 학습(Unsupervised Learning), 승자 독식(Winner-take-all) 경쟁 학습
  3. 학습 메커니즘: 입력 벡터와 가장 가까운 승자 노드(BMU, Best Matching Unit) 및 그 인근 노드들(Neighborhood)의 가중치를 함께 업데이트
  4. 특징: 역전파(Backpropagation) 사용 안 함

5. 인공신경망 (ANN, Artificial Neural Network)

[문제] 인공신경망에 대한 설명으로 옳지 않은 것은?
① 은닉층의 개수가 많아진다고 해서 정확도 향상이 보장되지는 않는다.
② 은닉층과 은닉노드의 수를 분석가가 직접 설정해야 한다.
③ 활성화 함수의 종류에 따라 선형적, 비선형적 모델 설계를 할 수 있다.
④ 설명력 있는 가중치를 산출할 수 있다.

[정답] ④

④가 틀린 이유 — 블랙박스 모델

  • 인공신경망은 수많은 노드와 가중치(Weight)가 복잡하게 얽혀 있어 "왜 이런 결과가 나왔는지" 과정이나 가중치의 의미를 사람이 직관적으로 해석하기 매우 어렵다.
  • 즉, 설명력(Interpretability)이 떨어진다는 것이 인공신경망의 가장 큰 단점.
  • 따라서 "설명력 있는 가중치를 산출할 수 있다"는 잘못된 설명.

내가 헷갈렸던 ②가 맞는 설명인 이유

  • 은닉층(Hidden Layer)의 수와 은닉 노드(Hidden Node)의 수는 학습 알고리즘이 자동으로 찾아주는 값이 아니다.
  • 이는 하이퍼파라미터(Hyperparameter) 로서 분석가(사용자)가 직접 실험하며 설정해야 한다.
  • 문제마다 최적의 노드/층 개수를 정해주는 공식이 딱히 없어 경험적(Trial and Error)으로 일일이 조정해야 한다는 실제 단점으로 분류된다.
    → "분석가가 직접 설정해야 한다"는 것은 단점이지만 사실이므로 맞는 설명. 여기서 함정에 걸렸다.

나머지 보기가 맞는 이유

  • ① 은닉층이 많아도 정확도 보장 X (O)
    은닉층이나 노드가 너무 많아지면 모델이 훈련 데이터에 과하게 맞춰지는 과대적합(Overfitting) 이 발생하여, 오히려 새로운 데이터에 대한 성능이 떨어질 수 있다.
  • ③ 활성화 함수에 따른 선형/비선형 설계 (O)
    항등 함수(Identity) 같은 선형 활성화 함수를 쓰면 선형 모델이 되고, Sigmoid·ReLU 같은 비선형 활성화 함수를 추가하여 복잡한 비선형 관계를 표현할 수 있다.

💡 인공신경망 핵심 포인트

  1. 장점: 복잡한 비선형 관계 표현 가능, 입력 데이터에 대한 유연한 학습
  2. 단점
    • 블랙박스(Black box) 문제: 예측 결과에 대한 설명력 / 해석력이 떨어짐
    • 과대적합(Overfitting) 위험: 모델이 너무 복잡해지면 일반화 성능 감소
    • 하이퍼파라미터 설정: 은닉층 / 노드 수, 학습률 등을 분석가가 직접 설정해야 함

6. K-평균 군집화 (K-means Clustering)

[문제] K-평균 군집화에 대한 설명으로 옳지 않은 것은?
① K-medoids는 K-means 군집화의 단점을 보완하기 위해 고안되었으나, 수행 속도가 느리다는 단점이 있다.
② K-means는 이상치에 민감한 특성이 있다.
③ 초기 중심값 설정에 따라 결과가 달라질 수 있으므로 최적화된 군집이 항상 보장되지는 않는다.
④ 군집의 개수 K는 알고리즘에 의해 자동으로 선택된다.

[정답] ④

④가 틀린 이유 — K는 하이퍼파라미터

  • K-means에서 군집의 개수를 나타내는 KK 값은 알고리즘이 자동으로 찾아주는 것이 아니라, 분석가(사용자)가 직접 지정해야 한다.
  • 최적의 KK를 찾기 위해 보통 엘보우 기법(Elbow Method) 이나 실루엣 계수(Silhouette Coefficient) 등을 활용해 분석가가 판단한다.

나머지 보기가 맞는 이유

  • ① K-medoids는 이상치에 강하지만 느리다 (O)
    K-means는 평균(Mean)을 사용하기 때문에 이상치에 취약하다. 이를 보완하기 위해 실제 데이터 포인트인 중심 개체(Medoid)를 사용하는 K-medoids(PAM) 가 등장했다.
    이상치에는 강하지만, 매번 모든 데이터 간의 거리를 재계산해야 하므로 계산량이 많아져 속도가 느리다.
  • ② 이상치에 민감 (O)
    군집의 중심점을 계산할 때 '평균(Mean)'을 사용하므로, 극단적인 이상치(Outlier)가 존재하면 중심점이 크게 왜곡된다.
  • ③ 초기값에 따라 결과가 달라짐 (O)
    처음에 KK개의 중심점을 무작위(Random)로 정하고 시작하기 때문에, 초기값 위치에 따라 지역 최적값(Local Optima) 에 빠질 수 있다. 실행할 때마다 결과가 조금씩 달라지거나 최적의 군집이 나오지 않을 수 있다.
    → 이를 보완한 알고리즘이 K-means++

💡 K-means 핵심 포인트

  1. 군집 수(KK): 분석가가 직접 설정 (하이퍼파라미터)
  2. 중심점 계산: 평균(Mean) 이용 → 이상치(Outlier)에 민감
  3. 초기값 민감성: 초기 중심점 위치에 따라 결과가 달라짐 (지역 최적해 위험)
  4. 거리 측정 방식: 주로 유클리드 거리(Euclidean Distance) 사용

7. 카이제곱 검정 (Chi-Square Test) / 범주형 자료 분석

[문제] 범주형 자료 분석에 대한 설명으로 옳지 않은 것은?
① 범주의 특성에 따른 기대도수와 실제 관찰도수를 활용하여 분석한다.
② 독립성 검정은 서로 다른 요인들에 의해 분할되어 있는 경우, 그 요인들이 관찰값에 영향을 주는지를 검정한다.
③ 동질성 검정은 관측값들이 정해진 범주 내에서 서로 비슷하게 나타나고 있는지를 검정한다.
④ 적합도 검정은 도수표 내 관찰도수의 분산과 기대도수 분산이 얼마나 일치하는지를 검정한다.

[정답] ④

④가 틀린 이유 — '분산'이 아니라 '도수의 차이'

  • 적합도 검정(Goodness of Fit Test)은 관측된 표본 데이터의 분포가 '특정 이론적 확률 분포(예: 균등분포, 정규분포 등)'에 잘 맞는지(적합한지) 를 검정하는 것이다.
  • 즉, '관찰 도수(실제 값)'와 '기대 도수(이론 값)' 사이의 차이를 검정하는 것이지, "분산과 분산이 얼마나 일치하는지"를 비교하는 것이 아니다.
    (분산을 비교하는 것은 ANOVA나 F-검정 등이다.)

나머지 보기가 맞는 이유

  • ① 기대도수와 관찰도수 활용 (O)
    카이제곱 검정 통계량 계산식 자체가 관찰도수(OO)와 기대도수(EE)의 차이를 바탕으로 계산된다.
χ2=∑(O−E)2E\chi^2 = \sum \frac{(O - E)^2}{E}
  • ② 독립성 검정 (O)
    두 개의 범주형 변수(요인)가 서로 관련이 있는지(독립적인지 아닌지)를 분석. (예: 성별과 선호하는 정당 간에 관련이 있는가?)
  • ③ 동질성 검정 (O)
    서로 다른 집단(표본) 간에 특정 범주형 변수의 비율(분포)이 서로 동일한지(동질한지)를 분석. (예: 20대, 30대, 40대 집단별 스마트폰 브랜드 선호 비율이 동일한가?)

💡 카이제곱 검정 3가지 핵심 유형

유형대상검정 내용
적합도 검정 (Goodness of Fit)1개의 범주형 변수이론적 분포에 잘 부합하는지
독립성 검정 (Independence)2개의 범주형 변수서로 연관성이 있는지(독립인지)
동질성 검정 (Homogeneity)여러 집단 간범주형 변수의 분포가 서로 동일한지

8. 시계열 분해 (Time Series Decomposition)의 4가지 구성 요인

[문제] 시계열 분해의 구성 요인에 대한 설명으로 옳지 않은 것은?
① 추세: 시간이 흐름에 따라 장기적으로 증가하거나 감소하는 변화 경향이다.
② 계절: 1년, 1주, 1일 등 일정한 주기를 갖고 반복되는 요인이다.
③ 순환: 경제나 자연현상과 같이 특정한 원인으로부터 반복되는 요인이다.
④ 불규칙: 추세, 계절, 순환으로 설명할 수 없는 우연적인 변동이다.

[정답] ③

③이 틀린 이유 — 순환은 '주기가 불분명한' 변동

  • 순환 요인(Cyclical Component)은 명확한 이유나 주기가 일정하지 않은(비주기적인) 장기적 변동을 의미한다.
    (예: 2~10년 단위의 불규칙한 경기 변동, 경기의 호황과 불황)
  • 오답 포인트: "특정한 원인으로부터 반복되는 요인", "특정한 주기를 가지고 반복되는 요인"은 계절 요인(Seasonal) 이나 주기 변동에 더 어울리는 설명이다.
  • 특히 순환 요인은 계절 요인과 달리 주기가 불분명하고 명확한 요인을 파악하기 힘든 경우가 많다.

시계열 분해 4대 요인 정리

요인영문명정의 및 특징예시
① 추세 요인Trend시간이 흐름에 따라 장기적으로 증가하거나 감소하는 변화 경향인구 증가, 기술 발전에 따른 매출 증가
② 계절 요인Seasonal1년, 1주, 1일 등 일정한 주기를 갖고 반복되는 변동여름철 에어컨 판매량, 주말의 영화관 관객 수
③ 순환 요인Cyclical일정한 주기는 없으나 장기적인 경기 변동(호황/불황) 에 따라 일어나는 변화2~5년 단위의 경기 순환, 경기 침체기 매출 감소
④ 불규칙 요인Irregular추세·계절·순환으로 설명할 수 없는 우연적인 / 오차 변동지진, 전쟁, 팬데믹, 갑작스러운 날씨 변화

💡 시계열 분해 핵심 포인트

  • 계절 요인 vs 순환 요인 구별하기
    • 계절(Seasonal): 주기가 명확하고 일정함 (예: 매년 7월마다, 매주 주말마다)
    • 순환(Cyclical): 주기가 불분명하고 길다 (예: 경기 변동)
  • 시계열 분해 모델 형태
    • 덧셈 모델 (Additive Model): Yt=Tt+St+Ct+ItY_t = T_t + S_t + C_t + I_t — 변동 폭이 일정한 경우
    • 곱셈 모델 (Multiplicative Model): Yt=Tt×St×Ct×ItY_t = T_t \times S_t \times C_t \times I_t — 시간에 따라 변동 폭이 점점 커지는 경우

9. 계층적 군집분석과 덴드로그램(Dendrogram) 읽기

[문제 유형] 아래와 같은 덴드로그램에서 Height = 2를 기준으로 할 때, 생성되는 군집의 개수는?

 Height
  5.0 ┤        ┌───────────────┐
  4.0 ┤        │               │
  3.5 ┤        │           ┌───┴───┐
  3.0 ┤    ┌───┴───┐       │       │
  2.5 ┤    │       │       │       │
  2.0 ┼╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌  ← 절단선 (Height = 2)
  1.5 ┤  ┌─┴─┐   ┌─┴─┐     │       │
  1.0 ┤  │   │   │   │   ┌─┴─┐   ┌─┴─┐
  0.5 ┤  │   │   │   │   │   │   │   │
  0.0 └──A───B───C───D───E───F───G───H──

[정답] 4개 → {A, B}, {C, D}, {E, F}, {G, H}

덴드로그램 읽는 방법 (쉽게 자르는 팁)

"Height 값을 X 기준으로 자를 때"라는 조건이 나오면,

  1. Y축의 Height = X 위치에 가로선을 하나 긋는다. (위 그림의 절단선)
  2. 이 가로선과 만나는 수직선(세로줄)의 개수를 센다. 그게 바로 생성되는 군집의 개수다.

왜 그런가 (핵심 원리)

  • 덴드로그램에서 두 군집이 합쳐지는 높이(Height) 는 그 군집 간의 거리(비유사도)를 뜻한다.
  • 절단선보다 아래에서 합쳐진 쌍은 이미 하나의 군집으로 묶여 있으므로 수직선 1개로 지나간다.
  • 절단선보다 위에서 합쳐지는 결합은 아직 일어나지 않은 것으로 취급하므로, 그 아래의 군집들은 각각 따로 센다.

위 예시에서 Height = 2 지점을 왼쪽에서 오른쪽으로 훑으면,

순서결합 높이절단선(2.0) 기준결과
A–B1.5아래에서 이미 결합군집 1: {A, B}
C–D1.5아래에서 이미 결합군집 2: {C, D}
E–F1.0아래에서 이미 결합군집 3: {E, F}
G–H1.0아래에서 이미 결합군집 4: {G, H}
{A,B}–{C,D}3.0위에서 결합 → 무시따로 셈
{E,F}–{G,H}3.5위에서 결합 → 무시따로 셈
전체 결합5.0위에서 결합 → 무시따로 셈

→ 절단선이 지나는 수직선은 총 4개, 즉 군집 4개.

⚠️ 주의: 절단 높이를 낮추면 군집 수가 늘어나고, 높이면 줄어든다.
위 예시에서 Height = 4로 자르면 → 2개 ({A,B,C,D}, {E,F,G,H}), Height = 1.2로 자르면 → 6개 ({A},{B},{C},{D},{E,F},{G,H}).


오늘의 정리

주제한 줄 요약
측정 척도명목(분류) → 서열(순서) → 등간(간격) → 비율(절대 0점) 위계
평가 지표Precision은 분모가 예측 Positive, Recall은 분모가 실제 Positive
회귀 출력 해석Estimate의 (Intercept) = 절편, 변수명 = 기울기
SOM2개 층 + 전결합, 역전파 사용 안 함, 승자 독식
인공신경망블랙박스 → 설명력 떨어짐이 단점
K-meansKK는 분석가가 직접 지정, 평균 사용 → 이상치 민감
카이제곱 검정적합도 / 독립성 / 동질성 — 분산이 아니라 도수의 차이
시계열 분해계절 = 주기 일정, 순환 = 주기 불분명
덴드로그램절단선이 지나는 수직선 개수 = 군집 수
profile
뭘봐

0개의 댓글