title: "[ADsP] 3과목 데이터 분석 개념 정리 — 측정 척도부터 시계열·군집분석까지"
description: 측정 척도 4종, 혼동 행렬 기반 평가지표, 회귀분석 출력 해석, SOM, 인공신경망, K-means, 카이제곱 검정, 시계열 분해, 덴드로그램까지 ADsP 3과목 정리
PART 1. 개념 정리
1. 4가지 측정 척도 (Nominal / Ordinal / Interval / Ratio)
측정 척도는 '정보량의 많고 적음' 과 '수학적 연산(사칙연산)이 어디까지 가능한가' 에 따라 위계가 나뉜다.
비교 요약
| 척도 종류 | 분류 | 순서/순위 | 등간격 (차이 비교) | 절대 0점 (비율 계산) | 예시 |
|---|
| 1. 명목 척도 | O | X | X | X | 성별, 혈액형, 등번호 |
| 2. 서열 척도 | O | O | X | X | 학점(A, B, C), 직급, 만족도 순위 |
| 3. 등간 척도 | O | O | O | X | 섭씨온도(∘C), IQ, 연도 |
| 4. 비율 척도 | O | O | O | O | 키, 체중, 소득, 나이, 시간 |
1) 명목 척도 (Nominal Scale)
- 개념: 단순히 대상을 구분하거나 분류하기 위해 이름 대신 숫자를 부여한 척도
- 특징: 숫자의 크기나 순서가 아무런 의미를 갖지 않음
- 가능한 연산: =(같다), =(다르다) 만 가능 (더하기/빼기 불가능)
- 예시
- 성별 (남성 = 1, 여성 = 2)
- 혈액형 (A, B, O, AB)
- 축구선수 유니폼 등번호 → 10번이 5번보다 실력이 2배 뛰어난 것이 아님
2) 서열 척도 (Ordinal Scale)
- 개념: 대상을 구분할 뿐만 아니라 순서나 순위(위계) 까지 나타내는 척도
- 특징: 순서는 알 수 있지만 격차(간격)가 일정하지 않다.
→ 1위와 2위의 차이가 2위와 3위의 차이와 같지 않음
- 가능한 연산: =, = 및 >(크다), <(작다) 비교 가능
- 예시
- 직급 (사원 < 대리 < 과장 < 부장)
- 학점 (A, B, C, D, F)
- 영화 별점 / 만족도 조사 순위
3) 등간 척도 (Interval Scale) — 구간 척도
- 개념: 순서뿐만 아니라 속성 간의 간격(차이)이 일정한 척도
- 특징: '절대 0점(Absolute Zero Point)'이 없다.
→ 0이라는 수치가 '아무것도 없다'를 의미하지 않는 임의의 0점
- 가능한 연산: 덧셈(+), 뺄셈(−) 가능 (곱셈 / 나눗셈은 불가능)
- 예시
- 섭씨온도: 0∘C는 온도가 없다는 뜻이 아니며, 20∘C가 10∘C보다 2배 더 따뜻한 것도 아니다. 다만 10∘C와 20∘C의 차이는 20∘C와 30∘C의 차이와 같다.
- IQ 지수: IQ 0인 상태가 지능이 전혀 없음을 의미하지 않음
- 서베이 리커트 척도: "매우 불만족(1점) ~ 매우 만족(5점)" (통계 해석상 등간척도로 다룸)
4) 비율 척도 (Ratio Scale)
- 개념: 등간 척도의 모든 특성 + '절대 0점' 을 가지는 가장 고급 단계의 척도
- 특징: 0이 '완전한 부재(없음)'를 의미하므로 비율 계산(몇 배인가?) 이 가능
- 가능한 연산: 사칙연산 전체(+,−,×,÷) 가능
- 예시
- 체중 / 키: 0kg은 무게가 아예 없는 상태. 80kg은 40kg보다 정확히 2배 무겁다.
- 소득, 매출액, 나이, 시간
💡 핵심 구분법
- 단순히 구분만 되나? → 명목
- 순서도 알 수 있나? → 서열
- 순서 간 간격이 일정한가? → 등간
- 0이 '없음' 을 뜻하여 배수(비율) 계산이 가능한가? → 비율
2. 정밀도 · 민감도 · 재현율 · 특이도
기반이 되는 혼동 행렬 (Confusion Matrix)
실제 값(Actual)과 모델이 예측한 값(Predicted)의 조합에 따라 4가지 결과가 나온다.
| 예측: 양성 (Positive) | 예측: 음성 (Negative) |
|---|
| 실제: 양성 (Positive) | TP (True Positive) 진짜를 진짜로 맞춤 | FN (False Negative) 진짜를 가짜로 틀림 (2종 오류) |
| 실제: 음성 (Negative) | FP (False Positive) 가짜를 진짜로 틀림 (1종 오류) | TN (True Negative) 가짜를 가짜로 맞춤 |
- Positive(양성): 관심 있는 대상 (예: 암 환자, 스팸 메일, 사기 거래)
- Negative(음성): 일반적인 대상 (예: 정상인, 일반 메일, 정상 거래)
① 정밀도 (Precision)
"모델이 양성(Positive)이라고 예측한 것 중, 실제로 진짜 양성인 비율"
Precision=TP+FPTP
- 핵심 질문: "모델이 맞다고 한 것 중에 진짜가 얼마나 돼?"
- 중요한 상황: 양성이라고 잘못 예측했을 때(FP) 위험이 큰 경우
- 예시 — 스팸 메일 분류: 일반 메일(Negative)을 스팸 메일(Positive)로 잘못 분류(FP)해서 삭제함에 넣으면 중요한 연락을 놓치게 된다.
② 민감도 (Sensitivity) / 재현율 (Recall)
"실제 진짜 양성(Positive)인 것들 중, 모델이 양성이라고 제대로 맞춘 비율"
Sensitivity=Recall=TP+FNTP
- 참고: 민감도와 재현율은 같은 개념 / 같은 공식이다.
의학·생물학 분야에서는 '민감도', 머신러닝·AI 분야에서는 '재현율'이라는 용어를 주로 사용한다.
- 핵심 질문: "실제 진짜들 중에 모델이 몇 개나 찾아냈어?"
- 중요한 상황: 실제 양성을 놓쳤을 때(FN) 위험이 매우 큰 경우
- 예시 — 암 진단 모델, 도난 / 사기 감지: 실제 암 환자(Positive)를 정상(Negative)으로 잘못 판단(FN)하면 환자가 치료 시기를 놓쳐 생명이 위험해진다.
③ 특이도 (Specificity)
"실제 음성(Negative)인 것들 중, 모델이 음성이라고 제대로 맞춘 비율"
Specificity=TN+FPTN
- 핵심 질문: "실제 가짜(정상)들 중에서 모델이 정상이라고 제대로 구별해낸 비율은 얼마야?"
- 특징: 민감도(재현율)와 대립되는 개념으로, 정상군을 얼마나 잘 가려내는지 측정한다.
ROC 커브를 그릴 때 1−특이도 (False Positive Rate) 형태로 자주 활용된다.
지표 한눈에 비교하기
| 지표 | 분모 (기준) | 핵심 목적 | 주요 활용 분야 |
|---|
| 정밀도 (Precision) | 모델이 Positive라고 한 전체 (TP+FP) | FP(False Alarm)를 줄이는 것 | 스팸 분류, 검색 엔진, 추천 시스템 |
| 민감도/재현율 (Recall) | 실제 Positive인 전체 (TP+FN) | FN(놓침)을 줄이는 것 | 질병 진단, 금융 사기(FDS) 감지, 결함 탐지 |
| 특이도 (Specificity) | 실제 Negative인 전체 (TN+FP) | 정상군을 올바르게 음성 판정 | 의학적 검사, 선별 검사 정밀 평가 |
💡 정밀도와 재현율의 Trade-off
정밀도와 재현율은 상극(Trade-off) 관계에 있다.
- 모델이 조금만 의심스러워도 전부 양성(Positive)이라고 예측하면 → 재현율은 올라가지만, 정밀도는 떨어진다.
- 반대로 100% 확실한 것만 양성이라고 매우 보수적으로 예측하면 → 정밀도는 올라가지만, 재현율은 떨어진다.
따라서 두 지표의 균형을 맞추기 위해 조화평균을 낸 F1-Score를 함께 평가 지표로 사용한다.
F1-Score=2×Precision+RecallPrecision×Recall
PART 2. 문제 유형별 오답노트
3. R 선형회귀분석 출력 결과로 회귀식 구하기
[문제] 다음은 BMI로 콜레스테롤 수치를 예측하기 위해 R로 단순선형회귀분석을 수행한 결과다. 이때 도출되는 회귀식은?
> summary(lm(formula = chol ~ bmi))
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 96.0400 2.14558 -0.539 0.5940
bmi 1.9700 0.9214 3.353 0.0023 **
Multiple R-squared: 0.2865
[정답] f(x)=96.04+1.97x
풀이 과정
출력 결과에서 가장 중요하게 봐야 할 부분은 Coefficients(회귀계수) 표의 Estimate(추정치) 열이다.
- 절편 (Y-Intercept)
(Intercept) 항목의 Estimate 값 = 96.0400
- 독립변수(BMI)가 0일 때의 기본값(절편 β0)
- 기울기 (Slope / 회귀계수)
bmi 항목의 Estimate 값 = 1.9700
- 독립변수(BMI)가 1단위 증가할 때 종속변수(콜레스테롤)가 변화하는 수치(기울기 β1)
- 회귀식 완성
- 단순선형회귀 기본 방정식: y=β0+β1x (또는 f(x)=절편+기울기×x)
- 대입하면 → f(x)=96.04+1.97x
함께 알아둘 출력값 해석
| 출력값 | 해석 |
|---|
lm(formula = chol ~ bmi) | chol(콜레스테롤) = 종속변수 y, bmi = 독립변수 x |
| `Pr(> | t |
Multiple R-squared = 0.2865 | 이 모델이 전체 데이터 분산의 약 28.65%를 설명 (R2, 결정계수) |
4. 자기조직화지도 (SOM, Self-Organizing Map)
[문제] 자기조직화지도(SOM)에 대한 설명으로 옳지 않은 것은?
① 고차원의 데이터를 저차원의 데이터로 시각화하기 위한 것이다.
② 역전파 알고리즘을 사용하지 않아 알고리즘 수행속도가 비교적 빠르다.
③ 입력층과 경쟁층은 부분적으로 연결된다.
④ 입력층과 경쟁층의 거리를 보존할 수 있다.
[정답] ③
③이 틀린 이유
SOM의 네트워크 구조는 입력층(Input Layer) 과 경쟁층(Competitive Layer, 격자/지도) 의 두 개 층으로만 구성되어 있으며, 입력층의 모든 노드는 경쟁층의 모든 노드와 완전히 연결(Fully Connected) 되어 있다.
→ 따라서 "부분적으로 연결된다"는 잘못된 설명.
나머지 보기가 맞는 이유
- ① 저차원 시각화 (O)
SOM은 대표적인 차원 축소 및 군집화(Clustering) 비지도학습 알고리즘. 고차원의 복잡한 데이터를 보통 2차원 평면(격자)에 시각화하여 패턴을 파악하기 쉽게 해준다.
- ② 역전파 미사용으로 빠름 (O)
일반적인 인공신경망(MLP 등)은 오차 역전파(Backpropagation)로 가중치를 학습하지만, SOM은 승자 독식 구조(Winner-take-all) 기반의 경쟁 학습을 하므로 역전파를 쓰지 않아 속도가 빠른 편이다.
- ④ 거리 보존 (O)
고차원 공간에서 가까이 있는 데이터들이 저차원 지도(경쟁층)에서도 가까운 위치에 배치되도록 위상적(Topological) 유사성과 거리를 보존한다.
💡 SOM 핵심 포인트
- 구조: 입력층 + 경쟁층 (2개 층, 단방향 전결합 / Fully Connected)
- 학습 방식: 비지도 학습(Unsupervised Learning), 승자 독식(Winner-take-all) 경쟁 학습
- 학습 메커니즘: 입력 벡터와 가장 가까운 승자 노드(BMU, Best Matching Unit) 및 그 인근 노드들(Neighborhood)의 가중치를 함께 업데이트
- 특징: 역전파(Backpropagation) 사용 안 함
5. 인공신경망 (ANN, Artificial Neural Network)
[문제] 인공신경망에 대한 설명으로 옳지 않은 것은?
① 은닉층의 개수가 많아진다고 해서 정확도 향상이 보장되지는 않는다.
② 은닉층과 은닉노드의 수를 분석가가 직접 설정해야 한다.
③ 활성화 함수의 종류에 따라 선형적, 비선형적 모델 설계를 할 수 있다.
④ 설명력 있는 가중치를 산출할 수 있다.
[정답] ④
④가 틀린 이유 — 블랙박스 모델
- 인공신경망은 수많은 노드와 가중치(Weight)가 복잡하게 얽혀 있어 "왜 이런 결과가 나왔는지" 과정이나 가중치의 의미를 사람이 직관적으로 해석하기 매우 어렵다.
- 즉, 설명력(Interpretability)이 떨어진다는 것이 인공신경망의 가장 큰 단점.
- 따라서 "설명력 있는 가중치를 산출할 수 있다"는 잘못된 설명.
내가 헷갈렸던 ②가 맞는 설명인 이유
- 은닉층(Hidden Layer)의 수와 은닉 노드(Hidden Node)의 수는 학습 알고리즘이 자동으로 찾아주는 값이 아니다.
- 이는 하이퍼파라미터(Hyperparameter) 로서 분석가(사용자)가 직접 실험하며 설정해야 한다.
- 문제마다 최적의 노드/층 개수를 정해주는 공식이 딱히 없어 경험적(Trial and Error)으로 일일이 조정해야 한다는 실제 단점으로 분류된다.
→ "분석가가 직접 설정해야 한다"는 것은 단점이지만 사실이므로 맞는 설명. 여기서 함정에 걸렸다.
나머지 보기가 맞는 이유
- ① 은닉층이 많아도 정확도 보장 X (O)
은닉층이나 노드가 너무 많아지면 모델이 훈련 데이터에 과하게 맞춰지는 과대적합(Overfitting) 이 발생하여, 오히려 새로운 데이터에 대한 성능이 떨어질 수 있다.
- ③ 활성화 함수에 따른 선형/비선형 설계 (O)
항등 함수(Identity) 같은 선형 활성화 함수를 쓰면 선형 모델이 되고, Sigmoid·ReLU 같은 비선형 활성화 함수를 추가하여 복잡한 비선형 관계를 표현할 수 있다.
💡 인공신경망 핵심 포인트
- 장점: 복잡한 비선형 관계 표현 가능, 입력 데이터에 대한 유연한 학습
- 단점
- 블랙박스(Black box) 문제: 예측 결과에 대한 설명력 / 해석력이 떨어짐
- 과대적합(Overfitting) 위험: 모델이 너무 복잡해지면 일반화 성능 감소
- 하이퍼파라미터 설정: 은닉층 / 노드 수, 학습률 등을 분석가가 직접 설정해야 함
6. K-평균 군집화 (K-means Clustering)
[문제] K-평균 군집화에 대한 설명으로 옳지 않은 것은?
① K-medoids는 K-means 군집화의 단점을 보완하기 위해 고안되었으나, 수행 속도가 느리다는 단점이 있다.
② K-means는 이상치에 민감한 특성이 있다.
③ 초기 중심값 설정에 따라 결과가 달라질 수 있으므로 최적화된 군집이 항상 보장되지는 않는다.
④ 군집의 개수 K는 알고리즘에 의해 자동으로 선택된다.
[정답] ④
④가 틀린 이유 — K는 하이퍼파라미터
- K-means에서 군집의 개수를 나타내는 K 값은 알고리즘이 자동으로 찾아주는 것이 아니라, 분석가(사용자)가 직접 지정해야 한다.
- 최적의 K를 찾기 위해 보통 엘보우 기법(Elbow Method) 이나 실루엣 계수(Silhouette Coefficient) 등을 활용해 분석가가 판단한다.
나머지 보기가 맞는 이유
- ① K-medoids는 이상치에 강하지만 느리다 (O)
K-means는 평균(Mean)을 사용하기 때문에 이상치에 취약하다. 이를 보완하기 위해 실제 데이터 포인트인 중심 개체(Medoid)를 사용하는 K-medoids(PAM) 가 등장했다.
이상치에는 강하지만, 매번 모든 데이터 간의 거리를 재계산해야 하므로 계산량이 많아져 속도가 느리다.
- ② 이상치에 민감 (O)
군집의 중심점을 계산할 때 '평균(Mean)'을 사용하므로, 극단적인 이상치(Outlier)가 존재하면 중심점이 크게 왜곡된다.
- ③ 초기값에 따라 결과가 달라짐 (O)
처음에 K개의 중심점을 무작위(Random)로 정하고 시작하기 때문에, 초기값 위치에 따라 지역 최적값(Local Optima) 에 빠질 수 있다. 실행할 때마다 결과가 조금씩 달라지거나 최적의 군집이 나오지 않을 수 있다.
→ 이를 보완한 알고리즘이 K-means++
💡 K-means 핵심 포인트
- 군집 수(K): 분석가가 직접 설정 (하이퍼파라미터)
- 중심점 계산: 평균(Mean) 이용 → 이상치(Outlier)에 민감
- 초기값 민감성: 초기 중심점 위치에 따라 결과가 달라짐 (지역 최적해 위험)
- 거리 측정 방식: 주로 유클리드 거리(Euclidean Distance) 사용
7. 카이제곱 검정 (Chi-Square Test) / 범주형 자료 분석
[문제] 범주형 자료 분석에 대한 설명으로 옳지 않은 것은?
① 범주의 특성에 따른 기대도수와 실제 관찰도수를 활용하여 분석한다.
② 독립성 검정은 서로 다른 요인들에 의해 분할되어 있는 경우, 그 요인들이 관찰값에 영향을 주는지를 검정한다.
③ 동질성 검정은 관측값들이 정해진 범주 내에서 서로 비슷하게 나타나고 있는지를 검정한다.
④ 적합도 검정은 도수표 내 관찰도수의 분산과 기대도수 분산이 얼마나 일치하는지를 검정한다.
[정답] ④
④가 틀린 이유 — '분산'이 아니라 '도수의 차이'
- 적합도 검정(Goodness of Fit Test)은 관측된 표본 데이터의 분포가 '특정 이론적 확률 분포(예: 균등분포, 정규분포 등)'에 잘 맞는지(적합한지) 를 검정하는 것이다.
- 즉, '관찰 도수(실제 값)'와 '기대 도수(이론 값)' 사이의 차이를 검정하는 것이지, "분산과 분산이 얼마나 일치하는지"를 비교하는 것이 아니다.
(분산을 비교하는 것은 ANOVA나 F-검정 등이다.)
나머지 보기가 맞는 이유
- ① 기대도수와 관찰도수 활용 (O)
카이제곱 검정 통계량 계산식 자체가 관찰도수(O)와 기대도수(E)의 차이를 바탕으로 계산된다.
χ2=∑E(O−E)2
- ② 독립성 검정 (O)
두 개의 범주형 변수(요인)가 서로 관련이 있는지(독립적인지 아닌지)를 분석. (예: 성별과 선호하는 정당 간에 관련이 있는가?)
- ③ 동질성 검정 (O)
서로 다른 집단(표본) 간에 특정 범주형 변수의 비율(분포)이 서로 동일한지(동질한지)를 분석. (예: 20대, 30대, 40대 집단별 스마트폰 브랜드 선호 비율이 동일한가?)
💡 카이제곱 검정 3가지 핵심 유형
| 유형 | 대상 | 검정 내용 |
|---|
| 적합도 검정 (Goodness of Fit) | 1개의 범주형 변수 | 이론적 분포에 잘 부합하는지 |
| 독립성 검정 (Independence) | 2개의 범주형 변수 | 서로 연관성이 있는지(독립인지) |
| 동질성 검정 (Homogeneity) | 여러 집단 간 | 범주형 변수의 분포가 서로 동일한지 |
8. 시계열 분해 (Time Series Decomposition)의 4가지 구성 요인
[문제] 시계열 분해의 구성 요인에 대한 설명으로 옳지 않은 것은?
① 추세: 시간이 흐름에 따라 장기적으로 증가하거나 감소하는 변화 경향이다.
② 계절: 1년, 1주, 1일 등 일정한 주기를 갖고 반복되는 요인이다.
③ 순환: 경제나 자연현상과 같이 특정한 원인으로부터 반복되는 요인이다.
④ 불규칙: 추세, 계절, 순환으로 설명할 수 없는 우연적인 변동이다.
[정답] ③
③이 틀린 이유 — 순환은 '주기가 불분명한' 변동
- 순환 요인(Cyclical Component)은 명확한 이유나 주기가 일정하지 않은(비주기적인) 장기적 변동을 의미한다.
(예: 2~10년 단위의 불규칙한 경기 변동, 경기의 호황과 불황)
- 오답 포인트: "특정한 원인으로부터 반복되는 요인", "특정한 주기를 가지고 반복되는 요인"은 계절 요인(Seasonal) 이나 주기 변동에 더 어울리는 설명이다.
- 특히 순환 요인은 계절 요인과 달리 주기가 불분명하고 명확한 요인을 파악하기 힘든 경우가 많다.
시계열 분해 4대 요인 정리
| 요인 | 영문명 | 정의 및 특징 | 예시 |
|---|
| ① 추세 요인 | Trend | 시간이 흐름에 따라 장기적으로 증가하거나 감소하는 변화 경향 | 인구 증가, 기술 발전에 따른 매출 증가 |
| ② 계절 요인 | Seasonal | 1년, 1주, 1일 등 일정한 주기를 갖고 반복되는 변동 | 여름철 에어컨 판매량, 주말의 영화관 관객 수 |
| ③ 순환 요인 | Cyclical | 일정한 주기는 없으나 장기적인 경기 변동(호황/불황) 에 따라 일어나는 변화 | 2~5년 단위의 경기 순환, 경기 침체기 매출 감소 |
| ④ 불규칙 요인 | Irregular | 추세·계절·순환으로 설명할 수 없는 우연적인 / 오차 변동 | 지진, 전쟁, 팬데믹, 갑작스러운 날씨 변화 |
💡 시계열 분해 핵심 포인트
- 계절 요인 vs 순환 요인 구별하기
- 계절(Seasonal): 주기가 명확하고 일정함 (예: 매년 7월마다, 매주 주말마다)
- 순환(Cyclical): 주기가 불분명하고 길다 (예: 경기 변동)
- 시계열 분해 모델 형태
- 덧셈 모델 (Additive Model): Yt=Tt+St+Ct+It — 변동 폭이 일정한 경우
- 곱셈 모델 (Multiplicative Model): Yt=Tt×St×Ct×It — 시간에 따라 변동 폭이 점점 커지는 경우
9. 계층적 군집분석과 덴드로그램(Dendrogram) 읽기
[문제 유형] 아래와 같은 덴드로그램에서 Height = 2를 기준으로 할 때, 생성되는 군집의 개수는?
Height
5.0 ┤ ┌───────────────┐
4.0 ┤ │ │
3.5 ┤ │ ┌───┴───┐
3.0 ┤ ┌───┴───┐ │ │
2.5 ┤ │ │ │ │
2.0 ┼╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌╌ ← 절단선 (Height = 2)
1.5 ┤ ┌─┴─┐ ┌─┴─┐ │ │
1.0 ┤ │ │ │ │ ┌─┴─┐ ┌─┴─┐
0.5 ┤ │ │ │ │ │ │ │ │
0.0 └──A───B───C───D───E───F───G───H──
[정답] 4개 → {A, B}, {C, D}, {E, F}, {G, H}
덴드로그램 읽는 방법 (쉽게 자르는 팁)
"Height 값을 X 기준으로 자를 때"라는 조건이 나오면,
- Y축의 Height = X 위치에 가로선을 하나 긋는다. (위 그림의 절단선)
- 이 가로선과 만나는 수직선(세로줄)의 개수를 센다. 그게 바로 생성되는 군집의 개수다.
왜 그런가 (핵심 원리)
- 덴드로그램에서 두 군집이 합쳐지는 높이(Height) 는 그 군집 간의 거리(비유사도)를 뜻한다.
- 절단선보다 아래에서 합쳐진 쌍은 이미 하나의 군집으로 묶여 있으므로 수직선 1개로 지나간다.
- 절단선보다 위에서 합쳐지는 결합은 아직 일어나지 않은 것으로 취급하므로, 그 아래의 군집들은 각각 따로 센다.
위 예시에서 Height = 2 지점을 왼쪽에서 오른쪽으로 훑으면,
| 순서 | 결합 높이 | 절단선(2.0) 기준 | 결과 |
|---|
| A–B | 1.5 | 아래에서 이미 결합 | 군집 1: {A, B} |
| C–D | 1.5 | 아래에서 이미 결합 | 군집 2: {C, D} |
| E–F | 1.0 | 아래에서 이미 결합 | 군집 3: {E, F} |
| G–H | 1.0 | 아래에서 이미 결합 | 군집 4: {G, H} |
| {A,B}–{C,D} | 3.0 | 위에서 결합 → 무시 | 따로 셈 |
| {E,F}–{G,H} | 3.5 | 위에서 결합 → 무시 | 따로 셈 |
| 전체 결합 | 5.0 | 위에서 결합 → 무시 | 따로 셈 |
→ 절단선이 지나는 수직선은 총 4개, 즉 군집 4개.
⚠️ 주의: 절단 높이를 낮추면 군집 수가 늘어나고, 높이면 줄어든다.
위 예시에서 Height = 4로 자르면 → 2개 ({A,B,C,D}, {E,F,G,H}), Height = 1.2로 자르면 → 6개 ({A},{B},{C},{D},{E,F},{G,H}).
오늘의 정리
| 주제 | 한 줄 요약 |
|---|
| 측정 척도 | 명목(분류) → 서열(순서) → 등간(간격) → 비율(절대 0점) 위계 |
| 평가 지표 | Precision은 분모가 예측 Positive, Recall은 분모가 실제 Positive |
| 회귀 출력 해석 | Estimate의 (Intercept) = 절편, 변수명 = 기울기 |
| SOM | 2개 층 + 전결합, 역전파 사용 안 함, 승자 독식 |
| 인공신경망 | 블랙박스 → 설명력 떨어짐이 단점 |
| K-means | K는 분석가가 직접 지정, 평균 사용 → 이상치 민감 |
| 카이제곱 검정 | 적합도 / 독립성 / 동질성 — 분산이 아니라 도수의 차이 |
| 시계열 분해 | 계절 = 주기 일정, 순환 = 주기 불분명 |
| 덴드로그램 | 절단선이 지나는 수직선 개수 = 군집 수 |