
ADSP 핵심 복습 노트
1. 지금 우선 복습할 개념
1. 회귀분석 해석
R^2 = 종속변수의 총변동 중 모형이 설명하는 비율
Adjusted R^2 = 독립변수 수를 고려해 보정한 설명력
- 회귀계수의
p-value가 작다 = 해당 변수가 유의할 가능성이 큼
- 유의성은
인과관계를 뜻하지 않음
잔차 = 실제값 - 예측값
OLS = 잔차제곱합을 최소화하는 방법
2. 분류 / 회귀 / 군집 구분
선형회귀 = 연속형 값 예측
로지스틱 회귀 = 범주형 결과의 확률 예측
군집분석 = 정답 라벨 없이 비슷한 것끼리 묶음
의사결정나무 = 분류와 회귀 모두 가능
3. 분류 성능평가
Accuracy = 전체 중 맞춘 비율
Precision = 양성 예측 중 실제 양성 비율
Recall = 실제 양성 중 찾아낸 비율
FN = 실제 양성인데 음성으로 예측한 경우
ROC Curve = TPR와 FPR 관계 그래프
AUC = 분류 판별 성능
4. 연관분석
Support = 전체 거래 중 함께 나온 비율
Confidence = X가 나왔을 때 Y도 나온 비율
Lift = 독립 대비 얼마나 더 함께 나오는가
Apriori 핵심 = 빈발하지 않은 집합의 상위집합도 빈발하지 않음
5. 가설검정
p-value < alpha 이면 귀무가설 기각
alpha = 제1종 오류 허용 수준
제1종 오류 = 참인 귀무가설 기각
제2종 오류 = 거짓인 귀무가설을 기각하지 못함
t-test = 두 집단 평균 비교
ANOVA = 세 집단 이상 평균 비교
카이제곱 검정 = 범주형 변수 간 독립성/연관성 검정
2. ADSP에서 자주 나오는 핵심 개념
데이터 이해 / 기획
Top-Down = 현업 문제와 목표에서 과제 도출
Bottom-Up = 데이터에서 패턴을 찾고 과제 도출
CRISP-DM = 업무 이해 -> 데이터 이해 -> 데이터 준비 -> 모델링 -> 평가 -> 전개
KDD = 선택 -> 전처리 -> 변환 -> 데이터마이닝 -> 해석/평가
분석 기획 = 목적, 범위, 자원, 우선순위 설정
데이터 저장 구조
DW = 주제지향적, 통합적, 시계열적, 비휘발적
DM = 특정 부서/주제 중심 저장소
- 운영계 데이터 = 실시간 거래 처리 중심
- 분석계 데이터 = 조회, 집계, 의사결정 중심
데이터 거버넌스 / 품질
데이터 거버넌스 = 표준, 품질, 보안, 관리 체계
- 데이터 품질 = 정확성, 일관성, 완전성 등 확보
빅데이터
3V = Volume, Velocity, Variety
3. 통계 기초
대표값
평균 = 합 / 개수, 이상치에 약함
중앙값 = 정렬했을 때 가운데 값
최빈값 = 가장 자주 나오는 값
산포도
분산 = 평균으로부터 퍼진 정도
표준편차 = 분산의 제곱근
IQR = 3사분위수 - 1사분위수
분포
정규분포 = 좌우 대칭, 평균 = 중앙값 = 최빈값
상관
상관계수 = 두 변수 간 선형 관계의 강도와 방향
- 범위는
-1 ~ 1
- 상관관계가 있어도 인과관계는 아님
4. 전처리와 모델링
전처리
- 결측값 처리: 원인, 비율, 중요도를 보고 제거/대체 결정
- 이상치 처리: 무조건 삭제하지 말고 원인과 목적 먼저 확인
- 스케일링: 변수 간 척도 차이 조정
정규화/표준화 = 거리 기반 모델, 경사하강법 모델에서 중요
변수 선택
- 불필요한 변수 제거
- 해석력 개선
- 예측력 개선
- 과적합 완화
- 다중공선성 완화
다중공선성
과적합 / 과소적합
과적합 = 훈련 데이터에는 잘 맞지만 일반화 성능 저하
과소적합 = 모델이 너무 단순해서 패턴을 못 배움
검증
- 일반화 성능은 훈련 데이터만 보고 판단하지 않음
테스트 데이터나 교차검증으로 확인
교차검증 = 데이터를 나눠 여러 번 학습/검증
5. 의사결정나무 / 군집 / 차원축소
의사결정나무
- 해석이 비교적 쉬움
- 분류와 회귀 모두 가능
- 좋은 분할 = 불순도 감소
엔트로피가 크다 = 클래스가 많이 섞여 있다
가지치기 = 과적합 완화, 일반화 성능 향상
군집분석
- 비지도학습
- 비슷한 객체끼리 묶음
k-means = 사전에 정한 k개의 군집 중심 사용
차원축소
- 변수 수를 줄여 효율 향상
- 잡음 감소
- 시각화 도움
PCA = 분산을 최대한 설명하는 새로운 축 찾기
6. 시험 직전 암기 포인트
반드시 바로 떠올라야 하는 짝
Support / Confidence / Lift
Precision / Recall / Accuracy
Type I Error / Type II Error
Top-Down / Bottom-Up
CRISP-DM / KDD
선형회귀 / 로지스틱 회귀
운영계 / 분석계
DW / DM
자주 틀리기 쉬운 함정
- 유의성은 인과관계가 아님
- 상관관계는 인과관계가 아님
R^2는 설명력이지 유의확률이 아님
Recall은 실제 양성 기준
Precision은 예측 양성 기준
FN은 놓친 경우
FP는 잘못 경보한 경우
7. 추천 복습 순서
- 회귀분석 해석, 로지스틱 회귀, 의사결정나무
- 분류 성능평가, 혼동행렬, ROC, AUC
- 연관분석과 Apriori
- 가설검정, p-value, 제1종/제2종 오류
- CRISP-DM, KDD, DW, DM, 거버넌스
- 통계 기초 대표값/산포도/상관/정규분포
8. 마지막 팁
- ADSP는 계산 자체보다
개념 구분과 출력 해석 문제가 많다
- 비슷한 용어를 한 세트로 묶어 암기하면 효율이 좋다
- 오답노트는 길게 쓰지 말고
왜 틀렸는지 한 줄만 남기는 게 좋다