ADSP 복습노트

Novel·2026년 4월 16일

adsp

목록 보기
3/3
post-thumbnail

ADSP 핵심 복습 노트

1. 지금 우선 복습할 개념

1. 회귀분석 해석

  • R^2 = 종속변수의 총변동 중 모형이 설명하는 비율
  • Adjusted R^2 = 독립변수 수를 고려해 보정한 설명력
  • 회귀계수의 p-value가 작다 = 해당 변수가 유의할 가능성이 큼
  • 유의성은 인과관계를 뜻하지 않음
  • 잔차 = 실제값 - 예측값
  • OLS = 잔차제곱합을 최소화하는 방법

2. 분류 / 회귀 / 군집 구분

  • 선형회귀 = 연속형 값 예측
  • 로지스틱 회귀 = 범주형 결과의 확률 예측
  • 군집분석 = 정답 라벨 없이 비슷한 것끼리 묶음
  • 의사결정나무 = 분류와 회귀 모두 가능

3. 분류 성능평가

  • Accuracy = 전체 중 맞춘 비율
  • Precision = 양성 예측 중 실제 양성 비율
  • Recall = 실제 양성 중 찾아낸 비율
  • FN = 실제 양성인데 음성으로 예측한 경우
  • ROC Curve = TPR와 FPR 관계 그래프
  • AUC = 분류 판별 성능

4. 연관분석

  • Support = 전체 거래 중 함께 나온 비율
  • Confidence = X가 나왔을 때 Y도 나온 비율
  • Lift = 독립 대비 얼마나 더 함께 나오는가
  • Apriori 핵심 = 빈발하지 않은 집합의 상위집합도 빈발하지 않음

5. 가설검정

  • p-value < alpha 이면 귀무가설 기각
  • alpha = 제1종 오류 허용 수준
  • 제1종 오류 = 참인 귀무가설 기각
  • 제2종 오류 = 거짓인 귀무가설을 기각하지 못함
  • t-test = 두 집단 평균 비교
  • ANOVA = 세 집단 이상 평균 비교
  • 카이제곱 검정 = 범주형 변수 간 독립성/연관성 검정

2. ADSP에서 자주 나오는 핵심 개념

데이터 이해 / 기획

  • Top-Down = 현업 문제와 목표에서 과제 도출
  • Bottom-Up = 데이터에서 패턴을 찾고 과제 도출
  • CRISP-DM = 업무 이해 -> 데이터 이해 -> 데이터 준비 -> 모델링 -> 평가 -> 전개
  • KDD = 선택 -> 전처리 -> 변환 -> 데이터마이닝 -> 해석/평가
  • 분석 기획 = 목적, 범위, 자원, 우선순위 설정

데이터 저장 구조

  • DW = 주제지향적, 통합적, 시계열적, 비휘발적
  • DM = 특정 부서/주제 중심 저장소
  • 운영계 데이터 = 실시간 거래 처리 중심
  • 분석계 데이터 = 조회, 집계, 의사결정 중심

데이터 거버넌스 / 품질

  • 데이터 거버넌스 = 표준, 품질, 보안, 관리 체계
  • 데이터 품질 = 정확성, 일관성, 완전성 등 확보

빅데이터

  • 3V = Volume, Velocity, Variety

3. 통계 기초

대표값

  • 평균 = 합 / 개수, 이상치에 약함
  • 중앙값 = 정렬했을 때 가운데 값
  • 최빈값 = 가장 자주 나오는 값

산포도

  • 분산 = 평균으로부터 퍼진 정도
  • 표준편차 = 분산의 제곱근
  • IQR = 3사분위수 - 1사분위수

분포

  • 정규분포 = 좌우 대칭, 평균 = 중앙값 = 최빈값

상관

  • 상관계수 = 두 변수 간 선형 관계의 강도와 방향
  • 범위는 -1 ~ 1
  • 상관관계가 있어도 인과관계는 아님

4. 전처리와 모델링

전처리

  • 결측값 처리: 원인, 비율, 중요도를 보고 제거/대체 결정
  • 이상치 처리: 무조건 삭제하지 말고 원인과 목적 먼저 확인
  • 스케일링: 변수 간 척도 차이 조정
  • 정규화/표준화 = 거리 기반 모델, 경사하강법 모델에서 중요

변수 선택

  • 불필요한 변수 제거
  • 해석력 개선
  • 예측력 개선
  • 과적합 완화
  • 다중공선성 완화

다중공선성

  • 독립변수들끼리 강한 상관관계가 존재하는 현상

과적합 / 과소적합

  • 과적합 = 훈련 데이터에는 잘 맞지만 일반화 성능 저하
  • 과소적합 = 모델이 너무 단순해서 패턴을 못 배움

검증

  • 일반화 성능은 훈련 데이터만 보고 판단하지 않음
  • 테스트 데이터나 교차검증으로 확인
  • 교차검증 = 데이터를 나눠 여러 번 학습/검증

5. 의사결정나무 / 군집 / 차원축소

의사결정나무

  • 해석이 비교적 쉬움
  • 분류와 회귀 모두 가능
  • 좋은 분할 = 불순도 감소
  • 엔트로피가 크다 = 클래스가 많이 섞여 있다
  • 가지치기 = 과적합 완화, 일반화 성능 향상

군집분석

  • 비지도학습
  • 비슷한 객체끼리 묶음
  • k-means = 사전에 정한 k개의 군집 중심 사용

차원축소

  • 변수 수를 줄여 효율 향상
  • 잡음 감소
  • 시각화 도움
  • PCA = 분산을 최대한 설명하는 새로운 축 찾기

6. 시험 직전 암기 포인트

반드시 바로 떠올라야 하는 짝

  • Support / Confidence / Lift
  • Precision / Recall / Accuracy
  • Type I Error / Type II Error
  • Top-Down / Bottom-Up
  • CRISP-DM / KDD
  • 선형회귀 / 로지스틱 회귀
  • 운영계 / 분석계
  • DW / DM

자주 틀리기 쉬운 함정

  • 유의성은 인과관계가 아님
  • 상관관계는 인과관계가 아님
  • R^2는 설명력이지 유의확률이 아님
  • Recall은 실제 양성 기준
  • Precision은 예측 양성 기준
  • FN은 놓친 경우
  • FP는 잘못 경보한 경우

7. 추천 복습 순서

  1. 회귀분석 해석, 로지스틱 회귀, 의사결정나무
  2. 분류 성능평가, 혼동행렬, ROC, AUC
  3. 연관분석과 Apriori
  4. 가설검정, p-value, 제1종/제2종 오류
  5. CRISP-DM, KDD, DW, DM, 거버넌스
  6. 통계 기초 대표값/산포도/상관/정규분포

8. 마지막 팁

  • ADSP는 계산 자체보다 개념 구분과 출력 해석 문제가 많다
  • 비슷한 용어를 한 세트로 묶어 암기하면 효율이 좋다
  • 오답노트는 길게 쓰지 말고 왜 틀렸는지 한 줄만 남기는 게 좋다
profile
ssafy_elonmusk

0개의 댓글