
키워드 정리
1 데이터 이해
1-1 데이터의 이해
- 데이터 특성
- 존재적 특성: 있는 그대로의 객관적 사실
- 당위적 특성: 추론, 예측을 위한 근거
- 암묵지와 형식지
- 암묵지: 내면화, 공통화
- 형식지: 표출화, 연결화
- DIKW
- SQL
1-2 데이터의 가치와 미래
- 빅데이터 특징
- 3V: Volume, Variety, Velocity
- 4V: 3V + Value
- 빅데이터가 만들어내는 변화
- 사전처리 -> 사후처리
- 표본조사 -> 전수조사
- 질 -> 양
- 인과관계 -> 상관관계
- 빅데이터 위기요인과 통제방안
- 사생활 침해: 동의에서 책임으로
- 책임 원칙 훼손: 결과 기반 책임 원칙 고수
- 데이터 오용: 알고리즘 접근 허용
1-3 데이터 사이언스
- 일차원적 분석 vs 가치기반 분석
- 데이터사이언스 구성 요소
- 데이터사이언스 요구 역량
- 데이터사이언스 가치 패러다임 변화
- Digitalization -> Connection -> Agency
2 데이터 분석 기획
2-1 데이터 분석 기획의 이해
- 분석 대상과 방법에 따른 4가지 주제
- 발견: 대상, 방법 모름
- 통찰력: 대상 모름
- 솔루션: 방법 모름
- 최적화: 다 암
- 목표 시점별 분석 기회
- 빠르게 해결 목적: Speed, Problem Solving
- 지속적 해결 목적: Accuracy, Problem Difinition
- 데이터 분석 방법론
- 분석 기획 -> 데이터 준비 <-> 데이터 분석 -> 시스템 구현 -> 평가
- 분석 과제 탐색 방법
- 상향식: 지도, 비지도 학습, 프로토타이핑
- 하향식: BM 탐색 기법 (업무, 제품, 고객, 인프라, 규제)
2-2 분석 마스터플랜
- 과제 우선순위 평가 기준
- 난이도: 쉽고 빠른거부터
- 시급성: 빠른고 쉬운거부터
- 분석 거버넌스 수준 진단
- 준비형: 준비, 성숙 낮음
- 도입형: 성숙 낮음
- 정착형: 준비 낮음
- 확산형: 좋음
- 데이터 거버넌스 체계
- 데이터 표준화 -> 데이터 관리 체계 -> 데이터 저장소 관리 -> 표준화 활동
- 데이터 분석 조직 유형
- 집중형 조직: 별도 조직
- 기능형 조직: 부서 내 조직
- 분산형 조직: 각 부서로 파견
3 데이터 분석
3-1 데이터 탐색
EDA
- 결측값 대치
- 단순 대치법: 결측값 삭제
- 평균 대치법: 평균, 중앙값 결측값 대치
- 단순 확률 대치법: KNN
- 다중 대치법: 결측값 대치 -> 분석 -> 결합
3-2 통계 분석
통계 이해
- 표본추출 방법
- 단순 랜덤 추출법
- 계통 추출법: k개씩 구간 나눠서 추출
- 군집 추출법
- 층화 추출법
- 척도
- 명목척도 ex) 성별
- 순서척도 ex) 학년
- 구간척도 ex) 온도
- 비율척도 ex) 무게 (절대적 기준 0 존재)
- 이산확률분포
- 베르누이분포: 한번 시행할때 확률 p
- 이항분포: 베르누이 시행 k번 성공
- 기하분포: 베르누이 시행 처음 성공
- 다항분포
- 포아송분포: 단위 시간 또는 단위 공간 내 발생
- 연속확률분포
- 균일분포
- 정규분포
- t-분포: 두 집단의 평균이 동일한지 검정
- 카이제곱분포: 두 개 이상의 집단간 동질성 또는 모분산 검정
- F 분포: 등분산 검정
기초 통계
- t-검정
- 일 표본 t-검정: 모집단의 평균값을 특정값과 비교
- 단측 t-검정: ~보다 크다, 작다
- 양측 t-검정: 값이 ~이다, 아니다.
- 이 표본 t-검정: 독립 두 집단에 모수 값이 같은지 검정
- 단측 t-검정: ~보다 크다, 작다
- 양측 t-검정: 값이 ~이다, 아니다.
- 대응 표본 t-검정: 동일 대상에 두 가지 관측치 비교
- 교차분석
- 범주형 자료간의 관계 확인 - 카이제곱 통계량
- 적합도, 독립성, 동질성 검정
- 상관분석
회귀분석
- 가정
- 선형성
- 독립성: 독립변수들이 독립
- 등분산성: 잔차가 고르게 분포
- 정규성: Q-Q plot
- 적합성
- 분산분석표

- 회귀모형의 유의성: F-검정
- 회귀계수의 유의성: t-검정
- 회귀모형의 설명력: R^2 = (SST-SSE)/SST
- 다중선형회귀
- 다중공선성: 독립변수 간에 강한 상관관계 (VIF > 10)
- 최적 회귀방정식
- 전진선택법: 독립변수 하나씩 추가
- 후진제거법: 독립변수 하나씩 제거
- 단계별 방법: 전진 + 후진
- 정규화 선형회귀: 계수 크기 제한
- 라쏘: L1 규제
- 릿지: L2 규제
- 엘라스틱넷: 라쏘 + 릿지
- 일반화 선형회귀
다변량 분석
- 다차원 척도법: 객체 간의 근접성을 차원 축소하여 표현
- 주성분분석 (PCA): 분산이 가장 큰 축이 주성분
시계열 분석
- 자기상관성: 데이터간의 상관관계 가짐
- 정상성 조건
- 일정한 평균
- 일정한 분산
- 시차에만 의존하는 공분산
- 자기상관계수
- 자기상관계수 (ACF): 특정 시점과 시차 시점의 상관관계
- 부분자기상관계수 (PACF): 오직 둘 사이의 상관관계 확인
- 시계열 분석 기법
- 이동평균법: 일정 기간별로 자료를 묶어 평균
- 지수평활법: 최근 데이터에 큰 가중치
3-3 정형 데이터 마이닝
데이터 마이닝
- 데이터 분할
- 홀드아웃
- K-Fold
- 붓스트랩
- 계층별 k-fold
- 오버샘플링, 언더샘플링
분류 분석
- 로지스틱 회귀분석
- 의사결정나무
- 성장
- 분리기준: 카이제곱(CHAID), 지니(CHRT), 엔트로피(C3.5)
- 가지치기
- 앙상블
- 배깅: 붓스트랩 -> 보팅
- 부스팅: 잘못 분류된 데이터에 더 큰 가중치
- 랜덤포레스트: 배깅 + a
- 스태킹: 모델 스태킹해서 최종모델
- 인공신경망
- 활성함수: Step, 시그모이드, Sign, tanh, ReLU, Softmax
- 종류: 단층, 다층 퍼셉트론
- 분류 모형 성과 평가
- Confusion Matrix

군집 분석
- 계층적 군집 분석
- 군집 간의 거리: 단일, 완전, 평균, 중심, 와드
- 비계층적 군집 분석
- K-means
- 초기 K 설정 -> 각 데이터 할당 -> 새로운 seed -> 재할당 -> 반복
- DBSCAN
- 자기조직화지도 (SOM, Self-Organization-Map) // 비지도학습
연관분석
- 측도
- 지지도: 두 개 품목 동시에 구매될 확률
- 신뢰도: 하나 구매될때, 다른 품목 구매될 확률
- 향상도: ?
- 특징