기초통계량
학습필요성
- 데이터 분석 기본 단계는 데이터의 전반적 특성을 이해하는 것
- 기술통계량을 통해 데이터의 특징을 빠르게 파악하고, 분석 방향성을 결정할 수 있음
중심 경향성
mean(평균)
- 자료 전체 경향을 나타내는 값으로 가장 많이 이용
- 장점: 일반적인 대표값으로 손쉽게 데이터의 경향 파악 가능
- 단점: 극단적인 값(아웃라이어) 영향을 받음.
- 크기 순으로 정렬한 데이터에서 중앙에 위치한 값
- 장점: 아웃라이어에 대하여 강건(robust) 하다
- 단점: 자료 수가 많아지면, 집단을 대표하는 대표성이 사라짐

최빈값(mode)
- 가장 빈도가 많은 값
- 장점: 숫자로 나타내지 못하는 자료의 경우에도 구할 수 있음
- 단점: 자료의 개수가 적은 경우, 자료 전체의 특징을 반영하지 못할 수도 있음, 중복 발생
퍼짐의 척도
범위 range
- 변동성을 파악하기 위한 가장 쉬운 방법
- 장점: 간단히 계산 가능
- 단점: 데이터의 퍼진 특성들을 고려하기 어려움
분산 variance
- 범위의 단점을 보완, 데이터가 중심으로부터 얼마나 멀리 떨어져있는지를 계산
- 장점: 자료가 평균에서 얼마나 흩어져 있는지에 대한 대표값으로 사용 가능
- 분산이 작다! -> 데이터가 중심으로 많이 몰려있다
- 단점: 제곱을 하여 계산하므로, 수치가 직관적이지 않음
표준편차 standard deviation
- 위에서 분산에 루트를 씌워 자료의 단위와 동일하게 표현한 값
- 장점: 자료의 단위와 동맇아여 직관적으로 해석하기 용이
형태의 척도
- 데이터를 다듬어서 모델이 잘 학습할 수 있게 만드는 것이 최종 목표
- 너무 심하면 학습에 도움이 안됨
왜도 skewness
- 데이터의 비대칭도, 왼쪽이나 오른쪽으로 치우쳐진 정도
첨도 kurtosis
위치의 척도
백분위수 percentile
- 전체 데이터 중 특정 백분율이 위치하는 값
- ex) 우리 아이 키는 백분위 수 95%야
4분위수 quartile
- 전체 관측값을 작은 순서로 배열했을 때 전체를 사등분하는 값
- Q1 Q2 Q3
- 많이 씀
정규분포
- 표본의 평균을 추정, 두 집단 간의 차이를 검정하는데 정규분푝가 사용됨
중심극한정리의 이해
- 데이터 분석에서 중심극한정리는 중요
- 큰 표본의 평균이 정규분포에 가까워진다는 것을 의미.
- 다양한 데이터 분석 상황에서 통계적 추론의 근거가 됨
데이터 정규성의 검증
- 많은 통계적 테스트와 기법들은 데이터가 정규 분포를 따른다는 가정하에 개발
- 데이터가 이러한 가정을 만족하는지 검증하는 것은 분석의 정확성을 확보하는 데 중요
이상탐지 및 데이터 정제
- 정규분포를 이해하면 데이터 세트 내 이상치를 식별하고 처리하는 데 도움이 됨
- 표준편차를 기반으로 한 이상치 탐지는 데이터 전처리 과정에서 핵심
기계학습 알고리즘의 이해 및 적용
- 많은 기계학습 알고리즘들은 데이터가 특정 분포를 따른다고 가정
- 이러한 가정을 이해하고 검증하는 능력은 알고리즘의 선택과 성능 향상에 중요한 역할
실험 설게 및 결과 해석
- A/B 테스트와 같은 실험 설계 시, 정규분포 실험 결과의 해석을 위한 기본적인 도구
- 실험 데이터의 분석과 해석에서 정규분포를 이해하는 것은 필수
표본의 개념과 표본 평균의 의미
- 통계적 추론(statistical inference) - 표본 데이터를 이용하여 모집단의 정보들을 추측하는 과정
중심극한정리의 이해(feat. 정규분포)
- 중심극한정리? -> 표본의 크기가 충분히 클 때, 여러 표본들의 표본 평균이 이루는 분포가 정규 분포에 가까워진다는 것.
정규성 검정(Normarlity Test)
- 특정 데이터 세트가 정규분포를 따르는지 여부를 검증하는 과정
- 데이터가 정규분포를 따른다는 가정은 많은 통계적 기법들이 유효하게 작동하기 위한 전제조건!