통계 수업 - 1

김주호·2024년 11월 13일

데이터의 종류

  • 분석기법: 기초 통계분석, 상관분석, 회귀분석, 군집분석, RFM분석
  • 분석 방법론: A/B TEST
  • 통계이론: 기초통계이론(평균,분산,표준편차), 정규분포와 중심극한정리, 신뢰구간과 유의수준, 가설 설정, 통계적 유의성 검정, 통계적 가설 검정

데이터의 종류를 분류하는 이유

  • 데이터를 분석하고 예측할 때 중요한 역활(데이터의 생김새가 시각화, 해석, 통계모델 결정에 중요한 역활을 하기 때문이다.)
  • 수치형: 숫자/ 이산혀으 연속형을 모두 포함하는 개념
  • 연속형: 일정 범위 안에서 어떤 값이든 취할 수 있는 데이터
  • 이산형: 소수점X/ 횟수와 값은 정수형 값만 취할 수 있는 데이터
  • 범주형: 가능한 범주 안의 값만을 취하는 데이터(이진형, 순서형 모두 포함)
  • 이진형: 두개의 값만가지는 특수한 경우(0과1, 예/아니오, 참/거짓)
  • 순서형: 값들 사이에 분명한 순위가 있는 데이터

통계 Python 기본 라이브러리

  • pandas
  • numpy
  • matplotlib
  • seaborn
  • altair

편차, 분산, 표준편차, 표본분포

#평균
df['점수'].mean()
#중앙값
df['점수'].median()
#최빈값
df['점수'].mode()

편차

  • 하나의 값에서 평균을 뺸 값=평균으로부터 얼마나 떨어져 있는지를 의미
- A 학생의 영어점수: 30점
- B 학생의 영어점수: 70점
- C 학생의 영어점수: 80점
- A,B,C 학생의 평균 영어점수: 60점

A 학생의 편차: -30 
B 학생의 편차: +10 
C 학생의 편차: +20 

학생 전체의 편차를 나타내기 위해 각 학생들의 편차를 모두 더하게 되면 0이 나오게 됩니다.
따라서 편차로는 반 전체의 점수 분포를 정확히 알 수가 없기에 나온 개념이 분산입니다.

분산

  • 편차의 합이0으로 나오는 것을 방지하기 위해 생성된 개념 = 편차 제곱합의 평균
- A 학생의 편차 제곱: (-30)^2 = 900
- B 학생의 편차 제곱: (+10)^2 = 100
- C 학생의 편차 제곱: (+20)^2 = 400 

편차 제곱합: 1400
편차 제곱합의 평균(분산): 1400/3 = 466 

분산은 466이 도출되었습니다. 그러나 점수라는 값에 제곱이 들어가며(점수에 제곱..!)
그 단위가 달라지게되었어요. 실제 데이터가 어느정도로 차이가 있는 지 알기 어렵게 되었습니다. 
이를 해결하기 위해 도입된 개념이 표준편차입니다. 

표준편차

  • 분산에서 제곱근을 씌워준 값(원래 단위로 되돌리기 = standard deviation)
- 분산: 466
- 분산의 제곱근 = 표준편차 = 약 21.6 이 되겠습니다. 

모집단

  • 어떤 데이터 집합을 구성하는 전체 대상

표본

  • 모집단 중 일부, 모집단의 부분집합

표본분포

  • 표본의 분포, 표본이 흩어져 있는 정도, 표본 통계량으로부터 얻은 도수분포

표본평균의 분포

  • 모집단에서 여러 표본을 추출하고 각 평균을 계산한다면 중심극한정리에 따라 정규분포에 가까워짐 / 표본 크기가 충분히 크면 정규분포를 따른다는 것을 의미

표본분산의 분포

  • 모집단에서 여러 표본을 추출하고 각 분산을 계산한다면 카이제곱 분포를 따른다. / 이는 모집단이 정규 분포를 따를 떄 보다 높게 성립

표준오차: 표본의 표준편차 = 표본의 평균와 모평균의 차이

  • ex) 70 모평균과 64 표본평균이 있으면 표준 오차는 6

앞으로 해보면 좋은 것

  • 도수: 특정 구간에 발생한 값의 수
  • 상대도수: 특정 도수를 전체 도수로 나눈 비율
  • 도수분포표: 각 값에 대한 도수와 상대도수를 나타내는 표
  • 히스토그램: 도수분포표를 활용하여 만든 막대그래프
  • 임의표본추출: 무작위로 표본을 추출하는 것
  • 편향: 한쪽으로 치우쳐져 있음

정규분포, 신뢰구간

정규분포

  • 평균에서 가장 확률이 높고, 평균을 중심으로 멀어지면서 그 수가 적어지게 되는 종 모양의 분포를 정규 분포라 한다.

정규분포의 특징은 아래와 같아요.

  • 분포는 평균을 중심으로 좌우 대칭의 형태이다.
  • 곡선은 각 확률값을 나타내며, 모두 더하면 1이 된다
    (동전을 뒤집어서 앞면이 나올 확률은 2분의 1 + 뒷면이 나올 확률 2분의 1 = 전체 확률 1)
  • 정규분포는 평균과 분산(퍼진정도)에 따라 다른 형태를 가진다
  • 평균 0, 분산 1을 가지는 경우, 이를 표준정규분포라고 합니다. (그림의 붉은색 그래프)

신뢰구간

  • 특정 범위 내에 값이 존재할것으로 예측되는 영역
    (수학점수가 20점에서 95점 사이일 것 같아요)

신뢰수준

  • 실제모수를 추정하는데 몇 퍼센트의 확률로 신뢰구간이 실제 모수를 포함하게 되는 확률 / 주로 95%와 99% 사용
    (영어점수가 10점에서 90점 사이에 있을(분포할)확률이 95% 같아요)

Python 'scipy' 라이브러리 사용해서 신뢰구간 구하기

import scipy.stats as st
import numpy as np

#샘플 데이터 선언 
sample1 = [5, 10, 17, 29, 14, 25, 16, 13, 9, 17]
sample2 = [21, 22, 27, 19, 23, 24, 20, 26, 25, 23]

df = len(sample1) - 1 # 자유도 : 샘플 개수 - 1
mu = np.mean(sample1) # 표본 평균
se = st.sem(sample1) # 표준 오차

# 95% 신뢰구간 ( = 95% 신뢰하려면 데이터의 범위가 어떻게 되는지?)
st.t.interval(0.95, df, mu, se) # (10.338733110887336, 20.661266889112664)

# 99% 신뢰구간( = 99% 신뢰하려면 데이터의 범위가 어떻게 되는지?)
# 99% 로 신뢰할 수 있어야 하므로, 앞선 95% 보다 데이터 범위가 넓은 점 이해되셨나요? :) 
st.t.interval(0.99, df, mu, se) # (8.085277068873378, 22.914722931126622)

0개의 댓글