#평균 df['점수'].mean() #중앙값 df['점수'].median() #최빈값 df['점수'].mode()
- A 학생의 영어점수: 30점 - B 학생의 영어점수: 70점 - C 학생의 영어점수: 80점 - A,B,C 학생의 평균 영어점수: 60점 A 학생의 편차: -30 B 학생의 편차: +10 C 학생의 편차: +20 학생 전체의 편차를 나타내기 위해 각 학생들의 편차를 모두 더하게 되면 0이 나오게 됩니다. 따라서 편차로는 반 전체의 점수 분포를 정확히 알 수가 없기에 나온 개념이 분산입니다.
- A 학생의 편차 제곱: (-30)^2 = 900 - B 학생의 편차 제곱: (+10)^2 = 100 - C 학생의 편차 제곱: (+20)^2 = 400 편차 제곱합: 1400 편차 제곱합의 평균(분산): 1400/3 = 466 분산은 466이 도출되었습니다. 그러나 점수라는 값에 제곱이 들어가며(점수에 제곱..!) 그 단위가 달라지게되었어요. 실제 데이터가 어느정도로 차이가 있는 지 알기 어렵게 되었습니다. 이를 해결하기 위해 도입된 개념이 표준편차입니다.
- 분산: 466 - 분산의 제곱근 = 표준편차 = 약 21.6 이 되겠습니다.



정규분포의 특징은 아래와 같아요.
import scipy.stats as st import numpy as np #샘플 데이터 선언 sample1 = [5, 10, 17, 29, 14, 25, 16, 13, 9, 17] sample2 = [21, 22, 27, 19, 23, 24, 20, 26, 25, 23] df = len(sample1) - 1 # 자유도 : 샘플 개수 - 1 mu = np.mean(sample1) # 표본 평균 se = st.sem(sample1) # 표준 오차 # 95% 신뢰구간 ( = 95% 신뢰하려면 데이터의 범위가 어떻게 되는지?) st.t.interval(0.95, df, mu, se) # (10.338733110887336, 20.661266889112664) # 99% 신뢰구간( = 99% 신뢰하려면 데이터의 범위가 어떻게 되는지?) # 99% 로 신뢰할 수 있어야 하므로, 앞선 95% 보다 데이터 범위가 넓은 점 이해되셨나요? :) st.t.interval(0.99, df, mu, se) # (8.085277068873378, 22.914722931126622)