Python으로 통계학 이해하기

안장훈·2025년 1월 6일

python 공부

목록 보기
5/6
  • 중심경향치
  • 범주형의 경우 최빈값(mode)을 많이 사용
  • 수치형의 경우 평균(mean), 중앙값(median) 사용
    - 평균 : 이상치에 민감함
    - 중앙값 : 이상값 존재해도 딥단의 대표성 설명 가능
  • 산포도

: 데이터의 퍼짐 정도를 나타내는 방법
1. 분산(Variance) : 평균에 데이터가 퍼진 정도

ex) 10,20,30,40,50의 분산

import numpy as np
data = [10,20,30,40,50]
my_array = np.array(data)
np.var(my_array)

#####
200
#####
  1. 표준편차(standard deviation) : 분산의 제곱근

  2. 변동계수(coeffient of variabtion)

    서로 값의 스케일이 다르면 분산도 달라지므로 변동계수를 사용해 측정 단위가 다른 자료를 비교한다.

이제 통계학을 파이썬을 활용하여 쓸려면 Numpy모듈을 이용해야 한다.
만약 python에서 사용되는 list를 사용하면

# list으로 처리
import time

start = time.time()

my_list = [i for i in range(10000000)]
for i in range(len(my_list)):
    my_list[i] = my_list[i] + 10
end = time.time()

print(end - start)

이렇게 적어야 하지만

Numpy모듈을 쓴다면

# array 자료형으로 처리
import numpy as np

start = time.time()
np.array(my_list) + 10
end = time.time()
print(end-start)

C언어에서 사용하는 array방식으로 처리하여 데이터 처리속도를 높일 수 있다.
또한 Random모듈을 사용하여 데이터를 임의로 만들어 시뮬레이션을 할수 있다.

0개의 댓글