
통계학 : 불확실한 상황에서 현명한 의사결정을 하기 위한 이론/방법의 체계. 자료 수집-분류-분석-해석의 체계를 갖는다기본 용어모집단(population) : 관심의 대상이 되는 모든 개체의 집합모수(parameter) : 모집단의 특성을 수치로 나타낸 것표본(samp

중심경향 (central tendency) : 관찰된 자료들의 중심이 어디에 있는가를 나타내 주는 것. 중심경항을 나타내는 수치를 분포의 대푯값이라고 한다.ex) 산술평균, 중앙값, 최빈값최빈값 (mode) : 빈도수가 가장 많이 발생한 관찰값사용 범위 : 질적자료와
확률의 정의 상대빈도 정의 (relative frequency definition) : 실험을 무한에 가깝게 시행했을 때, 전체 시행횟수에서 그 사건이 나타나는 빈도수를 상대적으로 나타낸 것을 확률로 정의한다. $$P(A) = \lim_{N \to \infty}

베르누이시행 (Bernoulli trial) : 어떤 실험이나 표본을 추출한 결과가 두 가지 사건으로만 나타나는 시행. 일반적으로 성공(S), 실패(F)로 두 결과를 나타낸다.상호배타적 사건 : 각 시행의 결과는 상호배타적인 두 사건으로 구분된다사건의 확률 : 성공의

균일분포 연속형 균일분포 (continuous uniform distribution) : 확률변수가 취하는 모든 구간에서 각 사건의 발생확률이 일정한 분포. PDF : $$f(X) = {1\over b-a},\;\;a\leq X \leq b$$ 평균
경제성, 시간의 제약과 같은 이유로 전수조사가 불가능할 경우 표본조사가 필수적이다. 그러나 대부분의 경우 표본에 의존하여 모집단의 특성을 분석한다면 필연적으로 오차가 생긴다.표본추출오차는 두가지 종류가 있다.편의(bias)에 의한 오차 : 모집단의 구성원 중 특수한 성

추정값 (estimate) : 모수를 추정하여 나온 결과값 ex) 모집단의 평균을 추정할 때 계산된 표본 평균이 추정값이된다추정량 (추정치, estimator) : 추정값을 구하기 위하여 사용되는 추정방법, 또는 추정값 계산을 위한 통계량ex) 표본 평균은 모집단 평

통계적 가설(statistical hypothesis) : 하나의 특정 주장을 모수를 이용해 나타낸 형태를 지칭한다. '한국 성인 남성의 몸무게는 크기 않다'는 통계적 가설이 될 수 없지만, '한국 성인 남성의 평균 몸무게는 70kg이다'는 통계적 가설이 될 수 있다.
scipy.stats(https://docs.scipy.org/doc/scipy/reference/stats.html| 가설검정 | 데이터 유형 | 검정 대상 | 주요 가정 | 표본/범주 개수 | 독립성

분산분석 (ANOVA) : 3개 이상의 모집단 평균이 서로 같은지 여부를 검증할 수 있는 통계적 분석 방법. 주어진 유의 수준에서 모집단 간 평균 차이가 우연에 의해 발생했는지, 아니면 실질적인 차이가 있는지를 평가할 수 있다요인 (factor) : 실험이나 관찰에서

사용 데이터 : Medical Cost Personal Datasets잔차가 정규 분포를 따르지 않는다는 신호가 많기 때문에 t-검정, F-검정, 로그우도, AIC, BIC값을 신뢰할 수 없지만, 각 항목들에 대해 살펴보는 것에 중점을 두고 보자.기본정보 (표 1-1)

two_way_anova

Norm, Lasso, Ridge, Elastic Net

Robust Regression Robust Regression (강건 회귀) : 이상치에 영향을 제거하거나, 덜 받도록 설계된 회귀 분석 기법 OLS는 MSE (Mean Squared Error)를 손실함수로 사용한다. 이때, 오차가 큰 이상치의 영향이 제곱(
잔차의 이분산성 잔차의 이분산성(heteroskedasticity)은 회귀 분석의 가정 중 하나인 "잔차의 분산이 일정하다"는 가정(등분산성, homoskedasticity)이 만족되지 않는 상황을 의미한다. 이는 종속 변수와 독립 변수 간의 비선형적 관계, 특정 변수