
하나의 독립변수가 categorical, 종속변수는 continuous 일 떄 one-way ANOVA 적용
Two-Way ANOVA
두 개의 독립변수(Cat)와 종속변수 간의 interaction(교호작용) 및 평균 비교
독립성 검정
두 범주형 변수가 독립인지, 연관성이 있는지 확인
t-test를 여러번 사용하면 1종 오류가 증가하여 신뢰도 X
직관적으로 그룹간의 평균간의 거리 / random한 변화의 정도를 의미
Within-Variance는 random한(무의미한) 변화의 정도
| 변동 요인 | SS (제곱합) | df (자유도) | MS (Variance) | F-value (분산/분산) | P-value |
|---|---|---|---|---|---|
| 집단 간 (Between) | |||||
| 집단 내 (Within) | - | - | |||
| 합계 (Total) | - | - | - |
SST식의 항인
위항으로 분해하여 제곱된 값을 풀어주면 교차항이 생기고, 교차항는 "편차의 합"으로 0

from scipy import stats
n = df_prob2.shape[0]
g_mean = df_prob2['loading_log'].mean()
k = len(df_prob2['product_code'].unique())
ssb = df_prob2.groupby('product_code')['loading_log'].apply(lambda ts: (ts.mean() - g_mean) ** 2 * ts.count()).sum()
ssw = df_prob2.groupby('product_code')['loading_log'].apply(lambda ts: ((ts - ts.mean()) ** 2).sum()).sum()
f_value = (ssb / (k - 1)) / (ssw / (n - k))
p_value = stats.f.sf(f_value, (k - 1), (n - k))
f_value, p_value