4장 통계 분석
3절 회귀분석
(1) 회귀분석 개요
회귀분석의 개요
- 회귀분석(Regression analysis)의 정의
- 하나나 그 이상의 독립변수들이 종속변수에 미치는 영향을 추정할 수 있는 통계 기법
- 변수들 사이의 인과관계를 밝히고 모형을 적합하여 관심 있는 변수를 예측하거나 추론하기 위한 분석 방법
- 회귀분석의 변수
- 영향을 받는 변수(y) : 반응변수(Response variable), 종속변수(Dependent variable), 결과변수(Outcome variable)
- 영향을 주는 변수(x) : 설명변수(Explanatory variable), 독립변수(Independent variable), 예측변수(Predictor variable)
선형회귀분석의 가정

- x,y값이 연속형 변수일 때 선형회귀분석 가능
그래프를 활용한 선형 회귀분석 가정 검토
(2) 단순선형회귀분석
단순선형회귀분석 정의
- 단순선형 회귀분석의 회귀 추정식
yi=β0+β1xi+ϵi(에러)i=1,...,nϵi∼N(0,σ2)
- e_i는 평균이 0, 분산이 𝜎_2
회귀분석의 추정(최소제곱법, 최소자승법)
yi=β0+β1Xi+ϵi(오차항),i=1,2,...,n,ϵi∼(0,σ2)
i=1∑N(ei)2=i=1∑N(yi−(β0+β1Xi))2
식을 각각 β0과 β1로 편미분하여 0과 같다고 놓는다.
∑y1μ=nβ0∗+β1∗∑xi(β0을기준으로편미분,∗는추정값을뜻함)
∑xiyi=β0∗∑xi+β1∗∑xi2(β1을기준으로편미분,∗는추정값을뜻함)
β0∗=E(y)−β1∗E(x)
β1∗=∑i=1n(xi−E(x))2∑i=1n(xi−E(x))(yi−E(y))
회귀계수의 검정
- β0, β1의 계수들을 추정했다면 계산해서 만들어진 값들이 통계적으로 유의미/무의미한지 검정해야 함
- 회귀계수 β1이 0이면 입력변수 x와 출력변수 y 사이에는 아무런 관계가 없음(기울기가 0이면)
-> 회귀계수 β1이 0이면 적합된 추정식은 아무 의미가 없게 됨
- 귀무가설 : β1 = 0, 대립가설 : β1 ≠ 0
t-감정=^β1/표준오차(^β1)

- 결정계수
- 1차 선형회귀식을 만들고 선형회귀식에 필요한 β0, β1값을 추정해서 추정식을 만들어낼 수 있다. 추정식을 t검정을 통해 계수가 통계적으로 유의미한지 검증한다. 유의미한 경우 그대로 활용할 수 있있다. 추정식에 의해 만들어진 설명력이 전체 관측된 값을 얼마나 잘 설명하고 있는지를 결정계수를 통해 설명 할 수 있다.
(3) 다중선형회귀분석
- 두 개 이상의 독립변수들로 구성되어 있는 종속변수들을 확인하는 단계
Y=β0+β1X1+β2X2+⋯+βkXk+ϵ
- 모형이 통계적으로 유의미한가?

- < 귀무가설(H0) : B1=b2=...=Bn VS 대립가설(H1) : B1≠B2≠...≠Bn > -> F통계량으로 확인
- 다중선형회귀분석할 경우 선택한 변수들의 계수들이 통계적으로 같은지 다른지 통해 통계적인 유의성을 확인해야 한다.
- 회귀계수들이 유의미한가> -> t통계량으로 확인
- 모형이 얼마나 설명력을 갖는가? -> 결정계수로 확인
- 모형이 데이터를 잘 적합하고 있는가? -> 잔차와 종속변수의 산점도로 확인
- 데이터가 전제하는 가정을 만족하는가? -> 선형성, 독립성, 등분산성, 비상관성, 정상성을 만족하는지 확인
다중공선성(Multicollinearity)
- 다중공선성이란 회귀분석에서 모형의 독립변수들 간에 강한 상관관계를 가지는 것을 의미
- 다중회귀분석에서 설명변수들 사이에 선형관계가 존재하면 회귀계수의 정확한 추정이 곤란
- 다중공선성 검사 방법
- 1.분산팽창요인(VIF) : 10보다 크면 심각한 문제
- 2.상태지수 : 10 이상이면 문제가 있다고 보고, 30보다 크면 심각
- 해결방안 : 선형관계가 강한 변수(문제가 있는 변수)제거, 주성분 회귀, 능형회귀 모형을 적용하여 해결
- 선형성이 강한 변수들이 있다고 판단된다면 유의 수준이 가장 좋은 변수를 두고, 유의 수준이 떨어지는 변수를 제거하고 나머지 변수들로 선형 추정식을 만듬, 유의한 변수들만 남겨두고 계속 반복하게 되면 다중공선성 문제 해결할 수 있음
(4) 영향력 진단
영향력 진단 정의
- 자료진단(Data Diagnostics)
- 자료진단에서는 데이터의 변화가 모형의 추정에 어떠한 영향을 미치는지를 알아보는것
- 관측한 데이터에서 모든 관측값의 특징이 같을 수 없는 경우가 있기 때문
- 주로 이상치의 존재와 관측값의 영향을 분석함
- 관측값의 영향력 분석은 모형이 옳다는 전제하에 이루어지며 적합한 회귀모형의 안전성을 평가하는 통계적인 방법
- 데이터에서 관측값을 하나씩 제거하는 방법으로 관측값의 영량력을 진단하여, 이때 데이터에서 특정 관측치가 제거됨에 따라 분석 결과의 주요 부분에 많은 변동이 있다면 모형의 안전성은 약하다고 판단함
- Leverage H(지레점, 레버리지), 쿡의 거리(Cook's Distance), DFBETAS, DFFFITS 등
(5) 변수 선택
최적회귀방정식의 선택
- 설명변수의 선택 : 필요한 변수만 상황에 따라 타협을 통해 선택
- y에 영향을 미칠 수 있는 모든 설명변수 x들을 y의 값을 예측하는데 참여
- 데이터에 설명변수 x들의 수가 많아지면 관리하는데 많은 노력이 요구되므로, 가능한 범위 내에서 적은 수의 설명변수를 포함
- 모형선택(Exploratory analysis) : 분석 데이터에 가장 잘 맞는 모형을 찾아내는 방법
- 모든 가능한 조합의 회귀분석(All possible regression) : 모든 가능한 독립변수들의 조합에 대한 회귀모형을 생성한 뒤 가장 적합한 회귀모형을 선택
- 변수선택법(Variable Selection)

벌점화된 선택 기준
-
모형의 복잡도에 벌점을 주는 방법
-
AIC(Akaike information criterion)
- AIC 값이 최소인 형태의 변수 구조 선정하면 됨
AIC=−2i=i∑n(yi,xiTβ^)/n+2k/n
-
BIC(Bayesian information criterion)
BIC=−2i=i∑n(yi,xiTβ^)/n+klog(n)/n
-
모든 후보 모형들에 대해 AIC 또는 BIC를 계산하고 그 중 최소가 되는 모형을 선택
-
AIC를 활용하는 방법이 보편화된 방법
-
그 밖의 벌점화 선택기준: RIC(Risk inflation criterion), CIC(Convariacne inflation criterion), DIC(Deviation information criterion)
(6) 회귀분석결과 해석

- F-통계량은 37.98이며 유의확률 p-value 값이 6.746e-16로 유의수준 5% 하에서 추정된 회귀 모형이 통계적으로 매우 유의함을 알 수 있음
- 결정계수와 수정된 결정계수는 각각 0.5614, 0.5467로 조금 낮게 나타나 이 회귀식이 데이터를 적절하게 설명하고 있다고는 할 수 없음
- 회귀계수들의 p-값들이 0.05보다 작으므로 회귀계수의 추정치들이 통계적으로 유의함
- 결정계수가 낮아 데이터의 설명력은 낮지만 회귀분석 결과에서 회귀식과 회귀계수들이 통계적으로 유의하여 자동차의 가격을 엔진의 크기와 RPM 그리고 무게로 추정할 수 있음
(보충해석)
- ~(물결)표 왼쪽은 종속변수, 오른쪽은 독립변수
- median이 0에 가깝고, Q1와 Q3의 잔차가 크게 차이가 없어 정규분포
- 자유도 89
- 각 독립변수들의 t-test값을 보아야 함, 어느정도 유의성이 있는지 살펴야 함
- 독립변수들이 p-value값보다 작게 나옴, 각각 계수들을 통계적으로 유의하다고 판단하고 estimate를 활용해서 회귀식을 만들어서 사용할 수 있다고 판단할 수 있음
- Residual standard error(잔차표준오차)는 6.504이고 자유도는 89, 독립변수가 3개이기 때문에 실제 데이터는 89+3+1 = 93
- 다변량회귀분석은 변량의 갯수가 많아지게 되면 수정된 결정계수를 사용하는 경우가 많음
- 단순회귀분석은 결정계수를 사용하는 경우가 많음
(7) 정규화 회귀 (문제 많이 출제되지 않음)
- 일반 선형회귀는 훈련 데이터에 지나치게 맞추려고 하다 보면 모델 복잡성이 커지고, 테스트 데이터에서는 성능이 나빠질 수 있음 -> 과대적합
- 정규화는 모델 복잡성을 강제로 줄이는 페널티(규제항)를 추가해, 불필요한 계수를 작게 만들거나 0으로 만들어준다.
릿지 회귀(Ride Regression)
- 가중치들의 제곱합을 최소화하는 것을 제약조건으로 추가하는 기법
- 가중치의 모든 원소가 0에 가까워지는 것을 원하며, 이를 위해 회귀모델에 사용하는 규제 방식을 L2규제(Penalty)라고 함
- 모든 회귀 계수를 작게 만들어 다중공선성을 줄이는데 효과
β^=argmin(i=1∑ei2+λj=1∑βj2)
라쏘 회귀(LASSO Regression)
- 가중치 절대값의 합을 최소화하는 것을 제약조건으로 추가하는 기법
- 라쏘 회귀에서 사용하는 규제 방식을 L1규제(Penalty)라고 함
- 일부 회귀 계수를 0으로 만들 수 있어 변수를 선택하는데 유용합니다. 즉, 변수 선택과 정규화를 동시에 수행 가능
β^=argmin(i=1∑ei2+λj=1∑∣βj∣)
(8) 연속형 모델의 성능 평가
회귀모형의 평가지표

