[ADsP] 3과목 정리(5)

전민정·2025년 5월 10일

ADsP 자격증

목록 보기
5/15

4장 통계 분석

3절 회귀분석

(1) 회귀분석 개요

회귀분석의 개요

  • 회귀분석(Regression analysis)의 정의
    • 하나나 그 이상의 독립변수들이 종속변수에 미치는 영향을 추정할 수 있는 통계 기법
    • 변수들 사이의 인과관계를 밝히고 모형을 적합하여 관심 있는 변수를 예측하거나 추론하기 위한 분석 방법
  • 회귀분석의 변수
    • 영향을 받는 변수(y) : 반응변수(Response variable), 종속변수(Dependent variable), 결과변수(Outcome variable)
    • 영향을 주는 변수(x) : 설명변수(Explanatory variable), 독립변수(Independent variable), 예측변수(Predictor variable)

선형회귀분석의 가정

  • x,y값이 연속형 변수일 때 선형회귀분석 가능

그래프를 활용한 선형 회귀분석 가정 검토

  • 선형회귀분석의 가정

  • 가정에 대한 검증

    • 단순선형회귀분석 : 입력변수와 출력변수 간의 산점도로 확인
    • 다중선형회귀분석 : 잔차와 출력변수의 산점도로 확인
      (선형회귀분석의 가정이 모두 만족하는 경우에는 잔차는 랜덤하게 표현됨)



(2) 단순선형회귀분석

단순선형회귀분석 정의

  • 단순선형 회귀분석의 회귀 추정식
    yi=β0+β1xi+ϵi(에러)i=1,...,nϵiN(0,σ2)y_i = \beta_0 + \beta_1x_i + \epsilon_i(에러) \quad i = 1,...,n \quad \epsilon_i \sim N(0,\sigma^2)
  • e_i는 평균이 0, 분산이 𝜎_2

회귀분석의 추정(최소제곱법, 최소자승법)

yi=β0+β1Xi+ϵi(오차항),i=1,2,...,n,ϵi(0,σ2)y_i = \beta_0 + \beta_1X_i + \epsilon_i(오차항), \quad i = 1,2,...,n, \quad \epsilon_i \sim(0,\sigma^2)
i=1N(ei)2=i=1N(yi(β0+β1Xi))2\sum_{i=1}^{N}(e_i)^2 = \sum_{i=1}^{N}(y_i - (\beta_0+\beta_1X_i))^2

식을 각각 β0과 β1로 편미분하여 0과 같다고 놓는다.

y1μ=nβ0+β1xi(β0기준으로편미분,추정값을뜻함)\sum y_1\mu = n\beta_0^* + \beta_1^*\sum x_i(\beta_0을\quad기준으로\quad편미분,\quad*는\quad추정값을\quad뜻함)
xiyi=β0xi+β1xi2(β1기준으로편미분,추정값을뜻함)\sum x_iy_i = \beta_0^*\sum x_i + \beta_1^*\sum x_i^2(\beta_1을\quad기준으로\quad편미분,\quad*는\quad추정값을\quad뜻함)
β0=E(y)β1E(x)\beta_0^* = E(y) - \beta_1^*E(x)
β1=i=1n(xiE(x))(yiE(y))i=1n(xiE(x))2\beta_1^* = \frac{\sum_{i=1}^{n}(x_i-E(x))(y_i-E(y))}{\sum_{i=1}^{n}(x_i-E(x))^2}

회귀계수의 검정

  • β0, β1의 계수들을 추정했다면 계산해서 만들어진 값들이 통계적으로 유의미/무의미한지 검정해야 함
  • 회귀계수 β1이 0이면 입력변수 x와 출력변수 y 사이에는 아무런 관계가 없음(기울기가 0이면)
    -> 회귀계수 β1이 0이면 적합된 추정식은 아무 의미가 없게 됨
  • 귀무가설 : β1 = 0, 대립가설 : β1 ≠ 0
    t-감정=^β1/표준오차(^β1)
  • 결정계수
    • 전체제곱합(Total Sum of Squares, SST) :
      i=1n(yiy)2\sum_{i=1}^{n}(y_i - \overline{y})^2
      - 실제 y값과 y의 평균값 차이 제곱합
    • 회귀제곱합(Regression Sum of Squares, SSR):
      i=1n(yi^y)2\sum_{i=1}^{n}(\hat{y_i} - \overline{y})^2
      - 추정값과 y의 평균값 간의 차이 제곱합
    • 오차제곱합(Error Sum of Squaresm SSE) :
      i=1n(yiyi^)2\sum_{i=1}^{n}(y_i - \hat{y_i})^2
      - 실제 y값과 회귀추정식을 통해 나온 y값 차이 제곱합
    • SST = SSR + SSE
    • 결정계수 R^2 = 회귀제곱합 / 전체제곱합 = SSR / SST 0≤R^2≤1
      -> 전체 데이터를 회귀모형이 설명할 수 있는 양(단순회귀분석에서는 상관계수 r의 제곱과 같다)
      -> 결정계수는 1에 가까울수록 회귀모형이 전체 데이터를 잘 설명함을 의미
  • 1차 선형회귀식을 만들고 선형회귀식에 필요한 β0, β1값을 추정해서 추정식을 만들어낼 수 있다. 추정식을 t검정을 통해 계수가 통계적으로 유의미한지 검증한다. 유의미한 경우 그대로 활용할 수 있있다. 추정식에 의해 만들어진 설명력이 전체 관측된 값을 얼마나 잘 설명하고 있는지를 결정계수를 통해 설명 할 수 있다.

(3) 다중선형회귀분석

  • 두 개 이상의 독립변수들로 구성되어 있는 종속변수들을 확인하는 단계
    Y=β0+β1X1+β2X2++βkXk+ϵY = \beta_0 + \beta_1X_1 + \beta_2X_2 + \cdots + \beta_kX_k + \epsilon
  • 모형이 통계적으로 유의미한가?
  • < 귀무가설(H0) : B1=b2=...=Bn VS 대립가설(H1) : B1≠B2≠...≠Bn > -> F통계량으로 확인
  • 다중선형회귀분석할 경우 선택한 변수들의 계수들이 통계적으로 같은지 다른지 통해 통계적인 유의성을 확인해야 한다.
  • 회귀계수들이 유의미한가> -> t통계량으로 확인
  • 모형이 얼마나 설명력을 갖는가? -> 결정계수로 확인
  • 모형이 데이터를 잘 적합하고 있는가? -> 잔차와 종속변수의 산점도로 확인
  • 데이터가 전제하는 가정을 만족하는가? -> 선형성, 독립성, 등분산성, 비상관성, 정상성을 만족하는지 확인

다중공선성(Multicollinearity)

  • 다중공선성이란 회귀분석에서 모형의 독립변수들 간에 강한 상관관계를 가지는 것을 의미
  • 다중회귀분석에서 설명변수들 사이에 선형관계가 존재하면 회귀계수의 정확한 추정이 곤란
  • 다중공선성 검사 방법
    • 1.분산팽창요인(VIF) : 10보다 크면 심각한 문제
    • 2.상태지수 : 10 이상이면 문제가 있다고 보고, 30보다 크면 심각
  • 해결방안 : 선형관계가 강한 변수(문제가 있는 변수)제거, 주성분 회귀, 능형회귀 모형을 적용하여 해결
    • 선형성이 강한 변수들이 있다고 판단된다면 유의 수준이 가장 좋은 변수를 두고, 유의 수준이 떨어지는 변수를 제거하고 나머지 변수들로 선형 추정식을 만듬, 유의한 변수들만 남겨두고 계속 반복하게 되면 다중공선성 문제 해결할 수 있음

(4) 영향력 진단

영향력 진단 정의

  • 자료진단(Data Diagnostics)
    • 자료진단에서는 데이터의 변화가 모형의 추정에 어떠한 영향을 미치는지를 알아보는것
    • 관측한 데이터에서 모든 관측값의 특징이 같을 수 없는 경우가 있기 때문
    • 주로 이상치의 존재와 관측값의 영향을 분석함
    • 관측값의 영향력 분석은 모형이 옳다는 전제하에 이루어지며 적합한 회귀모형의 안전성을 평가하는 통계적인 방법
    • 데이터에서 관측값을 하나씩 제거하는 방법으로 관측값의 영량력을 진단하여, 이때 데이터에서 특정 관측치가 제거됨에 따라 분석 결과의 주요 부분에 많은 변동이 있다면 모형의 안전성은 약하다고 판단함
    • Leverage H(지레점, 레버리지), 쿡의 거리(Cook's Distance), DFBETAS, DFFFITS 등

(5) 변수 선택

최적회귀방정식의 선택

  • 설명변수의 선택 : 필요한 변수만 상황에 따라 타협을 통해 선택
    • y에 영향을 미칠 수 있는 모든 설명변수 x들을 y의 값을 예측하는데 참여
    • 데이터에 설명변수 x들의 수가 많아지면 관리하는데 많은 노력이 요구되므로, 가능한 범위 내에서 적은 수의 설명변수를 포함
  • 모형선택(Exploratory analysis) : 분석 데이터에 가장 잘 맞는 모형을 찾아내는 방법
  • 모든 가능한 조합의 회귀분석(All possible regression) : 모든 가능한 독립변수들의 조합에 대한 회귀모형을 생성한 뒤 가장 적합한 회귀모형을 선택
  • 변수선택법(Variable Selection)

벌점화된 선택 기준

  • 모형의 복잡도에 벌점을 주는 방법

  • AIC(Akaike information criterion)
    - AIC 값이 최소인 형태의 변수 구조 선정하면 됨

    AIC=2i=in(yi,xiTβ^)/n+2k/nAIC = -2\sum_{i=i}^{n}(y_i,x^T_i\hat{\beta})/n + 2k/n
  • BIC(Bayesian information criterion)

    BIC=2i=in(yi,xiTβ^)/n+klog(n)/nBIC = -2\sum_{i=i}^{n}(y_i,x^T_i\hat{\beta})/n + klog(n)/n
  • 모든 후보 모형들에 대해 AIC 또는 BIC를 계산하고 그 중 최소가 되는 모형을 선택

  • AIC를 활용하는 방법이 보편화된 방법

  • 그 밖의 벌점화 선택기준: RIC(Risk inflation criterion), CIC(Convariacne inflation criterion), DIC(Deviation information criterion)


(6) 회귀분석결과 해석

  • F-통계량은 37.98이며 유의확률 p-value 값이 6.746e-16로 유의수준 5% 하에서 추정된 회귀 모형이 통계적으로 매우 유의함을 알 수 있음
  • 결정계수와 수정된 결정계수는 각각 0.5614, 0.5467로 조금 낮게 나타나 이 회귀식이 데이터를 적절하게 설명하고 있다고는 할 수 없음
  • 회귀계수들의 p-값들이 0.05보다 작으므로 회귀계수의 추정치들이 통계적으로 유의함
  • 결정계수가 낮아 데이터의 설명력은 낮지만 회귀분석 결과에서 회귀식과 회귀계수들이 통계적으로 유의하여 자동차의 가격을 엔진의 크기와 RPM 그리고 무게로 추정할 수 있음

(보충해석)

  • ~(물결)표 왼쪽은 종속변수, 오른쪽은 독립변수
  • median이 0에 가깝고, Q1와 Q3의 잔차가 크게 차이가 없어 정규분포
  • 자유도 89
  • 각 독립변수들의 t-test값을 보아야 함, 어느정도 유의성이 있는지 살펴야 함
  • 독립변수들이 p-value값보다 작게 나옴, 각각 계수들을 통계적으로 유의하다고 판단하고 estimate를 활용해서 회귀식을 만들어서 사용할 수 있다고 판단할 수 있음
  • Residual standard error(잔차표준오차)는 6.504이고 자유도는 89, 독립변수가 3개이기 때문에 실제 데이터는 89+3+1 = 93
  • 다변량회귀분석은 변량의 갯수가 많아지게 되면 수정된 결정계수를 사용하는 경우가 많음
  • 단순회귀분석은 결정계수를 사용하는 경우가 많음

(7) 정규화 회귀 (문제 많이 출제되지 않음)

  • 일반 선형회귀는 훈련 데이터에 지나치게 맞추려고 하다 보면 모델 복잡성이 커지고, 테스트 데이터에서는 성능이 나빠질 수 있음 -> 과대적합
  • 정규화는 모델 복잡성을 강제로 줄이는 페널티(규제항)를 추가해, 불필요한 계수를 작게 만들거나 0으로 만들어준다.

릿지 회귀(Ride Regression)

  • 가중치들의 제곱합을 최소화하는 것을 제약조건으로 추가하는 기법
  • 가중치의 모든 원소가 0에 가까워지는 것을 원하며, 이를 위해 회귀모델에 사용하는 규제 방식을 L2규제(Penalty)라고 함
  • 모든 회귀 계수를 작게 만들어 다중공선성을 줄이는데 효과
    β^=argmin(i=1ei2+λj=1βj2)\hat{\beta} = argmin(\sum_{i=1}e^2_i + \lambda \sum_{j=1}\beta^2_j)

라쏘 회귀(LASSO Regression)

  • 가중치 절대값의 합을 최소화하는 것을 제약조건으로 추가하는 기법
  • 라쏘 회귀에서 사용하는 규제 방식을 L1규제(Penalty)라고 함
  • 일부 회귀 계수를 0으로 만들 수 있어 변수를 선택하는데 유용합니다. 즉, 변수 선택과 정규화를 동시에 수행 가능
    β^=argmin(i=1ei2+λj=1βj)\hat{\beta} = argmin(\sum_{i=1}e^2_i + \lambda \sum_{j=1}|\beta_j|)

(8) 연속형 모델의 성능 평가

회귀모형의 평가지표


0개의 댓글