[ADsP] 3과목 정리(6)

전민정·2025년 5월 11일

ADsP 자격증

목록 보기
6/15

4장 통계분석

4절 시계열 분석

(1) 시계열 자료와 정상성

시계열 자료

  • 시간의 흐름에 따라 관찰된 값들을 시계열 자료라 함

  • 시계열 데이터 분석의 목적
    - 미래의 값을 예측(향후 일주일간 주가 예측, 다음 달 매출액 예측 등)
    - 시계열 데이터의 특성 파악(경향, 주기, 계절성, 불규칙성 등)

  • 일변량시계열분석 - Box-Jenkins(ARMA), 지수평활법, 시계열분해법, 시간(t)를 설명변수로 한 회귀모형 주가, 소매물가지수 등 하나의 변수에 관심을 갖는 경우의 시계열분석

    Zt=ϕ1Zt1+ϕ2Zt2++ϕpZtp+atZ_t = \phi_1 Z_{t-1} + \phi_2 Z_{t-2} + \cdots + \phi_p Z_{t-p} + a_t
  • 다중시계열분석 - 계량경제 모형, 전이함수모형, 개입분석, 상태공간 분석, 다변량 ARIMA 등 계량경제(econometrics) : 시계열 데이터에 대한 회귀분석(예: 이자율, 인플레이션이 환율에 미치는 요인)

    ERt=a+β1IRt1+β2IFt1ER_t = a + \beta_1IR_{t-1} + \beta_2IF_{t-1}
  • 역사
    1) 17세기 태양의 측점 자료나 밀 가격지수 변동을 나타내는 함수로 sim, cos 곡선 활용
    2) Yule(1926) - ARMA 개념 제시, Walker(1937) - ARMA 모형 제시
    3) Durbin(1960), Box & Jenkins(1970) - ARMA 모형에 대한 추정
    4) Holt(1957) - 지수평활법(exponential smmothing) 제시
    5) Winter(1960) - 계절성(seasonal) 지수평활법 제시

  • 종류

    • 비정상성 시계열 자료 : 시계열 분석하는데 다루기 어려운 시계열 자료(대부분의 시계열 자료)
    • 정상성 시계열 자료 : 비정상 시계열을 핸들링해 다루기 쉬운 시계열 자료로 변환한 자료

정상성

1)평균이 일정한 경우

  • 모든 시점에 대해 일정한 평균을 가짐
    - 평균이 일정하지 않은 시계열은 차분(difference)를 통해 정상화
    - 차분은 현시점 자료에서 전 시점 자료를 빼는 것
    ✓ 일반차분(regular difference) : 바로 전 시점의 자료를 빼는 것
    ✓ 계절차분(seasonal difference) : 여러 시점 전의 자료를 빼는 것, 주로 계절성을 갖는 자료를 정상화하는데 사용
    2)분산도 시점에 의존하지 않을 경우

  • 분산이 일정하지 않은 시계열 변환(transformation)을 통해 정상화 ex) log, 지수
    3)공분산은 단지 시차에만 의존, 실제 특정 시점 t,s에는 의존하지 않음

  • 정상 시계열의 모습

    왼쪽 - 정상 시계열, 오른쪽 - 비정상성 시계열

    [일정한평균]E(yt)=μ,[일정한분산]var(yt)=σ2,[공분산은t아닌s의존함]cov(yt,yt+s)=cov(yt,yts)=ys[일정한\quad평균] E(y_t) = \mu, \quad[일정한\quad분산]var(y_t) = \sigma^2,\quad \\ [공분산은\quad t가\quad아닌\quad s에\quad의존함]cov(y_t,y_{t+s}) = cov(y_t, y_{t-s}) = y_s
  • 정상 시계열의 특징

    • 어떤 시점에서 평균과 분산 그리고 특정한 시차의 길이를 갖는 자기공분산을 측정하더라도 동일한 값을 가짐
    • 항상 그 평균값으로 회귀하려는 경향이 있으며, 그 평균값 주변에서의 변동은 대체로 일정한 폭을 가짐
    • 정상 시계열이 아닌 경우 특정 기간의 시계열 자료로부터 얻은 정보를 다른 시기로 일반화할 수 없음

(2) 시계열자료 분석방법

분석방법론

  • 회귀분석(계량 경제)방법, Box-Jenkins 방법, 지수평활법, 시계열 분해법 등이 있음
  • 수학적 이론 모형 : 회귀분석(계량 경제)방법, Box-Jenkins 방법
  • 직관적 방법 : 지수평활법, 시계열 분해법으로 시간에 따른 변동이 느린 데이터 분석에 활용
  • 장기 예측 : 회귀분석방법 활용
  • 단기 예측 : Box-Jenkins 방법, 지수평활법, 시계열 분해법 활용

(3) 시계열 모형

자기회귀 모형(AR 모형, Autoregressive model)

  • p시점 전의 자료가 현재 자료에 영향을 줌
    Zt=ϕ1Zt1+ϕ2Zt2++ϕpZtp+atZ_t = \phi_1 Z_{t-1} + \phi_2 Z_{t-2} + \cdots + \phi_p Z_{t-p} + a_t
    Zt = 현재 시점의 시계열 자료
    Z
    {t-1}, Z_{t-2} : 이전, 그 이전 시점 p의 시계열 자료
    𝜙_p : p 시점이 현재에 어느 정도 영향을 주는지를 나타내는 모수
    a_t : 백색잡음과정(White noise process), 시계열 분석에서 오차항을 의미
    - 평균이 0, 분산이 σ^2, 자기공분산이 0인 경우
    - 시계열 간 확률적 독립인 경우 강(strictly) 백색잡음 과정이라 함
    - 백색잡음 과정이 정규분포를 따를 경우 이를 가우시안(Gaussian) 백색잡음 과정이라고 함
  • AR(1) 모형 :
    Zt=ϕ1Zt1+atZ_t = \phi_1 Z_{t-1} + a_t
  • AR(2) 모형 :
    Zt=ϕ1Zt1+ϕ2Zt2+atZ_t = \phi_1 Z_{t-1} + \phi_2 Z_{t-2} + a_t
  • 자기상관함수(ACF)는 빠르게 감소, 부분자기함수(PACF)는 어느 시점에서 절단점을 가짐 (ACF가 빠르게 감소하고, PACF가 2 시점에서 절단점을 갖는 그래프가 있다면, 1 시점 전의 자료까지가 현재에 영향을 미치는 AR(1) 모형이라 볼 수 있음)

자기회귀 모형

  • 자기상관계수(AutoCorrelation Function, ACF)
    • k 기간 떨어진 값들의 상관계수

      Pk=λkλ0=Cov(Yt,Ytk)Var(Yt)Var(Ytk)whereλk=Cov(Yt,Ytk):자기공분산(Autocovariance)P_k = \frac{\lambda_k}{\lambda_0} = \frac{Cov(Y_t, Y_{t-k})}{\sqrt{Var(Y_t) Var(Y_{t-k})}} \\ where\quad\lambda_k = Cov(Y_t, Y_{t-k}) : 자기공분산(Autocovariance)
    • 자기상관계수 함수(Autocorrelation Function, ACF) : 상관계수 k를 함수 형태로 표시

      )AR(1):Zt=ϕ1Zt1+at예)AR(1):Z_t = \phi_1 Z_{t-1} + a_t
    • 만일 -1 < 𝜙 < 1이면 두 지점 간의 거리가 멀어질수록 (k가 커질수록) ACF는 0에 수렴하게 된다.

  • 부분(편)자기상관계수(Partial ACF)
    • 서로 다른 두 시점 사이의 관계를 분석할 때 중간에 있는 값들의 영향을 제외시킨 상관관계 개념
      Corr(Yt,YtkYt1,,Ytk+1)Corr(Y_t, Y_{t-k} | Y_{t-1}, \cdots, Y_{t-k+1})

이동평균 모형(MA 모형, Moving Average model)

  • 유한한 개수의 백색잡음의 결합이므로 언제나 정상성을 만족
    Zt=a1θ1at1θ2at2θpatpZ_t = a_1 - \theta_1 a_{t-1} - \theta_2 a_{t-2} - \cdots - \theta_p a_{t-p}
  • 1차 이동평균 모형(MA1 모형)은 이동평균모형 중에서 가장 간단한 모형으로 시계열이 같은 시점의 백색잡음과 바로 전 시점의 백색잡음의 결합으로 이뤄진 모형
    Zt=a1θ1at1Z_t = a_1 - \theta_1 a_{t-1}
  • 2차 이동평균 모형(MA2 모형)은 바로 전 시점의 백색잡음과 시차가 2인 백색잡음의 결합으로 이뤄진 모형
    Zt=a1θ1at1θ2at2Z_t = a_1 - \theta_1 a_{t-1} - \theta_2 a_{t-2}
  • AR 모형과 반대로 ACF에서 절단점을 갖고, PACF가 빠르게 감소

자기회귀누적이동평균 모형(ARIMA(p,d,q) 모형, autoregressive integrated moving average model)

  • ARIMA 모형은 비정상시계열 모형
  • ARIMA 모형은 차분이나 변환을 통해 AR 모형이나 MA 모형, 이 둘을 합친 ARMA 모형으로 정상화할 수 있음
    Zt=ϕ1Zt1+ϕ2Zt2++ϕpZtp+a1θ1at1θ2at2θqatqZ_t = \phi_1 Z_{t-1} + \phi_2 Z_{t-2} + \cdots + \phi_p Z_{t-p} + a_1 - \theta_1 a_{t-1} - \theta_2 a_{t-2} - \cdots - \theta_q a_{t-q}
  • p는 AR 모형, q는 MA 모형과 관련이 있는 차수
  • 시계열{Z_t}의 d번 차분한 시계열이 ARMA(p,d)모형이면, 시계열{Z_t}는 차수가 p,d,q인 ARIMA 모형, 즉, ARIMA(p,d,q)모형을 갖는다고 함
  • d=0이면(차분을 안 한 경우) ARMA(p,d)모형이라 부르고 이 모형은 정상성을 만족
  • p=0이면(AR모형이 0이다) IMA(d,q)모형이라 부르고, d번 차분하면 MA(q)모형을 따름
  • q=0이면(MA모형이 0이다) ARI(p,d)모형이라 부르며, d번 차분한 시계열이 AR(p)모형을 따름

분해 시계열

  • 시계열에 영향을 주는 일반적인 요인을 시계열에서 분리해 분석하는 방법을 말하며 회귀분석적인 방법을 주로 사용
  • 분해식의 일반적 정의
    Xt=f(Tt,St,Ct,Lt)여기서Tt:경향(추세)요인,St:계절요인,Ct:순환요인,Lt:불규칙요인,Zt:시계열값,f:미지의함수X_t = f(T_t, S_t, C_t, L_t) \\ 여기서\quad T_t:경향(추세)요인,\quad S_t:계절 요인,\quad C_t:순환 요인, \\ L_t:불규칙 요인,\quad Z_t:시계열 값,\quad f:미지의 함수
  • 시계열을 구성하는 4가지 요소

시계열 분석 결과 해석 (중요)

  1. ts(data, freguency=n,start=c(시작 연도, 월)) : 기존 데이터를 시계열 데이터로 변환
  2. decompose(data) : 시계열 데이터를 x, trend, seasonal, random 값으로 분해
  3. SMA(data, n=이동평균 수) : 시계열 데이터를 이동 평균한 값 생성
  4. diff(data, differences=차분 수) : 시계열 데이터를 차분
  5. acf(data, lag.max=래그 수) : acf 값과 그래프를 도식화하여 래그 절단 값을 확인
  6. pacf(data,lag.max=래그 수) : pacf 값과 그래프를 도식화하여 래그 절단 값을 확인
  7. auto.arima(data) : 데이터를 활용하여 최적의 ARIMA 모형을 선정
  8. arima(data, order=c(p,d,q)) : 선정된 ARIMA 모형으로 데이터를 보정(fitting)
  9. forecast.Arima(fitted data, h=미래 예측 수) : ARIMA 모형에 의해 보정(fitting)된 데이터를 통해 미래값을 예측
  10. plot.ts(시계열 데이터) : 시계열 데이터를 도식화
  11. plot.forecast(시계열 예측된 데이터) : 시계열로 예측된 데이터를 도식화
  • 1~9까지가 시계열 분석 과정

0개의 댓글