Are Language Models Actually Useful for Time Series Forecasting? (NeurIPS 2024 SpotLight) 논문리뷰

구자협·2026년 1월 3일
post-thumbnail

현재 Tiem Series task 연구에서 LLM을 접목하고자 하는 연구들이 많이 쏟아지고 있음. (AAAI, NeurIPS, ICLR ..) 하지만, 해당 paper는 과연 Time Series Forecasting task에서 LLM이 정말 유용할까? 라는 근본적인 질문을 던지며, 현재 LLM을 접목한 Time Series 연구들에 대해서 반박하는 ablation study를 주장함. 이는 2024 NuerIPS에서 spotlight을 받았으며, forecasting task 안에서 LLM의 insight가 실질적으로 time series 예측에 영향을 주지 않는다는 것을 공개함.

0. Abstract

  • 많은 연구에서 Time Series Forecasting 연구에 LLM을 활용하고 있지만, 실제로 LLM component를 removing하거나 replacing 해도 예측 성능이 떨어지지 않는다. 심지어 특정 벤치마크 데이터셋에서는 성능 향상이 일어난다.

→ 이는 시계열의 sequential dependencies를 잘 representation 학습이 일어나지 않고, 또한 few shot에서도 큰 영향이 있지 않는다.

  • 또한 computational cost 측면에서도, scratch 보다 더 나은 점이 없다.

💡즉, TS encoder의 성능이 매우 좋다는 것을 의미하며, patching과 attention 연산 구조의 모델이 LLM based와 성능 측면에서 거의 유사하다.

1. Introduction

1.1 problem define

  • LLM + Time Series 분야 연구들에서는 한 가지 가정이 존재하는데,
    • LLM이 텍스트에서 sequential dependencies를 잘 하는데, 이는 Time Series data에서도 sequential dependencies를 잘 반영해서 일반화할 수 있다는 것이다.
  • 그런데 해당 가설은 불명확하다. LLM과 MTSF 사이에서의 connection에 대해서 정말 conventional한 TS encoder나 Attention 모듈이 LLM 보다 좋은지는 확인해볼 필요가 있다.
  • 해당 연구에서 우리가 주장하는 것은 LLM이 가지고 있는 내재적인 Reasoning 들을 TS task에서 제대로 활용하는 연구들 downstream task들이 있을 수 있다. 실제 text를 함께 활용하는 연구들에서
  • 그러나 8개의 벤치마크 데이터셋과 5개의 또 다른 시계열 데이터셋에 대해서 비교했을 때, conventional한 attention layer를 추가하는 것과 TS Encoder를 사용하는 것이 LLM block을 활용하는 것과 맞먹거나 오히려 더 좋다.
  • Ablation 진행을 위해서 2가지 정도 초점을 둠
    1. reproducing을 완벽하게 하는 것 (실제 paper에서 제시한 value까지 함께 표에 첨부)
    2. LLM 모듈을 replacing 할 때, attention layer 시 랜덤 초기화를 하거나 아니면 아예 LLM 모듈을 빼버림
      1. 이 과정에서 training과 inference 시간 3배까지 줄일 수 있었음
  • 새롭게 사용한 5가지 데이터셋에 대해서도 기존 8개의 오픈 벤치마크 데이터셋과 거의 유사한 양상을 보였다.
  • 뿐만 아니라 few shot 환경에서도 10%의 training data를 활용했을 때, forecasting 측면에서 큰 도움이 되진 않았다.

1.2 key contribution

  1. 직관적인 Ablation 연구 제안 및 검증

저자들은 LLM 기반 시계열 모델에서 LLM의 실제 효용성을 격리하여 측정할 수 있는 세 가지 비교 방법(w/o LLM, LLM2Attn, LLM2Trsf)을 제안

  1. pretraining 및 sequence 모델링 능력의 영향력 분석
  • 무작위 초기화 실험을 통해 아무런 영향 없음 발견
  • data shuffling and few shot: transfer 이뤄지지 않음 발견
  1. Patching과 Attention 구조는 여전히 강력하다.

  1. Time-LLM
  2. OneFitAll(GPT4TS) - GPT 2
  3. CALF(CrossModal Alignment Forecasting)

3. Experimental Setup

3가지 ablation study 진행
1. w/o LLM
2. LLM2Attn
3. LLM2Trsf

Reference Method (architecture)

  1. OneFitALL(GPT4TS)

  1. Time-LLM
  1. CALF(CrossModal Alignment Forecasting)
  • 전체 LLM ablation methods

(a) w/ LLM: 기존 LLM 기반 모델

(b) w/o LLM: LLM without 모델: 기존 LLM 기반 모델: 언어 모델(LLM) 성분을 완전히 제거합니다. 대신 인코딩 과정을 거친 입력 토큰들을 기존 참조 모델의 마지막 출력 층(final layer)으로 직접 전달합니다.

(c) LLM2Attn: LLM → 기본적인 Self-Attention 1개만 사용: 거대한 언어 모델을 무작위로 초기화된(학습되지 않은) 단일 멀티 헤드 어텐션(multi-head attention) 레이어로 교체합니다.

(d) LLM2Trsf: LLM 단순 트랜스포머로 교체: 언어 모델을 무작위로 초기화된 단일 트랜스포머 블록(transformer block)으로 교체합니다.


  • Datasets and Evaluation Metrics
  • Benchmark Datasets
    • ETT (Electricity Transformer Temperature): 전력 변압기 관련 7개 요인 데이터입니다. 시간 단위(ETTh1, ETTh2)와 15분 단위(ETTm1, ETTm2)의 4개 하위 집합으로 나뉩니다.
    • Illness: CDC에서 기록한 주간 독감 의심 환자 비율 데이터입니다.
    • Weather: 미국 1,600개 지역의 11개 기상 특징 데이터(2010~2013년)입니다.
    • Traffic: 샌프란시스코 고속도로의 시간당 도로 점유율 데이터입니다.
    • Electricity (ECL): 321개 고객의 시간당 전력 소비량 데이터(2012~2014년)입니다.
    • Exchange Rate: 8개국의 일일 환율 데이터(1990~2016년)입니다.
    • Covid Deaths: 266개 국가/지역의 일일 코로나19 사망자 통계입니다.
    • Taxi (30 min): 뉴욕시 1,214개 지점의 30분 단위 택시 승차 데이터입니다.
    • NN5 (Daily): 영국 내 111개 ATM의 일일 현금 인출 데이터입니다.
    • FRED-MD: 1959년부터 수집된 107개의 미국 월간 거시경제 지표입니다
  • Data split
    • ETT datasets: training 60% validation 20% test 20%
    • Illness, Weather, Electricity: training 70%, validation 10%, test 20%
  • Evaluation Metrics
    • MSE
    • MAE

4. Result

해당 부분에서 6가지 핵심 질문을 통해서 LLM의 종합적인 평가를 재고하고자 한다.

4.1 RQ1: 사전 학습된 언어 모델이 예측 성능에 기여하는가 ?

  • RA1 : No

시계열 예측 모델에서 거대한 LLM을 걷어내도 성능은 비슷하거나 오히려 더 좋아진다.

LLM을 빼버리거나 단순한 구조(attention or transformer block)로 바꾼 게 더 좋다. 특히, Time-LLM 경우, 모든 실험 사례 26/26에서 LLM이 없는 모델이 최고점이 아님

→ 현재 유형처럼 번지는 LLM 기반 시계열 예측 방식이 실제 예측 정확도 면에서 실질적인 이득을 주지 못하고 있음.

4.2 RQ2: LLM 기반 방법론들이 그만한 computational cost를 할애할 가치가 있는가 ?

  • RA2: No

  • 언어 모델의 파라미터가 frozen된 경우에도 training, inference 시 상당한 overhead 발생

  • Training part

    • Time-LLM의 경우 66억 개 파라미터 보유 → weather 데이터셋 학습 시 3003분 소요, ablation 모델은 24만 개 파라미터만으로 평균 2분대 학습 가능
  • Inference part

    • 추론 시간의 경우, 최대 배치 사이즈로 나누어 샘플당 추론 시간을 추정했습니다. Time-LLM, OneFitsAll, CALF는 수정된(어블레이션) 모델들보다 평균적으로 각각 28.2배, 2.3배, 1.2배 더 긴 시간이 소요

4.3 RQ3: 언어 모델의 사전 학습(pretraining)이 시계열 예측 task의 성능 향상에 직접적인 도움이 되는가?

  • RA3: LLM은 시계열에 대해서 아는 게 없다.
  • → 시계열 연구자들이 흔히 하는 가설인, “LLM은 문장을 이해하는 능력이 뛰어나니 숫자의 흐름(sequence)도 잘 이해할 것이다.”를 반박함.
  • w/o Pre + FT > w Pre + FT가 더 좋은 성능을 보임 (즉, random weight에서 시계열 데이터만 보고 새로 학습하는 것이 더 성능이 잘 나옴)
  • transfer learning 효과 x
  • 즉, 성능이 올라가는 이유는, LLM이 time series 형태를 잘 이해해서가 아니라, 시계열 데이터를 LLM input에 맞게 잘 preprocessing하고 나중에 학습시키는 finetuning 과정에서 성능이 올랐다.

4.4 RQ4: LLM이 시계열 데이터의 Sequential Dependencies라는 특징을 제대로 된 representation을 표현할 수 있는가?

  • RA4: 순서를 섞어도 별 다른 차이가 없음을 증명
  • 논리: 시계열 예측은 sequence가 생명이다. → 어제-오늘-내일의 순서가 섞인 데이터를 보고도 내일을 맞춘다면, 그 모델은 사실 순서(시퀀스)를 보고 있는 것이 아닌 단순히 통계적 수치(분포)만 보고 있음을 의미
  • 따라서 셔플링 진행
    • 셔플링 방식
      • 전체 시퀀스를 무작위로 섞는 방식 (sf-all)
      • 시퀀스의 앞부분 절반만 섞는 방식 (sf-half)
      • 시퀀스의 뒷부분 절반만 섞는 방식 (ex-half)
    • 일반적인 언어 모델 → 단어 순서가 섞이면 문장 이해 x
    • Time series LLM 모델은 순서를 엉망으로 섞었을 때 발생하는 성능 저하율이, LLM을 아예 안 쓴 단순한 모델들과 거의 똑같음
  • 즉, LLM이 시계열 데이터를 처리할 때, 텍스트를 읽을 때처럼 정교하게 “시간의 흐름”을 파악하는 것이 아니라, 단순히 숫자들의 통계적 특성만을 파악하고 있을 가능성이 높음

4.5 RQ5: LLM이 데이터가 부족한 few-shot learning에 도움이 되는가?

  • RA5: 유의미하게 유용하지 않음을 시사

  • 데터가 부족한 few shot 환경에서 pretrain된 가중치에 인코딩된 지식이 성능에 도움이 될 가능성이 존재했음

  • 따라서 10% 데이터만 사용하여 모델과, ablation 모델들을 학습함.

  • 결과 (LLaMA & GPT-2)

    • LLaMA (Time-LLM): 비싼 LLaMA를 쓰나, 그냥 다 떼버리고 직접 예측하나 승률이 8:8로 동일함 즉, 굳이 무거운 LLaMA를 쓸 필요가 없음
    • GPT2 (CALF): 오히려 LLM을 제외한 가벼운 모델이 14번 중 12번이나 이겼음. 데이터가 적을 때 무거운 LLM을 돌리는 것이 오히려 방해가 될 수도 있음을 시사
  • 즉, 데이터가 부족할 때 LLM의 사전 지식이 도움이 될 것이라는 기대는 시계열 예측에서 근거가 부족

4.6 RQ6: 현재 LLM을 접목한 Time Series Forecasting 연구에서 뽑아내는 성능은 실제로 어디서 오는 것일까 ?

  • LLM을 제거해도 성능이 유지된다는 것을 확인
  • 이에 따라 “왜 단순한 방식이 잘 작동하는가?”를 파악하기위해 patching, decomposition 등 시계열 모델에서 흔히 쓰이는 인코딩 기법들 적용
  • Patching + Attention {Attn) 구조
  • Instance Norm → Pathcing(Chaanel_Independence) → Linear Projection → One layer Attention → Final Projection
  • 해당 구조
    • 소규모 데이터 (<100만 row) 단순한 PAttn 구조가 효과적
    • 대규모 데이터 (Traffic ..) CALF의 인코더를 활용하되 Cross Modal Attetnion 제거한 Linear Trsf 모델이 더 좋은 성능을 보임

즉, LLM 기반 시계열 모델의 성능은 LLM의 언어적 지식이 아니라, "데이터를 패치로 쪼개고(Patching) 어텐션으로 관계를 파악하는 구조" 그 자체에서 나옴

5. Appendix part

5.1 Limitaition

  1. only time series forecasting 측면에서 진행
    1. LLM이 시계열과 어떻게 상호작용하는지 더 정확하게 파악하기 위해서는 classification이나 QA와 같은 다른 작업에서도 평가가 이뤄져야 함
  2. dataset 특성
    1. 대부분의 벤치마크 데이터셋들은 모두 일정한 시간 간격을 가진 데이터들임.
    2. 따라서 real world 실생활 데이터들은 불규칙한 데이터가 많음

5.2 Broader Societal Impact

  • 연구자들이 단순히 유행을 따라 모든 application에 LLM을 적용하는 것 대신에 실제로 LLM component가 왜 필요한지, LLM 성능과 연산 비용 간의 합리적인지 꼼꼼히 따져봐야 함
  • 더 작고 단순한 모델이 성능이 좋다는 발견 → 실제 현장에서 저렴하게 배포할 수 있고 해석이 쉬운 확장 가능한 모델을 개발하는 데 기여 가능

5.3 Additional Experimental Details

LLaMA 7B → A100 GPU(80GB)

GPT 2 → RTX A6000 GPU(48GB)

→ LLM 제거한 베이스라인 모델들은 훨씬 작은 GPU에서도 학습 가능

  • 하이퍼파라미터: 기존 모델 복제 시에는 원본 설정을 그대로 썼고, 어블레이션 모델(단순화된 모델)은 파라미터가 적기 때문에 학습률이나 배치 크기를 일부 조정
  • PAttn
    • PAttn: 패칭과 1개 층의 어텐션을 결합한 모델입니다. 기존 PatchTST 모델에서 위치 임베딩과 피드 포워드 층을 제거하고 트랜스포머 인코더를 단순한 어텐션 구조로 바꾼 형태
    • LTrsf: CALF 모델의 인코더에서 텍스트 정렬 기능을 뺀 모델로, 대규모 데이터셋에서 성능이 더 좋음
    • 비교 결과: PAttn 모델은 모든 LLM 기반 모델을 합친 것보다 더 자주 최고 혹은 차선의 성능을 기록했습니다(34회 vs 33회)
  • 신뢰 구간 (Confidence Intervals): 딥러닝 모델은 실행할 때마다 결과가 조금씩 다를 수 있으므로, 결과의 안정성을 확인하기 위해 신뢰 구간을 보고
  • 새로운 5개 데이터셋 검증: 기존 연구에서 다루지 않았던 환율, 코로나 사망자 등 5개의 새로운 데이터셋에서도 실험을 진행, 그 결과 역시 시계열 예측 작업에 언어 모델은 굳이 필요하지 않다

즉, 부록은 본문의 주장이 단순히 몇몇 사례에 그치는 것이 아니라, 다양한 환경과 데이터셋에서도 일관되게 나타나는 현상임을 데이터로 증명하고, 연구자들이 더 효율적인 모델을 찾는 데 도움을 주고자 해당 paper 작성되었음.

  • Time-LLM ablation study (MSE)

  • CALF ablation study (MSE)

  • OneFitsAll ablation study (MSE)
  • 실제 제조 현장에서 이를 접목시키기 위해서는 downstream task에서 잔존 수명 예측을 진행한다고 했을 때, 특정 이벤트(로그)가 수치적 변화(센서)에 어떤 인과적 영향을 주었는가 그리고 LLM을 어떤 부분에 적용할 것인가.
  • embedding 추출용인가 decoder 부분에서 예측에 직접적으로 활용할 것인가 혹은 현재 paper에서 제공하는 Patching + Attention(PAttn)을 활용할 것인가.
  • Time LLM을 reprogramming해서 변형해서 활용할 것인가 등에 대해서 고민하고 직접 실험해보며 진행할 필요가 있다. 데이터셋에 대한 요소들도 고민해볼 필요가 있다.
  1. Case Western Reserve University (CWRU) Bearing Data: 베어링 고장 데이터셋으로, 수치 데이터 외에 각 실험 단계에 대한 설명(Metadata/Text)이 상세히 기록
  2. BPI Challenge (Process Mining) Datasets : 제조 공정의 이벤트 로그(Event Log)가 중심인 데이터셋
profile
Time Series Analysis, Artifical Intelligence

0개의 댓글