Chen, Shengchao, et al. "Federated foundation models on heterogeneous time series." Proceedings of the AAAI Conference on Artificial Intelligence. Vol. 39. No. 15. 2025.
https://doi.org/10.48550/arXiv.2412.08906
시계열 파운데이션 모델(Time Series Foundation Model, TSFM)은 여러 도메인의 시계열 데이터를 하나로 합쳐 Transformer로 학습.
Foundation Model (Stanford CRFM, 2021):
방대한 데이터로 학습된 (보통 거대한) 모델로, 다양한 후속 작업(downstream tasks)에 맞게 적응(adaptation)할 수 있는 기반(base) 역할을 하는 모델.1. 대규모 사전학습(pre-training): 인터넷 텍스트, 이미지, 시계열 등 광범위한 데이터를 학습.
2. 범용성(general-purpose): 한 번 학습하면 번역, 요약, 질의응답, 코드 생성 등 여러 작업에 활용 가능 (예: GPT, BERT, CLIP).
3. 전이학습(adaptation): 파운데이션 모델을 기반으로 파인튜닝(fine-tuning) 또는 프롬프트(prompting)를 통해 다양한 태스크에 쉽게 적용.
Time Series Foundation Model:
시계열 데이터 전반에 적용 가능한 범용 모델. 서로 다른 도메인의 시계열 데이터를 통해 학습해 다양한 다운스트림 작업(예측, 보간, 이상탐지)을 수행.
텍스트/이미지와 달리 시계열 데이터는 도메인 별 의미가 완전히 상이. 도메인 이질성으로 인해 모델 성능 저하 문제 발생.
Transformer:
Transformer는 자기-어텐션(self-attention) 메커니즘을 기반으로 한 딥러닝 신경망 아키텍처로, 입력 데이터 내 요소들 간의 관계를 병렬적으로 학습하여 긴 문맥을 효과적으로 처리할 수 있도록 설계된 모델. “Attention is All You Need” 논문을 참고할 것.
자세한 설명: https://youtu.be/wjZofJX0v4M?si=3Um1a7DCh_VFow_A
도메인마다 데이터 분포가 달라서 (heterogeneous) 모델 성능에 대한 일반화가 어려움.
따라서, 연합학습을 채용한 TSFM을 통해 범용 시계열 분석 작업에서 일반화 성능 향상시키고자 함.
TSFM 학습을 위해서는 수많은 공개/사설 데이터셋에 접근할 필요가 있음.
기존의 중앙집중식(centralized) TSFM 학습 방식으로는 사설 데이터에 접근하기에 적합하지 않음.
데이터를 수집할 수 있는 장치의 최종 사용자들은 데이터 활용에 대해 매우 민감하게 반응.
연합학습을 활용하면 데이터를 직접 중앙 서버에 전송하지 않고도 모델을 학습시킬 수 있음.
따라서, 외부로의 데이터 유출에 대한 우려를 종식시킬 수 있음.
시계열 데이터는 토큰(부분 시퀀스)의 이질성(Heterogeneity)이 매우 큼. 도메인에 따라 물리적인 의미 자체가 달라지는 특성 보유. 도메인 간 불변성(cross-domain invariant)의 부족과 시계열의 이질성 증가가 성능 향상에 악영향.
이질성은 도메인 간 시계열이 시간적 패턴(trend, timescale, seasonality)에서 큰 변동을 보이기 때문에 발생하면 다음과 같은 문제 야기. (Fig 1. 참조)
1) 수렴 속도 불일치(incosistent convergence rates): 유사한 추세의 데이터 사이에서도, 복잡한 데이터가 단순한 데이터에 비해 수렴이 훨씬 느림.
2) 이질적인 데이터 활용의 어려움: 학습 데이터와 테스트 데이터의 도메인이 다를 때, 모델의 성능이 저하됨.
Figure 1. 데이터 이질성이 모델 성능에 미치는 영향 (건강 데이터와 날씨 데이터)
서로 다른 timescale에서 도메인 고유의 맥락적 의미(domain-specific contextual meanings)에 따른 고유한 해석을 요구하는 경우 존재. 관측 기간이 같아도 timescale 차이에 의해 의미가 왜곡되거나 데이터 통합 난이도 상승. 결과적으로 모델의 근본적 패턴 해석에 방해가 됨.
예) 날씨와 건강 데이터의 추세와 변동이 비슷해보여도 그 의미는 전혀다름.
Federated Foundation Models on Time Series(FFTS)를 통해 시계열 파운데이션 모델 학습을 위한 연합학습 접근법을 제안. 연합학습 도입을 통해 데이터 이질성 문제를 해결하고자 함.
각 데이터를 보유한 조직을 하나의 독립된 클라이언트로 취급.
각 클라이언트는 로컬 모델을 학습해 데이터셋 고유 특성 보존. 서버는 로컬 모델의 파라미터를 집계해 TSFM 구축.
1) 모델 아키텍처: 표준 인코더 전용 Transformer 구조 채택. Adaptive Trend-Awareness Module(ATM) 도입해 서로 다르 도메인 시퀀스 간 유사 패턴 식별. 다양한 다운스트림 작업에 적용할 수 있는 통합 적응 아키텍처를 설계.
2) 최적화 전략: 통일된 마스킹 전략(Uniform Masking Stretegy)을 사용해 로컬 모델이 도메인 특화 지식을 단순 암기하지 않도록 함. 이질적 지식 정렬(heterogeneous knowledge alignment)를 채택해 글로벌 모델의 편향 최소화.
Figure 2. TSFM 학습 과정 전반
a) STS Pretraining: 여러 도메인의 데이터를 하나의 시간축으로 이어붙어 단일 시계열(STS) 생성해 학습
b) MTS Pretraining: 여러 도메인의 데이터를 채널 차원으로 합쳐 멀티채널 시계열(MTS)로 학습
c) FFTS: 각 데이터 소유자를 독립된 클라이언트 취급. 클라이언트 별 로컬 모델 학습해 자체 특성 보존. 서버가 로컬 모델 집계해 글로벌 TSFM 생성.
도메인 로부터 얻은 MTS 관측값은 로 정의.
각 클라이언트는 자신의 모델 를 업데이트해 출력과 정답 간 격차 최소화.
글로벌 최적화 목적 함수: , (= 번째 클라이언트의 샘플 수, = 전체 샘플 수)
Figure 3. FFTS 모델 아키텍처
로컬모델은 인코더 전용 Transformer 구조(Fig. 3a) 기반, 즉 Self-Attention 기반 학습 진행. 유연성과 범용성 보장.
Patch Embedding 도입, 시계열 표현력 강화.
ATM 통해 복잡한 시계열 패턴 학습. 도메인 간 이질성 해결.
시계열 데이터의 개별 시점(time point)은 의미 정보(semantic info) 부족. → 인접 시점을 모아 "patch" 단위 토큰으로 생성. 다음과 같은 목적 달성 가능.
각 시계열 를 RIN으로 정규화, 분포 변화(distributuon shift) 완화. 는 의 overlapping pathes로 분할.
전체 patch 개수:
이질적 시계열이 가지는 유사한 패턴을 활용하기 위해 개별 시계열을 여러 timescale 표현으로 분리(decoupling). scale별 ATM 적용해 모델 이해도 증진.
Figure 4. 유사한 추세를 갖는 서로 다른 도메인과 timescale
ATM은 패턴 추출을 멀티태스크 문제로 접근. 다양한 timescale에 대한 표현 학습을 위해 독립적 연산 실시. ATM은 다음과 같이 구성:
도메인 별 시계열 복잡도가 달라 학습의 속도가 다름 → 클라이언트 별 전혀 다른 패턴 학습 → 글로벌 모델 일반화 성능 저하.
모든 클라이언트에 동일한 마스킹 전략 적용. 도메인 특화된 패턴을 암기하지 않고, 시계열의 추세적 관계 학습에 집중.
- 입력 시계열 일부를 가리고(masking), 모델이 이를 예측하도록 학습.
- 마스킹은 확률적으로 진행. 마스킹의 길이와 확률은 별도 파라미터로 관리
이질적 시계열로부터 공통 지식(common knowledge)을 추출해 통합된 기준의 글로벌 TSFM 구축해야.
ATM이 반환한 표현 기준으로 로컬 모델과 글로벌 모델 간 차이를 최소화하고 공통 패턴을 더 잘 반영하는 정규화 항 추가.
로컬 손실 함수: MSE 항+ ATM 정규화 항
글로벌 최적화 함수:
MLP + Layer 정규화로 구성된 adaptation head 사용 → 최소한의 파라미터 추가학습을 통해 다양한 시계열 작업에 효과적으로 적용 가능.
Figure 5. 다운스트림 작업에 따른 적응을 위한 FFTS 계략도
더 자세한 실험 결과는 논문 본문 및 부록을 참조바람.
Table 1. Main result of federated pretraining
기존 FL 기법(FedProx, pFedMe)은 이질적 시계열에서 효과가 떨어짐 (오히려 중앙집중 학습보다 나쁨).
FFTS는 중앙집중 방식(FFTS-Cen)보다도 더 낮은 MSE → 연합학습이 더 낫다는 결과.
Table 2. Ablation result
FFTS-A: ATM 제외. 사실상 FedAvg.
FFTS-B: 이질 지식 정렬 제외
FFTS 성능 개선의 원천은 ATM(시간 척도 모듈) 과 Alignment(정렬 전략). 두 요소를 제거하면 성능이 FedAvg 수준으로 떨어짐.
따라서 FFTS는 단순한 FL 적용이 아니라, 시계열 이질성을 다루는 특화된 구조적 개선 덕분에 강력한 결과를 얻음.
Table 4. Long-term forecasting
FFTS가 LLM 기반 SOTA 모델(Time-LLM) 보다 약 9.5% 향상.
단순 FL(FedAvg)만으로도 Time-LLM과 거의 비슷한 수준.
FL 기반 TSFM 사전학습이 매우 효과적임을 입증.
Table 5. Few-shot: 모델이 새로운 데이터셋/태스크를 만났을 때, 아주 적은 양의 학습 데이터(5%~10%) 만으로 학습(fine-tuning)하고 평가하는 시나리오.
FFTS가 Time-LLM보다 평균 4.1% 향상.
FedAvg조차 Time-LLM보다 좋은 결과 → 데이터 적은 환경에서도 FL 기반 TSFM이 강력.
Table 6. Zero-shot: 모델이 새로운 데이터셋/태스크를 만났을 때, 추가 학습(fine-tuning) 없이 바로 사용하는 시나리오.
FFTS가 Time-LLM 대비 평균 3.9% 성능 향상.
Zero-shot 환경에서도 중앙집중 학습보다 Federated 학습이 더 낫다는 결과.
Table 7. Short-term forecasting
FFTS는 단기 예측에서도 State of the Art(SOTA) 수준.
특히, 기존 통계적/딥러닝 모델(N-BEATS, Autoformer 등)을 안정적으로 능가.
Table 8. Imputation
FFTS가 GPT4TS 대비 평균 14.7% MSE 감소.
단순 FedAvg 기반 TSFM도 GPT4TS보다 성능 우수 → FL 기반 TSFM이 결측치 보완에서도 효과적.
즉, 데이터 손실이 흔한 현실 상황에서 FFTS가 매우 유용.
Table 9. Anomaly detection
FFTS가 GPT4TS 대비 +1.0% 성능 개선.
단순 FedAvg 기반도 GPT4TS보다 성능 높음.
즉, 산업용 IoT 환경(스마트 공장, 자율주행, 에너지 모니터링 등)에서도 FFTS가 가장 강력한 일반화 성능 발휘.
연합학습을 통해 학습하는 TSFM을 최초로 제시.
ATM을 통해 다중 timescale 패턴 효과적 포착.
도메인 특화 패턴 암기 방지. 공통 추세 학습 유도.
글로벌 표현 차이 줄여 모델 일관성 강화.
다양한 다운스트림 작업에 단일 아키텍처로 대응 가능한 범용성.
모든 다운스트림 작업에서 SOTA 성능 달성. 최신 LLM 대비 성능 우위 확보.
저는 아직은 모델링 경험이 적어 단일 도메인에서 단순한 구조의 시계열 데이터만 활용해 보았었기에, 시간 패턴을 변경한다던지, 서로 다른 도메인에서의 통합 모델링과 같은 접근이 저에게 새로운 자극이 되었습니다! 또한 문제 상황 - 제안 전략 - 결론 - 정리의 구조 덕분에 비교적 긴 호흡의 글임에도 방향을 잃지 않고 읽을 수 있어 좋았습니다!