[논문 리뷰] Towards a Rigorous Evaluation of Time-Series Anomaly Detection

뱅모·2023년 8월 1일

2023 하계 Paper Review

목록 보기
2/4
post-thumbnail

본 Paper Review는 고려대학교 스마트생산시스템 연구실 2023년 하계 논문 세미나 활동입니다.
논문의 전문은 여기에서 확인 가능합니다.

Abstract

  • 최근 많은 time-series anomaly detection (TAD) 연구들은 높은 F1 score 성능을 보였으나 이는 Point adjustment (PA)라고 불리우는 peculiar evaluation protocol을 scoring 전에 적용한 결과임

  • 하지만 PA는 detection performance를 overestimate하고 심지어는 random anomaly score가 SOTA 성능으로 보이도록 하기도 함

  • 따라서 misguided ranking으로 이끌 위험이 있음

  • 이에 본 논문은 새로운 baseline과 evaluation protocol을 제안하고자 함

  • TAD 모델에 대해 엄격한 평가 지표를 제시


1. Introduction

Consequences of system failures를 탐지해내는 것이 중요해지면서
Anomaly detection (AD) 이름으로 연구가 진행되고 있다.
특히 multivariate time-series AD (TAD)에 있어서 많은 연구들이 각자의 우수성을 F1-score를 통해 보여주고 있는 추세이다.

하지만, 최근 TAD 방법론들은 F1 score를 계산하기 전에
point adjustment (PA)라고 불리는 peculiar evaluation protocol를 먼저 적용한다.
PA는 contiguous anomaly segment 안에 한 moment라도 제대로 anomaly로 탐지한다면, 전체 segment가 anomaly로 옳게 탐지되었다고 보는 방법이다.
해당 아이디어를 사용한 이유는 anomaly period 안에 single alert만으로도 system recovery를 위한 행동을 취하기 충분하다는 것이다.

PA는 model performance를 overestimating 할 위험이 존재한다.

맨 위에 있는 것처럼 anomaly score를 산출해서 threshold를 넘는지 여부를 판단하여 이상을 탐지해야 이상적이지만, PA를 적용한다면 맨 아래와 같이 random anomaly score들 중 우연하게 anomaly segment에서 한 점이 넘는다면 맨 위 그림과 같은 성능을 보이게 된다.

그래서 PA를 적용한 결과 비교 모델들은 나름 유명한 TAD 모델들임에도 불구하고 Random score가 가장 높은 F1 score를 보임을 알 수 있다.

PA 만이 TAD 방법론들의 유일한 문제는 아니다.
분류 문제를 한다고 했을 때 50%면 Random guess니까 이보다 낮으면 안된다는 baseline이 존재하는데,
TAD task에 있어서는 그런 baseline이 존재하지 않는다.
따라서 저자는 그림 (b) 의 PA가 적용되지 않는 부분에 Baseline 성능을 함께 보여주며 저 정도는 넘어야 한다고 주장한다. 하지만 그림에서도 알 수 있듯, GDN을 제외하고는 전부 넘지 못하는 것을 볼 수 있다.

본 논문의 Contribution은 다음과 같다.

(1) PA 방법이 기존 TAD 방법론들의 detection 성능을 overestimate한다는 것을 증명
(2) PA 방법 없이는 기존 TAD 방법론들이 baseline 보다 더 나은 향상을 보여주지 못했다는 것을 증명
(3) 새로운 baseline을 제안하고 TAD의 엄격한 평가를 위한 evaluation protocol을 제안


2. Background

2.1 Types of Anomaly in Time-series Signals

TAD dataset에 존재하는 anomaly의 유형은 다양하다.

  • Contextual anomaly : normal signal과 다른 shape을 보여주는 anomaly
  • Collective anomaly : 일정 기간동안 작은 양의 noise가 누적되는 anomaly
  • Point anomaly : signal 값이 갑작스럽게 증가하거나 감소하는 anomaly

2.2 Unsupervised TAD

일반적인 AD 상황은 학습 시에 normal 데이터만 사용할 수 있다.
따라서 normal signals에 존재하는 shared pattern을 학습할 수 있는 unsupervised 방법론이 적절하다.
abnormality 정도에 따라 다른 anomaly score를 산출하는 것을 최종 목적으로 한다.
먼저, Reconstruction 기반 방법은 정상의 패턴을 복원할 수 있도록 학습한 다음,
복원 오차가 큰 input을 anomaly로 판단한다.
다음으로, Forecasting 기반 방법은 정상 input을 사용해서 예측한 다음 실제값과 예측값의 차이가 크게 발생하면 anomaly로 판단한다.


2.3 Assessment of TAD Evaluation

본 연구 전에도 TAD evaluation의 문제점을 지적한 연구들이 존재했다.
Wu and Keogh 2021 : one-linear의 simple detector로도 충분한 dataset들이 존재함.
본 연구는 risk of PA's overestimation & absense of baseline을 문제점으로 지적한다.


3. Pitfalls of the TAD Evaluation

3.1 Problem Formulation

다른 시계열 이상탐지 Task와 유사하게, N개의 다변량 센서로부터 수집된 데이터셋을 활용한다.
시계열 길이는 T이며, 그보다 짧게 하여 window 별로 anomaly score를 계산하여 threshold보다 커지면 이상으로 판단하는 방식이다.

이 때 anomaly scroe는 복원 오차를 사용하곤 한다.

성능 지표로는 다음과 같이 precision (P), recall (R), F1 score를 주로 사용한다.

TAD test dataset에서는 여러 개의 anomaly segment 들이 포함되어 있고, 각각은 일정한 time steps 동안 지속된다. 만약 PA 방식을 적용한다면 anomaly segment가 시작되고 끝나는 시점 중 하나라도 이상임을 밝혀내면 전부 맞혔다는 의미이다.

수식으로 나타내면 위와 같고, PA를 적용하지 않은 F1 score와 구분하기 위해 F1PAF1_{PA} 로 표기한다.


3.2 Random Anomaly Score with High F1PAF1_{PA}

F1 score는 P와 R의 조화평균으로 이루어져있다.
P와 R은 TP, FN, FP로 이루어져있다.
이제 PA를 적용했을 시에 F1PAF1_{PA}가 증가할 수 밖에 없는 이유를 설명하자면,
결론적으로 PA는 FP가 고정되어있는 상황에서, TP를 증가시키고, FN을 감소시키기 때문이다.

이게 원래 Recall에 대한 정의인데,

PA를 적용하면 위와 같이 바뀐다. 여기서 γ\gamma는 anomaly ratio이다.

Precision은 위와 같이 바뀐다.

일반적으로 anomaly ratio γ\gamma는 0과 0.2 사이이며, tetst_e - t_s는 100부터 5000 사이로 되어있다.

만약 Uniform 분포를 따르도록 하는 Random한 anomaly score를 만들어놓고 γ\gamma를 0.05로 고정했을 때, Threshold가 1에 가까워질수록 F1PAF1_{PA}가 1에 가까워지는 것을 볼 수 있다.

3.3 Untrained Model with Comparably High F1

Untrained model로 부터 얻어지는 anomaly score도 어느 정도는 informative하다고 합니다.

그 이유는 DNN은 일반적으로 Gaussian distribution으로부터 얻어지는 random한 weight으로 초기화되기 때문입니다. 이 때 Gaussian distribution의 평균은 0이고 표준편차는 1보다 작게 설정됩니다.

보통 복원모델이든, 예측모델이든간에 anomaly score는 input과 output의 Euclidean distance로 결정되며 이는 input window 값에 비례합니다.

Point anomaly의 경우, 위 식처럼 학습되지 않은 경우의 anomaly score여도 높게 나온다는 것이 뒷장에서 증명되었다고 합니다. 따라서 window size가 커지면 자연스럽게 F1 score가 좋게 나온다는 것입니다.


4. Towards a Rigorous Evaluation of TAD

4.1 New Baseline for TAD

분류 Task의 경우, baseline 정확도는 일반적으로 random guess이다.
따라서 random guess 보다만 높으면 improvement가 있다는 뜻이다.

유사하게 TAD의 경우에도 기존 방법론들과 비교할 뿐만 아니라,
baseline detection performance와도 비교해야할 것이다.

저자는 F1 score를 기준으로, single-layer LSTM으로 구성되어 있는 untrained autoencoder
극단적인 예시로 input과 상관없이 항상 0 값을 내뱉는 model의 anomaly score를 제시한다.


4.2 New Evaluation Protocol PA%K

PA가 detection performance를 overestimating할 가능성이 높기 때문에, 일단 빼고 생각한다.

그리고 또 고려해야할 점은 test data distribution에 따라서 baseline 성능을 뽑으면 너무 underestimate 될 위험도 존재한다는 것이다.
이유는 불완전한 test set labeling 때문에, anomalies로 라벨링 되어있는 몇몇 signals은 normal signals보다 더 많은 통계량을 공유하기 때문이다.

예시를 들어 설명하자면 다음과 같다.
파란 점이 정상, 주황 점이 비정상이라고 했을 때, (a)와 (c)는 확실히 다른 모습을 보인다.
하지만 (b)의 경우 비정상임에도 불구하고 정상과 유사한 모습을 보인다.
이런 경우 (b)와 같은 signals을 탐지할 수 없기 때문에 detection 성능이 underestimate 될 수밖에 없다.

따라서 저자는 Overestimation과 Underestimation 문제를 모두 해결하기 위해서 위와 같이 수식을 바꿨다.
저자는 기존 TAD metrics을 아예 대체하겠다는 뜻이 아니라, 그들과 함께 쓰면 좋을 것 같다고 제시한다.

여기서 K는 0과 100 사이에서 수동으로 선택하는 값이고, 만약 test set label이 믿음직하다면, 더 큰 K도 허용될 수 있다.
수식을 살펴보면 어려울 것 없이 PA 방식을 조금 더 엄격하게 사용하는 것처럼 이해하면 될 것이다.


5. Experimental Results

5.1 Benchmark TAD Datasets

  • Secure water treatment (SWaT)
  • Water distribution testbed (WADI)
  • Server Machine Dataset (SMD)
  • Mars Science Laboratory (MSL)
  • Soil Moisture Active Passive (SMAP)

5.2 Evaluated Methods

  • USAD
  • DAGMM
  • LSTM-VAE
  • OmniAnomaly
  • MSCRED
  • THOC
  • GDN
  • Case 1. Random anomaly score : uniform 분포에서 랜덤하게 생성되는 anomaly score
  • Case 2. Input itself as an anomaly score : input 값에 상관없이 0을 내뱉도록 해서 anomaly score 산출
  • Case 3. Anomaly score from the randomized model : Gaussian 분포 N(0, 0.02)를 통해 초기화된 파라미터를 이용해서 anomaly score 산출

5.3 Correlation between F1PAF1_{PA} and F1F1

F1이 가장 보수적인 detection 성능 지표라면, F1PAF1_{PA}랑 어느 정도 연관은 있을 것이다.

Pearson correlation coefficient (PCC)와 Kendall rank correlation coefficient (KRC) 결과는 위와 같은데, correlation이 존재한다고 보기 어렵다.
따라서 F1PAF1_{PA}만을 사용해서 detection performance를 평가하기에는 위험이 존재한다.


5.4 Comparison Results


Case 1, 2에는 어떠한 model inference도 사용되지 않았으며, Case 3의 경우 가장 간단한
encoder-decoder achitecure with LSTM layers가 사용되었다.

Case 1,2,3 는 5개의 다른 seed로 반복되었고, 평균 값을 성능으로 사용했다.

결과를 간단하게 살펴보면, PA를 적용했을 시에는 모델 성능들이 좋았으나, 이는 Random하게 anomaly score를 부여했을 시에도 같은 결과이다.


5.5 Effect of PA%K Protocol

K에 따른 F1PA%KF1_{PA\%K} 성능 차이이다.


6. Discussion

논문을 통틀어서 계속 말해온 것은 TAD의 두 가지 문제점이다.
(1) PA가 detection 성능을 overestimate 한다.
(2) 성능 결과를 다른 모델들이랑만 비교하지, baseline과 비교하지는 않는다.

PA가 나온 이유에 대해서 생각해보면 test dataset의 incompleteness 때문이다.
사실 더 정제된 test dataset을 사용하면 되긴 하지만, 현실적으로 어렵다.
본 연구에서는 F1PA%KF1_{PA\%K}를 통해 이를 어느정도는 완화할 수 있다고 설명한다.

그리고 threshold도 detection 성능과 연관이 높은데, AUROC or AUPR을 써야한다.


7. Conclusion

  • PA는 TAD 모델의 능력을 overestimate 한다.
  • TAD를 위한 새로운 baseline을 제안 --> PA%K protocol
profile
KU. SPS Lab 대학원생

0개의 댓글