16 심예슬1.png Yeseul Sim 2022.07.12

[ICLR 2022] 2편: Time Series Anomaly Detection

‘ICLR(The International Conference on Learning Representations, 표현 학습 국제 학회)’은 2013년에 최초로 개최되어 올해로 10주년을 맞은 딥러닝 분야 세계 최고 권위 학회입니다. 인공지능, 데이터 사이언스, 비전, 음성인식 그리고 로보틱스에 이르기까지 딥러닝을 활용하는 모든 분야에 걸친 최첨단의 연구와 논문을 나누는 공유의 장이기도 합니다. 지난 4월 온라인으로 진행된 ‘ICLR 2022’에서 소개된 논문을 LG AI연구원이 소개합니다.

- 1편: Efficient Transformer – Applied AI Research Lab 김정희 님
- 2편: Time Series Anomaly Detection – Applied AI Research Lab 심예슬 님
- 3편: Reinforcement Learning as a sequence modeling problem – Applied AI Research Lab 윤든솔 님


Introduction

Anomaly Detection(이상 감지)란 관측값이 데이터 내의 정상 패턴을 따르지 않아 기존 관측과 상이하게 판단되는 Anomaly를 탐지하는 task를 말합니다. 이는 다양한 도메인에서 활용될 수 있으며, 대표적으로 위험 관리, 비디오 보안, 사기 탐지 등의 분야에서 활용됩니다.

Anomaly Detection의 고전적인 방법에는 One-Class Support Vector Machine[1]과 Kernal Density Estimation[2] 등이 존재합니다. 이러한 전통적인 방법은 시계열 데이터가 가진 다양하고 넓은 범위의 dynamics를 완전히 학습하고, unseen real-word 시나리오를 일반화하기에는 한계가 있습니다. 특히, 최근 많은 센서, 장비 등의 발달로 수집되고 있는 고차원 데이터에 대해 성능이 떨어지는 것을 이미 많은 연구를 통해서 확인하였습니다.

 

Figure 1. 이상 감지 (Anomaly Detection) 주요 사례[3]

 

고전적인 Anomaly Detection 방식이 가진 성능의 한계를 극복하기 위해 최근 고차원 데이터(이미지, 음성)를 비롯해 복잡한 시계열 데이터 등에 딥러닝 모델을 적용하는 연구가 진행되고 있으며, 많은 성과를 냈습니다. 이번 글에서는 딥러닝을 기반으로 한 시계열 이상 감지 문제의 기본 개념과 접근 방법을 소개하고, 최근 ICLR 2022에서 발표된 두 개의 시계열 이상 감지 관련 논문을 소개하겠습니다.

 

딥러닝 기반 이상 감지

산업 장비, 우주 탐사선 등과 같은 시스템은 수많은 센서를 통해 데이터를 모니터링하고 수집합니다. 이때 시스템의 데이터는 연속적인 방식으로 측정되고 작동하므로 실시간으로 다양한 형태의 시계열 데이터가 수집됩니다. 시계열 이상 감지는 이런 복잡하고 다양한 대규모 데이터의 dynamics 속에서 주요한 Informative representation을 학습할 수 있어야 하며, 수많은 정상 데이터 속에서 극히 드문 비정상을 감지하여 이들을 쉽게 구별할 수 있는 조건을 만들 수 있어야 합니다.

만약 학습 데이터에 정상과 비정상 정답 라벨링이 충분하다면, 라벨링 된 정보를 모두 활용하여 test set에 대한 anomaly 여부를 판단하는 지도학습(supervised learning) 방식을 적용할 수 있습니다. 하지만, 실제 데이터에서는 비정상에 대한 라벨링이 존재하지 않으며, 비정상을 정의하는 것조차 불가능한 경우가 대다수입니다. 따라서 supervised learning 접근의 경우 모델이 한 번도 학습하지 못한 새로운 비정상 Test 데이터가 모델의 input으로 들어오게 되면 비정상 판단에 대한 대응이 불가능하다는 단점이 있습니다. 반면, 비지도 학습(unsupervised learning) 기반의 이상 감지는 정상 데이터만으로 학습할 수 있어 비정상에 대한 상세한 라벨링 등의 작업이 필요하지 않습니다. 또한, 데이터상에 존재하지 않는 완전히 새로운 Anomaly에 대해서도 대응할 수 있습니다.

 

Figure 2. 지도 학습과 비지도 학습[4]

 

따라서, 현실 세계의 데이터의 상황과 조건으로 인해 이상 감지 분야에서는 딥러닝 기반 unsupervised anomaly detection을 중심으로 연구가 진행되고 있습니다. 해당 연구의 기본 개념 및 이상 감지 모델의 학습은 Figure 3에서 확인할 수 있습니다. 이러한 방식은 정상 데이터만으로 Auto-Encoder 등의 복원 모델을 학습시켜 정상 데이터를 잘 복원할 수 있도록 하는 모델을 만듭니다. 이를 통해 딥러닝 모델이 복잡한 Input 데이터를 기반으로 정상 데이터를 정교하게 모델링하고 잘 Reconstruction 할 수 있게 됩니다.

 

Figure 3. Auto-Encoder 기반 이상 감지 모델 학습

 

Auto-Encoder 기반의 복원 모델이 잘 학습이 되었다면, 모델은 정상 데이터인 input에 대해서 input과 유사하게 데이터를 정상으로 복원할 수 있고, 이 경우 input과 output 간 오차가 작습니다. 반면, 모델이 한 번도 보지 못한 새로운 데이터인 input에 대해서는 모델이 정상 데이터만 알고 있으므로 여전히 정상 데이터로 복원하게 됩니다. 그렇게 되면 input과 output(복원 값) 간의 오차가 큽니다. 이 복원 오차(Reconstruction Error)를 기준으로 모델은 anomaly를 감지할 수 있게 됩니다.

 

Figure 4. Auto-Encoder 기반 이상 감지 모델 Inference

 

이러한 기본 개념을 바탕으로 업계에서는 단순한 Auto-Encoder 구조에서부터 Variational Auto-Encoder, GAN 구조, Adversarial Auto-Encoder 등의 다양한 모델 구조를 기반으로 한 이상 감지에 관한 연구가 활발히 진행되고 있습니다[5,6,7]. 특히 시계열 데이터의 경우 시계열 데이터 정보를 잘 반영하기 위해서 RNN, ConvLSTM 구조 등을 활용한 모델들이 제안되고 있습니다.

하지만, 현재 이러한 단순한 딥러닝 모델들도 몇 가지 한계점을 가지고 있습니다. 데이터의 복원에 대한 모델의 학습 능력이 너무 뛰어나, 비정상 데이터조차도 잘 복원하는 경우가 발생합니다. 또한, LSTM 등의 구조를 활용할 때 시간이 흘러가면서 hidden representation에 대한 정보가 오히려 손실되기도 합니다. 이때 이상 데이터 이전에 수많은 정상 데이터가 존재한다면 비정상 데이터가 묻히는 경우도 발생합니다. 모델은 각 time step에서 reconstruction error를 계산하여 비정상 여부를 판단하는데 이때 point로 계산이 되기 때문에 시계열의 temporal context를 반영할 수 없게 됩니다.

이번 ICLR 2022에서도 이상 감지 문제를 해결하고자 하는 연구들에 관한 논문이 다수 제출되었으며 그 중 특히 시계열 데이터를 대상으로 한 두 개의 논문을 소개하겠습니다. 두 개의 논문 모두 시계열 데이터에 적합한 모델 구조와 방법론을 제안해 벤치마크 데이터 세트를 대상으로 한 시계열 데이터 이상 감지에서 높은 성능을 확보할 수 있었습니다.

 

Anomaly Transformer

첫 번째 논문은 “Anomaly Transformer: Time Series Anomaly Detection with Association Discrepancy”[8]입니다. 제목에서 확인할 수 있듯이 이 논문에서 제안하는 것은 Transformer를 활용한 이상 감지 기법입니다. Transformer는 2017년 구글에서 발표된 이후 NLP 분야에서 비약적인 발전을 가지고 온 딥러닝 모델 구조입니다. 본 논문에서는 기존의 transformer 구조를 이상 감지에 적합하게 변경하여 anomaly transformer로 활용할 수 있도록 하는 구조를 제안하였습니다. 본 논문에서 제안하는 아이디어를 이해하기 위해서는 저자가 정의하고 제시한 아래의 3가지 용어를 알아야 합니다.

- Series Association: 각 time point에서 전반적인 시계열 데이터의 temporal context 정보 association
- Prior Association: 시계열 데이터의 adjacent-concentration association
- Association Discrepancy: 각 time point에서 prior-association과 series-association 간의 차이


본 논문에서는 prior association, series association이라는 term을 제안하고, 시계열 데이터에서 이 두 값을 추출하여 두 값의 차이를 비정상의 기준으로 삼고 있습니다. 또한, 이상 감지를 위해 아래와 같이 몇 가지 inductive bias idea를 제안하고 있습니다.

- 이상치는 희소하기 때문에 전반적인 시계열에 강한 association을 갖지 않고 다른 경향을 보인다
- 반면 정상 데이터는 인접한 영역뿐만 아니라 전체 time-series에 informative association을 보인다
- 시계열의 continuity 특성으로 이상치는 인접한 영역에 대해서 concentrate 한다
- 이러한 이상치의 특성이 association discrepancy로 나타날 것이다


본 논문에서 제안하는 모델 구조와 아이디어는 Figure 5와 같으며, 크게 Prior Association 추출, Series Association 추출, Minmax Strategy 등 세 가지로 나눌 수 있습니다. Prior association은 앞서 정의한 대로 시계열 데이터에서의 근접한 information/prior를 의미합니다. 이 Prior association은 각 data point에서 근접한 데이터 간의 association(상관성)을 추출합니다.

 

Figure 5. Anomaly Transformer 모델 구조

 

Prior association을 추출하는 과정은 다음과 같습니다. 우선 Gaussian kernel을 이용하여 relative temporal distance에 대한 prior를 계산합니다. 이때, learnable scale parameter인 σ를 다양한 시계열 pattern에 적용하여 prior association을 계산할 수 있게 됩니다.

Series association은 prior association 보다 긴 시간 동안의 데이터의 전반적인 관계성을 계산하는 데 쓰입니다. 본 논문에서는 기존 transformer 모델에서의 attention 계산값과 그 산출 과정을 그대로 series association의 추출에 활용하였습니다. 앞서 소개한 Prior association과 series association의 산출을 식으로 표현하면 아래와 같습니다.

 
 
 

본 논문에서는 이 두 association 값을 바탕으로 prior-association과 series-association 사이의 차이를 의미하는 association discrepancy라는 개념을 제안했습니다. 두 분포 간의 차이를 계산하는 방법은 다양하지만, 본 논문에서는 Kullback-Leibler divergence 값으로 두 분포의 차이를 계산했고, association discrepancy 값을 정상/비정상 판단 기준으로 활용할 수 있다는 것을 주요 아이디어로 제시했습니다. 이를 통해 각 layer 별로 prior association, series association을 계산할 수 있고, L개 layer의 평균값을 association discrepancy로 계산하였습니다. Association discrepancy를 계산하는 수식은 아래와 같이 표현할 수 있습니다. S, P는 각각 series association과 prior association을 의미합니다.

 
 

본 논문에서 제시하는 inductive bias에 의하면, 비정상 시점에는 근접한 분포를 반영한 prior association과 전체 series association이 attention하고 있는 분포가 동일하기 때문에 association discrepancy가 작게 나타납니다. 반면, 정상 데이터의 경우 전체 시계열 데이터의 series association이 attention하고 있는 부분이 정상 데이터 근방이 아니기 때문에 association discrepancy가 크게 나타납니다.

이렇게 도출한 association discrepancy를 anomaly transformer 모델 학습을 위한 loss function으로 활용하였습니다. 이 경우 비정상에 대한 라벨이 없는 상황으로 가정한 unsupervised task로 학습하기 때문에 reconstruction error와 association discrepancy를 모두 Loss로 활용하게 됩니다. 모델이 학습되면서 reconstruction error는 최소화하면서 association discrepancy는 최대화합니다. 즉, 학습에 활용되는 정상 데이터에 대해서 높은 복원력을 가지면서, prior Association과 series Association 간의 분포 차이가 벌어지도록 모델이 학습되는 것입니다.

 
 

또, 본 논문에서는 비정상의 정도를 판단하는 anomaly score에는 reconstruction error와 association discrepancy를 모두 활용하였습니다. 정상의 경우 reconstruction error는 작게 나타나고, association discrepancy는 크게 나타납니다. Anomaly의 경우, reconstruction error는 크게 나타나고 association discrepancy가 작게 나타나 anomaly score가 커지게 됩니다. 간혹 anomaly 데이터에서 의도와 달리 복원이 잘되어서 reconstruction error가 작게 나타나는 경우가 발생하기도 합니다. 그러나 이런 경우에도 여전히 association discrepancy는 작게 나타나기 때문에 비정상 case를 잘 검출할 수 있습니다. Anomaly score를 식으로 표현하면 아래와 같습니다.

 
 

Anomaly transformer 구조의 성능을 확인하기 위해 본 논문에서는 아래 6가지 데이터 세트를 활용하였습니다. 아래 테이블의 데이터 세트는 시계열 이상 감지 모델을 검증할 때 많이 활용되는 데이터 세트로 서버의 비정상 상황, NASA에서 공개한 인공위성의 비정상 상황, NeurlPS 2021에서 공개된 Time Series Benchmark 데이터 세트[9] 등으로 이루어져 있습니다. Dimension은 시계열 데이터의 Feature 개수를 의미하며, AR은 실제 성능 검증을 위한 데이터 세트 내에 분포하고 있는 실제 anomaly의 비율을 의미합니다.

 
 

OCSVM. Isolation Forest 등 기존의 anomaly detection 논문들과 anomaly transformer의 성능 비교는 아래 표에서 확인할 수 있습니다. Anomaly transformer가 F1 score를 기준으로 모든 데이터 세트에서 가장 뛰어난 성능을 보이고 있습니다.

 
 

실제 NeurlPS-TS 데이터 기준 검출 결과를 시각화해서 확인해 보면, anomaly transformer가 기존의 다른 모델들은 검출할 수 없었던 비정상 데이터를 검출한 것을 확인할 수 있습니다. 첫 번째 행은 실제 비정상 패턴을 포함한 검증용 시계열 데이터를 나타내고, 아래 행은 차례로, BeatGAN, Deep-SVDD, LSTM-VAE, Anomaly Transformer의 검출 결과를 나타냅니다. 비정상 구간에 대해서 anomaly score가 높게 나타나면 비정상을 제대로 검출한 것으로 볼 수 있습니다. Figure 6에서 빨간색 box로 표시된 그래프들은 검출하지 못한 case 들입니다. 정상과 비정상 구간에 대한 score 차이가 두드러지게 나타나지 않고 비정상 검출에 실패한 것을 확인할 수 있습니다. 반면, Anomaly transformer의 경우 비정상 구간에서 anomaly score가 상승함으로써 비정상 구간을 정확히 검출할 수 있었습니다.

 

Figure 6. NeurlPS-TS 기준 실제 anomaly 검출 case

 

Anomaly transformer 논문에 대해 요약을 하자면, 우선 association discrepancy라는 새로운 anomaly 기준을 제안하였으며, transformer 구조에 기반하여 시계열 self-attention을 활용한 이상 감지 모델 구조를 제시했습니다. 본 논문은 간단한 inductive bias를 모델로 구현하여 다양한 시계열 벤치마크 데이터 세트에서 개선된 성능을 입증하였습니다. 다만, 논문에서 제안하는 모델에 대한 이론적 설명, 근거 증명은 부족한 상황입니다

 

Graph Augmented Normalizing Flow

두 번째 논문은 “GRAPH-AUGMENTED NORMALIZING FLOWS FOR ANOMALY DETECTION OF MULTIPLE TIME SERIES[10]”입니다. 제목에서도 알 수 있듯이 graph 구조와 normalizing flow를 사용하여 시계열 데이터에서의 이상 감지를 시도한 논문입니다. 논문에서 활용한 normalizing flow의 개념에 대해 간단하게 설명하겠습니다.

Normalizing flow는 복잡한 확률분포를 예측하기 위해 제시된 방식입니다. Normalizing flow는 단순한 확률 분포(주로 gaussian distribution)에서부터 일련의 역변환 함수를 적용하여 점차 복잡한 확률 분포로 변환해 나갑니다. 이러한 일련의 변환과 변수 변환 이론을 통해 우리는 단순한 분포로부터 새로운 변수들을 반복해서 대체하게 되고 결과적으로 목표하는 최종 변수의 확률 분포를 얻을 수 있게 됩니다. Normalizing flow의 장점은 GAN이나 VAE와 달리 직접적으로 모델의 입력 데이터에 대한 likelihood를 계산할 수 있다는 것입니다. 다시 말해, explicit, tractable한 모델을 개발할 수 있다는 것을 의미합니다.

 

Figure 7. Normalizing Flow 개념[11]

 

본 논문은 multivariate time series 데이터를 graph 형태로 변환한 상태에서 normalizing flow를 활용하였습니다. Multivariate time series에서 각각의 input을 하나의 node로 생각하면 Bayesian network로 표현할 수 있습니다. N개의 Variable에 대한 Bayesian network의 joint distribution은 아래 식과 같이 표현할 수 있습니다. 이때, Xi는 multivariate time series를 의미하고, paXi=Xi:Aij0Xi의 parents set을 의미합니다. 각 시점 t에서, Xti의 density는 graph의 parents뿐만 아니라, 이전의 history, X1:t-1i의 영향도 받기 때문에 아래와 같은 식으로 표현됩니다.

 
 

데이터의 길이가 모두 다르기 때문에, conditional information인 paXi, X1:t-1i이 parameterization으로 바로 활용될 수는 없습니다. 다만, 본 논문에서는 제안한 graph 기반의 dependency encoder 모델을 통해 conditional information을 정해진 길이의 vector dti로 축약할 수 있고, 이때 conditional normalizing flow pXtipaXi1:t,X1:t-1ipXtidti와 동일하게 됩니다.

본 논문에서 제안하는 전반적인 모델 구조는 아래 Figure 8과 같습니다. 앞서 언급한 Bayesian network를 토대로 input 데이터를 변형하고 adjacency matrix를 계산해 graph convolution layer input으로 활용합니다. 원본 시계열 데이터의 경우 시계열 데이터에 적합한 RNN 구조를 활용해 hidden state H를 추출합니다. 추출된 hidden state H는 Graph Convolution layer의 input으로 활용되어, 통합된 Dependency representation Dt=dt1,,dtn 값을 계산하게 됩니다. 전체 Dependency Encoder의 구조는 이 Graph Convolution과 RNN을 모두 활용하고 있는 형태입니다. 시계열 데이터로부터 각 시점의 hidden state hti와 dependency representation Dt를 추출하는 식은 아래와 같습니다.

 
 

Dependency encoder를 통해 추출한 representation dti로부터 normalizing flow를 활용해 xti의 conditional density를 계산할 수 있게 됩니다. 이 식을 토대로 최종적으로 multiple time series X에 대한 log density 식을 산출하게 됩니다. Conditional density와 log density를 구하는 식은 각각 아래와 같습니다.

 
 

Figure 8. GANF (Graph Augmented Normalizing Flow) 구조

 

Normalizing flow의 일반적인 학습에 따라, objective 함수는 학습 데이터의 joint density를 활용했습니다. 이는 실제 데이터의 distribution과 flow로 계산된 distribution 간의 Kullback-Leibler divergence와 동일합니다. 이를 Adjacency matrix에 대한 제약과 함께 식으로 표현하면 아래와 같습니다.

 
 

모델을 학습시킨 후, 정상 비정상을 판단하는 기준인 anomaly score는 input multivariate time series의 log density (logpX)를 기준으로 합니다. 비정상의 경우, 정상 데이터 대비 드물게 존재하기 때문에 density가 낮게 나타나는 것을 가정하고 있습니다.

본 논문에서 제안하는 모델의 성능을 검증하기 위해서 PMU-B, PMU-C, SWaT 데이터 세트를 사용하였습니다. PMU-B, PMU-C는 미국의 Smart Grid에서 수집된 1년 치 Phasor Measurement Unit 데이터입니다. Domain 전문가들이 간헐적으로 발생하는 event 들을 anomaly로 라벨링 한 상태의 데이터이며, Open 된 데이터는 아니고 저자가 연구를 위해 활용하고 검증한 데이터 세트입니다. 저자는 추가로 공개 데이터인 SWaT에서도 검증을 진행하였습니다. 또한 제안하는 모델 구조와의 비교를 위해 기존에 연구된 딥러닝 계열 모델과 해당하는 데이터 세트 간의 성능을 비교했습니다. 성능 비교 기준은 AUC-ROC를 사용하였으며, AUC-ROC가 클수록 좋은 성능을 가진 모델로 판단했습니다. 아래 표에서 확인할 수 있듯이 저자가 제안하는 GANF (Graph Augmented Normalizing Flow)가 나머지 다섯 개 baseline 모델 대비 세 개의 데이터 세트 대상으로 모두 가장 좋은 성능을 보이고 있습니다.

 
 

실제 AUC-ROC 그래프를 살펴보면 아래와 같습니다. 아래 그래프에서 초록색 실선이 GANF의 성능을 나타내는데, PMU-B, PMU-C, SWaT 등 세 개의 데이터 세트에 대해서 모두 가장 좋은 성능을 보이는 것을 확인할 수 있습니다.

 

Figure 9. 데이터 세트를 대상으로 한 이상 감지 모델의 ROC Curve

 

실제 시계열 데이터 이상 감지에서 모델이 어떻게 성능을 내고 있는지 아래 그래프에서 확인할 수 있습니다. GANF 모델은 low density를 기준으로 anomaly를 측정하기 때문에 비정상 시점에선 Anomaly의 기준이 되는 density가 작게 나타나게 됩니다. 아래 그림에서도 빨간색 실선으로 표시되어 있는 anomaly 시점에 파란색 원그래프의 anomaly score가 낮게 떨어지는 것을 확인할 수 있습니다.

 

Figure 10. 실제 시계열 데이터에서의 이상 감지 결과

 

GANF (Graph Augmented Normalizing Flow) 논문에 대해 요약하자면, 본 논문에서는 다변량 시계열 데이터를 graph에 기반한 input 형태로 변형하여 활용하였으며 normalizing flow를 활용하여 input 데이터의 density를 학습시키고 계산하는 방식으로 비정상을 판단하는 모델을 제안하였습니다. 실제 운영 중인 데이터 세트를 대상으로 모델을 검증한 것은 의미가 있으나, 벤치마크 데이터 세트에서의 성능은 한 개의 세트에 대해서만 계산되어 성능에 대한 추가 검증이 필요합니다. 시계열 데이터 간 상관관계가 높은 센서 데이터나 특정 데이터들에 대해서는 본 논문에서 제안하는 GANF (Graph Augmented Normalizing Flow)가 의미가 있을 것으로 생각됩니다.

 

Conclusion

지금까지 ICLR 2022에서 발표된 시계열 데이터를 대상으로 한 이상 감지 관련 연구를 소개했습니다. 현실 세계에서 이상 감지는 라벨링의 부재로 인해 Unsupervised Learning에 기반하여 접근할 수밖에 없습니다. 이 때문에 딥러닝 Anomaly detection 초기에는 주로 reconstruction error 혹은 embedding space 상에서의 distance를 이용하여 비정상을 추출하곤 하였습니다.

오늘 소개한 두 논문에서는 모두 데이터나 문제 Case에 대해 어느 정도의 inductive bias를 가지고 데이터 상황에 맞게 모델을 학습시키며 모델의 구조에 적합하게 이상 검출의 기준 anomaly score를 설계했습니다. 각 논문에서 제안한 방법에서 더 발전해 어느 상황에서나 납득할 수 있고 적용할 수 있는 inductive bias 기반 모델과 방법론이 연구된다면 시계열 데이터에 대한 이상적인 anomaly detection 기술을 확보할 수 있을 것이라고 생각합니다.

참고
[1] Scholkopf, Bernhard, et al. "Estimating the support of a high-dimensional distribution." Neural computation 13.7 (2001): 1443-1471.

[2] Parzen, Emanuel. "On estimation of a probability density function and mode." The annals of mathematical statistics 33.3 (1962): 1065-1076.

[3] Chalapathy, Raghavendra, and Sanjay Chawla. "Deep learning for anomaly detection: A survey." arXiv preprint arXiv:1901.03407 (2019).

[4] Goldstein, Markus, and Seiichi Uchida. "A comparative evaluation of unsupervised anomaly detection algorithms for multivariate data." PloS one 11.4 (2016)

[5] An, Jinwon, and Sungzoon Cho. "Variational autoencoder based anomaly detection using reconstruction probability." Special Lecture on IE 2.1 (2015): 1-18.

[6] Akcay, Samet, Amir Atapour-Abarghouei, and Toby P. Breckon. "Ganomaly: Semi-supervised anomaly detection via adversarial training." Asian conference on computer vision. Springer, Cham, 2018.

[7] Beggel, Laura, Michael Pfeiffer, and Bernd Bischl. "Robust anomaly detection in images using adversarial autoencoders." Joint European Conference on Machine Learning and Knowledge Discovery in Databases. Springer, Cham, 2019.

[8] Xu, Jiehui, et al. "Anomaly transformer: Time series anomaly detection with association discrepancy." arXiv preprint arXiv:2110.02642 (2021).

[9] Lai, Kwei-Herng, et al. "Revisiting time series outlier detection: Definitions and benchmarks." Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 1). 2021.

[10] Dai, Enyan, and Jie Chen. "Graph-Augmented Normalizing Flows for Anomaly Detection of Multiple Time Series." arXiv preprint arXiv:2202.07857 (2022).

[11] https://lilianweng.github.io/posts/2018-10-13-flow-models/