Di-Lab_Juhyun-Lyu_2a9910831.png Juhyun Lyu 2021.09.27

[ICML 2021] 3편: Spatio-temporal Time-series Forecasting in ICML 2021

ICML 2021(International Conference on Machine Learning 2021)은 올해로 38회째를 맞은, 매년 약 7만 명 이상이 참가하는 대규모 국제 학회입니다. 논문 채택률 20%, 임팩트 팩터 6.99로 AI 분야에서 가장 영향력 있는 인공지능 학회 중 하나이기도 합니다. 지난 7월 18일부터 24일까지 온라인으로 개최되었던 'ICML 2021'에 참관한 LG AI연구원의 세 연구원이 학회 내용 중 유의미한 논문을 골라 소개합니다.

- 1편: Neural Combinatorial Optimization in ICML 2021 - Di Lab 이강훈님
- 2편: Generative model for OOD detection in ICML 2021 - Di Lab 정혜민님
- 3편: Spatio-temporal Time-series Forecasting in ICML 2021 - Di Lab 유주현님



올해 ICML은 코로나 상황으로 인해 지난해와 마찬가지로 온라인으로 진행되었습니다. 각 분야별 키노트와 워크샵, 포스터 세션뿐만 아니라 소셜 모임들까지도 온라인으로 진행된 점은 매우 흥미로운 부분이었지만, 직접 발표를 참관하고 질문을 주고받으며 소통할 수 있는 기회가 온라인으로 제한되는 점은 다소 아쉬웠습니다. 그래도 다양한 분야의 훌륭한 발표들이 기록물로 제공되어 다시 열람할 수 있기 때문에, 관심이 있으시다면 ICML 2021 웹페이지를 방문하는 것을 추천합니다.


Time series forecasting

이번 ICML 2021에서 저는 평소 연구중인 Time series(시계열) 데이터를 다루는 연구들을 위주로 참관하였습니다. Time series 분야는 굉장히 빠르게 성장하고 있는 분야로서 세상의 많은 데이터들이 이러한 시계열로 기록되고 있기 때문에 다양한 분야에서 널리 활용되고 있습니다. 예를 들자면 날씨나 기후 변화를 예측하는 climate science, 주식 예측과 같은 경제 분야, 그리고 healthcare 분야에도 널리 활용되고 있습니다.

이러한 연구 분야들 중 현재 연구를 진행하고 있는 time-series forecasting 분야는 다음과 같습니다. 주어진 과거 time series 데이터를 기반으로 미래 시점의 데이터를 예측하거나 미래 시점의 data distribution을 예측하는 task입니다. 예를 들자면 미래의 수요를 예측하는 demand forecasting 분야나 상품의 가격을 예측하는 price prediction 분야 등이 있습니다.

Stock price prediction, 이미지 출처: Deep stock predictions(’20. arxiv)[1] 


미래 시점의 time-series 데이터를 예측하기 위해서는 주어진 과거 데이터들의 특성을 파악하고 이를 바탕으로 미래 시점의 데이터를 예측하게 되는데, 이때 대표적인 특성으로 trend와 seasonality 등을 예로 들 수 있습니다. 이 중 Trend는 time-series 데이터가 단위 기간 동안의 증가 혹은 감소하는 추세를 나타내는 특성이고, Seasonality는 일정 기간 마다 반복되는 주기성을 나타내는 특성이라 할 수 있습니다.


Spatio-temporal time-series forecasting

실용적인 부분이지만 time-series forecasting task를 수행할 때 주어지는 데이터를 기준으로 케이스를 나눠 본다면, 데이터의 특성 파악에 도움을 주는 부수적인 정보가 주어지는 경우와 주어지지 않는 경우로 나눌 수 있습니다.

먼저 부수적인 데이터로 ‘promotion 정보’나 ‘생산 계획’ 등의 정보가 주어진다면 앞으로의 수요가 증가 혹은 감소될 것을 예측하는데 큰 도움이 될 수 있을 것입니다. 하지만 이러한 부수적인 정보가 주어지지 않는 경우엔 주어진 time-series 데이터 내의 분석을 통해 특성을 파악하고 미래 시점을 예측해야 합니다.

주어진 데이터 내의 특성을 파악하는 분야 중 spatio-temporal time-series forecasting 분야는 time-series 데이터들 간의 상호 관계나 시간의 흐름에서 얻을 수 있는 특성을 파악하여 미래 시점을 예측하는 연구 분야입니다.

만약 한 종류의 시계열 데이터(univariate time-series data)가 주어진다면 시계열 내 시간 흐름에 따른 연관성(temporal correlation)만을 파악하여 미래 시점의 예측을 진행할 수 있을 것입니다. 하지만 여러 종류의 시계열 데이터(multi-variate time-series data)가 주어졌을 때는 성공적인 미래 예측을 위해 시계열 간의 상호 연관성(spatial correlation) 파악이 필수적으로 수행되어야 할 것입니다. 이때 시계열 간의 상호 연관성을 파악하고 모델링하는 것은 굉장히 복잡한 과정이며, 이를 파악하기 위해 딥러닝을 기반으로 한 다양한 연구들이 이루어지고 있습니다.

그중 최근 spatio-temporal time-series forecasting 분야에선 복잡한 시계열 간의 관계를 파악하기 위해 그래프 기반의 network architecture가 널리 활용되고 있습니다. 그래프의 경우 시계열 예측 외에 다양한 분야에서 활용되고 있는 개념으로 각 node 들이 주어진 데이터를 뜻하고, 다양한 데이터들의 관계를 edge를 통해 표현하는 데이터 표현 방식입니다. 이러한 개념을 소셜 네트워크에 적용하면 아래의 그림 같은 그래프로 표현할 수 있습니다.

Graph of Social Network


이번 ICML에 소개된 time-series 논문들 중 이러한 주어진 시계열 데이터의 특성을 파악하여 미래를 예측하는 그래프 기반의 spatio-temporal time-series forecasting 논문을 2편 소개하고자 합니다.

1. RNN with Particle Flow for Probabilistic Spatio-temporal Forecasting (PAL, Soumyasundar, et al., 2021) [2]
2. Z-GCNETs: Time Zigzags at Graph Convolutional Networks for Time Series Forecasting (Chen, Yuzhou, et al., 2021)[3]



RNN with Particle Flow for Probabilistic Spatio-temporal Forecasting(PAL, Soumyasundar, et al., 2021)[2]

이 논문은 saptio-temporal forecasting을 수행하기 위해 RNN과 GCN(Graph convolutional network) 을 결합한 형태의 구조를 제시하고, 기존 particle filter를 모델링한 particle flow를 제시하여 미래 시점 데이터를 예측하는 point forecasting과 distribution을 모두 수행하는 것을 목표로 합니다.

Motivation

기존의 SOTA 알고리즘들의 극복하기 위한 한계로 다음과 같은 것들이 제기되고 있습니다. Point forecast model들은 불확실성은 파악하지 않는다는 점이 있고, 수많은 probabilistic models들이 연구되어 불확실성을 파악할 수 있었지만 그동안 그래프를 활용한 연구는 없었다는 점입니다.

본 논문에서는 위에서 말한 한계점들을 극복하기 위한 novel contribution으로 첫 번째로 Univariate와 multi-variate에 모두 사용할 수 있는 RNN과 GCN을 결합한 형태의 프레임워크를 제안하고, 두 번째로 Graph convolutional learning과 probabilistic state-space model, 그리고 particle flow를 결합한 형태의 inference 과정을 제안했습니다.

Main Idea & Contributions



본 논문의 주요 아이디어를 요약하면 다음과 같습니다.

① State transition model : 위 그림의 녹색 State transition model 부분 RNN 과 GCN을 결합한 형태로 design(참고: AGCGRN (’20. NIPS)[4]) 하여 probabilistic state transition model을 구현하였습니다. State transition의 역할은 다음 단계의 state 로 posterior distribution?(: predictive distribution) 을 예측하는 것으로, 이전 단계의 time state(xt-1), observation(yt-1), covariance(zt-1) 의 입력을 받아 다음 단계의 predictive distribution을 출력해줍니다.

② Particle flow : 위 그림의 붉은색 부분 Particle flow는 State space model에서 prior distribution에 분포된 particle들을 recursive하게 posterior distribution으로 approximate하는 Particle filter를 모델링하였습니다. (참고: 논문의 Supplementary Material, Particle Flow Bayes’ Rule (’19. ICML)[5])



위의 그림에서 살펴보면 prior distribution에 분포되어 있던 particle들이 time step별로 particle flow를 거쳐 posterior distribution으로 migrate되는 것을 볼 수 있습니다.(λ : time interval) 논문의 경우에서 이야기하자면 state transition model에서 예측된 predictive distribution을 posterior distribution으로 migrate해주는 역할을 합니다.

③ Emission : 위 그림의 파란색 부분
Approximate한 posterior distribution()을 통해 recursive하게 미래 데이터(or distribution)를 predict () 하는 역할을 합니다.

위의 구조를 포뮬레이션하면 하기의 식과 같이 되는데, 논문에 의하면 아래의 식은 intractable한 형태입니다. 결국 위의 제안된 method 들을 통해 intractable 한 joint posterior 문제를 풀 수 있게 되었습니다.

 

추가적으로, 본 논문에선 probabilistic forecasting뿐만 아니라 point forecasting도 할 수 있다고 밝혔는데 이는 각각의 task에 loss function을 달리하여 그러한 결과를 얻을 수 있습니다.

- For point forecasting: MAE, MSE 

- For probabilistic forecasting: negative log posterior probability



Experimental Results and Analysis

① Baselines: 본 논문에선 성능 비교를 위한 SOTA 알고리즘으로 그래프 기반의 spatio-temporal point forecast model들뿐만 아니라 graph agnostic한 point forecast model들, 그리고 probabilistic forecast model 들도 함께 비교를 수행했습니다. 이렇게 다양한 baseline들의 성능을 비교한 이유는 최근 spatio-temporal model 서 그래프 기반의 모델들이 non-graph 모델보다 더 좋은 성능을 보인다고 논문에서 밝혔는데, 이를 증명하기 위한 것으로 생각됩니다.

② Dataset: 그래프 기반 모델의 비교를 위해서 Road traffic dataset(PeMSD3, 4, 7)을 활용했습니다. (PeMSD: 특정 지역 도로에 설치된 센서를 통해 수집된 traffic speed data로 설치된 센서를 지도상으로 표현하면 fixed graph라 생각할 수 있습니다.) Non-Graph 기반의 모델들의 경우 위의 데이터를 활용하는 것이 적합하지 않기 때문에 성능 비교를 위해 Electricity(전력 소모량), Traffic(traffic occupancy rate), Wikipedia(web link들의 click수) 데이터셋을 활용하였습니다.

③ Metrics: Point forecasting 성능 평가를 위해서 MAE, RMSE, MAPE 등을 활용하였으며, Probabilistic forecasting 성능 평가를 위해선 CRPS, Quantile Loss 등을 활용하였습니다. 


먼저 PeMSD 데이터를 활용한 point forecasting 실험을 통해서 대체로 그래프 기반의 모델들이 graph agnostic 모델보다 더 나은 예측을 한다는 것과, 제안한 AGCGRU(기존 AGCRN의 RNN을 GRU로 사용)에 flow를 더한 모델에서 대체로 좋은 성능을 얻을 수 있는 것을 확인할 수 있었습니다.

그리고 probabilistic forecasting 문제에 있어서도 제안된 flow를 더한 모델들이 기존의 graph agnostic 모델보다 더 나은 성능을 보임을 알 수 있었습니다.

lg ai research


Conclusion & Discussion

이 논문에서는 어떠한 forecast uncertainty를 표현해줄 수 있는 일반적인 형태의 Bayesian framework를 제시해주었는데, 이는 그래프 기반의 state space model과 Particle flow라는 새로운 method를 제안하여 가능할 수 있었습니다.

사실 time-series forecasting 연구를 처음 시작할 때 직관적으로 생각한 것은 probabilistic 정보를 기반으로 point-wise하게 미래 데이터를 예측하는 형태가 연구에 유용할 것이라는 생각을 했는데, 본 논문의 이러한 구조는 참고할 수 있는 인사이트를 제공해 준 것 같습니다. 다만 본 논문에서는 그래프를 형성하는 방법에 대한 제시는 별도로 없어 이 부분이 아쉬웠습니다. 이 부분은 향후 제가 연구를 통해 확장해 나가야할 숙제인 것 같습니다.


Z-GCNETs: Time Zigzags at Graph Convolutional Networks for Time Series Forecasting(Chen, Yuzhou, et al., 2021)[3]

이 논문은 Zigzag persistence라는 topological 정보를 활용할 수 있는 수학적 개념을 적용하여 time-series forecasting을 수행하는 모델을 제시한 논문입니다.

Motivation

기존의 deep learning model들은 선천적으로 정적인 특성을 갖고 있어서 systematical하게 time-dimension의 정보를 학습 과정에 반영할 수 없었고, 이로 인해 기존 접근들은 잦은 model update를 필요로 하고 시간에 지남에 따라 변화하는 환경에 적응하는 것이 힘들다는 한계점이 있다고 이야기합니다.

이러한 과거 한계점들을 극복하기 위한 방안으로 ‘가장 주목해야 하는 time-conditioned topological information을 모델 성능 향상에 활용’하기 위해 Zigzag persistence라는 수학적 개념을 deep learning model에 적용하는 방법을 제시했습니다.

Main Idea & Contributions

본 논문의 주요 아이디어는 다음과 같습니다.

① Time-aware zigzag persistence into time-conditioned graph structure
먼저 Zigzag persistence homology[6]라는 수학적 tool을 활용하여 topological feature를 time conditioned model에 활용할 수 있도록 했습니다. 이에 더해, Persistence homology는 간단히 그래프의 변형 과정(filtration 과정)에서 topological feature를 추출하기 위한 툴이라 말할 수 있습니다.

Graph filtration


Filtration는 간단히 말하면 그래프가 성장하는 시퀀스라고 이해할 수 있는데, 이 과정에서 발생하는 component(node, edge) 들의 생성과 소멸을 persistence diagram[7]을 통해 기록하고 결국 이 정보를 topological feature로 활용할 수 있습니다.

Persistence diagram


즉, 위의 persistence diagram을 참고했을 때 node 및 edge의 생성과 소멸에도 오랫동안 유지되는 component들은 그래프 상에서 좀더 중요한 topological information을 내포하고 있다고 생각할 수 있습니다.

Zigzag persistence homology는 persistence homology를 일반화한 형태로, 기존 persistence homology의 방향이 한쪽 방향이었다면 zigzag persistence homology에서는 양방향 filtration(zigzag filtration)이 가능합니다. 따라서 그래프 내에서 pairwise한 구조를 분석할 수 있도록 해줍니다.



② Zigzag persistence image(ZPI)
본 논문에서는 topological feature를 학습에 활용할 수 있도록 zigzag persistence image라는 method를 제안했습니다. ZPI는 topological 정보를 이미지의 형태로 축약해주어 딥러닝 모델을 통해 분석할 수 있도록 해줍니다. 이를 위해 persistence diagram의 정보들을 mapping, discretization, integration 등의 과정을 거쳐 image 형태로 만들어 줍니다.

Persistence image


③ Z-GCNETs



마지막으로 topological feature를 spatial-temporal feature와 함께 활용할 수 있는 네트워크 구조인 Z-GCNETs를 제안합니다. Z-GCNETs는 Extraction + Aggregation + Combination의 과정으로 이루어져 있습니다. 이 중 Extraction(위 그림의 붉은색 box)은 CNN을 활용하여 입력되는 ZPI에 포함된 spatial-temporal topological feature를 추출하고 학습합니다. Aggregation(위 그림의 파란색 box)은 Spatial-temporal topological information(spatial or temporal)과 graph convolution을 통해 변환되는 정보를 수집합니다. Combination(위 그림의 초록색 box)은 앞서 추출하고 수집한 spatial-temporal information과 spatial-temporal topological information을 결합하여 뒤의 GRU 단으로 넘겨주는 역할을 수행합니다.

Experimental Results and Analysis

① Baselines: 본 논문에서는 성능 비교를 위해 기존 spatio-temporal graph 모델들 뿐만 아니라 RNN 기반의 모델들, self-attention을 활용한 모델, 그리고 statistical time-series 모델들도 함께 활용하였습니다.

② Dataset: 성능 평가를 위해 활용된 데이터셋으로는 앞선 논문에서 활용한 Road traffic dataset(PeMSD4, 8)을 사용하였고, 추가적으로 암호화폐인 Ethereum token network dataset(Bytom and Decentraland)을 활용하여 price prediction test도 수행하였습니다. Ethereum token network 은 각 node 들이 사용자의 address를 뜻하고, edge가 transaction을 뜻하며, 하루의 일정 시점을 기준으로 daily transaction에 따라 형성되는 graph network 입니다. 하지만 활용되는 Ethereum network의 complexity가 매우 복잡하기 때문에 이 논문에서는 100 개의 node를 갖는 sub-graph 를 추출하여 사용했습니다.

③ Metrics: 성능 평가를 위한 metric 으론 MAE, RMSE, MAPE 등을 활용하였습니다.

실험 결과를 살펴보면 먼저 PeMSD data를 활용한 실험에서 Z-GCNETs이 다른 기존의 baseline 들보다 좋은 성능을 보였습니다.



또한 Ethereum token network를 활용한 실험에서도 가장 좋은 성능을 보였습니다.



위의 결과들은 spatio-temporal graph structure의 모델들 중 최근에 가장 좋은 성능을 보였던 AGCRN보다도 높은 성능이며, 논문에서는 이렇게 좋은 성능을 얻은 결과가 Z-GCNETs이 topological information을 잘 활용하고 있음을 보여준다고 밝혔습니다.

Conclusion & Discussion

본 논문에서는 제안한 zigzag persistence를 활용해 시간 경과에 따라 topological feature를 잘 추적할 수 있고, 추가로 제안한 time-aware zigzag topological layer를 통해 데이터의 time-aware topological 특성을 잘 학습할 수 있다고 밝혔습니다.

개인적인 생각으로는 먼저 time-series forecasting을 위해 topological information을 활용하는 시도 자체는 좋은 시도였다고 생각 했습니다. 하지만 기존에 topological information을 활용하는 시도는 선행 연구가 있었기 때문에, 본 논문의 main contribution으로는 zigzag persistence 개념을 적용한 것 정도가 되지 않을까 하는 생각이 들었습니다. 또한 기존의 topological information을 활용한 연구와 성능 비교가 되지 않은 점도 아쉬웠습니다.


Conclusion

이번 ICML 2021 학회를 통해 현재 관심사인 어떻게 하면 주어진 time-series data 내에서 최대한 많은 정보를 활용하여 좋은 성능의 forecasting 모델을 만들 수 있을 지에 집중하고 연구들을 살펴보았습니다. 이는 어찌 보면 제 개인에게는 어떠한 time-series data에도 항상 좋은 forecasting 성능을 내는 일반적인 모델을 만들어 내기 위한 과정이 아니었나 싶습니다. 이를 위해 첫 번째 논문에서는 distribution 정보를 활용하여 point-wise 예측에 활용할 수 있는 아이디어를 활용할 수 있고, 두 번째 논문에서는 topological information을 통해 최대한 time-series data를 활용할 수 있는 아이디어를 차용할 수 있을 것 같습니다.

사실 이번 학회 참석을 통해 얻은 이러한 인사이트의 차용뿐만 아니라 추가로 연구해야 할 분야가 많다는 숙제가 주어진 느낌이 들었습니다. 예를 들어 그래프 기반 모델을 활용하기 위해 변화하는 입력에 따른 graph generation에 대한 연구가 선행되어야 한다는 생각이 들었습니다.

현재 LG AI 연구원은 다양한 계열사에서 의뢰되는 time-series forecasting 프로젝트를 수행하고 있는데, 주어진 데이터들을 보면 새로운 제품 출시 및 기존 제품의 단종 등 지속적으로 node, edge들이 변화하는 특성이 있습니다. 따라서 그래프를 어떻게 생성해야 하는지에 대한 연구도 함께 진행되어야 할 것이란 생각이 들었습니다. 이러한 미래 연구주제에 대해 함께 논의할 수 있는 LG AI연구원의 동료들과 함께 더욱 적극적으로 소통하며 연구를 진행해야겠다는 생각이 듭니다.


LG AI연구원 Di Lab 유주현님의 ICML 2021 Review 영상 보러 가기 (Link)

참고
[1] DOSHI, Akash, et al. Deep stock predictions. arXiv preprint arXiv:2006.04992, 2020.
[2] PAL, Soumyasundar, et al. RNN with Particle Flow for Probabilistic Spatio-temporal Forecasting. arXiv preprint arXiv:2106.06064, 2021.
[3] CHEN, Yuzhou; SEGOVIA-DOMINGUEZ, Ignacio; GEL, Yulia R. Z-GCNETs: Time Zigzags at Graph Convolutional Networks for Time Series Forecasting. arXiv preprint arXiv:2105.04100, 2021.
[4] Bai, L., Yao, L., Li, C., Wang, X., and Wang, C. Adaptive graph convolutional recurrent network for traf?c forecasting. In Proc. Adv. Neural Info. Process. Systems, 2020.
[5] CHEN, Xinshi; DAI, Hanjun; SONG, Le. Particle flow Bayes’ rule. In: International Conference on Machine Learning. PMLR, 2019. p. 1022-1031.
[6] CARLSSON, Gunnar; DE SILVA, Vin. Zigzag persistence. Foundations of computational mathematics, 2010, 10.4: 367-405.
[7] A gentle introduction to persistent homology. https://christian.bock.ml/posts/persistent_homology/