인공지능 분야에서 세계 최고의 권위를 갖는 학회인 NeurIPS (Neural Information Processing Systems)가 2024년 12월 10일부터 15일까지 캐나다 밴쿠버에서 개최됐습니다. 이번 NeurIPS에서는 이전 어느 학회 보다도 많은 수의 시계열 및 시계열 예측 관련 연구 결과들이 소개됐습니다. 이번 NeurIPS에서는 단순히 벤치마크 데이터에서 높은 성능을 보이는 예측 모델의 개발 목표 연구만이 아니라, LLM을 활용한 정성 예측[1], Multimodal 예측[2][3], 생성 모델을 사용한 예측[4][5], 예측 모델에 대한 분석 연구[6][7], 시계열 벤치마크[3] 등 다방면으로 시계열 예측에 대한 연구 결과들이 발표되었습니다.
최근 대형 모델들에 대한 관심이 높은 상황에서, 시계열 예측 분야에도 대형 모델의 활용과 그 필요성이 제기되고 있습니다. 이런 상황을 반영해, 이번 NeurIPS에서는 Time Series in the Age of Large Models (TSALM) Workshop이 열렸습니다. 해당 워크숍에서는 시계열 예측 분야에서의 대형 모델 활용에 관한 다양한 연구와 심도 있는 논의가 이루어졌습니다. Time Series Foundation 모델 등 Large Time Series 모델, 그리고 LLM(Large Language Model) 등 Pretrained Model의 시계열 예측 분야에서의 활용과 같은 주제가 다뤄졌습니다. LG AI연구원의 Data Intelligence (DI) Lab에서는 TSALM 워크숍에서 “Adaptive Information Routing for Multi Modal Time Series Forecasting[8]”을 주제로 Multimodal 시계열 예측에 관한 논문을 발표하고, LG AI연구원이 시계열 예측에 관해 진행 중인 연구와 해결 과제들에 대해 공유했습니다.
LG AI연구원의 Adaptive Information Routing for Multi Modal Time Series Forecasting[8]
시계열 예측은 미래에 대한 전망을 제공함으로써 비즈니스를 위한 의사결정 과정에 도움을 줄 수 있는 중요한 AI 기술입니다. 시계열 예측은 일반적으로 시계열 내에 존재하는 패턴을 학습하여, 과거 값을 바탕으로 미래를 예측하는 방법으로 이루어집니다. 그러나, 환율, 주가, 원자재 가격 등 현실 속 의사결정에 중요한 예측 문제에는 시계열의 과거 값 이외에도 다양한 요인이 개입합니다. 따라서 정확도를 높이기 위해서는 예측 모델 또한 다양한 요인들을 복합적으로 고려해 수행할 수 있어야 합니다. 또한, 현실 속 많은 정보들은 정형화된 시계열 형태가 아닌, 텍스트와 같이 정형화되지 않은 비정형 데이터의 형태로 존재합니다. LG AI연구원에서는 이같은 다양한 종류의 데이터를 효과적으로 활용해 현실세계의 다양한 예측문제에 대한 정확도를 높이는 방향으로, Multimodal 시계열 예측 기술에 대한 연구를 진행했습니다.
Multimodal 시계열 예측은 일반적으로 텍스트 정보를 시계열과 함께 활용해 예측을 수행하는 것을 목표로 하며, 현재까지 제안된 Multimodal 시계열 예측 기법은 크게 두 가지로 분류할 수 있습니다. 첫 번째는 언어모델 자체를 예측 모델로 활용하는 연구로, Pretrained Language Model (PLM)을 Multimodal 예측 모델로 Finetuning하는 방법론입니다[9][10][11]. 이 방법론은 PLM의 사전학습 과정에서 습득한 언어 능력 활용을 목표로 하며, 도메인 설명과 같은 간단한 텍스트 정보를 예측에 활용해 성능 향상을 가져옵니다. 텍스트 정보를 별도의 임베딩 모델을 통해 활용하는 방법론도 있습니다[3][8]. 이는 텍스트 데이터를 압축한 임베딩 정보를 보다 잘 활용할 수 있는 예측 모델 개발에 중점을 두며, 첫 번째 방법론에 비해 대량의 텍스트를 효율적으로 사용할 수 있다는 장점이 있습니다.
연구 내용
LG AI연구원에서 발표한 “Adaptive Information Routing for Multi Modal Time Series Forecasting”는 시계열 데이터와 텍스트 데이터의 서로 다른 특성을 반영한 Multimodal 예측 기술에 대한 연구입니다. 일반적으로 시계열 데이터는 텍스트 데이터에 비해 Local하고, 구체적이며, 구조화된 정보를 담고 있습니다. 텍스트 데이터는 시계열 데이터에 비해 Global하고, 모호하며, 구조화되지 않은 정보가 가득합니다. 따라서 두 데이터의 서로 다른 특성을 고려하지 않고 시계열, 텍스트 데이터를 단순히 모델 입력 목적으로 함께 사용하는 방법은 데이터의 활용 능력에서 근본적인 한계를 갖습니다. 본 연구에서는 시계열과 텍스트의 서로 다른 특성을 고려하여 텍스트 데이터를 시계열 모델의 컨트롤러로 활용하는 새로운 Multimodal 시계열 예측 기법 ‘Adaptive Information Routing (AIR)’을 제안합니다.
시계열 예측 모델은 일반적으로 시계열 데이터의 서로 다른 시점 간, 변량 간에서 정보를 혼합해 피쳐를 추출하고, 해당 피쳐를 바탕으로 한 예측 결과 획득 방식으로 동작합니다. 따라서, 시계열 예측 모델의 동작은 어떤 정보를 어느 강도로 혼합하는지에 따라 조절할 수 있습니다. 본 연구에서 제안하는 Adaptive Information Routing 기술은 시계열 모델 내에서 시계열 정보가 흐르고 혼합되는 Information Pathway를 텍스트 정보로 조절함으로써 시계열 예측 모델의 동작을 컨트롤하는 새로운 Multimodal 시계열 예측 기술입니다.
본 연구에서는 우선 Neural Network의 가장 기본적인 구성 요소인 Fully-Connected (FC) Layer에 집중합니다. FC Layer는 주어진 입력에 학습된 Weight Matrix를 곱하는 형태로 동작하는데, 이 FC Layer는 Latent를 갖는 두 개의 FC Layer로 나누어도 동일한 동작을 수행할 수 있습니다. 이때 두 FC Layer 사이의 각 Latent는 입력과 출력의 모든 Node에 연결되어 있으므로, 입출력간의 특정한 연결 관계 또는 특정한 Information Pathway에 대응합니다. 따라서 우리는 FC Layer를 둘로 나누고, 두 FC Layer 사이의 Latent에 가중치를 적용함으로써 FC Layer 내의 Information Pathway를 조절할 수 있습니다. 이와 같은 구조를 바탕으로 제안하는 AIR는 텍스트 임베딩으로부터 Latent의 가중치를 구하는 Information Routing 모듈을 이용해, 텍스트 정보를 바탕으로 시계열 예측 모델의 동작을 조절합니다.

이미지 1. Information Routing Module의 구조도[8]
위 이미지는 본 논문에서 제안하는 Information Routing 모델 구조입니다. 사전 학습된 임베딩 모델을 통해 텍스트 데이터를 고정된 벡터로 임베딩하고, Attention Layer와 학습가능한 Integration 토큰을 사용해 다수의 텍스트 데이터 정보를 단일 벡터로 통합합니다. 마지막으로, MLP 형태의 Weight 생성기를 통해 Latent에 적용할 가중치를 생성합니다.

이미지 2. Base 모델 (TSMixer )에 대한 Adaptive Information Routing 기법의 적용 예시[8]
본 논문에서는 AIR의 Base 시계열 예측 모델이자 FC Layer만으로 구성된 시계열 예측 모델인 TSMixer[12]를 사용합니다. TSMixer의 각 Mixer Block은 각각 Temporal Mixing과 Featural Mixing을 위한 두 개의 FC Layer로 구성되는데, 각 FC Layer를 각각 두 개의 FC Layer로 나누고, 나뉘어진 FC Layer 사이의 Latent들에 대해 Information Routing 모델에서 생성한 가중치를 적용합니다. Information Routing 모델은 모든 Block과 모든 FC Layer에 대해 서로 다른 가중치를 생성하여 활용합니다.
제안하는 AIR 기법의 성능 검증을 위해, 본 논문에서는 두 종류의 데이터를 제안하여 사용합니다. 첫 번째는 Synthetic 데이터로, AIR 기법이 실제로 텍스트 정보에 기반하여 시계열 정보 간의 혼합을 조절할 수 있는지 검증하기 위한 것입니다. 먼저 30개의 시계열 데이터를 랜덤하게 생성하고, 이 시계열 데이터 가운데 2개의 시계열 데이터를 랜덤하게 선택해 평균을 내는 방식으로 Target 데이터를 생성합니다. 이 과정에서 특정한 주기로 Target의 구성을 변화시키고, 이에 대한 정보를 담은 텍스트 데이터를 함께 생성합니다. 이 데이터에서 텍스트 데이터를 활용하지 못하는 모델은 적절한 예측을 수행할 수 없으나, 텍스트 데이터를 바탕으로 예측 모델의 동작을 조절할 수 있는 모델은 거의 완벽한 수준의 예측을 수행할 수 있습니다. 두 번째 데이터는 주가 데이터로, 실제 미국 주식시장의 IT 관련 주식들의 종가 시계열 데이터와 ChatGPT를 통해 생성한 Synthetic 텍스트 데이터로 구성했습니다. 주가 데이터는 현 미국 주식시장의 가장 대표 종목들인 M7 주식들의 주가 예측을 통해 제안하는 AIR 기법이 실제로 예측 성능 향상에 도움이 되는지를 검증합니다.

이미지 3. TSMixer 및 TSMixer+_AIR의 Synthetic 데이터 예측 결과 시각화[8]

이미지 4. Synthetic 데이터 예측 오차 비교 표[8]

이미지 5. 주가 데이터 예측 오차 비교 표[8]
Synthetic 데이터를 활용한 실험 결과, 시계열 데이터만을 활용한 Base 모델 TSMixer는 적절한 예측을 수행하지 못한 반면, 텍스트 정보를 컨트롤러로 활용하는 AIR 적용 TSMixer는 매우 작은 오차를 보이며 거의 완벽한 예측을 수행했습니다. 주가 데이터를 활용한 실험의 경우, AIR를 적용한 모델이 Base 모델에 비해 평균 16.93%, 최고 23.68%, 최저 12.71%의 오차 감소를 보이며 성공적인 성능 향상을 확인할 수 있었습니다.
향후 계획
지금까지 텍스트 정보를 시계열 예측에 사용하기 위한 목적으로, Multimodal 시계열 예측 분야에서 이루어져 온 다양한 시도들에 대해 살펴보고, LG AI연구원에서 제안한 새로운 Multimodal 시계열 예측 기법에 대해 소개했습니다.
미래에 대한 정확한 예측은 현실 세계의 의사결정 과정에 기여할 수 있는 중요한 기술입니다. 이를 고도화하기 위해서는 높은 예측 성능 달성과 함께 예측 결과에 대한 설명력 및 신뢰성 확보가 중요합니다. LG AI연구원 DI Lab에서는 다양한 종류의 데이터를 효과적으로 활용하여 정확하고 설명 가능한 예측을 수행하는 것을 연구 목표로 수립하고, 이와 관련하여 다양한 예측 기술에 대한 연구를 진행하고 있습니다. Multimodal 시계열 예측은 예측 성능 및 신뢰도 향상이라는 두 가지 측면에서 모두 기여할 수 있는 중요한 기술입니다. 이번 NeurIPS TSALM 워크숍에서 발표한 논문은 LG AI연구원이 Multimodal 예측 분야에서 발표한 첫 걸음으로, LG AI연구원에서는 본 연구 결과를 바탕으로 보다 정확하고 신뢰할 수 있는 예측 기술에 대한 연구를 이어 나갈 계획입니다.
NeurIPS 2024 Series
EP. 1 [NeuriPS 2024 Series] Mutual Information Estimation Benchmark 연구 소개
EP. 2 [NeurIPS 2024 Series] Tabular Data를 위한 B-splines 기반 입력값 정규화 방식
EP. 3 [NeurIPS 2024 Series] Tabular Data 예측 성능 강화를 위한 Attention 기반 데이터 증강기법 연구 소개
[1] Halawi, Danny, et al. "Approaching Human-Level Forecasting with Language Models." Advances in Neural Information Processing Systems 36 (2024).
[2] Wang, Xinlei, et al. "From news to forecast: Integrating event analysis in llm-based time series forecasting with reflection." Advances in Neural Information Processing Systems 36 (2024).[3] Liu, Haoxin, et al. "Time-MMD: Multi-Domain Multimodal Dataset for Time Series Analysis." Advances in Neural Information Processing Systems 36 (2024).
[4] Lee, Seunghan, Kibok Lee, and Taeyoung Park. "ANT: Adaptive Noise Schedule for Time Series Diffusion Models." Advances in Neural Information Processing Systems 36 (2024).
[5] Liu, Jingwei, et al. "Retrieval-Augmented Diffusion Models for Time Series Forecasting." Advances in Neural Information Processing Systems 36 (2024).
[6] Tan, Mingtian, et al. "Are language models actually useful for time series forecasting?." Advances in Neural Information Processing Systems 36 (2024).
[7] Kim, Dongbin, et al. "Are Self-Attentions Effective for Time Series Forecasting?." Advances in Neural Information Processing Systems 36 (2024).
[8] Seo, Jun, et al. "Adaptive Information Routing for Multi Modal Time Series Forecasting." NeurIPS Workshop on Time Series in the Age of Large Models.
[9] Cao, Defu, et al. "Tempo: Prompt-based generative pre-trained transformer for time series forecasting." International Conference on Learning Representations 13 (2024).
[10] Liu, Xu, et al. "Unitime: A language-empowered unified model for cross-domain time series forecasting." Proceedings of the ACM on Web Conference 2024.
[11] Jin, Ming, et al. "Time-llm: Time series forecasting by reprogramming large language models." International Conference on Learning Representations 13 (2024).
[12] Chen, Si-An, et al. "TSMixer: An All-MLP Architecture for Time Series Forecasting." Transactions on Machine Learning Research.