LKU_8c80d4241.png Kyungeun Lee 2025.01.14

[NeurIPS 2024 Series] Mutual Information Estimation Benchmark 연구 소개

NeurIPS 2024에서는 총 4,337개의 논문이 발표되었습니다. 그림 1에서 볼 수 있듯이, 이번 학회의 주요 키워드는 대규모 언어 모델(Large Language Model, LLM), 강화학습(Reinforcement Learning), 멀티모달 학습(Multimodal Learning), 그리고 확산 모델(Diffusion) 등이었습니다. 특히, 인과 학습(Causal Learning) 및 생물학/화학(Biology/Chemistry) 관련 연구들이 이전보다 더욱 두드러졌습니다.


이미지 1. NeurIPS 2024 발표 논문 Visualization plot[1]


특히 Datasets & Benchmark 트랙에서는 흥미로운 연구들이 많았습니다. 예를 들어, 대규모 멀티모달 항공우주 벤치마크[2], 형태 조립을 위한 IKEA Video Manuals[3], 그리고 Multi-image reasoning 벤치마크[4] 등이 대표적입니다. 이 연구들은 딥러닝이 해결해야 할 새로운 과제들이 지속적으로 탐구되고 있음을 보여줍니다.

LG AI연구원 Data Intelligence (DI) Lab은 NeurIPS 2024 Datasets & Benchmark 트랙에서 연구를 발표했습니다. 주요 내용은 딥러닝 연구 과정에서 종종 간과하는 문제를 해결하고, 모델 성능을 보다 엄밀하게 검증할 수 있는 벤치마크를 제안하는 데 초점을 뒀습니다. 특히, 이번 논문은 Representation Learning에서 두 개의 랜덤 변수 간 관계성을 측정하는 Mutual Information (MI, 상호 정보) 추정 관련 연구를 다루고 있습니다. MI 관련 논문은 NeurIPS 2024에서 총 9편 발표되었습니다. 이 중 4편은 MI 추정(MI Estimation) 연구였으며, 나머지 5편은 MI를 활용하여 최종 태스크 성능을 향상시키는 연구였습니다.


LG AI연구원의 A Benchmark Suite for Evaluating Neural Mutual Information Estimators on Unstructured Datasets[7]

Mutual Information (MI)은 정보이론(Information theory) 분야에서 두 랜덤 변수 (X, Y) 간의 관계성(공유하는 정보량)을 측정하는 핵심적인 메트릭으로, 오랜 시간 다양한 분야에서 사용해 왔습니다. MI는 Reparameterization-Invariance 속성을 가지며 비선형 관계도 측정할 수 있는 특징을 가집니다. MI는 다음과 같은 다양한 분야에서 활용되고 있습니다.


  1. Information Bottleneck Method

  2. Non-vacuous Generalization Bounds 유도

  3. Neural Network (NN) Training Dynamics 분석

  4. Representation Learning, Self-supervised Learning, Reinforcement Learning 등 다양한 분야의 최적화


하지만, MI의 활용에는 한 가지 중요한 문제가 있습니다. MI의 참값을 계산하려면 두 랜덤 변수의 Joint Distribution 및 Marginal Distribution을 정확히 알아야 하지만, 실제로 이를 파악하지 못하는 경우가 많습니다. 연구자들은 추정된 MI 값을 기반으로 논의하지만, 해당 값이 실제 MI에 얼마나 가까운지를 검증하는 것은 쉽지 않습니다.

현재까지 개발된 대부분의 MI 추정 기법은 Gaussian Multivariates 벤치마크에서만 평가됐습니다. 그러나 우리가 실제 딥러닝 연구에서 다루는 데이터는 이미지나 텍스트 같은 비정형 데이터(Unstructured Data)로, Gaussian과는 매우 다른 형태를 가집니다. 따라서 기존 Gaussian 벤치마크가 현실적인 MI 추정의 신뢰성을 보장하는지에 대한 의문은 아직 해소되지 않은 상태였습니다. 이 문제 해결을 위해 이번 연구에서는 기존 Gaussian Dataset에서 검증된 MI 추정 기법이 실제 이미지 및 텍스트 데이터에서도 일관되게 작동하는지를 확인했습니다.


1) 본 연구의 의의

본 연구는 다음과 같은 세 가지 주요 기여점을 가집니다.

  1. 임의의 데이터셋에서도 MI의 참값을 정확히 알 수 있는 데이터 생성 방법 제안

  2. Gaussian Multivariates, Images, Sentence embeddings에서 MI Estimator의 정확도를 평가할 수 있는 벤치마크 구축

  3. 7가지 시나리오를 기반으로 MI Estimator 성능 비교 및 실험 결과 정리


2) MI의 참값을 알 수 있는 데이터셋 생성 방법

MI의 참값을 알고 있는 데이터셋 생성을 위해, 본 연구에서는 [5]에서 제안한 Same-Class Sampling 방식을 활용했습니다. 이 방식에 따르면, 두 랜덤 변수 간의 공유 정보량을 클래스 정보(class information, C)로 제한 시, mild assumption 하에서 MI 값은 클래스 정보의 엔트로피로 결정됩니다. 즉, I(X;Y)=H(C)가 성립합니다.

이미지 데이터의 경우, MNIST 데이터에서 특정 숫자 클래스(0, 1)를 공유하는 이미지 쌍을 만들었으며, 텍스트 데이터는 IMDB dataset에서 BERT Fine-Tuned Sentence Embeddings를 활용해 Positive/Negative 클래스 공유 문장 벡터를 생성했습니다. 보다 큰 MI값을 가지는 데이터셋을 생성하기 위해 이미지 또는 Sentence Embedding Vector를 Concatenate 합니다. 추가로, Digit 이미지를 보다 현실적인 이미지로 만들기 위하여, 배경에 임의로 샘플링한 CIFAR-10 이미지를 삽입하여 Nuisance가 포함된 이미지를 생성하기도 합니다. 이때, 배경은 클래스 정보에 해당하는 Digit 정보에 전혀 영향을 주지 않기 때문에 MI 값은 변동 없습니다. 마지막으로 동일한 데이터셋에 대한 MI 값의 크기를 0에서 H(C) 사이의 임의 값으로 조절하기 위해 Binary Symmetric Channel을 추가로 도입하여 활용합니다.


이미지 2. 생성된 이미지 데이터셋 예시[7]


3) 실험 결과

본 연구에서 제안하는 벤치마크는 구체적으로 Gaussian Multivariates, Image, Sentence Embedding의 세 가지 데이터 도메인을 포함합니다. 각 데이터 도메인에 대하여 7가지 시나리오에 대한 Neural MI Estimator의 정확도 검증이 진행되었습니다. 결과를 요약하면 다음과 같습니다:

  1. Critic 구조: 모든 데이터 도메인에서 joint critic 방식의 추정 정확도가 가장 높음

  2. Critic Capacity: Critic capacity를 키운다고 항상 추정 정확도가 높아지는 것은 아님

  3. MI Estimator 종류: 모든 도메인에 대하여 항상 우수한 성능을 보이는 MI estimator는 없음

  4. Number of Information Sources: Gaussian multivariates 대비 image 및 sentence embeddings 데이터에서 강건한 추정 결과 도출

  5. Representation Dimension: 데이터 차원 크기는 MI 추정 정확도에 큰 영향을 주지 않음

  6. Nuisance: MINE Estimator[6] 가 가장 강건한 추정치를 제공

  7. Network and Layer Dependency: MI 값이 유지되는 invertible network 또는 학습된 네트워크의 upper layer에서 정확한 추정 가능


이 결과는 기존 Gaussian 기반 벤치마크가 비정형 데이터 세팅에서 MI 추정 정확도를 평가하는 데 치명적인 한계를 가지며, 다양한 데이터 도메인에서 검증이 필요함을 시사합니다. 나아가, Representation Learning을 포함하여 MI가 활용될 수 있는 다양한 분야에서 신뢰할 수 있는 MI 추정이 요구된다는 점도 알려줍니다. 특정 시나리오에서 MI 추정기의 성능이 다르게 나타나는 것을 분석함으로써, MI 추정 방법 선택에 대한 가이드를 제공한다는 점에서 유의미한 결과입니다.


향후 계획

본 연구는 Mutual Information 추정이 실제 데이터 환경에서 얼마나 정확하게 수행할 수 있는지를 검증하기 위한 벤치마크를 제안했습니다. LG AI연구원은 다양한 딥러닝 모델이 직면한 문제를 해결하기 위해 관련 연구를 지속할 것입니다. 특히 Representation Learning에서 MI Estimator의 활용성을 더욱 심도 있게 분석하고, MI 값을 활용한 딥러닝 모델의 일반화 성능 개선 연구를 진행할 예정입니다. 다양한 산업 도메인에서 발생하는 문제를 해결할 수 있는 딥러닝 알고리즘 개발에도 초점을 맞춰 후속 연구를 이어갈 계획입니다.

 

NeurIPS 2024 Series

EP. 2 [NeurIPS 2024 Series] Tabular Data를 위한 B-splines 기반 입력값 정규화 방식
EP. 3 [NeurIPS 2024 Series] Tabular Data 예측 성능 강화를 위한 Attention 기반 데이터 증강기법 연구 소개
EP. 4 [NeurIPS 2024 Series] Multimodal 시계열 예측을 위한 Adaptive Information Routing 기술 연구

참고

[1] NeurIPS 2024 공식 홈페이지, https://neurips2024.vizhub.ai/.

[2] Audenaert, Jeroen, et al. "The Multimodal Universe: Enabling Large-Scale Machine Learning with 100TB of Astronomical Scientific Data." Advances in Neural Information Processing Systems 36 (2024).

[3] Liu, Yunong, et al. "Ikea manuals at work: 4d grounding of assembly instructions on internet videos." Advances in Neural Information Processing Systems 36 (2024).

[4] Kazemi, Mehran, et al. "ReMI: A Dataset for Reasoning with Multiple Images." Advances in Neural Information Processing Systems 36 (2024).

[5] Lee, Kyungeun, et al. "Towards a rigorous analysis of mutual information in contrastive learning." Neural Networks 179 (2024): 106584.

[6] Belghazi, Mohamed Ishmael, et al. "Mutual information neural estimation." International conference on machine learning. PMLR, 2018.

[7] Lee, Kyungeun, et al. “A Benchmark Suite for Evaluating Neural Mutual Information Estimators on Unstructured Datasets.” Advances in Neural Information Processing Systems 36 (2024).