세계 최고 인공지능 학회로 손꼽히는 ICML 2023 학회(International Conference on Machine Learning)가 2023년 7월 23일부터 7월 30일까지 미국 하와이에서 개최되었습니다. LG AI연구원에서도 다수 연구원이 참석해 Conference 및 Workshop에서 연구 성과물을 발표하는 등 다양한 활동을 펼쳤습니다.
이번 학회에서 Data Intelligence Lab은 ‘Gradient Surgery for One-shot Unlearning on Generative Model’을 ‘ICML 2023 Workshop for Generative AI & Law’에 발표하였습니다. GPT-3, Stable Diffusion과 같은 Generative AI 기반 모델을 실제 서비스에 Deploy 할 때에 고려해야 할 법률 규제 및 Legal 이슈(개인정보 보호, 지식재산권 등)에 대해 논의하고, 이에 적합한 Training과 Evaluation 기법 등에 관해 다양한 Background의 ML 연구자들과 교류할 수 있었습니다. 또한, 여러 발표에 참관하여 최신 연구 트렌드를 탐색하고 유용한 인사이트를 얻을 수 있었습니다.
본문에선 Unlearning 문제와 발표 연구를 간략히 짚어본 뒤, 현재 LG AI연구원에서 집중하고 있는 분야이자 이번 학회에서 특히 주목을 받았던 Causal Inference, Geometric Deep Learning, Large Scale Foundation Model 분야의 응용 연구에 대해 소개를 하고자 합니다.
1. Unlearning
이번 ICML 2023에서는 Generative Model을 Unlearning 하는 간단하면서 효과적인 방법을 제안[34]하여 Workshop for Generative AI & Law에 발표하였습니다. Unlearning이란 GPT-3, Stable Diffusion과 같은 Pre-trained 모델을 실제 서비스할 때, Data Privacy 관련 법률 규제의 변화나 User의 개인 정보 보호 요청 등이 발생할 경우 이에 응답해 특정 Instance에 대한 정보를 Pre-trained 모델로부터 제거해 내는 문제입니다. 이 때 최소한의 Cost(1)로 Identification 정보는 충분히 제거함(2)과 동시에 성능은 최대한으로 유지해 내는 것(3)을 목표합니다. 따라서 Unlearning의 많은 Work들은 주어진 Pre-trained 모델을 특정 Instance를 제외한 Training Data 전체로, 처음부터 학습한 상태(Retrain-from-Scratch)와 동치가 되도록 만들어 주는 것을 Objective로 합니다.
Gradient Surgery for One-shot Unlearning on Generative Model[34]
먼저 Data에 대한 Influence의 정의에서부터 출발하고자 합니다. 어떤 Data의 Weight Parameter로의 Influence를 계산할 수 있다면 이를 Remove 하는 과정은 Unlearning의 Objective를 만족할 수 있습니다[36-39]. Data Influence 제거를 목적으로 하는 [36]에서는, Convex Loss를 가정하는 Linear 모델의 경우 위 Objective 가 Simple Newton Update로 근사가 가능하며, Exact Hessian 및 Gradient 계산으로 해당 세팅에서 Unlearning을 도출할 수 있음을 이론적, 실험적으로 보여주고 있습니다. 하지만 최근의 DNN 모델, 더 나아가 본 연구의 타깃인 Generative Model의 경우 Exact Hessian을 직접 계산하는 것은 Intractable 하며, Approximation의 Bound 또한 보장되지 않습니다.
본 연구에선 이를 우회하여 Generation Output으로의 Influence를 최소화하는 방향으로 접근하였습니다. 그 결과, 기존 Multi-task Learning 세팅에서 제안되던 Gradient Surgery[33] 기법이 주어진 모델 Weight Parameter를 Output으로의 Influence를 최소화하는 방향으로 업데이트할 수 있음을 이론적으로 확인하였습니다[34]. 뿐만 아니라 [35]에선 여러 Data를 제거하는(Sequential or Batch) 상황에서 발생하는 Weight Parameter로의 Influence의 Approximation Error 가 Gradient Conflict를 Minimize 하는 간단한 계산만으로 효과적으로 최소화할 수 있음을 이론적으로 확인하고, 기존 Newton Update 방법이 적용되지 않던 상황에 함께 적용 시 Unlearning에 효과적임을 실험적으로 검증하였습니다.
실험 결과, 기존 Newton Update 기반 방법에 함께 적용 시, Generative Model[34] 및 큰 Batch를 제거하는 상황[35]에서 주어진 Instance를 효과적으로 제거해 낼 수 있음을 확인하였습니다. 본문에선 VAE 기반의 Generative Model에서 Class와 Feature를 활용한 Unlearning 실험 결과를 보여주고 있으며, 이번 ICML 2023에서 새로이 논의된 Generative Model의 Fine-grained Evaluation 기법을 [34]의 향후 추가 실험 구성 및 Evaluation에 반영하고자 합니다. 추가로, Hessian Approximate로 사용하는 Loss Curvature를 Empirical하게 계산[35]하는 과정에 Differential Privacy 기반의 Weight Exploration Framework를 도입하여 Privacy의 Tighter Bound를 보장하는 방향으로 연구를 고도화해 나갈 예정입니다.

그림 1. Performance of Class/Feature Unlearning VAE on MNIST138 (left columns) and CelebA (right column)[34]
2. Causal Inference
Causal Discovery는 Data로부터 Causal Relation을 찾는 것을 목적으로 합니다. 이는 현대 과학의 근본이자 어떠한 현상의 Reasoning을 가능하게 만들어 준다는 점에서 중요한 Task로 자리매김하고 있습니다. 최근 Causal Inference 분야에서 Bayesian Inference 기반 알고리즘들이 가능성을 보여주고 있고, 이번 ICML 2023에서 또한 Single Point Estimate를 예측하던 기존 Statistical Learning 방법에서 벗어나 Bayesian Optimization 기반[1], Reinforcement Learning 기반[2] 등의 연구 결과가 다수 발표되었습니다. 아래 단락에선 Causal Discovery를 Probabilistic Inference로 접근하는 최근의 연구 흐름을 간략히 소개하고 있습니다.
GFlowNets for Causal Discovery: an Overview[3]
Causal Relation은 노드 간에 Cycle이 존재할 수 없음을(Causal 관계에서 원인과 결과는 항상 단방향) 전제로 합니다. 따라서 Causal Discovery는 Distribution of Directed Acyclic Graph으로부터 최적의 DAG를 찾는 문제로 볼 수 있습니다. 그러나, DAG은 Discrete, Combinatorial Space에서 정의되므로, 노드 개수에 따라 Exponentially Grow 한다는 점에서 Challenge가 있습니다. 또한 Data로부터 Structure Learning 하는 것은 NP-complete이며, 심지어 모든 DAG Space를 효율적으로 찾을 수 있는 오라클이 있다고 하더라도 제한된 Observation만이 확보된 지금의 상황에선 Prediction 결과를 충분히 신뢰할 수 없다는 한계가 있습니다.
선행 연구들은 따라서 Bayesian Posterior Distribution에서 Sampling 하는 방식을 취하고 있습니다. Factorized Variational Approximation을 사용하거나[4] 비싼 MCMC Simulation을 이용하는 방식을 취할 수 있으며, 최근 Bengio 그룹에서는[3] Generative Flow Network (이하 GFlowNet) 기반 방법의 가능성을 보여주고 있습니다. 이는 Bayesian Posterior를 Synthetic Dataset-Causal Graph Pair에서 Maximum-likelihood Objective를 부여해 Unseen, Realistic 한 Dataset에서 Generalize 가능하도록 학습하는 최근의 Supervised Learning 접근 방식 중 하나로 볼 수 있습니다.
GFlowNet는 DAG과 같은 Compositional Object를 주어진 Energy Function (Reward Function)에 따라 Step-by-step Sampling 하는 것을 목적으로 합니다. 이 프레임워크는 Self-Consistency Objective를 통해 학습되며, 중요한 점은 이 Energy Function으로 표현된 Intractable 한 Distribution의 Approximation 과정을 Neural Network로 대체하여 학습한다는 점입니다. 이를 통해 Data-driven으로 전 과정을 최적화할 수 있습니다. 기존 Supervised Learning 방법과의 차이점은, Neural Network Capacity를 상대적으로 적게 필요로 하고 주어진 단일 Dataset에 대한 Posterior에서 Sampling 하여 Pair를 요구하지 않는다는 점입니다. 최근 [5-7] 등의 연구에서 Causal Structure의 Bayesian Learning을 GFlowNet 기반으로 표현하고 있고, Uncertainty와 Misspecification 측면에서 고무적임을 보여주고 있습니다.

그림 2. GFlowNets 개념 이미지[40]
뿐만 아니라, ICML 2023에선 Causal Relation을 고려해 다양한 Task의 성능을 개선하는 응용 연구 또한 다수 확인할 수 있었습니다. [9]에서는 Motion Forecasting의 Generative Factor를 설명하는 데에 Causal Model을 활용하였고, [10]에서는 Dataset Shift 상황에 Robust 한 Generalization을 위해 Model Transfer 과정에선 어떤 정보가 필수적일지를 Causal 관점에서 Minimax Analysis를 통해 설명하고 있습니다. 아래 단락에선 DeepMind에서 발표한 Causal Relation을 고려해 Neural Algorithmic Reasoning을 해결한 Application 연구를 소개하고자 합니다.
Neural Algorithmic Reasoning with Causal Regulation[11]
Neural Algorithmic Reasoning은 Neural Network의 Reasoning 능력을 탐구하는 연구 분야입니다. Reasoning 능력이란, 추론, 결론 도출, 복잡한 문제 해결과 같이 논리적 사고나 의사결정 능력 등을 의미합니다. 따라서 Neural Network의 Reasoning이란, 논리적 추리, 의사결정을 요구하는 Algorithmic Task (알고리즘 실행, 수학 문제 풀이 등)를 Neural Network가 수행 가능함을 의미합니다. 구체적으로는, 주어진 Well-defined 된 Rule과 Procedure를 이용해 Computational Problem을 풀어내는 것으로, 주어진 Input을 순차적 Step을 거쳐 Output으로 효율적이면서 효과적으로 변환해 내는 것을 Task로 봅니다. 예를 들어 숫자의 List를 Sorting 하거나 Graph의 두 Point 사이의 Shortest Path를 구하는 것 등이 있습니다. Neural Algorithmic Reasoning 문제에서는, Neural Network가 이 Task를 Training Distribution의 Unseen Data와 Out-of-distribution Example에서 효과적으로 수행해 내는 것을 목적으로 합니다.
본 연구에선 Input 사이즈가 커질 때의 OOD Generalization 이슈를 다루고 있습니다. 큰 사이즈의 Input은, 알고리즘 내에서 계산이 필요한 Trajectory 개수를 Combinatorial 하게 증가시켜 학습 난이도를 높게 만들며, 특히 Test-time 때에만 이러한 Input이 주어진다면 Training 때 만난 데이터보다 더 복잡한 패턴 및 구조로 표현되어 정확한 예측에 제한이 생기게 됩니다. 저자들은 Neural Algorithmic Reasoning 문제에서 항상 다음과 같은 Causal Graph - 특정 시점의 Outcome은 오로지 현재 Snapshot의 Subset에만 의존한다 - 가 성립함을 확인하였습니다. 예를 들어, 아래의 DFS 문제의 경우 아래와 같이 어떤 노드 4로 가는 케이스는 어떠한 경우든 항상 노드 2를 거쳐야만 가능합니다.

그림 3. An illustration of the key observation of our work, on the depth-first search (DFS) algorithm as implemented in CLRS-30[11]
즉, 이러한 Conditional Independence를 만족하며, Snapshot의 나머지가 달라지더라도 이러한 Conditional Probability에 변화를 주지 않는다는 점 또한 성립되는 것을 알 수 있습니다. 따라서, 저자들은 이러한 케이스에 대해선 모든 Trajectory를 계산하지 않고 해당하는 Trajectory에 대해서만 계산한다면 전체 계산량을 줄일 수 있으며, 결과적으로 Input 크기가 커지더라도 효과적으로 학습 및 예측할 수 있다는 점에 주목하였습니다. X에서 Y로의 Conditionally Invariant한 Prediction을 위해 저자들은 위 문제 상황을 Self-supervised Objective로 표현하고 간단한 Contrastive Learning 기반의 Augmentation 방법을 제안하였습니다. 결과적으로 CLRS-30의 다양한 Algorithmic Task에서 실험한 결과 Baseline 대비 90% 이상 향상된 OOD micro-F1 성능을 보여주는 등 고무적인 성능 향상을 실험적으로 확인하였습니다.

그림 4. Per-algorithm comparison of the Triplet-GMPNN baseline and our Hint-ReLIC[11]
LG AI연구원에선 Causal Inference를 통해 Deep Neural Network의 예측 과정을 설명/분석하고자 합니다. 또한 Event 혹은 Variable 간의 Causal Relation을 고려해 Time-series Forecasting 등 다양한 문제 상황에서 개선된 성능을 확보해 나가고 있습니다. 세계 최고 학회 ICML 2023에서 보여준 Causal Inference의 선행 연구를 기반으로 LG AI연구원에선 보다 설명력 있고 개선된 예측 파이프라인을 구축하기를 기대하고 있습니다.
3. Geometric Deep Learning
최근 Structural Probabilistic Modeling 분야에서 Diffusion[12] 기반 알고리즘들이 Molecular Downstream Task에서 전례 없는 활약을 보이고 있습니다[14], 또한 EGNN[13] 등에서 제시된 Group Symmetry를 만족하는 Diffusion 모델 계열 (EDM[15] 나 GeoDiff[16])은 3D Molecular Generation 문제에서 주목할 만한 성능을 보여주며 이미 표준으로 자리매김하고 있습니다. 이후 이 논문들을 필두로 Diffusion 기반으로 동작하는 Graph Generative Model 연구가 가속화되고 있는 요즘입니다. 이번 ICML 2023 다양하게 발표된 Diffusion 기반의 Generation 연구들 중[19-20], Molecule을 위한 Stable Diffusion 연구인 GeoLDM[18]을 소개하고자 합니다.
Geometric Latent Diffusion Models for 3D Molecule Generation[18]
Diffusion Model은 Generative Model의 한 종류로, Training Data의 분포를 학습하기 위해 Instance에 Iterative 하게 Perturbation을 가중하는 Diffusion Process를 적용하고, 이 Corruption을 Denoised 된 원상태로 복원하는 과정을 Neural Network로 Parametrized, 학습하는 과정을 통해 원 분포를 효과적으로 학습합니다. Diffusion Model은 Image Inpainting 등 Non-geometric Domain의 Generation Task에서 괄목할 만한 성능을 보여주었으며[19-20], 작년 ICML2022를 필두로 Graph 데이터로 표현한 Molecule의 Generation Task 등 Geometric Domain에서 또한 비약적인 성과를 기록하고 있습니다[14-16].
3D Graph의 표현은 Operation Group의 Equivariance를 만족하는 것이 중요합니다. 특히 Molecule의 3D Coordinate는 Euclidean Space 상에서의 이하 3가지 Operation - Rotation, Reflection, Translation - 에 대해 Equivariant 해야 하며(SE(3)), EGNN[13]에선 이를 만족하는 GNN 을 SE(3)-Transformers[17]는 Transformer를, GeoDiff[16]에선 Diffusion Model을 제안하고 있습니다.
지금까지의 Geometric Domain의 Diffusion Process는 Feature Domain (Molecule의 경우, Atomic Space)에서 동작해 왔습니다. 그러나 이러한 방법은 복잡한 구조의 Likelihood를 직접 모델링하는 과정이 필요해 계산량, 표현력 측면에서 한계가 있습니다. 이에 저자들은 Diffusion Process를 Latent Space에서 동작하도록 디자인/제안하였습니다. Latent Space에서의 Diffusion Model은 Smooth 한 Distribution을 모델링할 수 있으며, 더 적은 Dimension에서의 학습/최적화를 통해 계산량 측면에서도 우위를 가질 수 있습니다. 또한 Text-guided Image Generation과 같이 Graph Generation 또한 Controllable 하게 만들어 어떤 특성을 갖는 Molecular Graph를 생성하게 확장이 가능하다는 장점이 있습니다.
그러나 Geometric Domain에서 Latent Representation을 얻는 것은 Trivial 하지 않습니다. 3D Molecular Geometries에 중요한 Roto-translational Equivariance를 Latent Representation에 Capture 하기 위해 저자들은 기존 Autoencoding을 Euclidean Groups SE(n)을 만족하는 Geometric Autoencoding 로 치환합니다. 구체적으로는, Latent Feature를 모든 노드에 대해서 3-d equivariant 한 latent feature와 k-d invariant 한 latent feature를 가지는 Point-Structured Variable로 구성하도록 제안합니다. 이런 Point-structured Latent Space는 Additional Parameterized Operation 없이 Output 또한 Input에 Equivariant 하게 표현할 수 있다는 장점이 있습니다.
GeoLDM은 QM9, DRUG와 같은 Molecular Benchmark를 Modeling 하는 데에 여러 Metric 측면에서 GT와 가장 근접한 성능을 보여주었습니다. 또한, Polarizability 등 Molecular 특성에 대한 Interpolation Task에서 값 변화에 따라 Control이 되는 Generation Result를 보여주어 Molecular Generation의 Controllable 가능성을 실험적으로 보여 주었습니다.

그림 5. Molecules generated by conditional GEOLDM[18]

그림 6. Results obtained by our own experiments. Other results are borrowed from recent studies[18]
또한, Manifold Learning 분야에서 Manifold의 Geometrical Curvature 기반 알고리즘들이 괄목할 만한 성과를 보인 이후로[21-22], 최근 다양한 Real-world 문제에서 관찰되는 Non-Euclidean 특성을 반영해 Latent 한 Hierarchical Relation을 확보하기 위한 목적으로 Riemannian Manifold를 활용하려는 움직임이 두드러지게 관찰되고 있습니다. 이번 ICML 2023 또한 그러한 움직임은 계속되었으며, 아래 문단에서는 Riemannian Manifold, 특히 Constant Negative Curvature를 가진 Hyperbolic Geometry를 소개하고, Depth Completion Task에 Hyperbolic Geometry를 적용한 응용연구를 간략하게 소개해 드리고자 합니다.
Hyperbolic Geometry
Hyperbolic geometry는 Non-euclidean Geometry의 하나로 Constant Negative Curvature를 갖는 Space를 의미합니다. Euclidean Space와 비교 시, Hyperbolic Space는 Hierarchical Data를 Low Distortion으로 표현할 수 있다는 이점을 가지고 있습니다. Hyperbolic Space의 Volume은 Radius에 따라 Exponential 하게 Grow 하고, 따라서 Exponentially-growing 하는 Hierarchies나 Tree-like Structure를 Low Distortion으로 표현할 수 있습니다. 이러한 측면에서 Hyperbolic Space는 복잡한 Data Structure - 예를 들어 NLP, Social Network, Image Analysis - 등을 표현하는 좋은 툴로서 사용할 수 있습니다.
Learning Affinity with Hyperbolic Representation for Spatial Propagation[23]
본 논문은 Depth Completion Task에서 기존 방법들의 한계점에서 출발합니다. Depth Completion Task란, Sparse Depth Map (e.g. Sparse Point Cloud)과 RGB 이미지가 주어졌을 때, 실제 3D 상의 Dense Depth Map을 Recovery 해내는 - 즉, 모든 Pixel에 대해 Depth Value를 도출하는 - Task입니다.
기존의 SOTA 방법론은 Spatial Propagation Network(SPN)[24] 였습니다. SPN은 두 개의 모듈로 구성되어 있습니다 : (1) Pixel 간의 Pair-wise Affinity를 계산하는 Affinity Branch와 (2) Affinity를 기반으로 Initial Seed를 전체 Image로 Propagate 하는 Propagation Branch. SPN 은 Initial Seed (User-defined이거나 Initial Prediction)를 Propagate 하고 Downstream Task를 수행하는 데에 Optimal 한 샘플 그룹(Affinity Map)을 도출하여 Downstream Low-level Vision Task를 효과적으로 수행합니다.
저자들은 이 SPN이 Boundary Ambiguity를 갖는 점에 주목했습니다. 즉, Image 상에서 Smooth 하게 Intensity가 변화하는 Object Boundary에서의 Affinity Map이 각 Object 간 Distinguishable 하지 않고 서로의 영역을 침범하는 Bleeding 현상이 일어나는 점인데요. 저자들은 이 문제의 원인을 Ill-defined Affinity로 보고, 기존의 Convolution Operation이 Euclidean Space에서 정의된 grid data만을 커버할 수 있다는 본질적인 문제에 집중하였습니다. 따라서 저자들은 Hyperbolic Space의 Geodesic Distance를 반영하여 Affinity 모듈의 문제를 해결하기를 제안합니다.

그림 7. Comparison results between baseline and HAM[23]
본 논문에선 Spatial Affinity를 계산하는 모듈인 Hyperbolic Affinity Learning Module (HAM)을 제안하고 있습니다. HAM은 Pixel Affinity가 Hierarchical Property를 갖도록 만들기 위해, Pixel Feature를 어떤 Curvature를 가진 Hyperbolic Space에 Embed 하고 Aggregate 하는 과정을 거칩니다. 구체적으로는, 두 개의 Component로 구성되어 있습니다 : (1) Beta-priority (2) Geodesic Weight. Beta-priority는 Hyperbolic Space 상에서 Pixel들의 Relative Importance를 계산하고 Semantically 가까운 Feature가 높은 Affinity를 갖도록 Encourage 합니다. Geodesic Weight는 Hyperbolic Space 상에서 Pixel 들의 Geodesic Distance를 계산하고 Hyperbolic Space 상에서 가까운 Pixel이 High Affinity를 갖도록 Encourage 합니다.

그림 8. Qualitative comparison on NYUv2 dataset for depth completion[23]
저자들은 제안하는 HAM이 Depth Completion Task, Semantic Segmentation Task에서 Euclidean Space에서 정의된 SPN보다 Outperform 함을 실험적으로 확인하였고, Pixel Feature의 Hyperbolicity와 Hyperbolic Space에서 각 Embedding의 Tree-likeliness 분석을 토대로, Hyperbolic Geometry가 Vision Task를 해결하는 데에 좋은 툴로 기능할 수 있음을 보였습니다.

그림 9. Quantitative semantic segmentation results on PASCAL VOC 2012[23]
우리는 3D 좌표로 표현된 Euclidean 공간 상에 존재하지만 우리 주변의 데이터는 Non-euclidean 공간에서 큰 설명력을 가지는 경우가 많습니다. 현업에서 주로 다루는 Tabular 데이터, Time-series 데이터 등은 Variable 간의 Hierarchy를 내재하고 있고, Relation으로 표현된 Graph 데이터 등은 Euclidean space의 거리 체계를 따르고 있지 않습니다. Non-euclidean 공간으로의 확장은 Real-world Data의 표현력 있는 Representation Learning을 가능하게 해줄 것입니다.
4. Large Scale Foundation Model
ChatGPT와 같이 방대한 양의 데이터로 훈련된 초거대 모델은 텍스트, 이미지, 오디오 등의 많은 영역에서 놀라운 성능을 보여주고 있습니다. 이러한 Large Scale Foundation 모델에 대한 관심은 ICML 2023에서도 여전히 계속되었습니다. ICML 2023에서는 데이터나 단순히 모델 사이즈의 Scale을 키우는 데에 그치지 않고, 다양한 현실적인 제약/상황 하에서 잘 동작하는 Foundation 모델 연구[25,29]를 다수 확인할 수 있었습니다. 이 중 다음에 소개할 두 가지 LLM 연구는 각각 Long-Tail Knowledge[29]와 Human Preference[25]라는 상황을 가정하며 크게 주목받았습니다.
Large Language Models Struggle to Learn Long-Tail Knowledge[29]에서는 Large Language Model (LLM)과 Long-tail Knowledge를 학습하는 능력 간의 관계를 다루고 있습니다. Long-tail Knowledge는 잘 알려지지 않은 Rare하고 Obscure한 Fact를 의미합니다. 저자들은 Language Model이 Fact-based Question에 Answer 하는 능력은 Pretraining 과정에서 접한 Relevant 한 Document의 개수에 비례함을 실험적으로 보였습니다. 추가적으로, 최근 모델들이 Long-tail Data 관련 QA에 취약하다는 문제를 개선하기 위해 간단한 실험 결과를 함께 제시하고 있습니다. 예시로, 외부 Knowledge를 제공하는 Retrieval-Augmentation가 Rare Fact Learning을 개선하는지 실험하였습니다. Retrieval Module은 LLM에 결합해 Relevant Textual Context를 반환하는 모듈입니다[26-28]. LM과 Wikipedia의 Gold Paragraph를 부여하는 Oracle 세팅에서 GPT-Neo의 2-Shot Accuracy를 평가한 결과, Oracle Retrieval-Augmentation이 Closed-book LLM에 비해 Accuracy를 급진적으로 향상, Pre-training Data의 Relevant Knowledge로의 Dependency를 완화하는 점을 확인할 수 있었습니다.
Pretraining Language Models with Human Preference[25]에서는 Language Model을 Human Preference에 Aligned 된 Text를 생성하도록 Guide 하는 Pretraining 방법을 제안하고 있습니다. 기존 Language Model은 Human Preference를 Violate 하는 Content (거짓정보, 공격적인 코멘트, 개인 식별 정보, 저퀄리티 코드 등)를 생성합니다. 이에 저자들은 Human Preference에 Alignment (Preference를 만족)하면서 동시에 기존 Capability (Downstream Task로의 성능)는 유지할 수 있는 다음 5가지 Objective 기반 Pretraining with Feedback을 제안하고 있습니다 - Conditional Training, Dataset Filtering, Unlikelihood Loss, Reward-Weighted Regression, Advantage-Weighted Regression. 각 Objective는 Task 별로 서로 다른 Alignment- Capability Trade-off를 갖지만, 이 중 Conditional Training이 모든 Task에서 Pareto Frontier 성능이 보임을 실험적으로 확인하였습니다. Conditional Training에서 LM은 Human Preference를 측정하는 Reward Function을 Maximize 하는 Text를 생성하기를 목적으로 합니다. Prompt가 주어지지 않은 상황이나 Adversarially-chosen Prompt가 주어진 상황에서 모두, Language Model은 Human Preference Score에 Condition 된 Token의 Learned Distribution (Expected Reward를 Maximize 하는)에서 Token을 Sampling 하므로, Human Preference에 잘 Align된 Text를 생성할 수 있게 됩니다. 저자들은 Toxicity를 측정하는 Task 등에서 PHF가 Finetuning 대비 현상을 효과적으로 완화할 수 있음을 실험적으로 확인하였습니다.

그림 10. (왼쪽) Language models struggle to capture the long-tail of information on the web[29],
(오른쪽) Toxicity score (lower is better) of LMs[25]
추가적으로 눈여겨볼 점은, 최근 이미지/텍스트 데이터를 학습한 Large Scale Foundation Model의 Knowledge를 다른 Modality의 Downstream Task나 혹은 전혀 다른 문제에 활용하려는 움직임이 관찰된다는 점입니다. 이러한 시도는 매우 고무적입니다. Real-world의 문제 상황이나 일반적인 Modality (Tabular, Graph, CO 등)는 이미지나 텍스트 Benchmark 데이터 대비 샘플 수가 적거나 데이터 수집 과정이 제한적이기 때문입니다. 만일 이미지나 텍스트 등 데이터의 확보가 용이한 Modality의 Knowledge를 Leverage 할 수 있다면 다양한 Task에서 Hand-designed 된 SOTA 모델보다 우수한 성능을 쉽게 얻을 수 있을 것입니다. 물론 이러한 시도는 최근 일부 연구에서 선행적으로 검토된 바 있습니다. [31]에선 GPT-2를 Image Classification에 적용하였으며, [32]에선 LLM을 Tabular Data를 Verbal Description 하는 간단한 Prompt로 Fine-tuning 하여 Tabular Generation 하는 방법을 제안하고 있습니다. 그러나 지금까지의 연구는 각 문제 상황에 Adhoc 하거나 특정 Modality에 국한되어 있다는 한계를 가지고 있었습니다. 이하 문단에서는 Modality 종류에 상관없이 Cross-Modal 하게 Finetuning 하는 연구 Cross-Modal Finetuning: Align then Refine[30]을 소개합니다.
Cross-Modal Fine-Tuning: Align then Refine[30]
본 연구에서 제안하는 방법 ORCA는 단일 Large-scale Pretrained Model을 Diverse Modality에 확장하는 것을 목적으로 합니다. 이론적으로 In-Modality와 Out-Modality에 제한 없이 동작합니다. ORCA는 Target Modality에 Adapt 하는 과정에 Align-then-Refine Workflow를 따릅니다: 즉, Target Input이 주어졌을 때, 이 Input의 Embedded Feature Distribution을 Pretraining Modality에 먼저 Alignment 시키고, 이후 전체 모델(Embedding Network, Model Body, Prediction Head)을 Fine-tuning 하는 방식을 취합니다. 본 연구에서는 Model Body를 Transformer 구조로 가정하고, In-modality가 이미지인 경우 ViT 계열인 Swin Transformer, 텍스트인 경우 RoBERTa에서 실험하였습니다.
중요한 점은, Source와 Target의 Distribution을 Alignment 하는 과정이 두 Modality 간 Semantics를 Alignment 하는 것이 아니라, Structure를 Alignment 하는 점이라는 것입니다. 이 과정은 Embedded Target Feature의 Feature와 Label 간의 Joint Probability가 Source의 그것과 유사하도록 Target Embedder를 강제합니다. 이 과정을 전체 Fine-tuning에 앞서 진행함으로써, 이후 Fine-tuning 과정에서 Model Body가 만나는 Feature-Label Joint Probability 양상은 Source든 Target이든 유사하며, Fine- tuning 과정에서 학습이 원활하게 이루어질 수 있습니다. 저자들은 Alignment 과정에 사용한 Distance Metric으로 Optimal Transport Dataset Distance을 사용함으로써, Joint Probability Alignment를 Feature Space의 Alignment와 Label Space의 Alignment의 합으로 표현하였습니다(Discrete 한 Label Space는 In-class Feature의 Distribution으로 표현해 Continuous로 확장). 그러나 저자들은 이론적으로 어떠한 Distance Metric도 사용이 가능함을 주장하며 다양한 Distance Metric의 실험 결과를 함께 리포트하고 있습니다.

그림 11. ORCA’s three-stage fine-tuning workflow[30]
저자들은 NAS Benchmark의 10개의 다양한 Task (Image, Fluid, Protein, RNAseq 관련 등)에서 실험하였습니다. 각 Task 별로 Task-specific 하게 Hand-designed 한 SOTA의 성능, Auto-ML 계열 중 SOTA의 성능, General Purpose Architecture 성능을 Baseline으로 보았을 때 ORCA가 Outperform 하는 것을 확인하였습니다. 또한 PDE Solving 등의 Source Task와 매우 거리가 있는 Target Task의 경우에 또한 Physical System에 Specific 하게 설계된 FNO 계열이나 PINN 계열들 대비 유사하거나 더 좋은 성능을 보여줌을 확인하였습니다.

그림 12. Prediction errors on 10 diverse tasks[30]

그림 13. (왼쪽) Normalized Root Mean Squared Errors (nRMSEs) for ORCA vs. baselines on 8 PDEBench tasks with varying dimensions (1D/2D), (오른쪽) ORCA is trained on resolution 256 and directly evaluated on resolution 512[30]
Real-world의 문제 상황은 많은 제약조건을 가지고 있으며, Data scarcity도 그중 큰 비중을 차지하고 있습니다. 위 연구는 일반적인 Real-world의 Data-scarce 한 Modality의 예측을 Data-rich 한 Modality의 Knowledge를 활용함으로써 기존 Hand- crafted 된 모델들의 성능 상한을 깰 수 있음을 실험적으로 제시하였습니다. 본 연구를 시작으로 최근 AI 연구의 Scalability 수혜를 상대적으로 누리지 못했던 문제 및 Data Modality에서의 패러다임 전환 및 성능 도약을 기대해 봅니다.
ICML 2023는 특정 분야에 제한되지 않는 ML 학회로 이번 행사에서는 더욱 다양한 Scope의 논문이 발표되었습니다. 그중 이번 학회에서 발표한 연구와 최근 학계에서 특히 주목하고 있으며 LG AI연구원에서도 집중하고 있는 Causal Inference, Geometric Deep Learning, Large Scale Foundation Model 분야의 주요 논문들에 대해 알아보았습니다.
LG AI연구원은 매 학회에서 좋은 연구 성과를 보여주고 있습니다. 뿐만 아니라 ML in Korea를 비롯해 다양한 Social Meetup에 참여하는 등 학생 및 현업 종사자 분들과 적극적인 교류를 이어가고 있습니다. 현장에서 수많은 발표를 들으며 머신 러닝이 적용되는 영역은 더욱 확장되면서 동시에 기술적 난이도는 더욱 높아지고 있다는 것을 느꼈습니다. LG AI연구원의 Data Intelligence Lab 은 Real-world 문제를 머신 러닝 문제로 새롭게 정의하고 효과적으로 풀어내는 응용 연구 분야 기술을 계속해서 개발해 나갈 계획입니다.
▶ Gradient Surgery for One-shot Unlearning on Generative Model (Link)
[1] Constrained Causal Bayesian Optimization (ICML 2023)
[2] Additive Causal Bandits with Unknown Graph (ICML 2023)
[3] GFlowNets for Causal Discovery: an Overview (ICML SPIGM Workshop)
[4] Large-scale differentiable causal discovery of factor graphs (NeurIPS 2022)
[5] Bayesian structure learning with generative flow networks (UAI 2022)
[6] Bayesian learning of causal structure and mechanisms with GFlowNets and variational bayes (arXiv 2022)
[7] Dyngfn: Bayesian dynamic causal discovery using generative flow networks (arXiv 2023)
[8] Causal Discovery with Language Models as Imperfect Experts (ICML SPIGM Workshop)
[9] Generative Causal Representation Learning for Out-of-Distribution Motion Forecasting (ICML 2023)
[10] Which Invariance Should We Transfer? A Causal Minimax Learning Approach (ICML 2023)
[11] Neural Algorithmic Reasoning with Causal Regulation (ICML 2023)
[12] Denoising Diffusion Probabilistic Models (NeurIPS 2020)
[13] E(n) Equivariant Graph Neural Networks (ICML 2021)
[14] DiffDock: Diffusion Steps, Twists, and Turns for Molecular Docking (ICLR 2023)
[15] Equivariant Diffusion for Molecule Generation in 3D (ICML 2022)
[16] GeoDiff: a Geometric Diffusion Model for Molecular Conformation Generation (ICLR 2022)
[17] SE(3)-Transformers: 3D Roto-Translation Equivariant Attention Networks (NeurIPS 2020)
[18] Geometric Latent Diffusion Models for 3D Molecule Generation (ICML 2023)
[19] Towards Coherent Image Inpainting Using Denoising Diffusion Implicit Models (ICML 2023)
[20] GibbsDDRM: A Partially Collapsed Gibbs Sampler for Solving Blind Inverse Problems with Denoising Diffusion Restoration (ICML 2023)
[21] Mixed-curvature Variational Autoencoders (ICLR 2020)
[22] Hyperbolic Graph Convolutional Neural Networks (NeurIPS 2019)
[23] Learning Affinity with Hyperbolic Representation for Spatial Propagation (ICML 2023)
[24] Dynamic Spatial Propagation Network for Depth Completion (AAAI 2022)
[25] Pretraining Language Models with Human Preference (ICML 2023)
[26] Retrieval-augmented generation for knowledge-intensive NLP tasks (NeurIPS 2020)
[27] Retrieval augmented language model pre-training (ICML 2020)
[28] Dense passage retrieval for open-domain question answering (EMNLP 2020)
[29] Large Language Models Struggle to Learn Long-Tail Knowledge (ICML 2023)
[30] Cross-Modal Fine-Tuning: Align then Refine (ICML 2023)
[31] Frozen pretrained transformers as universal computation engines (AAAI 2022)
[32] Lift:Language-interfaced fine-tuning for non-language machine learning tasks (NeurIPS 2022)
[33] Gradient Surgery for Multi-Task Learning (NeurIPS 2020)
[34] Gradient Surgery for One-shot Unlearning on Generative Model (ICML 2023 Workshop on Generative AI & Law)
[35] Privacy-Preserving Gradient Surgery for Group Removal on Deep Network (Preprint)
[36] Certified Data Removal from Machine Learning Models (ICML 2020)
[37] Eternal Sunshine of the Spotless Net: Selective Forgetting in Deep Networks (CVPR 2020)
[38] Forgetting Outside the Box: Scrubbing Deep Networks of Information Accessible from Input-Output Observations (ECCV 2020)
[39] Deep Unlearning via Randomized Conditionally Independent Hessians (CVPR 2020)
[40] Generative Flow Networks (https://yoshuabengio.org/2022/03/05/generative-flow-networks/)