Suhee_Yoon-2_d8241add1.png Suhee Yoon 2025.04.28

[AAAI-25] Foundation Model을 활용한 Anomaly 및 Out-of-Distribution Detection 강화

2025년 2월 25일부터 3월 4일까지 미국 펜실베이니아 필라델피아에서 AAAI-25 (Association For The Advancement of Artificial Intelligence)가 개최되었습니다. 전 세계 연구자와 산업 전문가들이 AI 기술의 최신 동향과 혁신적 연구 성과를 공유했고, AI의 기술 발전과 더불어 실제 산업 현장에서의 응용에 관한 연구 발표가 중점을 이뤘습니다. 특히 Foundation Model을 적극 활용하여 기존 산업의 난제들을 효과적으로 해결하는 시도가 돋보였습니다.

여러 산업 분야에서 공통적으로 직면하는 중요 과제 중 하나는 학습 과정에서 접하지 못한 Anomaly 또는 Out-of-Distribution(OOD) 데이터를 정확히 감지하는 능력입니다. LG AI연구원 Data Intelligence (DI) Lab은 이 문제를 효과적으로 접근한 “Diffusion-based Semantic Outlier Generation via Nuisance Awareness for Out-of-Distribution Detection”을 AAAI 메인 트랙 포스터 세션에서 발표했습니다.

이번 글에서는 LG AI연구원이 발표한 연구의 핵심 내용과 함께 Anomaly Detection 및 OOD Detection 분야의 주요 발전 동향을 분석하고자 합니다.


LG AI 연구원의 “Diffusion-based Semantic Outlier Generation via Nuisance Awareness for Out-of-Distribution Detection (SONA)[1]

Out-of-Distribution (OOD) Detection은 주어진 샘플이 학습에 사용된 In-distribution (ID)에 해당하는지를 판별하는 문제입니다. 기존의 OOD 검출 방법 중 하나인 Outlier Exposure 기법은 외부에서 얻은 OOD 샘플을 활용하여 모델이 ID와 OOD를 구분하도록 학습을 유도하는 방식입니다. 하지만, 이러한 방식은 외부 OOD 샘플을 수집하는 과정에서 비용이 발생하며, 특히 Near-OOD와 같이 ID와 유사한 샘플을 정확히 구별하기 어렵다는 한계가 존재합니다. 최근 연구들은 Diffusion 모델을 사용하여 Realistic한 Pixel-space에서 OOD 샘플을 생성하는 접근을 시도했지만, 이런 접근법 역시 생성된 샘플의 품질이 Target에 크게 의존하여 성능이 불안정한 문제가 있습니다. 따라서 ID 샘플의 세밀한 Semantic 특징을 고려하여 Near-OOD 샘플을 정확히 탐지할 수 있는 새로운 접근법이 필요합니다.

LG AI연구원이 제안한 SONA (Semantic Outlier Generation via Nuisance Awareness)는 Near-OOD부터 Far-OOD까지 정확하게 Detect하는 새로운 Outlier Generation 프레임워크로, 그 핵심은 ID 이미지를 직접적으로 Diffusion Model에 사용하는 것입니다. 아래 이미지 1에서 확인할 수 있듯이 SONA는 크게 SONA Outlier 합성과, OOD Classifier를 SONA Outlier로 학습하는 두 가지 유형으로 이루어집니다.


이미지 1. SONA Framework Overview[1]


먼저, Outlier 합성 과정에는 Diffusion Model에 ID 이미지를 넣기 전에 해당 이미지에 Random Timestep 까지 노이즈를 주입하여 ID의 Semantic 부분 위주로 Noise Corruption 효과가 더 크게 나타나도록 합니다. 이후, 원본 ID 이미지의 Semantic과 Nuisance 부분에 서로 다른 효과를 주기 위해, Conditional-Unconditional Noise Estimation 값의 차이를 활용하여 Masking합니다. 값의 차이가 크다면 해당 Condition의 특징을 많이 포함하며 Unconditional Term과 중복된 특징이 거의 없는 것으로 판단하여 Semantic 영역으로 Masking 합니다. 반대로, 값의 차이가 작다면 Unconditional Term과 중복된 특징을 많이 공유하고 있으므로 해당 부분은 Nuisance로 Masking 됩니다.

이렇게 Masking된 정보를 기반으로 하여 SONA Guidance는 총 세 가지 효과를 적용합니다:


  1. 기존 원본 Semantic 정보는 제거하고, Nuisance 정보는 최대한 유지합니다.

  2. 추가로 더욱 다양한 Outlier를 생성하기 위해 Random OOD Semantic을 선정합니다.

  3. 이를 기존 ID Semantic과 섞이게 합니다.

 

우리가 제안한 SONA Guidance는 기존의 선행 연구들에서 여러 번 한계점으로 언급되었던, 값의 차이에 의한 Outlier 생성 Quality Sensativity를 보다 효과적으로 해결했습니다.

더 나아가, 본 논문에서는 OOD Classifier가 SONA Outlier를 보다 효과적으로 학습할 수 있도록 새로운 Loss Term을 제안했습니다. Loss의 첫 번째 Term은 ID Class Label을 가지고 Multi-class Classification을 진행하며, 두 번째 Term에서는 Classifier가 ID와 OOD Sample을 구분할 수 있도록 학습합니다. 마지막으로, 세 번째 Term에서는 ID와 OOD Sample의 Semantic 정보의 Mutual Information을 Minimize하여 Classifier가 Semantic 차이에 보다 더 집중적으로 학습하게 합니다.


L = E(x,y)~DIDLCE(g(f(x)),y)+βExOOD~DOOD LOE gfxOOD +LMIf(x), fxOOD 

 

생성된 SONA 이미지의 예시는 아래와 같습니다. 기존에 활용된 Outlier들에 비해 SONA Outlier가 훨씬 더 정교한 Semantic 차이를 보여줌을 알 수 있습니다.


이미지 2. SONA와 기존 Outlier 생성 방법론 간의 시각적 비교 결과[1]


본 논문의 실험에서는 SONA의 SOTA 성능을 보여줍니다. 기존의 다양한 OOD Detection 방법론들과 비교했을 때, Near-OOD와 Far-OOD에서 모두 SOTA 성능을 보여줍니다. 특히, 기존 방법론들은 Near-OOD Dataset에서 심각한 성능 저하를 보여준 것과 달리, SONA는 Near-OOD Dataset에서도 여전히 높은 성능을 유지하며 프레임워크의 효용성을 입증했습니다.


이미지 3. Imagenet200에서 Near-OOD 및 Far-OOD 데이터셋에서의 SONA와 기존 방법론 간 성능 비교[1] (평가지표 : AUROC)


AAAI-25에서 주목할 만한 Detection 관련 연구

1) LogicAD: Explainable Anomaly Detection Via VLM-Based Text Feature Extraction[2]

본 논문에서는 산업 현장에서의 이미지 Anomaly Detection (AD) 문제가 구조적 이상(Structural Anomaly, SA)과 논리적 이상(Logical Anomaly, LA)으로 구분될 수 있다고 주장합니다. 구조적 이상은 결함, 긁힘, 파손과 같이 Localized Regional Features로 나타나는 이상인 반면, Logical Anomaly는 객체의 위치 오류, 누락, 개수 불일치 등 더 전역적이고 추상적인 판단이 필요한 복잡한 형태의 이상입니다. 기존의 AD 방법론은 대부분 Visual Feature 기반으로 작동하며, Pre-trained Vision Encoder를 기반으로 정상 데이터의 패턴을 학습하여 이상을 판단합니다.

그러나 이러한 방법들은 대부분 지역적 Visual Feature에만 집중하며, Logical 이상 판단 및 결과 해석에는 한계를 보입니다. 특히, LA는 정상 상태의 규칙적인 구성에 대한 이해와 Reasoning이 필요하기 때문에 더 높은 수준의 Semantic Understanding이 요구됩니다. 이에 따라 최근에는 Vision-Language Model (VLM), 특히 Autoregressive Multimodal Vision Language Models (Avlms)을 기반으로 한 이상 탐지의 가능성이 주목받고 있습니다. LogicAD는 이러한 한계를 극복하고자 Text Feature Extraction 및 Logic Reasoning을 기반으로 한, Explainable Logical Anomaly Detection 프레임워크를 제안합니다. 핵심 아이디어는 AVLM의 이미지-텍스트 매핑 능력을 활용하여 이미지로부터 Logical Text Descriptions을 생성하고, Automated Theorem Prover (ATP)를 통해 주어진 입력 이미지가 정상 규칙을 위반하는지 판단하는 방식입니다.

본 논문은 LogicAD를 세 가지 핵심 구성 요소로 나누어 설명합니다:


  1. 이미지로부터 논리적으로 해석 가능한 텍스트 정보를 생성하는 Text Feature Extraction 단계

  2. 생성된 텍스트 정보를 정형화된 구조로 임베딩하고 유사도를 계산하여 이상 여부를 판단하는 Format Embedding 단계

  3. 텍스트 정보를 논리 명세로 변환한 뒤 정형 논리 기반의 추론을 수행하여 이상 여부를 보다 정밀하고 설명 가능하게 판단하는 Logic Reasoner 단계

 

이미지 4. LogicAD Framework Overview[2]


LogicAD의 전처리 과정은 가장 먼저 입력 이미지에 존재하는 Visual Feature로부터 설명 가능한 텍스트를 추출하는 것에서부터 시작합니다. 이를 위해 Grounding DINO를 사용하여 이미지 내 ROI (Region of Interest)를 자동으로 추출하고, 각 ROI 및 전체 이미지를 AVLM에 입력하여 해당 영역을 설명하는 텍스트를 생성합니다. 이때 단순한 텍스트 생성만으로는 논리 이상 판단에 필요한 세부 정보를 충분히 확보하기 어렵습니다. 때문에LogicAD는 Guided Chain-of-thought (Cot) 프롬프트 방식을 도입했습니다. 예를 들어, “왼쪽에 몇 개의 슬롯이 있는가?”, “각 슬롯은 어떤 색의 케이블이 연결되어 있는가?”, “두 슬롯의 상대 위치(Top/Middle/Bottom)가 일치하는가?”와 같은 구체적이고 논리 판단에 필요한 정보를 직접적으로 유도하는 질문형 프롬프트를 구성하여, AVLM이 단순 묘사를 넘어서 구조 및 관계성 중심의 설명을 생성할 수 있도록 유도합니다. 생성된 설명은 AVLM의 변동성을 줄이기 위해 여러 번 반복 생성한 후, Text-embedding-3-large 임베딩 모델을 활용하여 벡터화하고, 이후 Local Outlier Factor (LOF)를 이용한 필터링 과정을 거쳐 품질이 낮거나 의미가 일관되지 않은 설명들을 제거합니다. 이러한 과정을 통해 의미적 일관성과 정확도를 갖춘 논리 기반 Text Feature를 최종적으로 확보하게 됩니다.

이와 같이 확보된 Text Feature는 두 가지 방식으로 활용됩니다. 하나는 임베딩 기반의 비교 방식이며, 다른 하나는 Formal Logic 기반의 추론 방식입니다. 전자의 경우, AVLM이 생성한 텍스트들을 LLM을 통해 JSON 기반 형식으로 정규화 한 후, 정상 이미지와 쿼리 이미지 각각에 대해 임베딩을 생성하고, Cosine Similarity를 계산하여 Anomaly Score를 얻습니다. 이 임베딩 유사도는 Score 기반 이상 판단에 사용되며, 유사도가 낮을수록 이상일 가능성이 높다고 판단합니다. 이 방식은 빠른 평가가 가능하다는 장점이 있지만, 근본적인 이상 원인을 설명하거나 복잡한 논리 오류를 정밀하게 탐지하는 데에는 한계가 있습니다. 이에 LogicAD는 논리 추론 방식을 병행하여 보다 심층적인 이상 판단을 수행합니다.

Formal Logic 기반의 추론 방식에서는 자연어로 구성된 이미지 설명을 정형화된 논리 표현으로 바꾸고, 이를 기반으로 정리 증명기(Prover9)를 활용하여 해당 이미지가 정상적인 논리 규칙을 위반하는지를 판단합니다. 예를 들어, "왼쪽에 사과와 네크타린이 있다"는 설명이 정상 규칙인 "왼쪽에는 둘 중 하나만 있어야 한다"는 조건과 모순된다면, LogicAD는 이를 논리적으로 증명하고 해당 이미지가 이상이라는 판단을 내릴 수 있습니다. 이 과정에서는 단순히 이상 여부만 판단하는 것이 아니라, 어떤 정보가 충돌을 유발했는지도 함께 식별하여 설명 가능한 이상 탐지를 실현합니다. 이러한 논리 추론의 정밀도를 높이기 위해, LogicAD는 객체 간 구분 규칙, 유일성 조건, 등장 가능한 객체의 제한, 기본값 지정 등 다양한 논리 규칙들을 함께 활용하여 누락된 정보나 모호한 상황도 안정적으로 처리할 수 있도록 설계되어 있습니다.

LogicAD는 다양한 이상 탐지 벤치마크에서 우수한 성능을 보이며 그 효과를 입증했습니다. 특히 논문에서는 MVTec LOCO AD 데이터셋을 기반으로 한 실험을 통해 LogicAD가 기존의 시각 피처 기반 방법론들보다 훨씬 뛰어난 성능을 보인다는 점을 강조하고 있습니다.


이미지 5. MVTec LOCO AD에서 LogicAD와 기존 방법론 간 성능 비교[2] (평가지표: AUROC, F1-Max)


2) Uniformaly: Towards Task-agnostic Unified Framework for Visual Anomaly Detection[3]

Uniformaly는 Task-agnostic하고 Unified한 Anomaly Detection Framework의 필요성에 주목하며 출발한 연구입니다. 실제 환경에서는 Anomaly Detection이 Defect Detection, Semantic Anomaly Detection, Multi-Class Anomaly Detection, Anomaly Clustering 등 다양한 형태로 요구되지만, 기존 연구들은 각 Task에 맞춰 별도의 모델 구조와 학습 전략을 설계해 왔습니다. 따라서 이를 다른 작업에 그대로 적용하기 어려운 한계가 있었습니다. 특히 Anomaly Detection은 대부분 Normal 데이터만을 활용하는 비지도 학습 환경에서 작동하기 때문에, 작업별로 모델을 재설계하거나 Fine-tuning이 필요한 기존 방식은 실용성과 확장성 측면에서 비효율적입니다. 이에 본 연구는 Self-supervised Vision Transformer의 Unified Representation에 주목하고, 어떤 Task에도 추가 수정 없이 적용 가능한 단일 프레임워크를 목표로 Uniformaly를 제안합니다. 이를 위해 세 가지 핵심 요소를 설계에 반영했습니다:


  1. 다양한 Task에 통용될 수 있는 Robust한 Representation을 활용

  2. Background Noise를 제거하고 Foreground 중심의 정보를 학습에 반영

  3. Anomaly의 다양한 분포를 포착할 수 있는 Flexible한 Scoring 방식을 도입

 

본 논문은 전체 프레임워크를 크게 세 단계로 구성해 제시합니다. 먼저 Training Set으로부터 Normal 이미지를 입력받아 Patch-level Representation을 추출하고, 이를 기반으로 Foreground 중심의 Memory Bank를 구축합니다. 이후 Inference 시에는 Test Image에 대해 동일한 방식으로 Patch-level Feature를 추출한 뒤, 메모리 내 정상 Patch들과의 유사도를 기반으로 Anomaly Score를 계산하는 방식입니다. 이 구조는 기존 Memory-based Anomaly Detection 구조와 유사하지만, Uniformaly는 여기에 두 가지 새로운 방법을 도입함으로써 Robustness와 Generalizability를 크게 향상시킵니다.


이미지 6. Uniformaly Framework Overview[3]


Back Patch Masking (BPM)은 의미 없는 Background Patch가 Memory Bank나 Anomaly Score에 영향을 미치는 문제를 해결하기 위해 도입되었습니다. 기존 방식은 모든 Patch를 Memory에 포함해 불필요한 Noise를 초래했지만, Uniformaly는 Vit의 [CLS] Token에서 생성된 Self-attention Map을 기반으로 Foreground에 해당하는 Patch만 선택합니다. Attention Score가 높은 영역을 Smoothing 처리한 후 Threshold를 적용하여 Binary Mask를 생성하고, 이 Mask를 통해 Foreground Patch만을 Memory에 저장하고 Scoring에 활용합니다. 이로써 Memory 사용량을 줄이고, 의미 있는 Anomaly Detection에 집중할 수 있습니다.

두 번째 기법인 Top K-ratio Feature Matching은 기존 Max Aggregation 방식의 한계를 보완합니다. Max 방식은 단일 패치에 의존해 Noise에 민감하거나 Semantic Anomaly를 포착하지 못하는 문제가 있었습니다. 이에 따라 Uniformaly는 Foreground Patch 중 Anomaly Score가 가장 높은 상위 K%의 Score만을 평균하여 최종 Anomaly Score로 사용합니다. 이 방식은 Noise에 의한 영향을 줄이면서도, 다양한 이상 패턴을 포괄할 수 있어 Robustness를 높이고, Multi-class Anomaly나 Anomaly Clustering 등에도 효과적으로 활용될 수 있습니다.

Uniformaly는 다양한 Anomaly Detection Task 전반에서 기존 방법론 대비 안정적이고 일관된 성능을 보여주었습니다. 특히 Defect Detection 분야에서는 대표적인 산업용 데이터셋에서 기존 SOTA 기법보다 더 높은 정확도와 낮은 분산을 기록하며, 실제 제조 환경에서의 신뢰도 높은 이상 탐지가 가능함을 입증했습니다. Semantic Anomaly Detection에서도, 다양한 데이터셋에서 뛰어난 성능을 보여주었습니다.


이미지 7. MVTec AD에서의 Defect Detection 성능 비교[3] (평가지표: AUROC)

이미지 8. 다양한 데이터셋에서의 Semantic Anomaly Detection 성능 비교[3] (평가지표: AUROC)


향후 계획

LG AI연구원 DI Lab은 Anomaly 및 OOD Detection을 중심으로, 다양한 Modality 전반에 걸친 연구를 지속해오고 있습니다. Text, Image와 같은 Unstructured 데이터 뿐만 아니라, 실제 산업 현장에서 중요한 역할을 하는 Tabular, Time-series, Graph 등 Structured 데이터에서도 Robust한 이상 탐지 기법을 개발해 왔습니다. 앞으로는 이러한 Anomaly/OOD Detection 역량을 더욱 고도화함과 동시에, 해당 과제를 목표로 한 Foundation Model 개발도 이어 나갈 계획입니다. LG AI연구원은 이러한 기술 기반을 바탕으로, 다양한 도메인에서 신뢰성 높은 이상 탐지 솔루션을 제공하고 AI의 실제 활용 가치를 확장해 나갈 것입니다.


AAAI-25 시리즈

EP.1 [AAAI-25] 3차원 좌표를 활용한 Denoising Distillation 모델 연구
EP.2 [AAAI-25] Tabular 데이터 예측 성능 향상을 위한 Truncated SVD 기반 Representation space에서의 새로운 증강기법
EP.3 [AAAI-25] 변수 중복성을 완화하는 효율적인 시계열 예측 모델 학습 전략 연구
EP.4 [AAAI-25] ImagePiece: Efficient ViT에서 토큰의 의미화를 위한 새로운 Content-Aware Re-Tokenization 기법

참고

[1] Yoon, Suhee, et al. "Diffusion based Semantic Outlier Generation via Nuisance Awareness for Out-of-Distribution Detection." arXiv preprint arXiv:2408.14841 (2024).

[2] Jin, Er, et al. "LogicAD: Explainable Anomaly Detection via VLM-based Text Feature Extraction." arXiv preprint arXiv:2501.01767 (2025).

[3] Lee, Yujin, et al. "UniFormaly: Towards Task-Agnostic Unified Framework for Visual Anomaly Detection." arXiv preprint arXiv:2307.12540 (2023).