MSW_6c36937c1.png Seonwoo Min 2022.08.25

[ECCV 2022] Grounding Visual Representations with Texts for Domain Generalization

본 연구에서는 Domain Generalization 문제 해결을 위해 natural language supervision을 활용하는 방법론을 소개합니다. 이번 연구를 통해 인간이 이미지를 설명하는 문장을 통해 시각적 표현형을 정착시키기 위한 두 가지 모듈을 제안합니다. Visual and Textual Joint Embedder는 시각적 표현형을 문장의 표현형을 중심으로 정렬하는 역할을 합니다. Textual Explanation Generator는 모델의 결정 근거를 설명하는 문장을 생성해냅니다. LG AI연구원은 이번 연구에서 새롭게 만든 CUB-DG 데이터셋과 DomainBed 벤치마크 모두에서 domain generalization 성능을 향상하고 SOTA 결과를 달성하였습니다.

 

Introduction and Motivation

기계학습(Machine learning)에서는 학습 데이터와 테스트 데이터가 독립적이고 동일하게 분포한다고 가정합니다. 하지만 이러한 가정은 도메인 전환이 자주 발생하는 현실에서는 무너지는 경우가 많습니다. 도시에서 촬영한 이미지로 학습된 자동차 이미지 분류 모델을 생각해보면, 사용자가 사용할 때는 학습 이미지와는 매우 다른 테스트 이미지가 주어질 수 있습니다. 예를 들어, 시골에서 촬영한 테스트 이미지가 주어질 경우 모델의 성능이 크게 하락할 수 있습니다. 이와 같은 문제를 domain generalization (DG) problem라고 합니다. 가능한 모든 도메인을 포함하는 데이터로 모델 학습을 진행한다면 문제가 개선될 수 있지만, 이는 비용이 많이 들고 실질적으로 불가능한 작업입니다. 따라서, 인공지능 모델의 DG 성능을 향상하는 연구는 학술 및 산업 분야에서 모두 중요하게 여겨지고 있습니다.

 

Figure 1. 본 연구 모델은 인간의 설명을 포함하는 텍스트로 시각적 표현형을 정착시킵니다.

 

이번 연구에서는 인간이 이미지를 설명하는 문장을 통해 모델의 시각적 표현형을 정착시키는 새로운 접근 방식을 제안합니다 (Figure 1). 우리는 natural language supervision을 활용하는 학습 방식이 image-only 학습 방식보다 특히 DG 문제에서 뛰어난 잠재력을 지님을 보여줍니다. 도메인 전환에 취약한 일반적인 기계학습 모델들과는 달리, 인간의 시각 인식 시스템은 도메인 일반화가 잘 이루어 집니다. 이러한 통찰을 토대로, 우리는 모델이 인간의 사고 과정과 부합할 수 있도록 언어적 설명을 활용하여 모델을 학습시킴으로써 DG 성능을 향상시킬 수 있었습니다.

 

Methods

본 연구의 중심인 DG 문제 셋팅에서는 단일 또는 다중 소스 도메인 S1,S2,=S에서 모델을 학습하고, 새로운 타겟 도메인 T1,T2,=T에서 해당 모델을 평가합니다. 이번 모델은 여러 도메인에서 발생하는 오류의 합을 최소화하는 Empirical Risk Minimization (ERM)에 기반을 두고 있습니다[1]. 이는 모델 매개 변수 θ에 대해 정의된 task-specific loss function task을 사용하며, 분류 문제에 초점을 맞추는 본 연구에서는 다음과 같이 정의된 cross-entropy loss를 사용합니다.

 
 

이때 y는 각 라벨의 클래스를 표시하는 One-Hot Vector이며, y^는 시각적 표현형 x에서 얻은 softmax 결과값입니다.

 

Figure 2. 제안 모델에 대한 개요.
본 모델은 (1) Visual and Textual Joint Embedder와 (2) Textual Explanation Generator을 통해 text modality를 활용합니다.

 

DG 문제 해결의 핵심은 모델의 일반화 성능 향상을 위해 이미지 도메인 전환에 영향을 적게 받는 표현형을 학습하는 것입니다. 우리는 이를 위해 핵심적인 의미를 학습할 수 있도록 하는 cross-modality supervision을 활용을 제안합니다. 구체적으로, 우리는 인간이 이미지를 설명하는 문장을 통해 모델의 시각적 표현형을 정착시키기 위해 두 가지 모듈을 사용합니다 (Figure 2). 첫 번째, Visual and Textual Joint Embedder는 모델이 이미지로부터 문장의 의미와 정렬된 시각적 표현형을 생성하도록 학습합니다. 두 번째, Textual Explanation Generator는 모델의 결정을 시각적 근거에 기반하여 설명하는 문장을 생성하도록 학습합니다. 두 가지 모듈은 모두 학습 단계에서만 모델을 정착시키기 위해 사용되며 테스트 단계에서는 불필요합니다. 다만, 테스트 단계에서도 원한다면 Textual Explanation Generator를 사용하여 모델의 결정 근거를 설명하는 문장을 얻을 수 있습니다.

 

Visual and Textual Joint Embedder

사람들의 언어적 설명은 종종 이미지를 식별할 수 있는 핵심적인 시각적 단서를 포함하고 있습니다. 따라서, natural language supervision은 이미지 도메인 전환에 영향을 적게 받는 시각적 표현형을 학습하는데 도움이 될 수 있습니다. Visual and Textual Joint Embedder에서는 sentence-level textual encoder를 사용하여, 가변적인 길이의 문장으로부터 크기가 고정된 표현형 v를 생성합니다. 우리는 모델이 도메인에 무관하게 이미지로부터 문장의 의미와 정렬된 시각적 표현형을 생성하도록 학습합니다. 구체적으로, 우리는 투사된 문장의 표현형과 시각적 표현형 사이의 l2거리를 최소화하는 다음의 목적 함수 align를 사용합니다.

 
 

fprojgproj는 각각 문장과 시각적 표현형을 위한 projection layer이며, yl~은 투사된 시각적 표현형 gprojxi에서 얻은 softmax 결과값입니다. 두 번째 cross-entropy 부분은 투사된 시각적 표현형이 이미지를 식별할 수 있는 정보를 내재하도록 유도합니다.

Pre-trained (Supervised) Textual Encoder (PTE)
문장의 표현형을 생성하는 방법 중 하나는 많은 데이터를 활용하여 사전 학습된 언어 모델을 활용하는 것입니다. 우리는 텍스트와 이미지를 같은 표현 공간에서 나타낼 수 있는 널리 알려진 CLIP을[2] 사용했습니다. CLIP의textual encoder는 63M개의 매개변수를 갖는 Transformer기반의 모델입니다. 이는 Vision Transformer (ViT) 기반의 image encoder와 함께 이미지와 텍스트의 올바른 쌍을 맞추는 방법으로 사전 학습되었습니다. 이번 연구에서는 CLIP-ViT-B-32모델의 text encoder를 메인으로 사용했지만, 다른 사전 학습된 언어 모델들도 활용 가능합니다.

Self-supervised Textual Encoder (STE)
문장의 표현형을 생성하는 또 다른 방법은 self-supervision을 사용하는 것입니다. 우리는 모델의 결정 근거를 설명하는Textual Explanation Generator를 self-supervised textual encoder로서 사용합니다. 다음 섹션에서 설명하는 것처럼, 우리는 모델을 학습하는 동안 long short-term memory (LSTM) 기반의 explanation generator에서 문장을 반복적으로 생성합니다. 따라서, LSTM의 마지막 hidden state를 자연스럽게 문장의 크기가 고정된 표현형 v로 사용할 수 있습니다.

Textual Explanation Generator
Textual Explanation Generator는 시각형 표현형을 입력으로 받아, 각 단어 별로 softmax 결과값을 출력하는 2-layer LSTM을 기반으로 합니다. 모델의 결정 근거를 설명하기 위해서는 분류 모델의 예측 결과도 Textual Explanation Generator의 입력으로 넣어줄 필요가 있습니다. 따라서, 이를 결과를 projected visual feature gprojx와 하나의 벡터로 결합하여 두 번째 LSTM layer의 입력으로 사용합니다.

우리는 강화 학습에 기반한 목적 함수를 사용하여 이미지 식별에 핵심적인 단서를 문장에 포함하도록 모델을 학습시킵니다[3]. 구체적으로, Textual Explanation Generator에서 샘플링된 문장들 o~~poI,C에 대해 -Ro~ 기대값을 최소화합니다. 여기서 poI,C는 주어진 입력 이미지 I와 분류 범주 C에 대한 문장들의 조건부 확률 분포입니다. 우리는 보상 함수로 Ro~=pCo~로 사용함으로써 생성된 문장이 이미지 식별에 핵심적인 단서를 포함할 수록 더 높은 보상을 받게 됩니다. 수식적으로, 우리는 다음의 목적 함수 expl를 최소화합니다.


Loss function

종합하면, 우리는 다음의 목적 함수 을 최소화하여 모델을 학습시킵니다.


이 때, hyperparameter λalignλexpl는 각 목적 함수의 크기를 조정하는데 사용됩니다.

 

Caltech UCSD Birds – Domain Generalization Extension (CUB-DG) Dataset

기존의 DG 벤치마크 데이터셋들은 사용 가능한 natural language supervision을 제공하지 않습니다. 따라서, 이번 연구에서는 DG 문제에서 cross-modality supervision의 효과를 확인하기 위해 CUB 데이터 세트를 기반으로 한 새로운 벤치마크 데이터셋을 준비했습니다[4]. CUB 데이터셋은 사진(Photo) 도메인으로만 구성되기 때문에, 우리는 사전 학습된 스타일 변환 모델들을 통해 세 가지 다른 도메인 (그림, 수채화, 만화)의 이미지를 만들었습니다[5~7].

 

Figure 3. DG 문제에서 natural language supervision의 효과를 확인하기 위해 CUB-DG 데이터 세트를 만들었습니다.

 

새롭게 만든 CUB-DG 데이터셋에는 11,768개의 이미지 세트와 이를 설명하는 문장들이 포함됩니다. 각 이미지 세트는 동일한 이미지를 4개의 다른 도메인에서 보여줍니다 (Figure 3). 우리는 서로 다른 도메인이 동일한 이미지를 포함하지 않도록 소스 도메인 데이터를 분할하여 학습에 사용합니다. 한 가지 유의할 점은 CUB-DG 데이터셋의 이미지들이 유사해 보일 수 있어도, 모델의 관점에서는 도메인들 사이에 상당한 차이를 지니고 있다는 것입니다. 예를 들어, Photo 도메인의 데이터로만 학습된 ERM모델을 다른 도메인의 데이터로 테스트할 경우에 큰 성능 하락을 보입니다.

 

Experiment Results

우리는 Multi-source DG 환경에서 돌아가면서 세 개의 도메인을 학습에 사용하고 나머지 하나의 도메인을 테스트에 사용하였습니다. 우선 새롭게 만든 CUB-DG데이터 세트에서 제안한 모델을 평가한 결과, 모든 테스트 도메인에서 우리의 모델이 다른 방법보다 우수한 성능을 보였습니다 (Table 1). 우리의 모델들 사이에서는 차이는 작지만 PTE를 사용하는 것이 더 우수한 성능을 보인다는 점도 확인했습니다.

본 블로그에서는 이번 연구의 주요 결과만 제시했으며, 더 자세한 실험 결과는 논문을 통해 확인하실 수 있습니다(Link). 전체 실험 결과는 제안한 모델에 대한 흥미로운 관찰들을 제공합니다. 예를 들어, 두 가지 모듈 중에서 Joint Embedder가 natural language supervision을 활용함에 있어서 더 핵심적인 역할을 합니다. 더불어 CLIP외에 다양한 사전 학습된 언어 모델들도 성공적으로 DG 성능을 향상시킬 수 있음을 확인했습니다.

 

Table 1. CUB-DG 벤치마크에 대한 Multi-source DG 평가 결과.

 

다음으로는 널리 사용되는 DomainBed 벤치마크를 활용하여 모델을 평가하였습니다[8]. 지금까지는 Per-Image 문장들이 주어졌다고 가정했지만, 모든 이미지에 대응되는 문장들을 얻는 것은 현실적으로 어려운 일입니다. 따라서, 우리는 각 클래스 별로 하나의 문장만을 동일하게 사용하는 보다 실용적인 방법을 소개합니다. 우리는 Oxford English Dictionary에서 각 클래스를 정의하는 문장들을 natural language supervision로서 사용했습니다[9]. 위와 같은 방법을 활용할 때, 우리의 모델은 DomainBed 벤치마크의 5개의 데이터셋에서 평균 1위를 달성하며 SOTA 성능을 보였습니다 (Table 2).

 

Table 2. CUB-DG 벤치마크에 대한 Multi-source DG 평가 결과.

 

Conclusion

이번 연구에서는 DG 성능 향상을 위해 cross-modality supervision을 활용하는 방법론을 소개했습니다. 구체적으로, 인간이 이미지를 설명하는 문장을 이미지 분류 모델의 학습과정에 활용하기 위한 두 가지 새로운 모듈을 제안했습니다. 우리는 Visual and Textual Joint Embedder를 통해 인간이 이미지를 설명하는 문장의 표현형과 정렬된 시각적 표현형을 학습할 수 있으며, Textual Explanation Generator를 통해 모델의 결정 근거를 언어적으로 설명할 수 있음을 보였습니다. 이번 모델은 새롭게 만든 CUB-DG 데이터셋과 DomainBed 벤치마크 모두에서 DG 성능을 향상하고 SOTA 결과를 달성하였습니다.

 

▶Grounding Visual Representations with Texts for Domain Generalization

- 논문 (Link)
- 코드 (Link)

참고
[1] Vapnik. Statistical learning theory. Wiley 2018.

[2] Radford et al. Learning transferable visual models from natural language supervision. arXiv 2021.

[3] Hendricks et al. Generating visual explanations. ECCV 2016.

[4] Welinder et al. Caltech-UCSD Birds 200. California Institute of Technology 2010.

[5] Zhu et al. Unpaired image-to-image translation using cycle-consistent adversarial networks. ICCV 2017.

[6] Zou et al. Stylized neural painting. ICCV 2021.

[7] Wang et al. Learning to cartoonize using white-box cartoon representations. ICCV 2020.

[8] Gulrajani et al. In search of lost domain generalization. ICLR 2021.

[9] Stevenson. Oxford dictionary of English. Oxford University Press 2010.