62Soonyoung Lee3.png Soonyoung Lee 2023.08.01

APH_2e6f6d141.png Pyunghwan Ahn 2023.08.01

[CVPR 2023] CVPR 2023에서 CV 연구 동향과 이미지 캡셔닝의 미래를 보다

세계 최대 컴퓨터 비전 학회인 ‘CVPR(Computer Vision and Pattern Recognition) 2023’이 캐나다 밴쿠버에서 6월 18일부터 22일까지 5일간 진행되었습니다. 이번 CVPR 2023에서 LG AI연구원은 다양한 논문을 통해 Computer Vision(CV) 분야의 연구 동향을 살펴보고, ‘NICE : New frontiers for zero-shot Image Captioning Evaluation’ 워크숍을 개최해 세계적인 AI 분야 전문가들과 교류했습니다. CVPR 2023에서 주목할 만한 논문 소개와 NICE 워크숍 후기를 Vision Lab 이순영, 안평환 님에게 들어봅니다.

 

사진1. CVPR 2023가 개최된 Vancouver Convention Center

 

[Vision Lab 이순영 님] CVPR 2023 발표 논문으로 살펴본 CV 연구 동향

이번 CVPR 2023에는 총 9,155 편의 논문이 제출되었습니다. 이는 작년 대비 12% 정도 증가한 수치로, Computer Vision과 AI에 대한 산업 및 학계의 관심이 여전히 최고 수준임을 보여주었습니다. 그중에서 채택된 약 25%의 2,359편 논문들은 현재 Computer Vision의 연구 방향과 트렌드를 시사합니다. 올해 발표된 논문 중 award를 수상한 논문 제목으로부터 이를 엿볼 수 있습니다.

 

  1. Best Paper: Visual Programming: Compositional visual reasoning without training[1]

  2. Best Paper: Planning-oriented Autonomous Driving[2]

  3. Honorable Mention: DynIBaR: Neural Dynamic Image-Based Rendering[3]

  4. Best Student Paper: 3D Registration with Maximal Cliques[4]

  5. Honorable Mention (Student): DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation[5]

 

자율주행, NERF(Neural Radiance Field), 고전 문제인 3D 정합 문제, 멀티모달(Multimodal) 등 다양한 토픽들이 확인됩니다. 이를 통해 이번 CVPR 2023에서는 유행이 될 만한 기술적 혁신이나 특정 분야에 집중하는 것이 아닌, 다양한 분야에서 건강하게 연구가 이루어졌음을 확인할 수 있습니다.

이러한 다양한 주제 속에서 저는 Best paper award 수상 논문이자, Large Language Model (LLM)의 새로운 시도를 통해 Computer Vision 문제를 풀어낸 “Visual Programming: Compositional visual reasoning without training[1]” 논문에 관심이 갔습니다.

 

LLM, 인간의 논리로 Vision 문제를 풀다

“Visual Programming: Compositional visual reasoning without training[1]”은 Vision 태스크를 해결하기 위해 다양한 모듈을 정의하고, 이 모듈들을 어떤 순서로 수행하고 어떤 파라미터를 넣어야 할 지 등을 LLM으로 결정하는 아이디어를 제안했습니다.

기존의 AI 기술의 연구 방향은 개별 태스크들(Detection, Segmentation, VQA, Captioning 등)에 대해서 높은 성능을 확보하는 방향으로 이루어졌습니다. 하지만 실제 문제들은 이렇게 한가지의 고립된 태스크로 구성되는 경우가 거의 없고, 다양한 태스크가 혼합되어 있거나 정의하기 힘든 태스크인 경우가 대부분입니다. 그래서 현업에서 요구되는 문제를 해결하는 가장 기본적인 접근 방법은 해당 문제에 특화된 데이터를 구축하여 특화된 모델을 학습하는 것입니다. 당연하게도 이 과정은 학습 데이터 구축에 시간이 걸리고, 모델을 학습할 때도 많은 자원이 필요하고, 이렇게 어렵게 학습한 모델은 이 문제 이외의 다른 문제에는 적용할 수는 없는 비효율적인 구조가 되기 십상입니다.

이 논문은 이러한 점에 착안하여 모델을 새로 만드는 것이 아니라, 기존에 개발된 모델과 기술들을 최적으로 엮으면 task-specific 한 문제도 해결할 수 있음을 보여줍니다. 기 개발된 모델과 기술을 모듈화된 함수 블록으로 만들고, 이 함수 블록을 호출하는 스케쥴러 역할을 LLM – GPT-3를 이용하는 것이 논문의 핵심 아이디어입니다.

 

그림 1. VisProg의 구조도[1]

 

그림 1은 본 논문에서 제시하는 기술의 구조를 보여줍니다. GPT의 강점인 대화형 지시자가 가능하여 문장으로 원하는 태스크를 지시하면, 이를 해결하기 위한 일련의 절차와 파라미터를 생성합니다. 마치 사람이 주어진 문제를 해결하는 코드를 작성하는 것과 같습니다. 그래서 저자는 이 기술을 Visual Programming(VisProg)이라고 명명했습니다. 이를 통해 새로운 모델과 학습 데이터도 없이, 기존 모델과 Computer Vision 기술들로 아래와 같은 다양한 비전 문제를 풀어냅니다.

 

그림 2. VisProg의 다양한 예시[1]

 

그림 2는 VisProg의 다양한 예시를 보여줍니다. LLM이 단순히 언어 모델이 아니라 인간의 논리를 시뮬레이트 하는 모델이라는 점이 인상적입니다. 또한 이렇게 여러 모델을 동시에 구현하고 이들이 매끄럽게 연결되도록 엔지니어링한 부지런함도 기억에 남습니다.

기술은 실제 생활에서 활용될 때 그 의미가 더 빛날 수 있습니다. 이미 세상에는 잘 작동하는 Task-specific 한 모델이 많습니다. 이들을 보다 더 실용적으로 만들기 위해서는 모델을 연결하고 튜닝해 실생활에서 필요한 복합적이고 애매하게 정의된 문제를 풀 수 있어야 할 것입니다. 플러그인과 조합된 GPT-4의 문제 해결 능력을 예로 들 수 있습니다. 앞으로의 Computer Vision 연구에서도 이러한 연구 방향이 한 축이 되지 않을까 조심스럽게 짐작해 봅니다.

LG AI연구원 Vision Lab에서는 비전과 언어 문제가 융합된 멀티모달을 활용해 다양한 시도를 하고 있습니다. EXAONE Atelier에서 보여준 Image-to-Text나 Text-to-Image 태스크를 비롯해, 문서에 있는 도식 요소(차트, 표 등)에서 데이터를 추출하는 태스크 등이 대표적입니다. 시각 정보와 언어 정보를 함께 이용하는 멀티모달 기술을 통해 기존 Computer Vision 기술만으로는 풀 수 없는 문제에서 큰 발전을 이루었습니다. 앞으로도 LG AI연구원 Vision Lab은 그룹 내/외에 산재한 멀티모달 태스크를 해결하는 새로운 연구 트렌드를 선도해 나가겠습니다.


[Vision Lab 안평환 님] NICE 워크숍 개최 후기

CVPR에서는 매년 논문 발표뿐만 아니라 워크숍과 튜토리얼 세션을 통해 특정 연구 주제나 연구 환경 및 사회적 영향과 관련된 다양한 이슈들을 논의해 왔습니다. 이번 CVPR 2023에서 LG AI연구원은 셔터스톡, 서울대와 함께 NICE 워크숍을 개최했습니다. 학회에 앞서 개최했던 ‘Zero-shot Image Captioning Evaluation’ 챌린지 결과 발표와 더불어 이미지 캡셔닝과 관련된 다양한 주제에 대해 토론했습니다.

 

이미지 캡셔닝의 한계를 극복하기 위한 논의의 장, NICE 워크숍

 

사진 2. NICE 워크숍 현장 사진

 

이미지 캡셔닝은 주어진 이미지를 분석해 이미지 내 요소를 글로 설명하는 태스크로, Computer Vision 분야에서 이미지 이해의 중요한 기반이 되는 기술입니다. 최근 멀티모달 모델들이 급속한 발전과 성장을 이루고 있음에도 불구하고, 여전히 이미지 캡셔닝 분야에서 극복하기 힘든 여러가지 한계가 있습니다. 이미지 캡셔닝 결과에 대한 평가 기준으로 사용하고 있는 단순한 텍스트 비교 metric들의 한계로 인해서 AI 모델들의 정량적인 평가는 여전히 어려운 환경에 놓여 있습니다.

예를 들면 이미지에 포함되지 않은 내용들이 캡션에 포함되는 hallucination 현상이 발생해도 여러 metric을 기준으로는 좋은 캡션으로 평가받는 경우가 생기기도 합니다[6]. 또한, 데이터의 분포에 따라서는 입력 이미지와 무관하게 특정 그룹의 사람들을 특정 행동이나 특성에 연결하는 bias 문제도 종종 발견되고 있습니다. 이러한 이슈들은 특정 분야의 기술만으로는 해결하기 힘든 만큼 각 분야 전문가들의 심도 있는 논의가 필요합니다. LG AI연구원은 이번 NICE 워크숍을 통해 해당 이슈와 관련된 연구 결과 및 방향을 공유할 수 있는 자리를 마련하고자 했습니다.

 

Opening Talk & Challenge 성과 공유 세션

 

사진 3. CVPR 2023 Zero-shot Image Captioning Evaluation 챌린지 1위~4위 수상자

 

NICE 워크숍은 이경무 서울대 AI대학원 석좌교수의 Opening Talk로 시작되었습니다. 이어 Zero-shot Image Captioning Evaluation 챌린지 소개 및 결과 공유가 진행되었습니다.

올해 1월부터 4월까지 진행된 챌린지에서는 약 3만 장의 이미지와 각 이미지에 대한 캡션을 기반으로 구성된 데이터셋의 이미지 캡셔닝 성능을 평가했습니다. 이미지와 캡션 데이터는 세계 최대 이미지 스톡 플랫폼인 셔터스톡에서 제공했으며, 우수한 이미지 캡셔닝 성능을 보여준 연구팀 1~4위를 초청해 시상식을 진행했습니다. 시상식에는 서울대학교 이경무 교수, 한보형 교수, 그리고 셔터스톡의 Senior Director of AI and Data Science인 Alessandra Sala가 참석하여 자리를 빛내 주었습니다. 시상식과 더불어 1위를 기록한 난징과기대 팀과 2위를 기록한 카이스트 팀은 챌린지 수상 알고리즘에 대한 발표도 진행했습니다.

 

세계적 석학의 인사이트를 듣다, Invited Talk Session

다음으로 Invited Talk 세션에서는 세계적으로 이미지 캡셔닝 분야에서 좋은 성과를 보여주고 있는 연구자들을 초청해 현재 멀티모달 모델들의 한계점 및 앞으로의 연구에 대한 insight를 들을 수 있는 자리가 마련되었습니다. 1부에서는 Anna Rohrbach(UC Berkeley)가 이미지와 관련도 높은 텍스트 정보 추출을 통해 정확도 높은 이미지 캡셔닝을 하는 방법 및 정확한 평가 방법에 대한 연구 결과를 발표했습니다. Cordelia Schmid(INRIA, Google Research)는 비디오 캡셔닝에 대한 최근 연구 현황들을 공유했습니다. 이어서 Hamid Palangi(Microsoft Research)는 단순한 구조의 이미지 캡셔닝 모델의 한계점과 이를 해결하기 위한 방법으로써 물체 간 관계성 학습, multitask 학습, 그리고 특정 목적을 위한 데이터 수집 등을 제시하였습니다.

 

사진 4. CVPR 2023 NICE 워크숍 Jack Hessel 발표사진

 

2부에서는 Yusuke Hirota(Osaka University)의 발표에서 AI 모델에서의 societal bias 문제와 이를 해결하는 방안을 다루었고, Jack Hessel(Allen Institute for AI)은 비디오 캡셔닝에서의 시간 순서에 따른 관계성 학습, 이미지 설명을 넘어서 전후 상황에 대한 추론, 그리고 일반적이지 않은 상황에 대해서도 정확한 캡셔닝을 할 수 있는 AI 모델 등을 주제로 흥미로운 연구 내용을 공유했습니다. 워크숍의 가장 마지막 순서로 LG AI연구원 이홍락 CSAI가 현재까지 제시된 제로샷 이미지 캡셔닝 모델들의 한계 및 추후 이미지 캡셔닝 연구의 방향과 목표에 대해 이야기했습니다.

 

사진 5. CVPR 2023 NICE 워크숍 단체사진

 

LG AI연구원에서는 이번 CVPR 2023에서 논의된 연구 결과와 챌린지 및 워크숍에서 얻은 성과를 토대로 더욱 발전된 이미지 캡셔닝 연구를 진행하고 있습니다. 최근 멀티모달 모델들이 Computer Vision과 언어 모델의 결합을 기반으로 단순 이미지 캡셔닝을 넘어 다양한 일을 해내는 사례가 많아지고 있는 만큼, LG AI연구원에서도 태스크를 확장할 수 있는 방법을 치열하게 고민할 것입니다. 다음 워크숍과 챌린지 또한 더욱 도전적이고 다양한 주제를 다룰 것으로 기대됩니다.

 

▶CVPR 2023 - NICE Workshop 스케치 영상 보러가기 (Link)

참고
[1] Tanmay Gupta, et al., “Visual Programming: Compositional visual reasoning without training,” in proc. CVPR 2023

[2] Yihan Hu, et al., “Planning-oriented Autonomous Driving,” in proc. CVPR 2023

[3] Zhengqi Li, et al., “DynIBaR: Neural Dynamic Image-Based Rendering,” in proc. CVPR 2023

[4] Xiyu Zhang, et al., “3D Registration with Maximal Cliques,” in proc. CVPR 2023

[5] Nataniel Ruiz, et al., “DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation,” in proc. CVPR 2023

[6] Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns, Trevor Darrell, and Kate Saenko. "Object Hallucination in Image Captioning.", EMNLP 2018