61Gwangmo Song2.png Gwangmo Song 2024.06.21

63Sihaeng Lee2.png Sihaeng Lee 2024.06.21

화담숲 프로젝트: LMM을 통한 Image Understanding & Generation

이미지 1. 화담숲 프로젝트


AI 기술의 발전은 예술의 형태와 창작 과정을 급격히 변화시키고 있습니다. AI는 방대한 데이터를 분석하고 패턴을 학습함으로써 예술가들이 상상하지 못한 새로운 형태와 스타일을 만들어냅니다. 또한 AI는 단순한 도구를 넘어 창작의 동반자로서, 예술가가 상상하지 못한 새로운 방향을 제시하고, 창의적인 아이디어를 구현하는 데 중요한 역할을 하고 있습니다. 이를 통해 예술가는 창작 과정에서 더 많은 시간과 에너지를 절약할 수 있게 됩니다.

화담숲 프로젝트(이미지 1)는 이러한 인간과 AI의 성공적인 협력 사례를 잘 보여줍니다. AI가 인간과 협력하여 주제를 설정하고, 주제에 어울리는 시각적 및 청각적 효과를 추천함으로써 창작 프로세스를 혁신적으로 변화시켰습니다. LG AI연구원 EXAONE의 Image Understanding 기술과 Image Generation 기술이 어우러져 미디어아트의 여러 요소를 추천하고, 이 요소를 바탕으로 화담숲의 미디어아트가 탄생했습니다.

본 블로그에서는 화담숲 미디어아트를 구성하게 된 Image Understanding, Image Generation 기술에 대해 연구 중인 내용을 소개하고, 실제로 어떻게 적용되었는지 알아보고자 합니다.


Image Understanding이란?

Image Understanding은 이미지에 대한 이해를 바탕으로 사용자의 다양한 질문에 대한 답변을 생성해 내는 Task로, 일반적으로 VLM (Vision-Language Model), LMM (Large Multimodal Model), MLLM(Multimodal Large Language Model) 등으로 불리는 Multimodal 모델들을 활용하여 수행됩니다. GPT-4V[1]가 보여주는 이미지 기반 문답이 Image Understanding의 대표적인 예시이며, 주요 LMM 모델로는 LLaVA[2]가 있습니다.


이미지 2. LLaVA 구조[2]


LLaVA의 구조는 이미지 2와 같습니다. 주어진 이미지가 Vision Encoder를 거쳐 Vision 정보를 담고 있는 Feature로 변경된 다음 Projection Layer를 거쳐 LLM에 적합한 Feature로 전환됩니다. 이후 사용자가 던진 질문 정보와 Align되어 원하는 답변을 얻게 됩니다. 이러한 구조는 LMM 분야에 성공적으로 적용되어 LLaVA 이후의 다양한 LMM에서 기본 구조로 사용되고 있습니다.


Dataset의 명과 암

이러한 LLaVA의 구조를 가능케 하는 것은 LLaVA 논문에서 제시한 Visual Instruction Tuning Data 덕분입니다. 기존 Image-Text Pair 데이터셋은 단순히 Image에 대한 Description 정보만을 제공하는 데에 그쳤습니다. 하지만 LLaVA에서는 이미지에 대한 단순한 설명뿐만 아니라 복합적인 질문, Reasoning Task에 대한 정보를 담고 있는 데이터셋을 제안하여 LMM의 성능을 크게 향상시켰습니다. 이러한 접근 방법은 Share-GPT4V[3]에서도 적용되어 다양한 Instruction Tuning Dataset이 제안되었고 여러 LMM의 학습에 사용되었습니다.

그러나 이러한 Instruction Tuning Dataset에는 단점이 존재합니다. 수십~수백만에 달하는 데이터를 만들기 위해 대부분의 데이터셋은 GPT에 의존합니다. 이러한 GPT Generated 데이터는 연구용으로는 사용 가능하지만 라이선스 이슈에서는 자유롭기 어렵습니다. 우리는 이러한 제약으로부터 벗어나기 위해 기존과 다른 구조의 LMM을 제안했습니다.


EXAONE LMM의 특징


이미지 3. EXAONE LMM 구조


제안하는 EXAONE LMM의 구조는 이미지 3과 같습니다. 먼저 [4]와 같이 이미지로부터 이미지에 대한 설명을 출력하는 Captioning Module과 이미지에 존재하는 물체들의 위치 정보를 표현하는 Detection의 두 Vision 모듈을 통해 이미지 정보를 도출합니다. 이렇게 도출된 정보를 SLM (Small Language Model)이 하나의 문장으로 정리하여 이미지에 대한 설명을 완성합니다. 이를 사용자 질문과 함께 LLM의 입력값으로 사용함으로써 최종 답변을 생성하게 됩니다.

EXAONE LMM의 핵심은 LLM을 학습 없이 그대로 사용하는 것입니다. End-to-End 학습을 위해 복잡한 Instruction Tuning Dataset을 사용하였던 기존 모델과는 달리 단순한 Task를 위한 SLM의 학습만을 필요로 합니다. SLM은 Vision 모듈에서 나온 정보를 하나로 정리해 주는 역할만 하기 때문에 단순한 학습으로 충분합니다. 이러한 단순한 형태 덕분에 더 적은 데이터셋으로 더 빠르게 학습이 가능합니다.

또한 High-level vision feature를 사용함으로써 정보를 보다 명확하게 인식할 수 있습니다. 예를 들어 기존 모델들의 단점으로 지적되었던 물체 개수 카운팅과 같은 Task를 보다 잘 수행할 수 있게 됩니다. 그리고 추후 필요시 차트 인식이나 OCR등 다른 Vision 모듈을 손쉽게 추가함으로써 Task-specific한 모델 구성이 가능해진다는 점 또한 EXAONE LMM 모델 구조가 가지는 장점이라고 할 수 있습니다.


Image Generation이란?

Image Generation도 이미지에 대한 이해를 바탕으로 사용자의 다양한 입력 Prompt 대한 답변을 Image로 생성하는 Task입니다. 2021년 OpenAI의 Dall-E[5]를 시작으로 Stability AI의 Stable Diffusion[6], Google의 Imagen[7] 등 많은 연구가 이루어지고 있는 분야입니다. LG AI연구원도 자체 이미지 생성 모델을 개발하였으며, Image Understanding 기술과 함께 EXAONE Atelier란 네이밍으로 LG생활건강 등의 LG 내 계열사의 디자인 프로세스 현업에 활용되고 있습니다. 이미지 생성의 기본 알고리즘인 Denoising Diffusion Probabilistic Models (DDPM)[8]을 활용하며 연구원만의 차별화된 연구로 발전시켰습니다. DDPM을 활용한 Generative Model은 관련 기술 내용은 이전 블로그에 자세하게 설명되어 있습니다.


[NeurIPS 2021] 1편: Generative model - Diffusion model Review 보러가기


Customize Image Generation 모델 개발

화담숲 프로젝트를 시작하기 전, 현재 EXAONE Image 생성 모델이 화담숲을 얼마나 잘 나타낼 수 있을지 테스트를 먼저 진행했습니다. 그런데 화담숲을 표현하고자 하는 많은 프롬프트를 입력해도 화담숲을 나타내는 이미지는 단 한 장도 생성하지 못했고, 다른 이미지 생성 모델도 마찬가지였습니다. 이유는 Image 생성 모델을 학습할 때 화담숲 데이터를 학습하지 않았기 때문입니다. 모든 AI 모델에서 데이터 의존도가 가장 큰 만큼 당연한 이유였습니다. 화담숲 프로젝트의 목표는 화담숲의 철학을 담아 새로운 화담숲을 상상하는 것이었기 때문에, EXAONE Image Generation 모델에 화담숲의 철학을 담은 새로운 Customize 모델을 개발해야 했습니다.

먼저 학습에 필요한 화담숲 데이터를 수집했습니다. Image Generation 모델을 학습하기 위해서는 Image-Text Pair 데이터가 필요한데 확보 가능한 데이터는 화담숲을 촬영한 영상이 전부였습니다. 우리는 EXAONE Image Understanding 모델을 활용하여 화담숲 촬영 영상을 설명하는 Text를 생성했고, 이를 Image-Text Pair 데이터셋으로 가공했습니다.

그리고 생성 모델의 Tuning 기법인 LoRA[9], Dreambooth[10] 등으로 EXAONE Image Generation 모델에 화담숲이 가지고 있는 철학을 입히고자 다양한 방법으로 접근하며 수많은 시도를 거듭했고, 마침내 화담숲의 철학을 담은 Customize 모델을 개발했습니다.


이미지 4. 화담숲 미디어아트 생성 프로세스


EXAONE, 화담숲의 Director로

그렇다면 EXAONE LMM은 어떻게 화담숲 미디어아트를 기획했을까요? 먼저 화담숲의 각 계절의 실사 사진을 보고 대표적인 사진을 선택했습니다. 그 다음 이 사진들을 바탕으로 미디어아트를 기획할 때 필요한 요소들을 EXAONE LMM을 통해 생성했습니다. 예를 들어 가을의 화담숲을 표현할 때 기본이 되는 스토리, 그림으로 표현할 때 어울리는 화풍, 전체적인 분위기를 나타내는 음악적인 요소 및 미디어아트로 표현할 때 사용하면 좋을 애니메이션 효과 등을 EXAONE이 제안함으로써 전시의 방향을 디렉팅했습니다(이미지 5).


이미지 5. 화담숲의 가을 관련 추천 요소 생성 예시


이렇게 EXAONE LMM이 추천한 요소에 따라 기본 방향을 기획하고 화담숲의 철학을 가진EXAONE Image Generation 모델과 전문가의 손을 거쳐 최종적으로 화담숲 미디어아트가 탄생했습니다(이미지 6).


이미지 6. 화담숲 미디어아트


화담숲 프로젝트는 인간의 조력자로서 AI가 얼마나 큰 잠재력을 가지고 있는지를 보여줍니다. 미디어아트뿐만 아니라 다양한 분야에서도 AI와 인간의 협업이 이루어질 수 있는 가능성은 무궁무진합니다. AI는 예술, 과학, 기술 등 여러 분야에서 창의성과 효율성을 동시에 높여주며, 인간의 한계를 극복하는 데 큰 도움을 줄 수 있습니다. 앞으로 AI는 더욱 발전된 형태로 다양한 산업과 일상생활에 깊숙이 침투할 것이며, 인간과 AI의 협력은 새로운 혁신과 성과를 창출하는 원동력이 될 것입니다. LG AI연구원은 앞으로도 지속적인 연구와 개발을 통해, AI와 인간이 함께 더 큰 가치를 창출할 수 있는 길을 열어 나갈 것입니다.


▶자연을 배운 인공지능 EXAONE, 화담숲의 사계를 그리다

참고

[1] Achiam, Josh, et al. "Gpt-4 technical report." arXiv preprint arXiv:2303.08774 (2023).

[2] Liu, Haotian, et al. "Visual instruction tuning." Advances in neural information processing systems 36 (2024).

[3] Chen, Lin, et al. "Sharegpt4v: Improving large multi-modal models with better captions." arXiv preprint arXiv:2311.12793 (2023).

[4] Kim, Taehoon, et al. "Large-scale bidirectional training for zero-shot image captioning." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2024.

[5] Ramesh, Aditya, et al. Zero-shot text-to-image generation. In: International conference on machine learning. Pmlr, 2021. p. 8821-8831.

[6] Rombach, Robin, et al. High-resolution image synthesis with latent diffusion models. In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2022. p. 10684-10695.

[7] Saharia, Chitwan, et al. "Photorealistic text-to-image diffusion models with deep language understanding." Advances in neural information processing systems 35 (2022): 36479-36494.

[8] Ho, Jonathan, Ajay Jain, and Pieter Abbeel. "Denoising diffusion probabilistic models." Advances in neural information processing systems 33 (2020): 6840-6851.

[9] Hu, Edward J., et al. "Lora: Low-rank adaptation of large language models." arXiv preprint arXiv:2106.09685 (2021).

[10] Ruiz, Nataniel, et al. "Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation." Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. 2023.