|
NVIDIA GTC는 인공지능, 컴퓨터 그래픽, 기계 학습 등의 주제로 진행되는 글로벌 AI 컨퍼런스입니다. NVIDIA GTC 2022는 9월 19일부터 22일까지 온라인으로 3일간 개최되어 최신 기술을 발전시키는 연구자와 비즈니스 리더들이 참석해 대형 언어 모델, 디지털 트윈, Human AI 등 다양한 주제에 관해 적극적으로 교류하고 소통하는 세션으로 진행되었습니다. 온라인 컨퍼런스 현장에 참가한 LG AI연구원 Vision Lab의 이현민, 이민수 님이 GTC 2022에 대한 이야기를 전해드립니다. |
이번 포스팅에서는 GTC 2022에서 진행한 디지털 아바타 관련 세션을 정리해보았습니다.
디지털 아바타의 시장 규모는 매년 성장세를 이어가고 있습니다. 시장조사업체 Emergen Research이 발표한 2022년도 보고서에 따르면 디지털 아바타의 시장 규모는 점점 커져 2030년에는 527.76 billion 달러에 이를 것으로 예상됩니다. 디지털 아바타는 로봇부터 가상 휴먼까지 다양한 존재로 구현할 수 있으며 교육, 게임, 헬스케어 등 다양한 산업군에 활용할 수 있어 큰 주목을 받고 있습니다.
디지털 아바타를 크게 세 가지로 분류한다면 디지털 비서, AI 서비스 에이전트, 가상 인플루언서로 나눌 수 있습니다. (1) 디지털 비서는 아마 우리에게 가장 친숙한 형태일 것입니다. 질문에 즉각적으로 대답하는 AI 챗봇 등이 있습니다. (2) AI 서비스 에이전트는 아바타에 애니메이션이 적용되어 상호작용이 가능한 형태입니다. 눈 맞춤, 얼굴 표정 변화, 바디 랭귀지와 같은 애니메이션이 적용되며 즉각적인 대답 및 도메인 지식을 통해 문맥을 파악하고 추천하는 기술이 적용됩니다. (3) 가상 인플루언서는 사람이 액팅하여 가상의 3차원 아바타에게 음성, 얼굴 표정, 몸짓과 관련된 기술을 적용한 형태이며 게임과 v-tube 등에 활용됩니다.
대화형 디지털 아바타를 만들기 위해서는 3D 아바타 생성, AI 모델 학습, 응용 프로그램 개발 기술이 모두 필요하여 전체적인 프로세스가 복잡하고 작업 시간이 많이 소요됩니다. 따라서 엔비디아에서는 편리하게 아바타를 구축하고 배포할 수 있도록 Omniverse ACE (Avatar Cloud Engine)를 만들었습니다. ACE는 사실적인 대화형 아바타를 구축해 사용자를 지정하고 배포할 수 있는 클라우드 기반 AI 모델 및 서비스의 모음입니다. 지금부터 ACE에 포함된 AI 기술들(Audio2Face, Text-to-Speech)에 대해 먼저 설명한 후 ACE를 이용해 개발된 어플리케이션들(Tokkio, Maxine)을 소개하겠습니다.
Audio2Face [데모 영상] , [소개 홈페이지]

Figure 1. 분노, 기쁨, 슬픔 등의 감정을 조절하여 얼굴 애니메이션 생성 ⓒNVIDIA Omniverse™
Audio2Face는 오디오를 입력으로 받아 표정이 담긴 얼굴 애니메이션을 생성하는 딥러닝 기반의 AI 기술입니다. 주요 특징으로는 실시간성, face-swap을 통한 다른 캐릭터로의 리타켓팅 그리고 Figure 1의 감정 조절 후처리 기능 등이 있습니다. 무엇보다 오디오에서 직접 감정을 추론하여 얼굴 표정을 생성할 수 있다는 점이 가장 인상적이었습니다.
Text-to-Speech [데모 영상] , [소개 홈페이지]

Figure 2. 음높이, 속도, 발음, 음량 등을 조절하여 음성 생성 ⓒNVIDIA Riva
TTS는 텍스트를 입력으로 받아 음성을 생성하고, 그 음성을 아바타가 말하도록 만드는 기술입니다. 기계음이 아닌 사람처럼 자연스러운 목소리를 생성하는 것을 목표로 하고 있으며, 30분 분량의 음성 파일을 통해 음높이(pitch), 속도, 발음, 음량 등을 조절한 customized 음성을 만들어 낼 수 있다는 특징이 있습니다.
Tokkio (Customer Service Kiosk) [데모 영상]

Figure 3. 여러 AI 기술이 접목되어 작동하는 고객 응대 서비스 Tokkio ⓒNVIDIA Omniverse ACE
Tokkio는 여러 AI 기술이 결합되어 고객에게 다양한 서비스를 제공합니다. 컴퓨터 비전, 대화형 AI, 3D 애니메이션 및 추천 등의 기술이 모두 포함되어 있기 때문에 가게에 있는 점원처럼 주문을 받고, 메뉴를 추천할 수 있습니다.
Maxine (Video Communication Framework) [데모 영상] , [소개 홈페이지]

Figure 4. 화상 회의 때 눈 포즈를 조절하여 카메라 응시 ⓒNVIDIA Maxine

Figure 5. 번역 및 Audio2Face 기술을 통해 여러 언어로 대화가 가능한 모습 ⓒNVIDIA Maxine
Maxine은 화상 회의, 고객 서비스 센터 통화 등에서 명확한 커뮤니케이션을 지원하여 상호작용을 도와주는 어플리케이션입니다. Maxine은 앞서 소개 드린 Audio2Face, Text-to-Speech 기술을 포함해 음성 인식, 번역 등의 기술이 함께 사용됩니다. 주요 특징으로는 Figure 4와 같이 눈 포즈를 조절하여 눈이 카메라를 바라보도록 하며, Figure 5와 같이 자동 번역 기술을 통해 다른 언어를 사용하는 나라의 사람과도 대화가 가능해집니다.
Conclusion
이번 블로그에서는 디지털 아바타의 종류와 더불어 필요한 기술들에 대해 알아봤습니다. 나날이 발전해가는 AI 기술로 인해 디지털 아바타는 점차 사람과 비슷한 표정과 목소리로 대화할 수 있게 되었습니다. 엔비디아에서 발표한 Tokkio, Maxine와 같이 여러 AI 기술들이 융합한 어플리케이션이 앞으로는 어떻게 발전할지 기대됩니다.