1.개요
2023년 OpenAI GPT-4의 등장과 함께, 거대언어모델(Large Language Model, LLM)이 인공지능을 넘어 다양한 분야에서 큰 성공을 거두었습니다. 이를 반영하듯 NeurIPS 2023에서도 LLM의 방대한 사전 지식과 강력한 일반화 능력을 이용하는 LLM 기반 자율 에이전트(LLM-based Autonomous Agent, LLM Agent)[1] 관련 연구가 다수 발표되었습니다.
자율 에이전트(Autonomous Agent)란 환경과 상호작용하면서 어떤 상태나 사건에 대해서 의도된 결과가 예측되는 액션을 자율적으로 수행할 수 있는 컴퓨팅 시스템입니다. 이번 포스팅에서는 NeurIPS 2023에 소개된 LLM 기반 자율 에이전트 관련 연구를 (1) 범용 LLM 에이전트 (General-purpose LLM Agents) 연구, (2) 도메인 특화 LLM 에이전트(Domain-specific LLM Agents) 연구, (3) LG AI연구원에서 진행 중인 AI 에이전트 연구로 나누어서 살펴보겠습니다.
2. 범용 LLM 에이전트 (General-purpose LLM Agents)
범용 LLM 에이전트 관련 연구는 LLM을 활용하여 추론(Reasoning) 및 계획(Planning) 능력을 필요로 하는 복잡한 순차적 의사결정(Sequential Decision-making) 문제를 해결하는 것을 주로 다루고 있습니다. NeurIPS 2023에서는 기존 범용 LLM 에이전트의 한계를 해결할 수 있는 흥미로운 방법들이 다수 발표되었습니다.
2.1 Problem Solving

그림 1. Tree of Thoughts[2] 개념도
NeurIPS 2023 Oral 논문에 선정된 Tree of Thoughts (ToT)[2]는 일반적인 문제해결(Problem Solving) 과정에도 LLM을 사용할 수 있도록, 기존 Chain of Thought (CoT)를 확장한 새로운 프롬프팅 프레임워크(Prompting Framework)를 제안하고 있습니다. LLM을 사용하는 기존 방법들은 주로 Left-to-Right 형태의 직선적인 의사결정 과정을 수행했습니다. 이와 다르게, Tree of Thoughts는 LLM이 가능한 여러 추론 경로(Reasoning Path)를 스스로 평가하면서 탐색(Search)할 수 있는 방법을 제안하고 있습니다(그림 1 참조). 예를 들면 “Game of 24”라는 연산 추론 문제의 경우 기존 CoT 방법은 단지 4%의 성공률을 보이지만, ToT 방법은 74%의 성공률을 달성합니다.
2.2 Linguistic Feedback

그림 2. Reflexion[3] 개념도
현재 LLM 에이전트는 매우 적은 수의 샘플만으로도 매우 높은 성능을 달성할 수 있다는 장점이 있지만, Trial and Error를 통해서 성능을 향상시키는 것이 상대적으로 부족했습니다. Reflexion[3]은 신경망의 가중치(Weight)를 업데이트하는 방식이 아닌, 자연어 피드백(Linguistic Feedback)을 이용해서 LLM 에이전트의 성능을 강화할 수 있는 프롬프팅 프레임워크(Prompting Framework)를 제안합니다(그림 2 참조). Reflexion은 자연어 피드백을 반영해 액션 궤적(Action Trajectory)을 개선하는 과정을 여러 번 반복하며 작업의 성능을 향상시킵니다.
2.3 Adaptive Planning

그림 3. AdaPlanner[4] 개념도
현재 LLM 에이전트는 플래닝(Planning) 없이 액션을 수행하거나 정적 플랜(Static Plan)에 의존해서 액션을 수행한다는 한계가 있습니다. AdaPlanner[4]는 LLM 에이전트가 환경의 피드백을 반영해 자신이 생성한 플랜을 스스로 개선할 수 있는 적응형 플래닝(Adaptive Planning)을 위한 프롬프팅 프레임워크(Prompting Framework)를 제안하고 있습니다(그림 3 참조). LLM의 환각(Hallucination) 현상을 완화하기 위해서, AdaPlanner는 코드 스타일(Code-style)의 프롬프트를 사용합니다. 그리고, 스킬 디스커버리(Skill Discovery) 방법을 이용해서 유용한 스킬을 Few-shot 프롬프트에 사용합니다.
2.4 Cooperation

그림 4. SwiftSage[5] 개념도
Spotlight 논문에 선정된 SwiftSage[5]는 복잡한 추론 작업을 위한 액션 플래닝(Action Planning)을 위해 인지과학의 이중과정 이론(Dual-process Theory)에서 영향을 받은 에이전트 프레임워크를 제안합니다. SwiftSage는 빠르고 직관적인 생각(Intuitive Thinking)을 담당하는 Swift 모듈과 신중한 사고 과정(Deliberate Thought Process)을 담당하는 Sage 모듈로 구성되어 있습니다. Swift 모듈은 오라클 에이전트의 액션 궤적(Action Trajectory)을 학습시킨 작은 Encoder-Decoder LM으로 구현되었습니다. Sage 모듈은 하위 목표(Subgoal) 플래닝을 위해 GPT-4와 같은 LLM을 사용합니다.
3. 도메인 특화 LLM 에이전트 (Domain-specific LLM Agents)
이번 학회에서는 LLM 에이전트를 위한 범용 알고리즘 이외에도, 도메인 특화 LLM 에이전트에 대한 연구도 많이 발표되었습니다. 주목할 만한 도메인 특화 LLM 에이전트들로는 복잡한 웹 브라우징을 수행하는 웹 에이전트(Web Agents), 실행 가능한 코드 작성을 수행하는 코딩 에이전트(Coding Agents), 가상 및 실제 물리 환경과 상호작용하면서 작업을 수행하는 임바디드 에이전트(Embodied Agent), 과학적 발견을 위해 실험 설계, 실행 및 분석을 수행하는 리서치 에이전트(Research Agents) 등이 있습니다.
3.1 웹 에이전트 (Web Agents)

그림 5. Mind2Web[6] 개념도
웹 에이전트는 자연어로 주어진 명령을 따라 웹사이트를 조작하는 복잡한 작업을 수행하는 에이전트입니다. Datasets and Benchmarks 트랙에서 Spotlight로 Mind2Web[6]이 발표되었습니다. Mind2Web은 웹 에이전트를 개발하고 평가하기 위한 데이터세트를 제공하고 있습니다(그림 5 참조). 기존 데이터세트들은 시뮬레이션 기반 가상 웹사이트들 혹은 제한된 일부 작업들만 다루고 있기 때문에, 실제 웹 에이전트 개발에는 적합하지 않았습니다. Mind2Web은 31개 분야를 포함하는 137개 웹사이트에서 수집된 2,000개 이상의 작업들에 대한 액션 시퀀스(Action Sequence)를 제공합니다. 뿐만 아니라, Mind2Web 데이터를 기반으로 MindAct라는 범용 웹 에이전트를 개발해서 기본 성능을 제공하고 있습니다.
3.2 코딩 에이전트 (Coding Agents)

그림 6. InterCode[7] 개념도
코딩 에이전트는 자연어로 주어진 명령을 따라서 코드 작성을 수행하는 에이전트입니다. 코딩 에이전트 관련 연구로는, Datasets and Benchmarks 트랙에서 InterCode[7]가 발표되었습니다. InterCode는 인터랙티브 코딩 에이전트를 개발할 수 있는 유연하고 사용하기 쉬운 강화학습(Reinforcement Learning, RL) 환경입니다(그림 6 참조). InterCode는 프로그래밍 언어와 플랫폼으로부터 독립적입니다. 논문의 저자들은 InterCode의 기능과 유용성을 강조하기 위해 Bash, SQL, 그리고 Python을 위한 인터랙티브 코딩 환경을 구성해서 제공합니다. 그리고 최신 LLM에 다양한 프롬프팅(Prompting) 방법을 적용해서, 각 방법의 성능을 측정하고 보고합니다.
3.3 임바디드 에이전트 (Embodied Agents)

그림 7. DEPS[8] 개념도
임바디드 에이전트는 실제 혹은 가상 물리 환경과 상호 작용하면서 목표를 수행하는 에이전트입니다. 이번 NeurIPS 2023에는 LLM 기반의 임바디드 에이전트가 다수 소개되었습니다. 그 중 하나인 DEPS[8]는 Minecraft와 같은 가상 물리 환경에서 효과적으로 목표를 달성하기 위한 DEPS (Describe, Explain, Plan, and Select)라는 인터랙티브 플래닝(Interactive Planning) 방법을 제안하고 있습니다. 이 방법은 LLM이 생성한 초기 플랜을 실행 프로세스에 대한 추가 설명, 실행 오류에 대한 피드백, 그리고 예측에 기반한 학위 목표 선택 등을 통해 개선할 수 있도록 합니다. 이 방법을 통해 논문은 Minecraft에서 70개 이상의 작업을 매우 높은 성능으로 달성할 수 있음을 보이고 있습니다.
3.4 리서치 에이전트 (Research Agents)

그림 8. MLAgentBench[9] 개념도
리서치 에이전트는 과학적 발견을 위해서 실험 설계 및 분석을 수행하는 에이전트입니다. 리서치에이전트 관련해서는 Foundation Models for Decision Making Workshop에서 MLAgentBench[9]가 발표되었습니다. MLAgentBench는 자연어로 주어진 Machine Learning (ML) 작업(E.g. “train.py”가 만드는 이미지 분류 모델의 성능을 향상시키세요.”)을 수행하는 리서치 에이전트의 성능을 평가하기 위한 일종의 강화학습 (Reinforcement Learning, RL) 환경입니다(그림 8 참조). 에이전트는 파일 읽기/쓰기, 코드 수행, 그리고 결과 분석 등의 액션을 수행할 수 있습니다. 그리고, 에이전트는 수행 결과(Submission.csv 파일)과 수행 과정(Interaction Trajectory)를 통해서 성능이 평가됩니다.
4. LG AI연구원의 LLM 에이전트 연구
LG AI연구원에서도 LLM 에이전트 관련 연구가 진행되고 있으며, 이번 NeurIPS 2023에서 연구 성과를 담은 여러 연구 논문을 발표하였습니다. LG AI연구원이 발표한 LLM 에이전트 관련 논문을 몇 편 소개해 드리겠습니다.
4.1 MultiPrompter

그림 9. MultiPrompter[10] 개념도
In-Context Learning (ICL) 기반 LLM 에이전트는 사용되는 프롬프트에 따라 성능에 많은 영향을 받습니다. MultiPrompter[10]는 파운데이션 모델(Foundation Model)을 사용할 때마다 사람이 매번 번거롭게 프롬프트 최적화(Prompt Optimization)를 하는 것이 아닌, 자동으로 최적의 프롬프트를 찾아주는 방법을 제안하고 있습니다. 특히, 기존의 프롬프트 최적화 문제를 여러 개의 에이전트가 서로 협력해서 함께 최적화하는 새로운 관점을 제안했습니다. 이러한 협력을 통해 효과적으로 프롬프트 탐색 공간(Prompt Search Space)를 분할했고, 기존 방법에 비해서 훨씬 향상된 프롬프트를 얻는 것을 확인했습니다. 이 논문은 Efficient Natural Language and Speech Processing (ENLSP) 워크샵에서 Spotlight로 선정되었습니다.
▶MultiPrompter: Cooperative Prompt Optimization with Multi-Agent Reinforcement Learning (Link)
4.2 Prospector

그림 10. Prospector[11] 개념도
현재 LLM 에이전트들은 주로 단순한 Few-shot Demonstration을 기반으로 하고 있기 때문에, 주어진 과제를 완수하기 위한 최적의 Action 선택과 평가가 제한적이라는 문제가 있습니다. 이러한 문제를 해결하기 위해서, Prospector[11]는 LLM Actor와 LLM Critic이라는 두 개의 상호 보완적인 LLM으로 구성된 에이전트를 제안합니다.
LLM Actor는 Self-Asking이라는 프롬프팅 방법을 통해서 보다 나은 Action을 생성할 수 있습니다. LLM Critic은 LLM Actor가 생성한 다양한 실행 궤적(Trajectory)의 보상(Reward)을 예측하는 역할을 합니다. 이 중에서 보상이 높을 것으로 예측되는 궤적(Trajectory)를 선택하는 Trajectory Ranking을 통해서, Prospectors는 과제의 성공률을 높입니다. ALFWorld라는 가사 활동 시뮬레이션 환경과 WebShop이라는 온라인 쇼핑 시뮬레이션 환경을 통해서, 제안하는 LLM 에이전트가 기존 ReAct 및 Reflexion 등의 LLM 에이전트보다 더 높은 성공률을 얻을 수 있음을 실험적으로 보입니다.
▶Prospector: Improving LLM Agents with Self-Asking and Trajectory Ranking (Link)
5. 결론
NeurIPS 2023에서는 LLM 에이전트와 관련된 다양한 워크샵들이 성황리에 개최되었습니다. 그 중에서 대표적인 워크샵들로는 Foundation Models for Decision Making (FMDM)[12], Agent Learning in Open-Endedness (ALOE)[13], Instruction Tuning and Instruction Following (Instruction)[14] 등이 있습니다. 각 워크샵에서는 LLM 에이전트와 관련된 흥미로운 연구와 방법론들이 제시되었고, 관련 연구를 진행하는 연구원들은 최신 트렌드와 인사이트를 공유할 수 있었습니다.
지금까지 NeurIPS 2023에서 소개된 LLM 에이전트 관련 최신 연구를 (1) 범용 LLM 에이전트 연구와 (2) 도메인 특화 에이전트 연구, 그리고 (3) LG AI연구원의 에이전트 연구로 나누어서 살펴보았습니다. LG AI연구원은 초거대 AI인 EXAONE을 기반으로, 다양한 LLM 에이전트 연구를 활발히 진행하고 있습니다. 예를 들면, 외부 도구를 사용해서 수학 문제를 푸는 등의 복잡한 추론(Reasoning)이 가능한 에이전트, 환경이나 사용자의 피드백을 반영하여 적응형 플래닝(Planning)이 가능한 에이전트 등을 연구하고 있습니다. 이러한 연구를 통해서 보다 발전된 도메인 특화 LLM 에이전트를 효과적으로 개발할 수 있을 것으로 기대하고 있습니다.
▶ NeurIPS 2023 Research Blog 시리즈가 궁금하다면? (Link)
[1] Lilian Wang, “LLM Powered Autonomous Agents”, https://lilianweng.github.io/posts/2023-06-23-agent/
[2] Shunyu Yao, Dian Yu, Jeffrey Zhao, Izhak Shafran, Thomas L. Griffiths, Yuan Cao, Karthik Narasimhan, “Tree of Thoughts: Deliberate Problem Solving with Large Language Models”, NeurIPS 2023 (Oral).
[3] Noah Shinn, Federico Cassano, Edward Berman, Ashwin Gopinath, Karthik Narasimhan, Shunyu Yao, “Reflexion: Language Agents with Verbal Reinforcement Learning”, NeurIPS 2023.
[4] Haotian Sun, Yuchen Zhuang, Lingkai Kong, Bo Dai, Chao Zhang, “AdaPlanner: Adaptive Planning from Feedback with Language Models”, NeurIPS 2023.
[5] Bill Yuchen Lin, Yicheng Fu, Karina Yang, Faeze Brahman, Shiyu Huang, Chandra Bhagavatula, Prithviraj Ammanabrolu, Yejin Choi, Xiang Ren, “SwiftSage: A General Agent with Fast and Slow Thinking for Complex Interactive Tasks”, NeurIPS 2023 (Spotlight).
[6] Xiang Deng, Yu Gu, Boyuan Zheng, Shijie Chen, Samuel Stevens, Boshi Wang, Huan Sun, Yu Su, “Mind2Web: Towards a Generalist Agent for the Web”, NeurIPS 2023 Datasets and Benchmarks (Spotlight).
[7] John Yang, Akshara Prabhakar, Karthik Narasimhan, Shunyu Yao, “InterCode: Standardizing and Benchmarking Interactive Coding with Execution Feedback”, NeurIPS 2023 Datasets and Benchmarks.
[8] Zihao Wang, Shaofei Cai, Guanzhou Chen, Anji Liu, Xiaojian Ma, Yitao Liang, “Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents”, NeurIPS 2023.
[9] Qian Huang, Jian Vora, Percy Liang, Jure Leskovec, “Benchmarking Large Language Models as AI Research Agents”, NeurIPS 2023 Foundation Models for Decision Making Workshop.
[10] Dong-Ki Kim, Sungryull Sohn, Lajanugen Logeswaran, Dongsub Shim, Honglak Lee, “MultiPrompter: Cooperative Prompt Optimization with Multi-Agent Reinforcement Learning”, NeurIPS 2023 Efficient Natural Language and Speech Processing (ENLSP) (Spotlight).
[11] Byoungjip Kim, Youngsoo Jang, Lajanugen Logeswaran, Geon-Hyeong Kim, Yu Jin Kim, Honglak Lee, Moontae Lee, “Prospector: Improving LLM Agents with Self-Asking and Trajectory Ranking”, NeurIPS 2023 Foundation Models for Decision Making (FMDM) Workshop.
[12] NeurIPS 2023 Workshop Agent Learning in Open-Endedness (ALOE), https://sites.google.com/view/aloe2023.
[13] NeurIPS 2023 Workshop Foundation Models for Decision Making (FMDM), https://sites.google.com/view/fmdm-neurips23.
[14] NeurIPS 2023 Workshop Instruction Tuning and Instruction Following (Instruction), https://an-instructive-workshop.github.io/.