
이미지 1. LG AI연구원과 미시건 대학교가 함께 진행한 거대 언어 모델의 문화적 상식 이해에 대한 연구가 NAACL 2024 소셜 임팩트 어워드를 수상했다.
1. 컨퍼런스 소개
북미컴퓨터언어학학회(NAACL; North American Chapter of the Association for Computational Linguistics)은 컴퓨터언어학협회(ACL; Association for Computational Linguistics)의 주요 지부입니다. NAACL은 자연어 처리(NLP; Natural Language Processing) 및 컴퓨터 언어학 발전에 초점을 둔 컨퍼런스를 개최합니다. 또한, NAACL 컨퍼런스는 NLP, 머신러닝, 언어학 이론, 언어 기술 응용 등 인간 언어의 컴퓨터적 측면에 대한 연구를 다룹니다.
어워드 소개
본 논문은 NAACL 2024에서 소셜 임팩트 어워드를 수상했습니다. 그리고 프로그램 위원회에서는 본 논문을 선정한 근거에 대해 다음과 같이 말했습니다:
| "본 논문은 LLM의 문화적 편견에 대한 중요한 이슈를 시기적절하게 다루며 AI 시스템의 안정성 및 공정성에 중대한 영향을 미칠 수 있는 향후 연구에 대한 깊은 통찰력과 가능성 있는 방법을 제시합니다. LLM에 내재된 문화적 편견을 드러내는 본 논문은 사회적 편견을 줄이고 AI 기술의 포용성을 촉진하기 위해 문화적으로 지각 있는 언어 모델을 긴급히 개발해야 한다고 강조합니다." |
2. 연구 논문 소개
I. 서론
일반적으로 상식은 사람들 사이에 공유되는 기본적인 지식을 말합니다. 그리고 LLM(Large Language Model, LLM)은 이렇게 대부분의 사람들이 합의한 지식을 파악하는 상식 벤치마크에서 우수한 성능을 보여주기도 했습니다. 그러나 어떤 지식이 상식으로 여겨지는가에 대한 합의는 집단에 따라 달라질 수 있습니다. 예를 들어, 미국이나 이탈리아 등의 국가에서는 하얀색 웨딩 드레스를 보편적이라고 생각하는 반면, 인도나 중국 등의 국가에서는 빨간색 웨딩 드레스가 보편적이라고 여겨집니다. 따라서 ‘어떤 색의 웨딩 드레스가 보편적인가’라는 질문에 대한 답은 답변하는 사람의 문화적 배경에 따라 달라질 수 있습니다.
여러 벤치마크를 통해 LLM이 상식에 대해 뛰어난 성능을 보인 결과는 많았지만, 문화적인 요소가 LLM의 상식 이해에 어떤 영향을 미치는지에 대한 체계적인 분석은 부족합니다. 이번 연구는 다음 질문에 대한 답변을 통해 부족한 부분을 채우고자 합니다:
LLM의 상식 이해 능력이 문화 별로 차이가 있는가?
문화적 맥락과 상식에 대한 접근법의 관계는 무엇인가?
위 질문에 대한 답변을 찾아가는 과정에 언어 선택이 어떤 영향을 미치는가?
II. 실험 설계
이러한 질문들을 위해 우리는 다음과 같은 간단한 파이프라인을 고려했습니다:
서로 다른 작업에 대한 질문 프롬프트 디자인
질문 프롬프트를 다양한 언어로 번역(예: 이란과 관련된 상식 주장은 영어와 페르시아어 모두에서 모델을 프로빙)
작업에 대한 여러 LLM의 성능 입증
* 국가 및 언어: 본 논문은 지역, 언어, 문화적 다양성 측면에서 다섯 개의 국가(중국, 인도, 이란, 케냐, 미국) 및 다섯 개의 언어(중국어, 힌디어, 페르시아어, 스와힐리어, 영어)를 선택해 초점을 두고 분석했습니다.
* 모델: 본 논문은 오픈 소스 및 클로즈드 소스 모델을 포함한 다양한 모델을 테스트했습니다.
오픈 소스 모델: Vicuna, Falcon, Llama2
클로즈드 소스 모델: GPT-3.5-turbo, GPT-4
* 데이터셋: 본 논문은 문화적 상식 데이터셋(GeoMLAMA, CANDLE) 및 일반 상식 데이터셋(GenericsKB)을 포함한 여러 데이터셋의 데이터를 분석에 이용했습니다.
III. 분석
1) LLM이 문화적 상식을 이해하는가?
문화적 상식을 인지하는지 검증하기 위해 우리는 “문화적 상식 QA”, “국가 식별”이라는 두 개의 작업을 고려했습니다. 각 작업에 대한 예시는 아래에 나와 있습니다.
■ 문화적 상식 QA - 언어별
|
질문: 다음 문장의 빈칸에 들어갈 가장 적합한 답변을 고르세요 - 중국에서 운전석은 <mask>에 있다. |
이 작업에서 발견한 핵심은 다음과 같습니다.
영어 및 중국어에서 모델의 성능은 다른 언어에 비해 높은 경향이 있음. (이 이유는 사전 학습 데이터 내 영어와 중국어 데이터의 양이 많기 때문임)
모든 모델은 이란과 케냐에 관련된 주장에서는 성능이 저하되는 경향이 있음. 또한 페르시아어와 스와힐리어에서 지시를 수행하는 성능이 현저하게 제한됨.
모델이 문화적 상식을 이해하는지 조사하는 데 사용된 언어가 성능 차이를 완화하지 못함. 즉, 특정 문화에 맞는 특정 언어로 질문을 던진다고 해서 모델이 질문에 더 정확하게 답하는 데 도움이 되지 않음.
■ 문화적 상식 - 국가 식별
|
질문: 적절한 국가로 문장의 빈칸을 채워 넣으세요 - 노루즈는 지역에 상관없이 전 세계의 <mask>인들이 기념한다. |
이 작업에서 발견한 핵심은 다음과 같습니다.
모델은 인도와 관련된 상식에 대해서 더 높은 성능을 내며, 그 이유는 인도가 특화된 문화적 특징을 가진 국가이기 때문임 (예: 아유르베다는 <mask>의 전통 의학 체계이다, 정답: 인도).
앞선 언어 별 작업에서와 마찬가지로, 모델 성능은 인도와 케냐에 대해서는 저하됨.
대부분의 모델은 해당 국가의 언어가 아닌, 영어로 프로빙할 때 가장 높은 성능을 냄. GPT의 경우에는 해당 국가의 언어로 프로빙할 때 일부 성능 개선을 보이기도 함.
2) 일반 상식 주장을 이해하는 데 있어서 LLM은 문화적 맥락의 영향을 받는가?
다음으로 본 논문은 특정 문화에 국한되지 않고 통용되는 일반 상식 주장을 이해하는 데 있어서 LLM이 문화적 맥락의 영향을 받는지를 연구했습니다. 예를 들어, ‘건강한 식단은 혈당을 낮추는 데 도움이 된다’와 같은 주장은 문화적 맥락과 관계없이 사실로 통용되는 주장입니다. 우리는 이러한 일반 상식 주장을 이해하는 데 있어서 특정 문화적 맥락이 모델에 영향을 주는지 여부를 연구했습니다.
■ 상식 연관성
|
질문: 건강한 식단은 혈당을 낮추는 데 도움이 된다. 이란에서 이 주장은 사실인가, 아니면 거짓인가? |
이 작업에서 우리는 해당 국가의 언어로 질문했을 때 GPT에서 균일한 성능 개선이 나타난다는 점을 발견했습니다.
■ 상식 검증
|
질문: 온도가 낮으면 물은 얼음이 된다. 이 문장은 다음 나라 중 어떤 나라에서 일어나는 일에 대한 설명인가? |

이미지 2. 우리는 다양한 프로빙(proving) 작업을 통해 모델의 문화적 상식 이해 능력을 연구했습니다.
본 논문은 이 작업에서 다음과 같은 점을 관찰했습니다.
모든 국가에서 통용되는 일반 상식임에도, 미국이 답변으로 제시되는 경우가 많음(이미지 2 참고).
모델은 사용된 언어에 해당되는 국가를 고르는 경향이 있음(예: 중국어로 질문하는 경우 모델은 중국을 답변으로 고르는 경향이 있음).
3. 결론 및 향후 계획
요약하자면 본 논문에서 분석의 핵심은 다음과 같습니다:
LLM은 문화 특이적 상식에 대해 테스트할 경우 서로 다른 문화에 대해 현저한 성능 차이를 나타냄
LLM은 일반 상식을 소수의 지배적 문화와 연관 짓는 오류를 범함.
LLM 프롬프트에 사용된 언어는 모델의 문화적 상식 이해에 큰 영향을 미칠 수 있음
본 연구는 언어모델이 문화적 맥락을 이해하는 능력과 한계를 확인하기 위한 첫 걸음입니다. LG AI연구원에서는 본 연구 결과를 바탕으로 언어모델이 문화적 맥락을 이해하고, 다양한 문화적 가치를 반영할 수 있도록 연구 방향을 이어갈 것입니다.