[AI 윤리 세미나 ep.1] 생성형 AI를 위한 Red Team 연구 트렌드와 응용 사례


LG AI연구원은 왜 AI 윤리를 연구할까요? 사람에게 도움이 되는 AI 개발을 위해 AI 윤리 연구가 반드시 필요하다고 믿기 때문입니다. 그래서 우리는 AI 라이프사이클의 전체 과정에서 우리가 예상하지 못한 기술의 부작용은 없는지 AI 윤리 측면에서 항상 고민합니다.

우리의 AI 윤리 연구 과정에는 다양한 구성원들이 함께하고 있습니다. AI 연구자, 사업 개발자, 변호사를 비롯해 UI/UX 디자이너, 데이터 사이언티스트, AI 교육 기획자가 함께 논의하는 'AI 윤리 세미나'가 대표적입니다. 세미나에서는 주목할 만한 AI 윤리 연구와 최근의 트렌드를 분석하고 각자의 인사이트를 나눕니다. 이렇게 논의된 내용들은 우리의 AI 윤리 활동에 접목시켜 내재화합니다.

이번 글에서는 올해 AI 윤리 세미나에서 논의된 주요 주제를 시리즈로 소개하겠습니다. 우리가 나누는 여러 고민과 인사이트가 AI 윤리 발전에 도움이 되기를 바랍니다.


생성형 AI 기술이 빠르게 발전하면서, AI 시스템을 개발하고 배포하거나 사용할 때 책임 있는 AI(Responsible AI, RAI)의 중요성이 커지고 있습니다. 생성형 AI의 중요도가 증대됨에 따라 ‘AI Red Team’에 대한 관심도 높아지고 있습니다. ‘Red Team’은 모의 군사훈련에서 적의 역할을 수행하는 팀을 칭하던 군사 전략에서 나온 개념으로, 적의 입장에서 문제를 분석하고 시뮬레이션하여 대응책을 마련하는 역할을 합니다.

AI Red Team은 기존 Red Team의 접근 방식을 생성형 AI에 맞춰 특화하고 확장한 개념입니다. 이들은 프롬프트 주입(Prompt Injection)이나 데이터 중독(Poisoning)과 같은 새로운 보안 위협을 탐지하고, 공정성 문제나 유해 콘텐츠의 발생을 방지하기 위해 AI 시스템을 종합적으로 점검합니다. AI Red Team은 악의적인 공격뿐만 아니라 일반 사용자의 상호작용에서 발생할 수 있는 부적절한 결과까지 포괄적으로 다루며, AI 시스템의 빠른 변화에 대응하기 위해 지속적이고 주기적인 점검과 자동화된 모니터링을 실시합니다. 특히, 확률적 생성 방식으로 작동하는 생성형 AI의 기술적 특성을 고려해 다양한 테스트를 반복한 후 결과를 분석하며, 다층적인 방어 전략을 도출해 시스템의 일관성과 신뢰성을 향상시킵니다. 이와 같이 AI Red Team은 안전하고 신뢰할 수 있는 AI 시스템을 개발하는 데 중요한 역할을 수행합니다.

LG AI연구원은 지난 8월 공개한 Enterprise AI Agent, ChatEXAONE에도 AI Red Team을 적용했습니다. ChatEXAONE은 기업 사용자의 업무 생산성을 혁신하는 서비스로, AI Red Team 적용을 통해 보안 요건과 신뢰성을 강화하고 사용자에게 책임 있는 AI 서비스를 제공하고 있습니다[1].

이번 글에서는 생성형 AI를 위한 Red Team의 주요 개념을 살펴보고, ChatEXAONE의 프롬프트 추천기능을 포함해 AI Red Team이 적용된 다양한 응용 사례와 연구를 소개하겠습니다.


1. AI Red Team의 개념

최근 초거대 언어 모델과 비전-언어 모델을 중심으로 한 생성형 AI 기술은 다양한 분야에서 관심을 받고 있습니다. 모델의 뛰어난 생성 능력은 생성형 AI 기술의 강점이면서도, 잘못 사용되거나 악의적인 요청에 의해 조작될 수 있는 한계도 가집니다. AI Red Team은 이러한 위험을 줄이기 위해 중요한 역할을 합니다.

AI Red Team은 모델의 취약점을 찾아내고, 이를 방어할 수 있는 방법을 개발하여 모델의 안전성을 높이는 과정을 수행합니다. 이 과정은 크게 네 단계로 이루어집니다. 첫 번째 단계는 위험 요소를 찾아내고 분류하는 것이며, 두 번째는 공격 전략을 개발하고 이를 자동화하는 단계입니다. 세 번째 단계에서는 이러한 공격에 대해 방어할 수 있는 방법을 수립하고 검증하며, 마지막 네 번째 단계에서는 AI Red Team 결과를 반영해 전반적인 시스템 운영을 개선합니다. AI Red Team은 단계별 프로세스를 통해 공격 및 방어 전략을 도출하여 AI 시스템의 안전성과 견고성, 신뢰성을 높입니다[2].


(1) 위험 분류 및 식별

AI Red Team의 첫 번째 단계는 AI 모델이 보유할 수 있는 위험 요소를 찾아내고, 이를 체계적으로 정리하는 것입니다. 이 과정에서는 여러 기준을 활용해 모델이 발생시킬 수 있는 위험을 나누고 분석합니다. 먼저, AI 서비스 제공 주체는 서비스를 안전하게 제공하기 위해 모델이 따라야 할 규칙과 지침을 마련합니다. 이 지침에는 폭력, 착취, 테러와 같은 불법 행위를 방지하고, 특정 개인이나 집단에 해를 끼치지 않도록 하는 규정이 포함됩니다. 이를 기반으로, AI Red Team은 모델이 작동하면서 발생할 수 있는 위험을 세분화하여 분석합니다.

위험 요소를 구체적으로 나누기 위해 몇 가지 기준을 사용합니다:


  1. 정책: 모델이 따라야 하는 규칙이나 지침을 기준으로 위험을 분석합니다.

  2. 유해 유형: 모델이 잘못 작동할 경우 발생할 수 있는 피해의 종류를 구체적으로 정의합니다.

  3. 대상: 모델이 영향을 미칠 수 있는 대상, 즉 특정 개인, 그룹, 또는 외부 집단을 구분하여 위험을 평가합니다.

  4. 도메인: 과학, 저작권, 윤리 등 특정 분야에 따라 모델이 해당 분야에서 일으킬 수 있는 문제를 파악합니다.

  5. 시나리오: 모델이 실제로 사용될 때 예상되는 다양한 상황을 가정하고, 그 상황에서 발생할 수 있는 위험을 세분화하여 보다 현실적인 평가를 합니다.


이러한 다층적인 접근을 통해 AI Red Team은 모델이 다양한 상황에서 어떤 위험을 초래할 수 있는지 예측하고, 이를 바탕으로 안전하고 신뢰할 수 있는 AI 시스템을 구축할 수 있도록 지원합니다.


(2) 공격 전략 개발

1단계에서 위험 요소를 식별하고 분류했다면, 2단계에서는 이를 기반으로 다양한 공격 전략을 개발합니다. 이 단계에서는 생성 모델의 특성에 맞는 공격 방법을 설계하고, 잠재적인 위협을 시뮬레이션합니다. 언어 모델에 대한 공격 전략은 네 가지 주요 영역으로 구분할 수 있으며, 각 공격 전략은 모델이 학습 과정에서 획득한 특성과 능력을 활용합니다. 공격자는 이를 통해 모델이 부적절하거나 위험한 응답을 생성하도록 유도할 수 있습니다.


이미지 1. 언어 모델의 특성에 따른 공격전략 분류[2]


먼저, 완성 순응(Completion Compliance) 전략이 있습니다. 인과적 언어모델(Causal Language Model)의 특성으로 인해, 주요 디코더 기반 언어모델들은 주어진 컨텍스트를 바탕으로 다음 시퀀스의 토큰을 예측하는 특성을 갖습니다. 공격자는 인과적 언어모델의 특성을 악용하여 모델이 악의적인 프롬프트에 순응하여 응답을 생성하도록 유도합니다. 예를 들어, 유해하거나 금지된 내용 뒤에 "물론입니다, 결과는 다음과 같습니다."와 같은 긍정적인 접미사(Affirmative Suffixes)를 덧붙여 최종 입력 프롬프트를 입력하면, 모델은 긍정적인 접미사의 영향을 받아 유해하거나 금지된 내용에 대한 응답을 할 가능성이 높아집니다.

다음으로, 지시 우회(Instruction Indirection) 전략은 모델의 지시 수행 능력을 악용합니다. 모델은 학습 과정에서 지시 튜닝을 통해 다양한 형태의 지시를 수행할 수 있는 능력을 갖추게 되며, 공격자는 이를 이용해 모델이 지시에 따라 행동하면서도 안전 규정을 우회하도록 만들 수 있습니다. 예를 들어 모델이 특정 형식(JSON, 위키백과 스타일 등)으로 응답하도록 유도하거나, 복잡한 시나리오나 중첩된 시뮬레이션을 통해 모델이 지시를 수행하는 과정에서 위험한 내용을 포함하도록 할 수 있습니다. 이를 통해 모델이 본래의 안전 정책을 무시하도록 유도할 수 있습니다.

또한, 일반화 미끄러짐(Generalization Glide) 전략은 모델의 일반화 능력을 악용하는 방식입니다. 언어 모델은 학습 과정에서 다양한 언어와 도메인에 걸쳐 데이터를 학습하여 일반화된 응답을 생성할 수 있습니다. 공격자는 이 일반화 능력을 이용해 모델이 안전장치를 우회하도록 시도합니다. 예를 들어, 저자원 언어(사용 빈도가 낮은 언어)로 유해한 프롬프트를 작성하여 모델이 해당 언어에 대한 안전성 검증이 충분하지 않다는 점을 이용해 위험한 응답을 생성하게 할 수 있습니다. 또한, 암호화된 문장을 해석하도록 유도하여 안전성 검증을 회피하는 방법도 사용할 수 있습니다.

마지막으로, 모델 조작(Model Manipulation) 전략은 모델의 매개변수, 활성화 값 또는 구성 요소를 직접 조정하여 모델의 출력을 조작하는 방식입니다. 이 전략은 특히 오픈소스 모델이나 사용자가 모델의 내부 구조에 접근할 수 있는 경우에 효과적입니다. 공격자는 모델의 디코딩 매개변수(예: Temperature)를 조정하여 모델이 다양한 출력 결과를 생성하도록 유도하거나, 샘플링 방식을 변경하여 공격 성공률을 높일 수 있습니다. 또한, 모델의 가중치나 특정 활성화 값을 수정하여 의도적으로 유해한 결과를 생성하도록 조작할 수도 있습니다.

이와 같은 공격 전략들은 언어 모델의 고유한 학습 특성과 기능에 대한 이해를 바탕으로, 모델의 안전성을 위협할 수 있는 다양한 방법을 체계적으로 제시합니다. 각 전략은 모델의 특정 능력이나 학습 과정을 악용하는 방식으로 설계되며, 이를 통해 모델이 본래의 안전한 행동을 유지하지 못하게 하는 것을 목표로 합니다.


(3) 방어 전략 수립 및 시스템 운영 개선

공격이 식별되면 이를 평가해 방어 전략을 수립하고, 시스템 운영을 개선하는 단계로 나아갑니다. 이때 방어 전략은 크게 학습 시점 방어와 추론 시점 방어로 나뉩니다.


이미지 2. 모델 구축 단계별 방어 전략[2]


학습 시점 방어는 언어 모델의 사전 학습 이후 미세 조정(Fine-tuning)이나 강화 학습(RLHF)을 통해 이루어집니다[3]. 이 과정에서 모델이 유해한 입력 데이터를 인식하고 이를 거부하도록 모델을 학습시켜 다양한 상황에서도 안전하게 응답을 생성할 수 있도록 합니다. 한편, 적대적 학습(Adversarial Training) 방식으로 유해한 쿼리를 생성하고 이를 거부하도록 학습하여 모델의 안전성을 강화하는 방법도 있습니다. 이때 보상 모델(Reward Model)을 활용하여 안전성과 유용성을 평가하고, 해당 데이터를 사용해 모델을 정밀하게 조정합니다. 이러한 학습 시점 방어는 모델이 새로운 상황에서도 안전성을 유지하는 데 효과적이지만, 모델의 본래 기능에 영향을 줄 수 있어 정렬 비용(Alignment Tax)이 발생하거나 성능 저하가 일어날 수 있습니다.

추론 시점 방어는 입력 필터링, 시스템 프롬프트, 가드레일 시스템이 순차적으로 작동하여 AI 모델의 위험을 효과적으로 줄이는 방식입니다. 먼저, 입력 필터링 단계에서는 사용자 입력을 평가하여 유해하거나 부적절한 내용이 있는지 확인하고, 이를 모델에 전달하기 전에 차단합니다. 이로 인해 안전하지 않은 응답이 생성될 가능성을 줄이며, 공격적인 입력에 선제적으로 대응하는 역할을 합니다. 다만, 프롬프트의 길이와 단계적 절차 때문에 응답이 지연될 수 있다는 단점이 있습니다.

시스템 프롬프트는 모델의 행동을 유도하는 구체적인 지침을 제공하여, 모델이 책임감 있고 안전한 방식으로 응답하도록 돕습니다. 마지막 단계로, 가드레일 시스템이 모델의 출력을 모니터링하여 사전에 정의된 규칙과 기준에 따라 안전하지 않은 응답을 걸러내거나 수정합니다. 이러한 방어 체계는 다양한 위협에 유연하게 대응하며, AI 시스템의 안전성과 신뢰성을 유지하는 데 기여합니다. 그러나 이 과정은 계산 비용이 증가할 수 있고, 모든 복잡한 공격을 완벽히 방어하기에는 한계가 있을 수 있습니다.


2. AI Red Team 연구 및 응용 사례

(1) MART: Improving LLM Safety with Multi-round Automatic Red-Teaming

MART는 대규모 언어 모델(LLM)의 안전성을 향상시키기 위해 다중 라운드 자동 Red-Teaming을 제안합니다. 적대적 모델과 안전 모델이 상호 작용하며, 적대적 모델(Adversarial Model)은 안전 모델의 취약점을 공격하는 프롬프트를 생성하고, 안전 모델(Safe Model)은 이를 방어하며 안전성을 높이는 방식으로 학습됩니다. 이를 통해 MART는 반복적인 학습을 통해 모델의 취약점을 지속적으로 찾아내고, 이를 개선하여 최종적으로 더 안전하고 신뢰할 수 있는 AI 시스템을 구축하는 것을 목표로 합니다.


이미지 3.MART 학습 프레임워크[4]


먼저, 초기화 단계에서는 안전 모델과 적대적 모델은 대규모 LLM인 LLaMA-65B 모델을 기반으로 하고, Open Assistant와 LIMA 데이터셋을 사용해 초기 학습을 수행합니다 [5, 6]. 이때 사용된 데이터셋은 비공격적이고 유해하지 않은 데이터를 포함하도록 정제되어, 모델이 기본적인 지시 수행 능력을 안전하게 갖추도록 합니다.

적대적 모델은 기존에 수집된 약 2,400개의 공격 프롬프트를 바탕으로 악성 프롬프트를 생성하는 학습을 합니다. 이미지 3의 왼쪽 그림과 같이, 적대적 모델은 학습 과정에서 각 라운드마다 이전에 성공적으로 공격한 프롬프트를 바탕으로 새로운 프롬프트를 생성합니다. 이후, 안전 모델의 응답을 평가하여 공격의 성공 여부를 판단합니다. 이 과정에서 적대적 모델은 생성한 프롬프트가 안전 모델을 성공적으로 공격했을 때, 지속적으로 효과적인 공격이 가능하도록 최적화됩니다.

반대로, 안전 모델의 안전성 강화 과정에서는 적대적 모델의 공격에 대응하여 안전한 응답을 생성한 후, 이를 바탕으로 모델을 재학습합니다. 안전 모델은 반복적인 학습을 통해 점차적으로 더 안전한 응답을 생성할 수 있도록 개선됩니다. 이미지 3의 오른쪽 그림은 안전 모델이 적대적 모델의 공격에 성공적으로 방어했을 때의 상황을 보여줍니다.

MART의 성능평가에서는 안정성을 증진시키면서도 유용성을 얼마나 유지할 수 있는지에 대해서 검증을 진행했습니다. 학습한 데이터(In-distribution)에 대한 평가는 안전성 평가 데이터셋(SafeEval)과 유용성 평가 데이터셋(HelpEval)으로 수행됩니다. 이때, SafeEval은 MART에 사용된 공격 프롬프트의 일부를 포함하고, HelpEval은 인간 레이블러가 작성한 비공격적인 프롬프트로 구성됩니다. 학습 시 사용하지 않은 데이터(Out-of-domain)에 대한 평가에서는 AlpacaEval 데이터셋과 Anthropic Harmless 데이터셋을 사용하여 MART의 일반화 성능을 측정합니다.


이미지 4. In-Distribution 및 Out-of-domain 모델 성능[4]


이미지 4의 평가결과 (a), (c)에서 확인할 수 있듯이 SafeEval과 Anthropic Harmless에 대한 안전성 점수는 MART의 적대적 학습을 반복할수록 크게 향상됨을 확인할 수 있습니다. 특히 낮은 점수 구간(20% 및 40% 백분위수)의 케이스에서 안정성 점수의 현저한 개선을 확인할 수 있습니다. 한편, (b), (c)의 결과와 같이 HelpEval과 AlpacaEval에 대한 평가결과에서 MART의 적대적 학습의 반복 과정에서도 유용성 점수는 안정적으로 유지되어, MART가 모델의 안전성을 강화하면서도 유용성은 크게 손상시키지 않았음을 보였습니다.


(2) AI Red Team 응용 사례

ChatEXAONE의 프롬프트 추천 기능은 AI Red Team 방어 전략이 적용된 대표적인 사례입니다. 프롬프트 추천 기능은 기업 사용자의 직무와 업무 전문성에 맞춰 맞춤형 프롬프트를 제공합니다. 또한, ChatEXAONE과의 대화 과정에서 더 깊은 인사이트를 얻을 수 있도록 최적의 후속 프롬프트를 추천합니다.


이미지 5. ChatEXAONE에 적용된 프롬프트 추천 기능 화면[7]


ChatEXAONE의 프롬프트 추천 기능은 최적의 후속 프롬프트를 제공하여, 사용자의 업무생산성을 향상시키는데 크게 기여하지만, 사용자의 입력 의도를 정확히 파악하고 이에 적합한 후속 프롬프트를 제공하는 기능적 특성에 기인하여 위험이 발생할 여지가 있습니다. 사용자가 악의적인 프롬프트를 입력하는 경우 부적절한 후속 프롬프트를 보조하여 악의적인 후속 프롬프트를 제공하는 사례가 대표적인 예시입니다.

LG AI연구원은 이를 방지하기 위해 학습과 추론 단계에 모두 AI Red Team 방어 전략을 적용했습니다. 프롬프트 추천 기능의 경우 EXAONE 기반의 자체 모델 구축 단계에서부터 악의적인 프롬프트에 대응하는 학습을 진행했습니다. 또한, 추론 단계에서는 LG AI연구원이 자체 개발한 안전 필터를 적용해 실시간으로 유해한 콘텐츠를 감지하고 차단하도록 구현했습니다. 이를 통해 ChatEXAONE의 시스템 안전성과 신뢰성을 강화할 수 있었습니다.

최근에는 LLM API를 중점적으로 활용하는 서비스 적용 사례가 늘어나면서, 학습 시점 방어보다 추론 시점 방어의 중요성도 더욱 부각되고 있습니다. OpenAI, Meta, 그리고 Microsoft와 같은 글로벌 기업들은 이러한 필요성에 대응하여 AI 모델의 안전성과 신뢰성을 강화하는 다양한 접근 방식을 적용하고 있습니다.

OpenAI는 Red Teaming Network를 구축해 다양한 전문가들이 참여하는 평가와 테스트를 수행합니다. 이 네트워크는 GPT-4와 같은 대형 모델의 잠재적 악용 사례를 탐구하고, 반복적인 테스트를 통해 정책 위반을 식별하며, 모델의 안전성을 확보합니다. 이러한 Red Team 활동은 AI 시스템이 사용자 환경에서 책임감 있고 안전하게 작동할 수 있도록 유해 콘텐츠와 관련된 위험을 사전에 파악하고 대응하는 데 중점을 둡니다[8].


이미지 6. Microsoft의 AI Red Team 가이드(좌), Meta의 Safeguards 프레임워크[9, 10]


Microsoft는 GPT-4와 Bing Chat과 같은 응용 프로그램을 대상으로 AI Red Team을 수행하여 모델이 생성할 수 있는 보안 취약점과 유해 콘텐츠를 식별합니다. 이 과정에서 Microsoft는 AI 시스템 전반의 안전성을 높이는 포괄적인 방어 전략을 제공합니다. 특히, Azure OpenAI 모델의 사용자들을 위해 AI Red Team 가이드를 제공하여, 이들이 보다 안전하고 신뢰성 있는 AI 시스템을 개발할 수 있도록 지원하고 있습니다[9].

Meta의 Purple LLaMA는 공격적 전략(Red Team)과 방어적 전략(Blue Team)을 결합한 Purple Teaming을 통해 AI 시스템의 보안을 강화하는 종합 프레임워크로서 앞서 살펴본 AI Red Team 접근 방식을 충실히 수행하는 대표적인 예시입니다. Purple Llama는 LLM을 위한 사이버 보안 평가 벤치마크와 Llama Guard와 같은 안전 필터 모델을 포함하며, 개발자들이 AI 시스템에서 발생할 수 있는 유해하거나 악의적인 콘텐츠 생성을 방지할 수 있도록 지원합니다[10].


이번 글에서는 생성형 AI를 위한 AI Red Team의 주요 개념을 깊이 있게 이해하고, 관련 연구와 더불어 ChatEXAONE의 프롬프트 추천 기능을 포함한 응용 사례를 살펴봤습니다. AI Red Team은 생성형 AI의 안전성과 신뢰성을 보장하는 데 필수적인 요소로, 점점 더 많은 관심과 중요성을 얻고 있습니다. 앞으로도 AI Red Team의 전략과 기술이 발전함에 따라 AI 모델의 취약점을 사전에 탐지하고 개선하고, 윤리적인 AI 활용이 더욱 강화될 것으로 기대됩니다.

LG AI연구원 역시 2022년 ‘AI 윤리 원칙’을 발표하고 2024년에는 AI 윤리원칙 이행 성과를 담은 ‘AI 윤리 책무성 보고서’도 발행하며 사람과 AI가 조화를 이루며 공존할 수 있는 방법을 끊임없이 모색해왔습니다[11]. ChatEXAONE에 AI Red Team을 적용하고 오픈할 수 있었던 것도 이러한 노력의 결과입니다. LG AI연구원도 ChatEXAONE의 프롬프트 추천 사례와 같이 사용자들이 보다 안전하게 서비스를 활용할 수 있도록 지속적으로 AI Red Team을 강화해 나가겠습니다.

 

AI 윤리 세미나 시리즈

#2. [AI 윤리 세미나 ep.2] AI로 인한 위험을 제대로 바라보기 위한 연구들
#3. [AI 윤리 세미나 EP.3] 신뢰할 수 있는 AI 경험 설계를 위한 주요 AI Toolkit 소개 및 실무 적용 가이드라인
#4. [AI 윤리 세미나 EP.4] AI Agent를 통해 살펴본 책임 있는 AI 사회 구현
#5. [AI 윤리 세미나 ep.5] AI 윤리, UI/UX 디자이너의 시선으로 보다

참고

[1] LG AI Research "ChatEXAONE: Enterprise AI Agent" https://www.lgresearch.ai/data/upload/tech_report/en/Technical_report_ChatEXAONE.pdf (2024).

[2] Lin, Lizhi, et al. "Against The Achilles' Heel: A Survey on Red Teaming for Generative Models." arXiv preprint arXiv:2404.00629 (2024).

[3] Ganguli, Deep, et al. "Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned." arXiv preprint arXiv:2209.07858 (2022).

[4] Ge, Suyu, et al. "Mart: Improving llm safety with multi-round automatic red-teaming." arXiv preprint arXiv:2311.07689 (2023).

[5] Kopf, Andreas, et al. "Openassistant conversations-democratizing large language model alignment." Advances in Neural Information Processing Systems 36 (2024).

[6] Zhou, Chunting, et al. "Lima: Less is more for alignment." Advances in Neural Information Processing Systems 36 (2024).

[7] LG AI Research “Introducing ChatEXAONE : Enterprise AI Agent Boosting Corporate Efficiency with Expert AI Insights” https://www.lgresearch.ai/blog/view?seq=458

[8] OpenAI, "OpenAI Red Teaming Network" https://openai.com/index/red-teaming-network/ (2023).

[9] Microsoft, "Microsoft AI Red Team building future of safer AI", https://www.microsoft.com/en-us/security/blog/2023/08/07/microsoft-ai-red-team-building-future-of-safer-ai/ (2023).

[10] Meta, "Introducing Purple Llama for Safe and Responsible AI Development" https://about.fb.com/news/2023/12/purple-llama-safe-responsible-ai-development/ (2023).

[11] LG AI Research "2023 LG AI 윤리 책무성 보고서" https://www.lgresearch.ai/about/vision#ethics (2023).