NeurIPS 2023은 세계 최고 권위의 AI 학회로 매년 수만명의 인공지능 연구자들이 참여하고 있습니다. LG의 주요 계열사들이 함께 NeurIPS 2023에 참여해 통합 부스 운영하는 등 최신 AI 연구 동향을 파악하고, 다양한 연구자들과 교류할 수 있었습니다. 저는 이번 학회에 LG에너지솔루션을 대표해 참석하여, ‘스마트팩토리 구현에 필수적인 비전 검사 기술’ 시연을 진행했습니다.
이번 글에서는 NeurIPS 2023 속 Computer Vision (CV), Large Language Model (LLM), Large Multimodal Model (LMM), Diffusion Model, 그리고 Reinforcement Learning (RL)의 다섯 가지 주제에 대한 핵심 내용을 소개하고 주목할 만한 연구 논문을 함께 알려드리고자 합니다.
Topic 1. Computer Vision (CV)
첫 번째로 살펴볼 분야는 Computer Vision입니다. Computer Vision이란 Image를 입력으로 다루는 모델을 의미합니다. 전통적인 Computer Vision Model은 Image Classification, Object Detection, Segmentation 등 출력 유형에 따라 별개로 구성되었습니다. 예를 들어 Object Detection을 위한 대표적인 모델은 YOLO[1] 시리즈가 있고, Segmentation을 위한 대표적인 모델은 U-Net[2] 등이 있습니다.
하지만 최근 들어 Computer Vision 모델은 다양한 출력 유형을 다룰 수 있는, 이른바 Foundation Model을 제작하는 방향으로 나아가고 있습니다. 대표적인 모델로는 MAE[3], DINO[4] 등을 들 수 있습니다. NeurIPS 2023에서는 이러한 기조를 이어받아 더욱 성능이 좋은 Vision Foundation Model을 개발하려는 방향을 보여주었습니다.
Towards In-context Scene MUnderstanding[5]
첫 번째로 살펴볼 논문은 Hummingbird[5]입니다. 기존 Foundation Model에서도 다양한 Vision Task 출력을 다뤘지만, Dense 출력에서는 성능이 낮게 나타나는 한계가 있었습니다. 이는 대부분의 Foundation Model이 Image-Text 간의 정렬을 학습하는 방법을 사용했기 때문입니다.
이에 Hummingbird에서는 Dense 출력에서도 좋은 성능을 보이는 Vision Foundation Model 개발을 목표로 합니다. Hummingbird 모델의 큰 특징 중 하나는 Decoder입니다.

그림 1. Hummingbird Decoder 동작 방법
위 그림 1은 Hummingbird의 Decoder로부터 Segmentation Map이 출력되는 과정을 보여줍니다. 픽셀의 클래스를 결정하는 과정에서 Nearest Neighbor를 사용하는 것을 확인할 수 있으며, 이는 Encoding된 Feature가 Feature 공간상에서 동일한 클래스끼리 가까이 분포한다는 가정을 전제로 합니다.
이러한 과정을 위해서는 Context를 고려하여 유사한 Feature끼리 가까이 분포하도록 Encoding 해주는 Encoder가 필요합니다.

그림 2. Hummingbird Architecture
위 그림 2는 Hummingbird Encoder의 동작 방법을 보여주고 있습니다. 눈에 띄는 부분은 Memory Bank로부터의 데이터를 Encoding에 사용한다는 점입니다. 학습 과정에서 이전 Batch 데이터를 Memory Bank로 사용합니다. 그리고 이들 Memory Bank 데이터의 정보를 함께 고려하여 BYOL[6]과 유사하게 Self Supervised Learning 방식으로 학습해 줍니다.

그림 3. Hummingbird와 기존 Vision Model의 Semantic Segmentation 성능 비교
위 그림 3은 이렇게 학습한 Hummingbird와 기존 Vision Model들의 Semantic Segmentation 성능을 비교한 표입니다. 각자의 방법으로 Pretraining 한 뒤 Small Dataset으로 Finetuning한 결과를 나타냅니다. 기존 방법들보다 Hummingbird가 좋은 성능을 보였음을 확인할 수 있습니다.
Siamese Masked Autoencoders[7]
두 번째로 소개할 논문은 SiamMAE[7]입니다. 기존 Vision Foundation Model의 대표적인 학습 방법 중 하나는 Contrastive Learning인데, 이 Contrastive Learning은 다량의 데이터를 대조적으로 학습하며 좋은 특징을 학습할 수 있다는 장점이 있습니다. 하지만 Video 도메인에서는 사용하기 어렵다는 한계가 있었고, 이로 인해 시간 정보를 다뤄야 하는 다양한 문제에 적용할 수 없다는 문제가 존재했습니다. 이에 SiamMAE에서는 Siamese Encoder를 사용하여 비디오를 학습할 수 있는 방법을 제안합니다.

그림 4. SiamMAE Architecture
위 그림 4는 SiamMAE Architecture를 표현한 그림입니다. 입력으로 들어가는 이미지 두 개는 하나의 영상에서 추출한, 인접한 프레임들입니다. 예를 들어 Frame 2는 Frame 1의 3초 뒤 프레임이라고 생각하면 됩니다. SiamMAE는 이 중 나중 Frame에 해당하는 Frame 2에만 95% 패치를 Masking 해줍니다. 그러고 나서 Frame 2를 복원하도록 모델을 학습해 줍니다.

그림 5. SiamMAE와 기존 Vision Model 성능 비교
위 그림 5는 이렇게 학습한 SiamMAE와 기존 모델들의 성능을 비교한 표입니다. DAVIS는 Video Object Segmentation, JHMDB는 Human Pose Propagation, VIP는 Semantic Part Propagation Task입니다. 모든 Task에서 SiamMAE가 기존 모델들의 성능을 능가하는 모습입니다.
Topic 2. Large Language Model (LLM)
다음으로 살펴볼 분야는 Large Language Model(LLM)입니다. Computer Vision이 이미지를 입력으로 다루는 분야라면 LLM은 언어를 입력으로 다루는, AI 분야의 양대 쌍두마차 중 한 축이라고 할 수 있습니다. 2017년 Transformer[8]가 발표된 이후로 LLM은 혁신적 발전을 지속해왔으며, BERT[30], GPT시리즈[9,10,11], LLaMA[12] 등 다양한 LLM들이 경쟁적으로 발표되며 성장해왔습니다.
하지만 기존 LLM에도 한계는 존재했습니다. 예를 들어 최신 정보 습득 능력이 떨어지고, 그럴듯한 거짓 정보를 말하며 (Hallucination), 수학 계산에 약하고, 시간 경과 인식 능력이 떨어진다는 문제 등입니다. NeurIPS 2023에서는 이러한 기존 LLM의 한계를 극복하기 위한 다양한 시도들이 등장하였습니다.
SToolformer: Language Models Can Teach Themselves to Use Tools[13]
먼저 살펴볼 논문은 Toolformer[13] 입니다. Toolformer는 외부 Tool API를 사용하여 기존 LLM의 한계를 극복하려는 시도를 보여줍니다. 이를 위해 외부 Tool을 사용해서 대답을 하는 데이터셋을 구성하고 Language Model을 Finetuning 해줍니다.

그림 6. Toolformer 데이터셋 제작 방법
위 그림 6은 이렇게 외부 Tool을 사용하여 대답하기 위한 데이터셋을 구성하는 과정을 보여주고 있습니다. 먼저 기존 Language Model을 사용하여 질문을 구성하고, API를 사용하여 이 질문에 대한 API의 대답을 생성합니다. 이렇게 만들어낸 질문과 API 대답 중 적절한 데이터만 필터링한 뒤 모델을 Finetuning 해주는 과정을 보여줍니다.

그림 7. Toolformer와 기존 모델 성능 비교
그림 7의 표는 이렇게 학습한 Toolformer와 기존 모델의 수학 문제에 대한 성능을 비교한 표입니다. 외부 Tool을 사용하지 않는 기존 LLM들에 비해 월등하게 높은 성능을 보입니다.
ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings[14]
마찬가지로 외부 Tool을 사용하는 방법을 통해 기존 LLM의 한계를 극복하고자 하는 ToolkenGPT[14]도 있습니다.

그림 8. ToolkenGPT 동작 방법
그림 8은 ToolkenGPT의 동작 방법을 표현한 그림입니다. 기존의 Language Model은 단어에 해당하는 Token을 예측하는 방법으로 동작합니다. 그런데 만약 외부 Tool을 사용해야 하는 타이밍에는 Word Token이 아닌 Tool Token (Toolken)을 예측하도록 만들어주면 어떨까요? 이렇게 Toolken이 예측되면 해당하는 외부 Tool을 사용하여 정답을 찾은 뒤 다시 기존의 Language Model 모드로 돌아오도록 할 수 있습니다.

그림 9. ToolkenGPT와 기존 모델 성능 비교
그림 9의 표는 이렇게 구성한 ToolkenGPT와 기존 LLM들의 성능을 비교한 표입니다. GSM, FuncQA와 같은 수학 문제 데이터셋에서도ToolkenGPT는 모든 데이터셋에서 기존 LLM들보다 좋은 성능을 보여줍니다.
Topic 3. Large Multimodal Model (LMM)
최근에는 전통적인 Computer Vision과 Language Model을 통합한 Large Multimodal Model (LMM)이 활발히 연구되고 있습니다. 대표적으로 Flamingo[15], GPT4[16]를 들 수 있습니다. 이들 모델은 Image, Text 데이터를 통합 학습하여 Image, Text를 모두 입력 받아 연산할 수 있습니다. 이러한 LMM은 최근 들어 활발하게 연구되고 있고, NeurIPS 2023에서도 다양한 LMM들이 발표되었습니다.
Visual Instruction Tuning[17]
먼저 살펴볼 논문은 LLaVA[17]입니다. GPT4는 강력한 능력을 보여주는 LMM이지만 대중에게 공개된 모델은 아닙니다. LLaVA는 Text만을 입력으로 받는 LLM을 사용하여 간단하게 LMM을 만들 수 있는 방법을 제안하며, 이를 위해서는 먼저 Image, Instruction, Answer로 구성된 데이터셋을 제작해야 합니다.

그림 10. 기존 LLM으로 LMM 데이터셋 만들기
이를 위해 LLaVA에서는 Image-Caption 데이터셋을 활용합니다. Image를 설명하는 Text를 기반으로 공개된 LLM (그림에서는 GPT4)을 사용하여 Question과 Answer를 만들어내는 방식입니다.

그림 11. 최종 구성된 LMM 데이터셋
그럼 최종적으로 위의 그림 11과 같이 Image, Instruction, Answer가 Pair되어 있는 LMM용 데이터셋을 제작할 수 있게 됩니다. 데이터셋이 준비되었으니 이제 LMM을 학습할 차례입니다. LLaVA에서는 기존 Pretrained LLM과 Pretrained Vision Encoder를 사용하여 간단하게 LMM을 구성하는 방법을 제안합니다.

그림 12. LLaVA Architecture
위 그림 12는 LLaVA에서 제안하는 LMM Architecture를 표현한 것입니다. 모든 모델의 가중치는 고정된 채 Projection Layer만 학습하는 모습을 볼 수 있습니다.

그림 13. LLaVA와 기존 모델 성능 비교
이렇게 단순히 기존의 Image Embedding과 Text Embedding을 정렬하는 구성만으로도 위의 표와 같이 기존 Vision Language Model들의 성능을 능가하는 모습을 보여줍니다. 이번 글에서 자세히 다루지는 않았지만 NeurIPS 2023에서는 InstructBLIP[18], KOSMOS-1[19] 등 다양한 LMM들이 제안되기도 했습니다.
Topic 4. Diffusion Model
최근 이미지 생성 분야에서 단연 돋보이는 건 Diffusion Model입니다. NeurIPS 2023에서도 역시 다양한 Diffusion Model들이 발표되었는데, 크게 세 가지 연구 방향으로 나눌 수 있습니다.
ImageBrush: Learning Visual In-Context Instructions for Exemplar-Based Image Manipulation[20]
첫 번째 방향은 기존 Diffusion Model의 기능을 확장하는 것입니다. 예를 들어 이미지를 단순히 생성하는 것이 아니라 원하는 방향으로 편집하거나 Instruction을 주는 것입니다. 대표적인 모델로는 ImageBrush[20]가 있습니다. Stable Diffusion[21] 등 기존의 Diffusion Model을 사용해 이미지를 생성할 때 원하는 이미지의 모습을 정확하게 설명하기 어렵다는 불편함이 있었습니다. ImageBrush에서는 내가 원하는 이미지의 모습을 언어로 설명하지 않고, 예시 이미지로 Instruction을 주는 방법을 제안합니다.

그림 14. ImageBrush 동작 예시
위 그림 14에서처럼, Instruction을 통해 Before/After 이미지를 제공해 준 뒤 Query Image를 입력해주면 Instruction에 맞도록 이미지를 편집해 주는 모습을 볼 수 있습니다.

그림 15. ImageBrush Architecture
이를 위해 ImageBrush에서는 4개의 Image를 Grid 형태로 만들어 한 번에 Diffusion Model에 입력해 주는 방법을 사용합니다. Instruction 이미지 2개, 입력 이미지, 그리고 출력으로 생성해야 하는 이미지를 하나의 입력 형태로 구성해 주는 방법입니다. 그리고 Instruction과 Query 간의 상관관계를 계산하기 위해서는 Transformer를 사용해 줍니다. 결과적으로 Self Attention과 Cross Attention을 적절히 구성하여 입력 이미지를 어떻게 변형해 줘야 하는지를 학습합니다.
The Surprising Effectiveness of Diffusion Models for Optical Flow and Monocular Depth Estimation[22]
두 번째 방향은 Diffusion Model을 Vision Model로 확장하는 것입니다. 이러한 흐름은 NeurIPS 2023 이전에도 존재했습니다. 대표적으로 DiffusionDet[23]에서 Diffusion Model 그 자체를 Object Detection 모델로 사용하는 방법을 보여준 것을 들 수 있습니다.
이러한 흐름에 맞춰 NeurIPS 2023에서는 DDVM[22] 논문이 발표되었습니다. DDVM은 Diffusion Model을 Depth/Flow Estimation 모델로 사용하는 방법을 보여줍니다.

그림 16. DDVM Architecture
위 그림 16은 DDVM Architecture를 표현한 것입니다. 입력으로는 Depth, Flow 등의 Noisy Map을 받고, Condition으로 RGB Image를 입력받습니다. Output으로는 Ground Truth Map을 출력해 줍니다. 즉 이미지를 생성하는 Diffusion Model이 아닌, 이미지를 참고해 Depth/Flow 를 생성하는 Diffusion Model인 것입니다.

그림 17. DDVM과 기존 모델 성능 비교
이렇게 학습한 DDVM은 기존의 Depth/Flow Estimation 모델에 필적하는 성능을 보여줍니다. 위 그림 17은 Depth Estimation 결과를 비교한 것입니다.
StableRep: Synthetic Images from Text-to-Image Models Make Strong Visual Representation Learners[24]
세 번째 방향은 기존 Task에 Diffusion Model을 활용하는 것입니다. Diffusion Model로 이미지를 생성하고, 이렇게 생성한 이미지를 기존 Vision Model의 학습에 사용하는 것을 하나의 예로 들 수 있는데, 이러한 방법을 제안한 논문이 StableRep[24] 입니다.

그림 18. 실제 이미지와 합성 이미지를 사용한 모델 학습 비교
위 그림 18과 같이 Stable Diffusion Model을 사용하여 이미지를 합성하고, 이를 학습 데이터로 활용하는 방법을 제안하고 있습니다.

그림 19. StableRep 학습 방법
뿐만 아니라 이렇게 합성된 이미지를 효율적으로 학습하는 Self-supervised Learning 방법도 같이 제안합니다. Caption을 사용해 이미지, 정렬을 학습했던 CLIP[25]과 달리 Caption을 Stable Diffusion에 입력해 이미지를 합성해 주는 모습을 볼 수 있습니다. 그리고 이렇게 합성된 이미지들은 SimCLR[26]와 유사하게 Contrastive Learning 방법으로 학습해 주고 있습니다.
Topic 5. Reinforcement Learning (RL)
마지막으로 살펴볼 주제는 Reinforcement Learning (RL)입니다. RL은 관련 연구가 점점 더 많이 진행되고 있고, 이에 따라 급격하게 발전하는 분야 중 하나입니다. 특히 InstructGPT[27]에서 RL을 사용해 Human Preference를 학습할 수 있는 RLHF (Reinforcement Learning by Human Feedback)을 선보이면서, 기존 모델에 RL을 활용하는 방안이 활발히 연구되고 있습니다.
Direct Preference Optimization : Your Language Model is Secretly a Reward Model[28]
이러한 흐름에 맞게 먼저 살펴볼 논문은 DPO[28] 입니다. InstructGPT에서 RL을 사용하여 Human Preference를 학습할 수 있는 방법을 제안했지만, 이는 복잡한 과정을 통해 이루어졌습니다.

그림 20. RLHF와 DPO 비교
위 그림 20에서는 기존 RLHF와 DPO 과정을 비교해 보여줍니다. RLHF는 먼저 Human Preference Dataset을 구성한 뒤 이를 학습한 Reward Model을 구성하고, 이를 학습한 Reward Model을 사용해 최종적으로 Human Preference를 반영한 LM Policy를 학습합니다. 2단계에 걸친 복잡한 학습 과정을 필요로 하고 있는 것입니다. 반면 오른쪽의 DPO는 Human Preference Dataset을 사용해 곧바로 LM을 Finetuning하며, RLHF의 2단계 학습 과정을 1단계로 간소화합니다.
DPOK : Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models[29]
LLM 뿐만 아니라 Diffusion Model에도 RL을 활용할 수 있는 방안이 제안되었습니다. DPOK[29]에서는 Text to Image Diffusion Model을 RL을 사용하여 Finetuning 하는 방법을 제안합니다.

그림 21. Supervised Finetuning과 RL Finetuning 비교
기존 Supervised Finetuning 방법에서는 먼저 Pretrained Diffusion Model을 사용해 다양한 형태의 이미지를 생성해 줍니다. 그리고 이들 이미지에 대한 Human Preference를 반영한 Reward Function을 구성해 줍니다. 이 Reward Function을 사용하여 최종적으로 Diffusion Model을 Finetuning 해주는 방법입니다.
하지만 이 방법은 이미 구성된 Dataset에 대해서만 Preference를 학습한다는 한계가 있습니다. 이에 DPOK에서는 이미지 생성, 평가, 피드백을 Iterative하게 구성하는 방법을 제안합니다. 이를 통해 모델은 지속적으로 Preference를 반영하며 학습해 더 좋은 성능을 보여줍니다.
지금까지 NeurIPS 2023에 발표된 다섯 가지 주제와 관련 연구 논문들을 살펴봤습니다. 각 주제들은 저마다의 독특한 방식으로 AI 분야를 발전시키고 있습니다. Vision Foundation Model과 Language Model의 경쟁 속에서 더욱 효율적이고 강력한 AI 모델 개발이 가능해지고 있습니다. 또한 Multimodal Model의 발전으로 이미지와 텍스트 데이터를 통합해 더욱 다양한 응용 분야에 AI를 적용할 수 있습니다. Diffusion Model과 Reinforcement Learning은 시각적 작업과 학습 방법에 혁신적인 아이디어를 제공하고 있고, 향후에는 이 연구 성과가 다양한 분야에 활용될 것으로 보입니다.
이렇게 AI 연구 동향을 분석하면서, AI 연구가 모든 Modality를 처리할 수 있는 Multi Modality Model을 향해 나아가고 있음을 알 수 있었습니다. 이로부터 얻은 인사이트를 저의 연구에도 적용할 예정입니다. 현재 저는 LG에너지솔루션에서 이미지 불량 검출, 배터리 최적 설계 추천, 전기차 수요 예측 알고리즘을 개발하고 있습니다. 지금까지는 단일 Modality 데이터만을 사용하여 알고리즘을 개발해 왔지만, 각 분야의 Domain Knowledge를 Text 형태로 모델에게 입력해 Multimodal 방식의 알고리즘을 개발하는 방향으로 연구를 진행해볼 계획입니다. 앞으로도 AI 연구가 꾸준히 진보하고, 세상에 많은 변화를 만들어 나가기를 기대해 봅니다.
▶ NeurIPS 2023 Research Blog 시리즈가 궁금하다면? (Link)
1. Redmon, Joseph, et al. "You only look once: Unified, real-time object detection." Proceedings of the IEEE conference on computer vision and pattern recognition. 2016.
2. Ronneberger, Olaf, Philipp Fischer, and Thomas Brox. "U-net: Convolutional networks for biomedical image segmentation." Medical Image Computing and Computer-Assisted Intervention?MICCAI 2015: 18th International Conference, Munich, Germany, October 5-9, 2015, Proceedings, Part III 18. Springer International Publishing, 2015.
3. He, Kaiming, et al. "Masked autoencoders are scalable vision learners." Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2022.
4. Caron, Mathilde, et al. "Emerging properties in self-supervised vision transformers." Proceedings of the IEEE/CVF international conference on computer vision. 2021.
5. Bala?evi?, Ivana, et al. "Towards In-context Scene Understanding." arXiv preprint arXiv:2306.01667 (2023).
6. Grill, Jean-Bastien, et al. "Bootstrap your own latent-a new approach to self-supervised learning." Advances in neural information processing systems 33 (2020): 21271-21284.
7. Gupta, Agrim, et al. "Siamese Masked Autoencoders." arXiv preprint arXiv:2305.14344 (2023).
8. Vaswani, Ashish, et al. "Attention is all you need." Advances in neural information processing systems 30 (2017).
9. Radford, Alec, et al. "Improving language understanding by generative pre-training." (2018).
10. Radford, Alec, et al. "Language models are unsupervised multitask learners." OpenAI blog 1.8 (2019): 9.
11. Brown, Tom, et al. "Language models are few-shot learners." Advances in neural information processing systems 33 (2020): 1877-1901.
12. Touvron, Hugo, et al. "Llama: Open and efficient foundation language models." arXiv preprint arXiv:2302.13971 (2023).
13. Schick, Timo, et al. "Toolformer: Language models can teach themselves to use tools." arXiv preprint arXiv:2302.04761 (2023).
14. Hao, Shibo, et al. "ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings." arXiv preprint arXiv:2305.11554 (2023).
15. Alayrac, Jean-Baptiste, et al. "Flamingo: a visual language model for few-shot learning." Advances in Neural Information Processing Systems 35 (2022): 23716-23736.
16. Yang, Zhengyuan, et al. "The dawn of lmms: Preliminary explorations with gpt-4v (ision)." arXiv preprint arXiv:2309.17421 9.1 (2023).
17. Liu, Haotian, et al. "Visual instruction tuning." arXiv preprint arXiv:2304.08485 (2023).
18. Dai, W., et al. "InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning. arXiv 2023." arXiv preprint arXiv:2305.06500.
19. Huang, Shaohan, et al. "Language is not all you need: Aligning perception with language models." arXiv preprint arXiv:2302.14045 (2023).
20. Sun, Yasheng, et al. "ImageBrush: Learning Visual In-Context Instructions for Exemplar-Based Image Manipulation." arXiv preprint arXiv:2308.00906 (2023).
21. Rombach, Robin, et al. "High-resolution image synthesis with latent diffusion models." Proceedings of the IEEE/CVF conference on computer vision and pattern recognition. 2022.
22. Saxena, Saurabh, et al. "The Surprising Effectiveness of Diffusion Models for Optical Flow and Monocular Depth Estimation." arXiv preprint arXiv:2306.01923 (2023).
23. Chen, Shoufa, et al. "DiffusionDet: Diffusion model for object detection." Proceedings of the IEEE/CVF International Conference on Computer Vision. 2023.
24. Tian, Yonglong, et al. "StableRep: Synthetic Images from Text-to-Image Models Make Strong Visual Representation Learners." arXiv preprint arXiv:2306.00984 (2023).
25. Radford, Alec, et al. "Learning transferable visual models from natural language supervision." International conference on machine learning. PMLR, 2021.
26. Chen, Ting, et al. "A simple framework for contrastive learning of visual representations." International conference on machine learning. PMLR, 2020.
27. Ouyang, Long, et al. "Training language models to follow instructions with human feedback." Advances in Neural Information Processing Systems 35 (2022): 27730-27744.
28. Rafailov, Rafael, et al. "Direct preference optimization: Your language model is secretly a reward model." arXiv preprint arXiv:2305.18290 (2023).
29. Fan, Ying, et al. "DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models." arXiv preprint arXiv:2305.16381 (2023).
30. Devlin, Jacob, et al. "Bert: Pre-training of deep bidirectional transformers for language understanding." arXiv preprint arXiv:1810.04805 (2018).