![]()
자연어 처리(NLP) 분야에서 가장 권위 있는 국제 학회 중 하나인 ACL (Association for Computational Linguistics, ACL) 은 매년 NLP 연구의 최신 동향을 확인할 수 있는 중요한 플랫폼입니다. 올해 방콕에서 열린 ACL 2024에서는 특히 초거대 언어 모델(Large Language Model, LLM)이 주요 화두였습니다.
이번 학회에서 발표된 메인 컨퍼런스 논문 943편 중 319편 이상이 LLM과 관련된 연구로, LLM 연구가 매우 활발하게 이루어지고 있음을 시사했습니다. 3개의 메인 키노트 세션 또한 모두 LLM을 중심으로 현재 LLM의 역량과 한계, 그리고 신뢰성을 다뤘습니다.
예를 들어, “Can LLMs Reason and Plan?” 세션에서는 LLM이 모든 문제를 해결할 수 있는 만능 도구로 간주되는 것에 대한 경계심을 표현합니다. 진행자는 현재 LLM 추론 능력의 한계에 대해 지적하며, 추가적인 자원이나 검증 하에 LLM을 활용하는 방향을 제시했습니다. “Are LLMs Narrowing Our Horizon? Let’s Embrace Variation in NLP!” 세션에서는 LLM의 발전에 따른 신뢰 문제와 이를 해결하기 위한 다양한 방법론이 제안되었습니다. 인간의 판단과 모델의 판단 간의 차이를 신뢰의 영역으로 해석해, 그 원인과 해결책을 데이터와 사회 과학의 관점으로 살펴봤습니다.

이미지 1. ACL 2024 Main Conference Papers Topic 분석
(https://aclanthology.org/events/acl-2024/ 기준)
이처럼 ACL 2024 키노트 세션과 워크숍을 통해 확인할 수 있었던 인사이트를 바탕으로, 이번 포스팅에서는 LLM을 중심으로 다음 2가지 주제에 대해 다뤄보고자 합니다.
LLM Evaluation & Faithfulness
LLM Evaluation & Faithfulness
ACL 2024에서 약 70개의 벤치마크 관련 논문과 120개의 평가 주제 논문이 발표되며, 새로운 벤치마크와 평가 방법론을 제안하는 연구가 활발히 진행되고 있음을 알 수 있었습니다. 특히 LLM의 성능을 객관적으로 평가하기 위한 다양한 접근이 시도되었습니다. 간단한 Task를 넘어서 더욱 복잡하고 어려운 Task를 목표로 하거나 더 높은 Reasoning Ability를 요구하는 벤치마크들도 다수 발표되었습니다.
LLM의 능력이 발전함에 따라, 기존의 간단한 평가 방법이 아닌 세분화되고 전문적인 수준의 평가 방법론에 대한 필요성도 제기됐습니다. 사람 평가자의 고비용 문제를 해결하기 위해 LLM을 평가자로 활용하는 방향의 연구들도 논의되었습니다. LG AI연구원에서도 최근 PROMETHEUS 2[1]와 The BiGGen Bench[2] 논문을 아카이빙하며 이러한 LLM 평가 영역에 대해 연구를 활발히 진행 중입니다.
추가적으로 웹 상에 공개된 데이터는 모델 학습 데이터에 포함되었을 수 있다는 우려를 기반으로, 벤치마크 신뢰성과 관련된 Data Contamination을 주제로 Workshop도 진행되었습니다.
이번 포스팅 첫번째 주제로 ACL 2024에서 발표된 논문 중 Complex Task Benchmark, LLM Faithfulness Metric, Data Contamination 에 대한 연구들을 소개합니다.
1) AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents[3]
|
요약 : 기존 벤치마크의 간단한 API 호출 같은 Task를 넘어, LLM을 Agent로서 Real World에 적용하기 위해 Interactive Coding 환경을 반영하여 Advanced/Complex Task를 겨냥한 Benchmark를 제안합니다. |

이미지 2. AppWorld Benchmark Overview[3]
기존의 Tool-based LLM Evaluation 벤치마크들은 간단한 API 호출 시퀀스만을 다룬다는 한계가 있었습니다. LLM이 실제 환경에 Agent로서 서빙될 수 있는지 평가하기 위해서는, 여러 가지 프로그램/앱의 운영, 환경 및 사용자와의 상호작용을 반영한 테스트 환경이 필요합니다.
저자들은 AppWorld Engine을 활용한 AppWorld Benchmark를 제안합니다. AppWorld Engine은 60,000줄의 코드로 구성된 고품질 실행 환경을 구축하여, 9개의 일상 앱을 457개의 API를 통해 조작할 수 있는 시뮬레이션 환경을 구축하고, 해당 환경에서 106명의 가상 사용자의 삶을 시뮬레이션하여 현실적인 디지털 활동을 수집합니다. AppWorld Benchmark는 이 활동 데이터를 토대로 구성된 자율 에이전트 Task Set으로, 40,000줄의 코드로 구성된 750개의 자연스러우면서도 어려운 Task에 대한 풍부하고 상호작용적인 코드 생성을 요구합니다.
또한, State-based Unit Tests를 통해 견고한 프로그래밍 평가를 지원하며, 다양한 방식으로 작업을 완료할 수 있도록 하는 동시에 예상치 못한 변경 사항(즉 부수적인 피해)을 검사합니다.
Experimental Result & Conclusion
본 논문에서는 기존 Code Generation Benchmark에서 SoTA를 달성하는 GPT-4o, GPT-4 Turbo, LLaMA3 70B, 그리고 Deepseek Coder에 대해서 AppWorld Benchmark 상의 성능을 측정하였습니다. 그리고 4가지 방법론 (ReAct[4], PlanExec[5], FullCodeRefl[6], Iterative Parallel Function Calling)을 적용해서 가장 최고 성능을 기준으로 평가했습니다.

이미지 3. LLM 별 AppWorld 성능 그래프[3]
평가 결과, GPT-4o조차 ‘Normal’ Task를 약 49%, ‘Challenge’ Task를 약 30%만 풀 수 있으며, 다른 모델들은 이보다 최소 16% 더 낮은 성능을 보였습니다. API 개수나 호출 횟수, 필요한 Code Lines들을 보았을 때 기존 Code Generation Benchmark나 Tool-based Benchmark 보다 어려우며, 상호작용적 코딩 에이전트의 가능성을 평가하기 위한 벤치마크로 적합하다는 점에서 Contribution이 있습니다.
2) The Probabilities Also Matter: A More Faithful Metric for Faithfulness of Free-Text Explanations in Large Language Models[7]
|
요약 : LLM이 명시적으로 생성해 내는 Explanation/Rationale과 LLM 의 최종 판단 사이의 관계성을 분석하고, 이를 통해 LLM 신뢰성을 직간접적으로 평가하고자 하는 시도를 보여줍니다. |
CoT 등의 방법론으로 생성해 내는 LLM이 자연어 설명이나 추론 과정은 Sound Plausible 합니다. 그러나 모델의 최종 판단에 실질적으로 영향을 준 요인들과 모델이 생성해 낸 설명이 얼마나 일치하는지는 불명확합니다. 본 논문에서는 상관적 설명 신뢰성(Correlational Explanatory Faithfulness, CEF)이라는 새로운 평가 메트릭을 제안하여 좀 더 정교하게 모델의 판단과 설명을 평가합니다.
선행 연구로 Atanasova et al. (2023)의 반사실 테스트(Counterfactual Test, CT)[8] 가 있습니다. CT는Input Query에 일부 텍스트를 삽입하는 방법론(Interventional Addition, IA)을 사용합니다. CT-Unfaithfulness는 Model Explanation에 대한 평가 지표입니다. 삽입된 일부 텍스트로 인해 모델 예측이 변경되었을 때, 모델이 생성한 설명에 추가된 내용이 언급되지 않는 경우 해당 설명이 Unfaithful하다고 보는 것입니다. 즉, (1) 모델의 최종 예측이 변경되었을 때에만 IA가 유효했다고 판단하며, (2) 설명이 IA를 언급하는지 여부를 이진법으로 측정합니다. (Classification Threshold = 0.5로 상정). 만약 모델이 Context 전체를 설명으로 포괄하여 생성해버리면, 낮은 설명 퀄리티임에도 불구하고 해당 설명은 Faithful하다고 판단되는 단점이 있습니다. 또한 모델 예측의 변화 폭은 고려하지 않습니다.
따라서 본 논문은 모델이 생성한 설명과 실제 예측 사이의 관련성을 CT 방법론에 반영하는 것이 필요하다고 판단하고, CEF (Correlational Explanatory Faithfulness)라는 평가 메트릭을 제안합니다. CEF는 Intervention* Impact**와 Explanation Mention***의 관련도를 Pearson Correlation으로 측정하는 방법론입니다.
* Intervention: 단어를 삽입해 input query를 변형하는 것
** Intervention Impact: 모델의 Prediction에 대한 Intervention의 유효성
*** Explanation Mention: 모델이 설명에서 Intervention을 중요하게 다루는 정도

이미지 4. CEF 메트릭 예시: Intervention 전후 모델 예측과 설명 변화 측정[7]
CEF의 Intervention Impact는 모델의 Intervention 전후 Predictions에 대한 Total Variation Distance (TVD)로 측정합니다. TVD를 통해서 해당 Intervention이 모델 예측에 얼마나 영향을 주었는지를 수치화 할 수 있습니다(이미지 5). Mention importance는 CT 방법론에서 사용했던 언급 유무 기준의 이진법을 사용합니다. 이에 따라 CEF는 점 이분 상관 계수로 측정될 수 있습니다.

이미지 5. TVD 값과 Inserted Text 가 모델에 미친 영향의 상관관계[7]
Experimental Result & Conclusion
저자들은 위 CEF 메트릭과 CT 방법론을 적용하여, 상관적 반사실 테스트(Correlational Counterfactual Test, CCT)를 제안하고 Llama2 모델을 3개의 대표적인 Classification Benchmark 인 e-SNLI, ComVE, ECQA에 대해서 테스트합니다.

이미지 6. 3가지 벤치마크에서 기존 CT 방법론 및 CCT로 측정한 Faithfulness 성능 비교[7]
이미지 6에서 ECQA는 모델의 설명이 Intervention에 대해 거의 언급하는 경향을 보이지만, 해당 Intervention이 모델의 예측에는 거의 영향을 주지 않는 것을 확인할 수 있습니다. 즉, 모델에게 중요했던 부분이 무엇이었는지 설명에 전혀 반영되지 않았다는 해석이 가능하며, CCT는 이 부분을 수치화해서 표현할 수 있음을 보여줍니다.
3) Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models[9]
본 논문은 대표적인 코드 생성 벤치마크(HumanEval, MBPP)의 데이터 누출 가능성을 다룹니다. Surface Level 과 Semantic Level로 학습 데이터와 벤치마크 데이터 사이의 유사도를 평가하는 방법론을 제안하고, 대규모 학습 데이터셋인 The PILE 과 The STACK에서의 데이터 오염도를 분석합니다.
Surface level의 유사도 측정은 Levenshtein Similarity Score를 사용합니다. Levenshtein Edit Distance는 두 문자열 간의 형태적 유사도를 계산하는 알고리즘으로, 한 문자열이 다른 문자열과 같아지기 위한 최소 연산 횟수를 계산합니다. Levenshtein Similarity Score는 파일 단위로 기존 Dataset을 Deduplication할 때 활용되었는데, 본 논문에서는 파일 단위가 아닌 부분 문자열 단위로 유사도를 측정합니다.
Semantic Level은 코드가 실질적으로 수행하는 기능 관점에서, Dolos Toolkit를 활용해 Abstract Syntax Trees (ASTs) 기반 유사도를 측정합니다. 코드 표절 검사에 자주 쓰이는 방법론으로, 기능적으로 완전히 똑같지만 함수명과 변수명만 다른 코드의 경우 Semantic Level 유사도가 높게 측정될 수 있습니다.

이미지 7. 학습셋 별 MBPP, HumanEval 벤치마크 Data Contamination 비율 & 오염 가능성이 높은 문제 셋과 낮은 문제셋 별 성능 차이 비교[9]
이미지 7은 벤치마크 내에서 오염된 평가 데이터와 그렇지 않은 데이터를 분류하고, 두 Sub Set 사이의 LLM 성능을 비교해, 현재까지 보고된 LLM의 Code Generation 성능 신뢰도에 대한 문제 제기를 보여줍니다. 학습 셋이 유출되었을 가능성이 높은 벤치마크 문제들의 정확도 대비, 모델이 학습 때 비슷한 내용을 보지 못한 문제 세트의 정확도가 낮은 것을 확인할 수 있습니다. 저자들은 코드 문제의 길이나 난이도와 관련 없이, 학습 때 비슷한 코드를 보았는지의 여부가 모델의 정확도와 직결된다고 분석했습니다.
LLM Efficiency : Parameter-Efficient Fine-Tuning (PEFT)
LLM 활용의 연장선으로, 현재로서는 매우 큰 비용이 발생하는 LLM의 학습 및 서빙 비용을 줄이기 위한 효율화 및 최적화 연구도 증가하고 있습니다. 이번 ACL 에서는 약 64개의 논문이 이 주제를 다루고 있는데, 특히 글로벌 테크 기업과 ACL 스폰서 기업 소속 논문이 다수 포함된 점이 주목할 만합니다.
LLM의 크기가 커지면서 모든 Parameter를 Fine-tuning하는 것이 점점 힘들어지고 있습니다. 이에 적은 수의 Parameter만 학습하는 Parameter-Efficient Fine-Tuning (PEFT) 방법들이 크게 각광을 받으며 연구도 활발하게 진행되고 있습니다. Low-Rank 행렬만을 학습하는 Low-Rank Adaptation (LoRA)[10]가 대표적입니다. 이번 ACL 2024에서 주목할만한 PEFT 연구들을 몇 가지 소개하겠습니다.
1) Multimodal Instruction Tuning with Conditional Mixture of LoRA[11]
본 논문은 LoRA[10]와 같은 비교적 적은 수의 Parameter를 학습하는 방법이 Multimodal Instruction Tuning을 할 때, Task Interference가 발생하는 현상의 해결 방법을 제안했습니다. Task Interference는 Multi-task Learning할 때 발생하는 현상인데, 다양한 Task를 동시에 학습할 때 Task간의 Gradient가 서로 다른 방향으로 향하고 있어서 학습이 잘 되지 않는 현상을 말합니다.
저자들은 Task Interference Score[12]를 사용해서 실제로 Multimodal Instruction Tuning을 할 때 Task Interference가 발생하고 있음을 다음과 같이 보여줍니다.

이미지 8. LoRA 행렬 A, B의 Task Interference Score heatmap[11]
LLaVa[13] 모델을 LoRA를 활용해 다양한 Task에 대해서 학습하면 모델의 깊이 여부와 관계없이 높은 Score가 나타나는 것을 확인할 수 있습니다. 이를 해결하기 위해 저자들은 MoE[14]에서 영감을 받아 다수의 Low-Rank Factor를 동적으로 조합하는 Conditional Mixture-of-LoRA를 제안합니다.

이미지 9. LoRA와 본 논문에서 제안한 MixLoRA의 도식도[11]
위 그림을 보면 오른쪽에 다수의 a, b Low-Rank Factor가 있으며 Input에 따라 동적으로 선택되는 Low-Rank Factor들의 합으로 기존 LoRA의 A, B 행렬을 대체하는 것을 볼 수 있습니다. Low-Rank Factor들을 선택하는 알고리즘은 a, b Factor들을 각각 독립적으로 선택하는 Independent Factor Selection (IFS)과 선택된 a Factor들을 기반으로 b Factor를 선택하는 데 도움을 주는 Conditional Factor Selection (CFS)로 구성되어 있습니다.
2) MELoRA: Mini-Ensemble Low-Rank Adapters for Parameter-Efficient Fine-Tuning[15]
본 논문은 Paremeter를 Low-Rank로 근사하여 학습하는 LoRA[10]가 모든 Parameter를 학습하는 Full Fine-tuning에 비해 성능에서 차이가 있을 수 있으며, 어떻게 더 High-Rank로 근사하되 효율적으로 학습할 수 있는지에 대해서 고민했습니다. LoRA의 Rank를 늘리는 것은 결국 Parameter수를 증가시키는 것과 같은 말이기 때문입니다.
어떻게 하면 적은 수의 Parameter를 학습하면서 High-Rank를 근사할 수 있을까요?
저자들은 행렬을 대각방향으로 연결하면 각 행렬의 Rank 합은 연결된 행렬의 Rank와 같은 성질을 이용해서, 적은 수의 Parameter를 유지하되 High-Rank를 유지하는 아이디어를 제안했습니다.

이미지 10. n개(그림에서는 3)의 비교적 작은 크기의 부분 LoRA 행렬들을 이용해서 완전한 sparse LoRA 행렬 A, B를 만듭니다[15].
3) PRoLoRA: Partial Rotation Empowers More Parameter-Efficient LoRA[16]
본 논문은 Personal Customization, Multi-task 같은 상황에서 여러 개의 LoRA[10]를 학습하고 유지해야 할 필요성이 발생할 때, 더욱 Parameter-efficient한 방법이 필요하다고 주장하며 Partially Rotation Enhanced Low-Rank Adaptation (PRoLoRA)이라는 새로운 방법론을 제안합니다.

이미지 11. LoRA와 PRoLoRA, 그리고 PRoLoRA가 되기까지의 중간 과정(CLoRA, RoLoRA) 도식도.
PRoLORA는 4가지 요소로 이루어져 있습니다[16].
Broadcast Reduction: Parameter수를 줄이기 위해 기존의 LoRA 행렬 A, B를 같은 크기의 작은 Chunk로 잘라서 Broadcasting을 통해 Parameter를 공유합니다. (CLoRA)
Rotation Enhancement: Broadcast Reduction으로 Parameter수는 줄였지만 같은 값들이 Chunk마다 중복되어 있어서 학습 시 표현력이 떨어지는 문제가 있습니다. 이를 해결하기 위해 각 Chunk를 정해진 Stride에 따라 Rotation 시킵니다. (RoLoRA)
Partially-Sharing Refinement: rotation만으로는 표현력을 증가시키기에 충분하지 않아서 처음 Chunk로 자를 때 일부 Rank는 Parameter 공유를 하지 않도록 합니다. (PRoLoRA)
Rectified Initialization Strategy: 행렬 B는 기존의 LoRA같이 0으로 초기화했지만 A의 경우에는 공유되는 Parameter와 공유되지 않는 Parameter의 초기화를 위해 약간 변경된 Kaiming 초기화[17]를 수행합니다.
이번 ACL 2024 에서는 LLM의 역량과 한계, 신뢰성 확보와 관련한 다양한 연구를 확인하고 많은 연구자들과 심도 있는 논의를 이어갈 수 있었습니다. 특히 LG AI연구원도 지난 8월 성능과 경제성이 강화된 EXAONE 3.0 을 발표하고, 연구 목적으로 사용할 수 있는 7.8B Instruction tuned 모델을 오픈소스로 공개하기도 했습니다. LG AI연구원은 이번에 공개한 EXAONE 3.0을 바탕으로 더욱 신뢰성과 성능이 강화된 모델 연구 개발에 매진하고, 실제 산업현장에 EXAONE 3.0을 적용하며 AI의 활용 사례를 만들어 나갈 계획입니다.
ACL Trends Review Series
#1. [ACL 2024] LLM 연구의 최신 트렌드와 주요 인사이트
#2. [ACL 2024] 차트 이해 및 추론을 위한 새로운 접근 방법
#3. [ACL 2024] 효율적인 언어모델을 향하여
#4. [ACL 2024] AI-generated Text Detection 최신 연구 동향
#6. [ACL 2024] 문화 간 차이를 고려한 LLM 연구 트렌드
[1] Kim, Seungone, et al. "Prometheus 2: An open source language model specialized in evaluating other language models." arXiv preprint arXiv:2405.01535 (2024).
[2] Kim, Seungone, et al. "The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models." arXiv preprint arXiv:2406.05761 (2024).
[3] Harsh Trivedi, Tushar Khot, Mareike Hartmann, Ruskin Manku, Vinty Dong, Edward Li, Shashank Gupta, Ashish Sabharwal, and Niranjan Balasubramanian. 2024. AppWorld: A Controllable World of Apps and People for Benchmarking Interactive Coding Agents. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 16022?16076, Bangkok, Thailand. Association for Computational Linguistics.
[4] Shunyu Yao, Jeffrey Zhao, Dian Yu, Nan Du, Izhak Shafran, Karthik Narasimhan, and Yuan Cao. 2023. ReAct: Synergizing reasoning and acting in language models. In ICLR.
[5] Simeng Sun, Yang Liu, Shuohang Wang, Dan Iter, Chen- guang Zhu, and Mohit Iyyer. 2024. PEARL: Prompt- ing large language models to plan and execute ac- tions over long documents. In Proceedings of the 18th Conference of the European Chapter of the As- sociation for Computational Linguistics (Volume 1: Long Papers), pages 469?486, St. Julian’s, Malta. Association for Computational Linguistics.
[6] Noah Shinn, Federico Cassano, Beck Labash, Ashwin Gopinath, Karthik Narasimhan, and Shunyu Yao. 2023. Reflexion: Language agents with verbal rein- forcement learning. In NeurIPS.
[7] Noah Siegel, Oana-Maria Camburu, Nicolas Heess, and Maria Perez-Ortiz. 2024. The Probabilities Also Matter: A More Faithful Metric for Faithfulness of Free-Text Explanations in Large Language Models. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers), pages 530?546, Bangkok, Thailand. Association for Computational Linguistics.
[8] Pepa Atanasova, Oana-Maria Camburu, Christina Lioma, Thomas Lukasiewicz, Jakob Grue Simonsen, and Isabelle Augenstein. 2023. Faithfulness Tests for Natural Language Explanations. In Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers), pages 283?294, Toronto, Canada. Association for Computational Linguistics.
[9] Martin Riddell, Ansong Ni, and Arman Cohan. 2024. Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 14116?14137, Bangkok, Thailand. Association for Computational Linguistics.
[10] Edward J Hu, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, Weizhu Chen, et al. 2021. Lora: Low-rank adaptation of large language models. In International Conference on Learning Representations.
[11] Ying Shen, Zhiyang Xu, Qifan Wang, Yu Cheng, Wenpeng Yin, and Lifu Huang. 2024. Multimodal Instruction Tuning with Conditional Mixture of LoRA. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 637?648, Bangkok, Thailand. Association for Computational Linguistics.
[12] Jinguo Zhu, Xizhou Zhu, Wenhai Wang, Xiaohua Wang, Hongsheng Li, Xiaogang Wang, and Jifeng Dai. 2022. Uni-perceiver-moe: Learning sparse generalist models with conditional moes. Advances in Neural Information Processing Systems, 35:2664?2678.
[13] Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. 2023. Visual instruction tuning
[14] Noam Shazeer, Azalia Mirhoseini, Krzysztof Maziarz, Andy Davis, Quoc Le, Geoffrey Hinton, and Jeff Dean. 2016. Outrageously large neural networks: The sparsely-gated mixture-of-experts layer. In International Conference on Learning Representations.
[15] Pengjie Ren, Chengshun Shi, Shiguang Wu, Mengqi Zhang, Zhaochun Ren, Maarten Rijke, Zhumin Chen, and Jiahuan Pei. 2024. MELoRA: Mini-Ensemble Low-Rank Adapters for Parameter-Efficient Fine-Tuning. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 3052?3064, Bangkok, Thailand. Association for Computational Linguistics.
[16] Sheng Wang, Boyang Xue, Jiacheng Ye, Jiyue Jiang, Liheng Chen, Lingpeng Kong, and Chuan Wu. 2024. PRoLoRA: Partial Rotation Empowers More Parameter-Efficient LoRA. In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 2829?2841, Bangkok, Thailand. Association for Computational Linguistics.
[17] Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2015. Delving deep into rectifiers: Surpassing human-level performance on imagenet classification. In Proceedings of the IEEE international conference on computer vision, pages 1026?1034.