공부한 적이 있으나... 발표뿐만 아니라 단락별로 기록해놓으면 좋을 것 같아서 작성하는 논문 정리
Abstract
- BERT :Bidirectional Encoder Representations from Transformers
- 모든 layer에서 좌우 문맥을 조건화하여, unlabling 텍스트에서 깊은 양방향 표현을 사전 훈련시킨 모델.
- pre-train BERT모델 - 구조 수정없이, 단 하나의 output layer에서 파인튜닝 가능.
- "Conceptually Simple" & "Empiricaly Powerful"
- 2019 당시, 자연어처리 작업 (GLUE score, MuiltiNLI acc etc.) SOTA Model
1. Introduction
NLP 에서 Pre-training model은 효과적인 것으로 이미 판단됨.
(자연어 추론, 의역 등 문장간의 관계 예측)
해당 모델들은 문장 간의 관계를 예측할 때, 토큰 수준의 작업에서 정확한 output을 출력해야했었음.
Pre-trained model 을 Downstream task에 적용하기위한 기존 전략 2가지
Downstream : 최종적으로 구체적으로 해결하고자 하는 작업.
- Feature-Based
- ex. ELMo
- 작업 특정 아키텍처 사용. 추가적인 Feature로 Pre-train된 표현을 포함함.
- Fine-Tuning
- ex. gpt
- 최소한의 작업 특정 파라미터를 도입. 모든 pre-train된 parameter를 fine tuning 진행.
위 두가지는 동일한 방향성을 가짐.
"pre-train동안, 한방향 언어 모델을 사용하여 학습함"
ㄴ 2025.1.27 작성