[논문] BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding (Jacob Devlin et al.)

ijnuyh·2025년 1월 28일

TIL

목록 보기
4/16

공부한 적이 있으나... 발표뿐만 아니라 단락별로 기록해놓으면 좋을 것 같아서 작성하는 논문 정리

Abstract

  • BERT :Bidirectional Encoder Representations from Transformers
  • 모든 layer에서 좌우 문맥을 조건화하여, unlabling 텍스트에서 깊은 양방향 표현을 사전 훈련시킨 모델.
  • pre-train BERT모델 - 구조 수정없이, 단 하나의 output layer에서 파인튜닝 가능.
  • "Conceptually Simple" & "Empiricaly Powerful"
  • 2019 당시, 자연어처리 작업 (GLUE score, MuiltiNLI acc etc.) SOTA Model

1. Introduction

NLP 에서 Pre-training model은 효과적인 것으로 이미 판단됨.
(자연어 추론, 의역 등 문장간의 관계 예측)

해당 모델들은 문장 간의 관계를 예측할 때, 토큰 수준의 작업에서 정확한 output을 출력해야했었음.

Pre-trained model 을 Downstream task에 적용하기위한 기존 전략 2가지

Downstream : 최종적으로 구체적으로 해결하고자 하는 작업.

  1. Feature-Based
    • ex. ELMo
    • 작업 특정 아키텍처 사용. 추가적인 Feature로 Pre-train된 표현을 포함함.
  2. Fine-Tuning
    • ex. gpt
    • 최소한의 작업 특정 파라미터를 도입. 모든 pre-train된 parameter를 fine tuning 진행.

위 두가지는 동일한 방향성을 가짐.
"pre-train동안, 한방향 언어 모델을 사용하여 학습함"

ㄴ 2025.1.27 작성


profile
ad astra per aspera

0개의 댓글