BERT

Vincent·2023년 3월 17일

BERT

AI 관련기술, 구글의 베이스 모델

BERT의 설계 의도

Pre-training

  • MLM(Masked Language Model)
    • MaskedToken에 대한 정답을 찾는 Task
  • NSP(Next Sentence Classfication)
    • 두 개의 문장이 연속된 문장인지 판별하는 Task

Fine-Tuning

  • Sentence Pair Classification Tasks
  • Single Sentence Classification Tasks
  • Question Answering Tasks
  • Single Sentence Tagging Tasks

BERT 모델 Architecture

  • Multi-layer bidirectional Transformer encoder
  • BERTbase
  • BERTlarge

Input/Output Representation

Pre-training

  • CLS : sequence의 시작을 나타내는 첫번째 토큰
  • SEP : 두 sentence를 구별하는 토큰
  • C : CLS 토큰에 해당하는 마지막 hidden vector
  • TNT_N : N번째 토큰에 해당하는 마지막 hidden vector
  • Token embedding : WordPiece embeddings(3만 토큰 사전)
  • Segment embedding : 문장의 앞뒤를 구분
  • Position embedding : 토큰의 위치 정보를 포함
profile
Frontend & Artificial Intelligence

0개의 댓글