Transformer의 시발점 https://arxiv.org/abs/1706.03762 Abstract 기존의 RNN과 CNN의 한계를 극복하기 위해 새로운 구조인 Transformer를 제안한다 Attention 메커니즘을 기반으로하여 입력 시퀀스의 모든 단어를

BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding트랜스포머의 양방향 인코더 표현모든 레이어에서 왼쪽 및 오른쪽 컨텍스트를 공동으로 조건화하여 레이블이 지정되지 않은 텍스트에서

BART : seq-to-seq 모델 사전학습시키기 위한 denoising autoencoder임의의 noising function으로 텍스트 변형원래대로 복원하도록 모델을 학습Transformer 기반 표준 NMT 구조BERT와 GPT 및 많은 사전학습 schemes