[청강] 딥러닝 16 - GPT, BERT , BART

방선생·2026년 1월 19일

청강

목록 보기
16/20

한양대학교 박서연 교수님 - github.io

(한양대학교 박서연 교수님의 딥러닝 수업을 청강 하면서 정리한 내용을 바탕으로 교수님의 허락을 받고 작성하였습니다.)


GPT, BERT, BART

BERT Code - GitHub

GPT_2 Code - GitHub


+ 오늘의 연구 코멘트



Transformer based Pre-trained Language Models: GPT (GPT Paper)

  • transformer의 decoder만 사용한 모델
    • Autoregressive Language Modeling으로 이전 token만 확인하여다음 token을 prediction하도록 학습됨

    • GPT는 unidirectional(단방향)으로 동작해서, 왼쪽에서 오른쪽 방향만 고려하여 prediction


Transformer based Pre-trained Language Models: BERT (BERT Paper)

  • transformer의 incoder만 사용한 모델
    • Masked Language Modeling : input token을 무작위로 mask하고 context기반으로 prediction하도록 학습됨

    • Next Sentence Prediction : 주어진 두개의 sentences가 original text에서 연속되는지 prediction하도록 학습됨

    • BERT는 bidirectional(양방향)으로 동작해서, context의 양쪽을 모두 보고 prediction


Transformer based Pre-trained Language Models: BART BART Paepr

  • transformer의 incoder와 decoder를 모두 사용한 모델
    • 목표는 손상된 input sequences를 재구성 하는것 (seq2seq)
    • ex) Token Masking, Token Deletion, Text Infilling, Sentence Permutation, Document Rotation

  • 비슷한 구조로 T5 model도 있음
    • 둘다 Seq2Seq(incoder-decoder) model
    • 하지만, 각 model마다 architecture나 data processing에서 요구하는 것이 다르기 때문에 task에 맞게 잘 선택해야함


  • BART로 machine translation을 진행할경우 encoder를 하나더 추가하는 것이 좋음


  • Pre-trained model : 이미 학습된(Pre-trained) 모델

  • Fine-tuning : Pre-trained model을 dataset을 추가하여 미세조정(Fine-tuning)하는 것

  • Transfer Learning : task에 대한 정의가 달라질 경우 task가 전이(Transfer)되었기 때문에 Transfer Learning이라고 함.
    • task간의 전이가 일어날때, Catastrophic Forgetting이 자주 발생함

Summary








  • 참고자료

Transformers

Rowan/hellaswag · Datasets at Hugging Face

allenai/swag · Datasets at Hugging Face
다음 sentence에 뭐가 와야되는지 prediction하는 방법으로 학습하는 데이터셋

profile
AI & Robotics

0개의 댓글