+ 오늘의 연구 코멘트
- See What You Are Told: Visual Attention Sink in Large Multimodal Models
- Attention Sink 문제를 어떻게 해결할 것인가에 대한 paper
- Zebra-CoT: A Dataset for Interleaved Vision Language Reasoning
- visual Reasoning을 가능하게하는 dataset을 만들겠다는 paper
Transformer based Pre-trained Language Models: GPT (GPT Paper)
- transformer의 decoder만 사용한 모델
- Autoregressive Language Modeling으로 이전 token만 확인하여다음 token을 prediction하도록 학습됨
- GPT는 unidirectional(단방향)으로 동작해서, 왼쪽에서 오른쪽 방향만 고려하여 prediction함
Transformer based Pre-trained Language Models: BERT (BERT Paper)
- transformer의 incoder만 사용한 모델
- Masked Language Modeling : input token을 무작위로 mask하고 context기반으로 prediction하도록 학습됨
- Next Sentence Prediction : 주어진 두개의 sentences가 original text에서 연속되는지 prediction하도록 학습됨
- BERT는 bidirectional(양방향)으로 동작해서, context의 양쪽을 모두 보고 prediction함
Transformer based Pre-trained Language Models: BART BART Paepr
- transformer의 incoder와 decoder를 모두 사용한 모델
- 목표는 손상된 input sequences를 재구성 하는것 (seq2seq)
- ex) Token Masking, Token Deletion, Text Infilling, Sentence Permutation, Document Rotation
- 비슷한 구조로 T5 model도 있음
- 둘다 Seq2Seq(incoder-decoder) model
- 하지만, 각 model마다 architecture나 data processing에서 요구하는 것이 다르기 때문에 task에 맞게 잘 선택해야함
- BART로 machine translation을 진행할경우 encoder를 하나더 추가하는 것이 좋음
Summary
Rowan/hellaswag · Datasets at Hugging Face
allenai/swag · Datasets at Hugging Face
다음 sentence에 뭐가 와야되는지 prediction하는 방법으로 학습하는 데이터셋