[논문 리뷰] T5

마계닭·2026년 2월 4일

논문 리뷰

목록 보기
9/18

원제: Exploring the Limits of Transfer Learning with a Unified
Text-to-Text Transformer

1. Introduction

Transfer: 텍스트 이해를 위한 범용적인 지식을 매번 직접 학습시키는 것이 아닌, unlabeled data로 일반적인 언어 지식을 학습하고, 특정 과제를 fine-tuning해서 전이
이런 전이학습의 결과물들은 서로 다른 설정, 평가 기준, 모델 구조로 인해서 개별 기법들의 장단점 파악이 어렵다는 단점이 존재한다.
위의 문제를 해결하기 위해 모든 NLP과제를의 입출력을 모두 텍스트로 변환해서 text-to-text로 만든다.

2. Setup

Transformer 기반, text-to-text 프레임워크(자연어 텍스트 입력 -> 텍스트 출력)

Model

Self-Attention: 시퀀스의 각 원소를 해당 시퀀스 내 다른 원소들의 가중 평균으로 대체하여 시퀀스를 처리한다.

Encoder-Decoder Transformer: 처음 제안된 Transformer 형태를 따른다.
Encoder: 입력 토큰 시퀀스 -> 임베딩 시퀀스 -> Encoder로 전달

  • 여러개의 block으로 구성된 stack(Self-attention layer + FFD)
  • Layer normalization이 각 하위 구성 요소의 입력으로 적용
  • Additive bias가 없는 단순화된 형태의 Layer normalization
  • Residual skip connection을 사용하여 각 하위 구성 요소의 입력을 출력에 더함
  • Dropout: FFD, skip connection, Attention weight, 입/출력에 적용

Decoder: 구조적으로 Encoder와 유사함.

  • Encoder의 출력을 참조하는 standard attention도 포함
  • autoregressive적인 self-attention을 사용하여 과거의 출력에만 집중하도록 함
  • 최종 디코더는 Dense layer로 전달됨. 해당 layer의 가중치는 입력 임베딩 행렬과 공유됨
  • 모든 attention은 여러 개의 독립적인 head로 분할ㄹ.

Positional Embedding

  • Self-attention은 순서에 독립적인 연산이기에 명시적인 위치 정보(position signal) 제공
  • 상대적 위치 기반으로 벡터가 아닌 하나의 스칼라로 위치를 표현

The Colossal Clean Crawled Corpus(C4)

웹에서 수집된 Common Crawl을 활용한다. Common Crawl은 메뉴나 오류 메시지 등 무의미한 문자열이 많기에 전처리 과정을 거친다.

  • 끝이 종결 부호인 경우에만 유지
  • 문장이 3개 미만인 페이지와 단어 수가 5개 미만인 줄은 폐기
  • list of Dirty, Naughty, Obscene or Otherwise Bad Words가 포함된 페이지 제거
  • Javascript라는 단어가 포함된 줄 제거
  • lorem ipsum과 같은 place-holder text가 존재하면 제거
  • 중괄호 제거(코드가 포함된 문서 제거)
  • 인용표시 제거
  • boilerplate policy 문구 제거
  • 세 문장으로 이루어진 연속 구간이 이미 데이터셋 내에 존재할 경우 기존 데이터만 남기고 나머지 제거
  • langdetect로 영어로 분류될 확률이 0.99인 페이지만 유지

Downstream Tasks

일반적인 언어 학습 능력을 측정한다.

  • 텍스트 분류: GLUE, SuperGLUE
  • 요약: CNN/Daily Mail
  • 질의응답: SQuAD
  • 번역: WMT(이 경우 fine-tuning이 필요)
  • 데이터는 Tensorflow Datasets

Input and Output Format

  • 모든 태스크를 text-to-text로 변환
  • 항상 maximum likelihood를 목표로 학습: teacher forcing 사용(prefix)
  • 각 개별 task에 대해서 별도로 fine-tuning이 허용됨
  • 명시적 질의 응답 대신 짧은 prefix 사용

Experiments

굉장히 다양한 실험 결과가 나열되어있기에 일부만 본다.

Encoder-Decoder의 우위

Transfer Learning에 있어선 Encoder-only의 BERT나 Decoder-only의 GPT보다 Encoder-Decoder 구조가 더 안정적이다.
이는 구조적으로 입력의 이해(encoder)와 출력 생성(decoder)의 분리가 유리하기 때문이다.

Parameter Sharing의 손해가 적다

파라미터 수가 절반이 되고 FLOPs는 유지되지만, 성능 자체는 거의 동일하게 유지된다.

Denoising > LM

모든 구조와 태스크에서 Denoising Objective가 LM objective보다 더 유리하다. 즉, 자연어 이해에 있어서 다음 토큰을 예측하는 방식보다 손상된 의미 구조를 복원하는 것이 더 일반적인 학습 신호이다.

Span corruption > Token masking

연속 span을 날리고 복원하는 방식이 BERT스타일의 token masking보다 더 유리하다.

prefix LM은 한계가 명확하다

요약, 번역, 복합 생성 task등에서 prefix LM(GPT + prefix attention)은 Encoder-Decoder구조의 대체제가 될 순 없다.

데이터의 양보다는 정제 방식이 중요하다

같은 Common Crawl에서 필터링 규칙에 따라서 성능 차이가 극명하게 난다.

자원이 많다면 전이 학습의 이득이 적다

WMT와 같은 대형 번역 테스크에선 pre-training의 유무 차이가 거의 없다.

Conclusion

일반적인 Transformer에서 모든 NLP문제를 text-to-text로 변환하고 기존에 있던 방식들을 정리하여 어떤 세팅이 더 유리한지를 보여준 논문이다.

profile
뉴비

0개의 댓글