[Prompt_learning] PPT: Pre-trained Prompt Tuning for Few-shot Learning

서유리·2023년 4월 30일

AI_Study

목록 보기
24/33

🔴 논문

  • 제목 : PPT: Pre-trained Prompt Tuning for Few-shot Learning
  • 년도 : arXiv/2021

🟠 1. Introduction

  • Fine-tuning pre-trained language models (PLMs) : 전체 모델 parameters를 조정함으로써 레이블이 지정되지 않은 대규모 말뭉치에서 얻은 지식을 다양한 NLP 작업을 처리하는데 적용하고 처음부터 모델을 학습하는 접근 방식을 능가할 수 있음
  • FT (full-model tuning) 전체 모델 튜닝
    ➡ 그림 1(b)
    : PLM 위에 Task head를 추가한 다음 해당 training data에서 task-specific objectives를 최적화하여 전체 모델을 fine-tuning
    ➡ 그림 1(c)
    : prompt-oriented fine-tuning으로, PLM의 지식을 조사하기 위해 language prompts를 활용
    : prompt-oriented fine-tuning에서 data samples은 prompt tokens를 포함하는 sequences로 변환되고 downstream tasks는 언어 모델링 문제로 공식화됨
    : Figure 1 (c)에서 “It was hXi .” 프롬프트 추가
    : mask 위치에서 “great” or “terrible”을 예측하여 PLMs를 사용하여 문장 결정
    ➡ 그림 1.
    : task-oriented finetuning과 비교하여 prompt-oriented fine-tuning은 pre-training objectives (masked language modeling)와 더 유사하므로, PLM에서 지식을 더 잘 사용하고 더 나은 성능을 얻는데 도움 됨

    ➡ FT는 좋은 결과를 보이지만, 각 downstream task에 대해 전체 large model을 fine-tuning하고 storing하는 비용이 많이듦
    : 이 문제를 해결하기 위해 Lester et al은 그림 1(d)와 같이 large PLMs를 downstream tasks에 저렴하게 적용하기 위한 prompt tuning (PT)를 제안함
    : 구체적으로, PT는 hard prompts (discrete language phrases) 대신 연속 임베딩으로 구성된 soft prompts를 사용함
    : 이러한 continuous prompts는 일반적으로 무작위로 초기화되고 종단 간 학습됨
    : 각 downstream task에 대해 전체 모델을 저장하지 않기 위해 PT는 모든 PLM parameters를 동결하고, 중간 레이어 및 task-specific components를 추가하지 않고, soft prompts만 조정함
    😀 PT 2가지 장점
    (1) soft prompts는 hard prompts와 비교하여 end-to-end로 학습할 수 있음
    (2) PT는 대규모 PLM의 실제 사용을 위한 효율적이고 효과적인 패러다임이며, downstream data가 충분할 때 FT와 비교할 수 있음 (그림 2(a))
    : 그러나, 그림 2(b)에서 볼 수 있듯이, PT는 few-shot settings에서 FT 보다 성능이 훨씬 좋지 않아 다양한 저자원 시나리오에서 PT를 적용하는데 방해가 될 수 있음
    ➡ 구체적인 단어 임베딩으로 소프트 프롬프트를 초기화하는 것만으로는 성능이 향상되지 않지만 소프트 프롬프트하드 프롬프트를 결합하는 것이 도움이 됨 / 이 모든 방법은 few-shot 프롬프트 tuning 문제를 잘 처리할 수 없음
    😍 PPT : Pre-trained Prompt Tuning framework
    📁 3가지 데이터 사용
  • 11B PLMs: T5-XXL (Raffel et al., 2020)
  • mT5-XXL (Xue et al., 2021)
  • CPM-2 (Zhang et al., 2022)
    🔸 실험결과
  • PPT는 FT 방법에 도달하거나 심지어 능가하는 큰 마진으로 PT를 향상시킬 수 있을 뿐만 아니라 few-shot learning의 variance 도 줄일 수 있음
  • PPT는 PT의 parameter 효율성을 유지하며, 이는 대규모 PLM의 향후 응용 프로그램에 유용함
profile
best of best

0개의 댓글