[Paper Review] GPT-1

msgoยท2026๋…„ 5์›” 25์ผ

๐Ÿ“Œ ๋ณธ ๊ธ€์€ 2023.04 ์— ์ž‘์„ฑํ•œ paper review๋ฅผ ๋‹ค๋“ฌ์–ด ๋ฐœํ–‰ํ•œ ์•„์นด์ด๋ธŒ ๊ธ€์ž…๋‹ˆ๋‹ค.
์ž‘์„ฑ ๋‹น์‹œ ์ปจํ…์ŠคํŠธ: X:AI 4๊ธฐ Basic
์›๋ณธ ๋…ผ๋ฌธ: https://s3-us-west-2.amazonaws.com/openai-assets/research-covers/language-unsupervised/language_understanding_paper.pdf

Improving Language Understanding by Generative Pre-Training

Abstract

Natural language์ดํ•ด๋Š” textual entailment, question answering, semantic similarity assessment, and document classification์™€ ๊ฐ™์€ ๋‹ค์–‘ํ•œ ์ž‘์—…์œผ๋กœ ๊ตฌ์„ฑ๋ฉ๋‹ˆ๋‹ค. ํ…์ŠคํŠธ ๋ฐ์ดํ„ฐ๋Š” ํ’๋ถ€ํ•˜์ง€๋งŒ ํŠน์ • ์ž‘์—…์„ ์œ„ํ•œ ๋ผ๋ฒจ์€ ๋ถ€์กฑํ•ด์„œ ๋ชจ๋ธ์„ ์ ์ ˆํžˆ ํ›ˆ๋ จํ•˜๋Š” ๊ฒƒ์€ ์–ด๋ ต์Šต๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” ์–ธ์–ด ๋ชจ๋ธ์˜ generative pre-training๊ณผ ๊ฐ ํ…Œ์Šคํฌ์— ๋งž์ถ˜ discriminative fine-tuning์— ์˜ํ•ด ์œ„์™€ ๊ฐ™์€ ํ…Œ์Šคํฌ์— ๋งŽ์€ ๋ฐœ์ „์„ ๊ฐ€์ ธ๋‹ค ์คŒ์„ ๋ณด์ž…๋‹ˆ๋‹ค. ์ด์ „๊ณผ๋Š” ๋‹ค๋ฅธ ์ ‘๊ทผ์œผ๋กœ ๋ชจ๋ธ ๊ตฌ์กฐ์˜ ์ตœ์†Œํ•œ์˜ ๋ณ€๊ฒฝ์„ ํ†ตํ•ด ๊ฐ ํ…Œ์Šคํฌ์— ๋งž์ถ˜ ์ข‹์€ ์„ฑ๋Šฅ์„ ๋‚˜ํƒœ๋‚ด๊ธฐ ์œ„ํ•œ fine-tunning์„ ์ง„ํ–‰ํ•ฉ๋‹ˆ๋‹ค. ์ด๋ฅผ ํ†ตํ•ด์„œ 12๊ฐœ์˜ task์ค‘ 9๊ฐœ์—์„œ sota๋ฅผ ๋‹ฌ์„ฑํ•˜๊ฒŒ ๋œ๋‹ค.

Introduction

์›๋ณธ ํ…์ŠคํŠธ๋กœ๋ถ€ํ„ฐ ํšจ๊ณผ์ ์œผ๋กœ ํ•™์Šตํ•˜๋Š” ๋ฐฉ๋ฒ•์€ NLP์—์„œ supervised learning์˜ ์˜์กด์„ฑ์„ ์™„ํ™”์‹œํ‚ค๋Š” ๊ฒƒ์ด๋‹ค. ๋Œ€๋ถ€๋ถ„์˜ ๋”ฅ๋Ÿฌ๋‹ ๋ฐฉ์‹์€ ๋Œ€๊ฒŒ ๋ผ๋ฒจ ๋ฐ์ดํ„ฐ๋ฅผ ํ•„์š”๋กœ ํ•˜์ง€๋งŒ ์ด๋Š” ๋ผ๋ฒจ ๋ฐ์ดํ„ฐ๊ฐ€ ๋ถ€์กฑํ•˜์—ฌ ๋งŽ์€ ํ…Œ์Šคํฌ์—์„œ ์ œ์•ฝ์ด ์ƒ๊น๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ์ƒํ™ฉ์—์„œ ์‹œ๊ฐ„์ด ๋งŽ์ด ๋“ค๋ฉฐ ๋น„์‹ธ์ง€๋งŒ ์–ธ๋ผ๋ฒจ ๋ฐ์ดํ„ฐ์—์„œ ์–ธ์–ด ์ •๋ณด๋ฅผ ํ™œ์šฉํ•  ์ˆ˜ ์žˆ๋Š” ๋ชจ๋ธ์€ annotation์„ ๋ชจ์œผ๊ธฐ ์œ„ํ•ด ์œ ์šฉํ•œ ๋Œ€์•ˆ์„ ์ œ๊ณตํ•ฉ๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ๊ฒฝ์šฐ supervision ํ•™์Šต์ด ๊ฐ€๋Šฅํ•˜์ง€๋งŒ, unsupervised์—์„œ ์ข‹์€ representation์€ ์ƒ๋‹นํ•œ ์„ฑ๋Šฅ ํ–ฅ์ƒ์„ ๊ฐ€์ ธ๋‹ค ์ค„ ๊ฒƒ์ž…๋‹ˆ๋‹ค. ์œ„์— ๋Œ€ํ•œ ๊ทผ๊ฑฐ๋กœ๋Š” NLPํ…Œ์Šคํฌ์—์„œ ๊ด‘๋ฒ”์œ„ํ•œ pre-trained word embedding์„ ์‚ฌ์šฉํ•  ๊ฒฝ์šฐ ์„ฑ๋Šฅ์ด ํ–ฅ์ƒํ–ˆ๋‹ค๋Š” ๊ฒƒ์ž…๋‹ˆ๋‹ค.

unlabeled text์—์„œ ๋” ๋งŽ์€ word-level ์ •๋ณด๋ฅผ ํ™œ์šฉํ•˜๋Š” ๊ฒƒ์€ ๋‘๊ฐ€์ง€์˜ ์ด์œ ๋กœ ์ธํ•ด ๋ฌธ์ œ๊ฐ€ ์žˆ์Šต๋‹ˆ๋‹ค. ๋จผ์ € ์–ด๋–ค ๋ชฉ์  ํ•จ์ˆ˜๊ฐ€ ํŠน์ • task์— ๋Œ€ํ•œ representation์„ ์ž˜ ๋งŒ๋“ค์–ด๋‚ผ์ง€ ๋ถˆ๋ถ„๋ช…ํ•ฉ๋‹ˆ๋‹ค. ์ตœ๊ทผ ์—ฐ๊ตฌ์—์„œ ๋‹ค์–‘ํ•œ ๋ชฉ์ ํ•จ์ˆ˜๊ฐ€ ์‚ฌ์šฉ๋œ task์—์„œ ์ข‹์€ ์„ฑ๋Šฅ์„ ๋ณด์˜€์Šต๋‹ˆ๋‹ค. ๋‘๋ฒˆ์งธ๋กœ, ํ•™์Šต๋œ representation์„ ํŠน์ • task๋กœ ๋งž์ถ”๋Š” ๊ฒƒ์— ๋Œ€ํ•œ ํšจ๊ณผ์ ์ธ ๋ฐฉ๋ฒ•์ด ์—†์Šต๋‹ˆ๋‹ค. ํ˜„์žฌ ๋ฐฉ๋ฒ•์—๋Š” ํŠน์ • ํ…Œ์Šคํฌ์— ๋”ฐ๋ฅธ ๋ชจ๋ธ ๊ตฌ์กฐ ๋ณ€๊ฒฝ, ๋ณต์žกํ•œ ํ•™์Šต ๋ฐฉ์‹ ๊ทธ๋ฆฌ๊ณ  ๋ณด์กฐ ๋ชฉ์  ํ•จ์ˆ˜๊ฐ€ ์žˆ์Šต๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ์• ๋งคํ•œ ๊ฒƒ๋“ค์€ ์–ธ์–ด ๋ชจ๋ธ์— ๋Œ€ํ•œ ํšจ๊ณผ์ ์ธ semi-supervised learning์„ ๋ฐœ์ „์‹œํ‚ค๊ธฐ ์–ด๋ ต๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค.

์ด ๋…ผ๋ฌธ์—์„œ๋Š” ์–ธ์–ด ํ…Œ์Šคํฌ์— ๋Œ€ํ•ด unsupervised pre-traing ๊ณผ supervised fine-tunning์„ ํ™œ์šฉํ•œ semi-supervised ๋ฐฉ์‹์„ ์ œ์•ˆํ•ฉ๋‹ˆ๋‹ค. ์šฐ๋ฆฌ์˜ ๋ชฉํ‘œ๋Š” ์ž‘์€ ์ ์šฉ์„ ํ†ตํ•œ ๋ฒ”์šฉ์ ์ธ representation์„ ํ•™์Šตํ•˜๋Š” ๊ฒƒ์ž…๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” ๋งŽ์€ unlabeled text ๋ง๋ญ‰์น˜ ๋ฐ์ดํ„ฐ ์„ธํŠธ์™€ annotated๊ฐ€ ์ง€์ •๋œ ๋ฐ์ดํ„ฐ์…‹์ด ์žˆ๋‹ค๊ณ  ๊ฐ€์ •ํ•ฉ๋‹ˆ๋‹ค. ๊ทธ๋ฆฌ๊ณ  target task๊ฐ€ unlabeled ๋ง๋ญ‰์น˜์™€ ๋™์ผํ•œ ๋„๋ฉ”์ธ์ด ์•„๋‹ˆ์–ด๋„ ๋ฉ๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” ๋‘๊ฐ€์ง€์˜ ํ•™์Šต ๋ฐฉ์‹์„ ์ด์šฉํ•˜๋Š”๋ฐ ๋จผ์ €, ์–ธ์–ด ๋ชจ๋ธ ๋ชฉ์ ํ•จ์ˆ˜๋ฅผ unlabeled ๋ฐ์ดํ„ฐ๊ฐ€ ์ƒˆ๋กœ์šด ์–ธ์–ด ๋ชจ๋ธ ์ดˆ๊ธฐ ๊ฐ€์ค‘์น˜๋ฅผ ํ•™์Šตํ•˜๋Š”๋ฐ ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค. ์—ฐ์†์ ์œผ๋กœ ์ด๋Ÿฌํ•œ ๊ฐ€์ค‘์น˜๋“ค์€ supervised objective์™€ ์—ฐ๊ด€๋˜์–ด target task์— ์‚ฌ์šฉ๋ฉ๋‹ˆ๋‹ค.

์šฐ๋ฆฌ๋Š” ๋‹ค์–‘ํ•œ ๊ธฐ๊ณ„ ๋ฒˆ์—ญ, ๋ฌธ์„œ ์ƒ์„ฑ, ๊ตฌ๋ฌธ ๋ถ„์„๊ณผ ๊ฐ™์€ ๋‹ค์–‘ํ•œ ํ…Œ์Šคํฌ์—์„œ ์ข‹์€ ์„ฑ๋Šฅ์„ ๋‚˜ํƒ€๋‚ด๋Š” transformer๊ตฌ์กฐ๋ฅผ ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค. transforemr๋Š” ๊ตฌ์กฐํ™”๋œ ๋ฉ”๋ชจ๋ฆฌ๋ฅผ ํ†ตํ•ด text์—์„œ long-term dependencies๋ฅผ ํ•ด๊ฒฐํ•ฉ๋‹ˆ๋‹ค. ์ „์ดํ•™์Šต์— ๊ฒฝ์šฐ, ํŠน์ • ํ…Œ์Šคํฌ์— ์ธํ’‹์— ๋”ฐ๋ฅธ ์Šคํƒ€์ผ์„ ํ™œ์šฉํ•ฉ๋‹ˆ๋‹ค. ์ด๋Š” fine-tune์„ ์ตœ์†Œํ•œ์˜ pretained model์˜ ๋ณ€ํ™”๋กœ ํšจ๊ณผ์ ์œผ๋กœ ๊ฐ€๋Šฅ๊ฒŒ ํ•ฉ๋‹ˆ๋‹ค.

์šฐ๋ฆฌ๋Š” natural language inference, question answering, semantic similarity, and text classification๋ฅผ ํ†ตํ•ด ํ‰๊ฐ€๋ฅผ ์ง„ํ–‰ํ•ฉ๋‹ˆ๋‹ค. ์šฐ๋ฆฌ์˜ ๋ฐฉ์‹์€ ํŠน์ • ํ…Œ์Šคํฌ์— ๋งž์ถฐ ํ•™์Šตํ•˜๋Š” ๋ฐฉ์‹๋ณด๋‹ค ๋” ์ข‹์€ ์„ฑ๋Šฅ์„ ๋ฐœํœ˜ํ–ˆ์Šต๋‹ˆ๋‹ค.

๋˜ํ•œ, pre-trained model์—์„œ์˜ zero-shot์„ ๋ถ„์„ํ•ด๋ณธ ๊ฒฐ๊ณผ pre-trained model์€ ๋‹ค๋ฅธ ํ…Œ์Šคํฌ์˜ ์œ ์šฉํ•œ ์–ธ์–ด์  ์ง€์‹์„ ์–ป๋Š”๋‹ค๋Š” ๊ฒƒ์„ ์ฆ๋ช…ํ–ˆ์Šต๋‹ˆ๋‹ค.

Semi-supervised learning for NLP

์šฐ๋ฆฌ์˜ ์ž‘์—…์€ semi-supervised learning of NLP์— ์†ํ•ฉ๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ๊ด€์ ์€ sequence labeling๊ณผ text classification์— ์ง€๋Œ€ํ•œ ๊ด€์‹ฌ์„ ์ด๋Œ์—ˆ์Šต๋‹ˆ๋‹ค. ์ดˆ๊ธฐ ์—ฐ๊ตฌ์—์„œ๋Š” unlabel ๋ฐ์ดํ„ฐ๋ฅผ work-leveel ์ด๋‚˜ phrase-level์˜ ํ†ต๊ณ„๋ฅผ ๊ณ„์‚ฐํ•˜๋Š”๋ฐ ์‚ฌ์šฉ๋˜์–ด upervised model์˜ feature๋กœ ์‚ฌ์šฉ๋˜์—ˆ์Šต๋‹ˆ๋‹ค. ์ง€๋‚œ ๋ช‡๋…„๊ฐ„ ์—ฐ๊ตฌ์ž๋“ค์€ unlabel ๋ง๋ญ‰์น˜๋กœ ํ•™์Šต๋˜์–ด์ง„ ๋‹จ์–ด ์ž„๋ฒ ๋”ฉ ๋ฐฉ์‹์˜ ์žฅ์ ์„ ์ฆ๋ช…ํ•˜์˜€์ง€๋งŒ, ์ด๋Ÿฐ ๋ฐฉ์‹์€ ๋‹จ์–ด ์ •๋ณด๋ฅผ ํŒŒ์•…ํ•˜๋Š”๋ฐ ๊ทธ์น˜๋ฉฐ ์šฐ๋ฆฌ๋Š” ๋” ๋†’์€ ๋‹จ๊ณ„์˜ ์˜๋ฏธ๋ฅผ ํฌ์ฐฉํ•˜๊ณ ์ž ํ•ฉ๋‹ˆ๋‹ค.

์ตœ๊ทผ ์—ฐ๊ตฌ๋Š” unlabel ๋ฐ์ดํ„ฐ์—์„œ ๋‹จ์–ด ์ˆ˜์ค€์˜ ์˜๋ฏธ๋ณด๋‹ค ๋” ๋†’์€ ์ฐจ์›์˜ ์ •๋ณด๋ฅผ ํ™œ์šฉํ•˜๊ณ ์ž ํ•˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค. ๋ฌธ๋งฅ ๋‹จ๊ณ„๋‚˜ ๋ฌธ์žฅ ๋‹จ๊ณ„ ์ž„๋ฒ ๋”ฉ์€ unlabel ๋ฐ์ดํ„ฐ๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ํ•™์Šตํ•  ์ˆ˜ ์žˆ์œผ๋ฉฐ ๋‹ค์–‘ํ•œ ํ…Œ์Šคํฌ์—์„œ ์ ์ ˆํ•œ ๋ฒกํ„ฐ ํ‘œํ˜„์œผ๋กœ ์ธ์ฝ”๋”ฉ๋ฉ๋‹ˆ๋‹ค.

Unsupervised pre-training

unsupervised pre-training์€ ์ข‹์€ ํŒŒ๋ผ๋ฏธํ„ฐ ์ดˆ๊ธฐ ์ง€์ ์„ ์ฐพ๋Š” semi-supervised learning์˜ ํŠน์ดํ•œ ๊ฒฝ์šฐ์ž…๋‹ˆ๋‹ค. ์ดˆ๊ธฐ์—๋Š” ์ด๋ฏธ์ง€ ๋ถ„๋ฅ˜๋‚˜ ํšŒ๊ท€์—์„œ ์‚ฌ์šฉ๋˜์—ˆ์Šต๋‹ˆ๋‹ค. ์ด์–ด์ง„ ์—ฐ๊ตฌ์—์„œ๋Š” pre-training์ด ๋”ฅ๋Ÿฌ๋‹์—์„œ ์ •๊ทœํ™” ์—ญํ• ์„ ํ•ด์ฃผ๋Š” ๊ฒƒ์„ ๋ฐํ˜”์Šต๋‹ˆ๋‹ค. ์ตœ๊ทผ์—๋Š”, ๋‹ค์–‘ํ•œ ์—ฐ๊ตฌ์—์„œ ํ™œ์šฉ๋˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค.

์šฐ๋ฆฌ์™€ ๊ฐ€์žฅ ์œ ์‚ฌํ•œ ์ž‘์—…์€ pre-training network๋ฅผ ์–ธ์–ด ๋ชจ๋ธ์„ ์‚ฌ์šฉํ•˜์—ฌ ํ•™์Šต์‹œํ‚จ ํ›„ supervised ํ•™์Šต์„ ํ†ตํ•ด fine-tunning์„ ์‹œํ‚ค๋Š” ๊ฒƒ์ž…๋‹ˆ๋‹ค. ๊ทธ๋Ÿฌ๋‚˜ ์ด๋“ค์€ LSTM models์„ ์‚ฌ์šฉํ•˜์˜€๊ณ  ์ด๋Š” ์งง์€ ๊ธธ์ด๋ผ๋Š” ์ œ์•ฝ์ด ์žˆ์Šต๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” transformer๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ๋” ๊ธด ๊ธธ์ด๋ฅผ ์‚ฌ์šฉํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค.

๋˜ ๋‹ค๋ฅธ ์ ‘๊ทผ์€ pre-trained model์—์„œ ๋‚˜์˜จ hidden representations๋ฅผ ๋ณด์กฐ ํ”ผ์ณ๋กœ์„œ ํƒ€๊ฒŸ ํ…Œ์Šคํฌ์— ๋งž์ถ˜ ์ง€๋„ ํ•™์Šต์— ์‚ฌ์šฉํ–ˆ์Šต๋‹ˆ๋‹ค. ์ด๋Š” ํ…Œ์Šคํฌ์— ๋งž์ถฐ ๋งŽ์€ ์–‘์˜ ์ƒˆ๋กœ์šด ํŒŒ๋ผ๋ฏธํ„ฐ๊ฐ€ ํ•„์š”ํ•˜์ง€๋งŒ ์šฐ๋ฆฌ๋Š” ํ…Œ์Šคํฌ์— ๋”ฐ๋ผ ์•ฝ๊ฐ„์˜ ๋ณ€๊ฒฝ๋งŒ์„ ์š”๊ตฌํ•ฉ๋‹ˆ๋‹ค.

Auxiliary training objectives

๋ณด์กฐ ๋ชฉ์  ํ•จ์ˆ˜๋ฅผ ๋น„์ง€๋„ ํ•™์Šต์— ์ถ”๊ฐ€ํ•˜๋Š” ๊ฒƒ์€ ๋ฐ˜์ง€๋„ ํ•™์Šตํ•™์Šต์— ๋ฐฉ์‹์ž…๋‹ˆ๋‹ค. ์ดˆ๊ธฐ์—๋Š” ๋‹ค์–‘ํ•œ ๋ณด์กฐ ํ…Œ์Šคํฌ๋ฅผ ์˜๋ฏธ์  ๋ผ๋ฒจ๋ง์„ ๋ถ€์—ฌํ•˜๊ธฐ ์œ„ํ•ด ์‚ฌ์šฉํ–ˆ๋‹ค. ์ตœ๊ทผ์—๋Š” ๋ณด์กฐ ์–ธ์–ด ๋ชฉ์  ํ•จ์ˆ˜๋ฅผ ์ง€๋„ ๋ชฉ์  ํ•จ์ˆ˜์— ์ถ”๊ฐ€ํ–ˆ๊ณ  ์ด๋Š” ๋” ์ข‹์€ ์„ฑ๋Šฅ์„ ๋‚˜ํƒ€๋ƒ„์„ ๋ณด์˜€์Šต๋‹ˆ๋‹ค. GPT ๋˜ํ•œ ์ด๋ฅผ ์‚ฌ์šฉํ•˜์ง€๋งŒ, ๋น„์ง€๋„ ํ•™์Šต์€ ์ด๋ฏธ ํƒ€๊ฒŸ ํ…Œ์Šคํฌ์™€ ๊ด€๋ จ๋˜์–ด ์žˆ๋Š” ์–ธ์–ด์  ์ธก๋ฉด์„ ํ•™์Šตํ•ฉ๋‹ˆ๋‹ค.

Framework

ํ•™์Šต ๊ณผ์ •์€ two-stage๋กœ ์ด๋ฃจ์–ด์ ธ ์žˆ๋‹ค. ๋จผ์ € ์ •๋ง ๋งŽ์€ ํ…์ŠคํŠธ๋ฅผ ๋ฒ”์šฉ์ ์ธ ์–ธ์–ด ๋ชจ๋ธ์„ ํ•™์Šตํ•˜๋Š” ๊ฒƒ์ด๋‹ค. ๊ทธ ํ›„, ๋ผ๋ฒจ ๋ฐ์ดํ„ฐ๋ฅผ ํ†ตํ•ด ํ…Œ์Šคํฌ์— ๋งž์ถ˜ ๋ชจ๋ธ์„ ์ ์šฉ์‹œ์ผœ fine-tunning์„ ์ง„ํ–‰ํ•ฉ๋‹ˆ๋‹ค.

Unsupervised pre-training

์ฃผ์–ด์ง„ ํ•™์Šต๋˜์–ด์ง€์ง€ ์•Š์€ ๋‹จ์–ด U=[u1,...,u2]U = [u1, ..., u2]๋ฅผ ํ‘œ์ค€์ ์ธ ์–ธ์–ด ๋ชจ๋ธ๋ง์„ ํ†ตํ•ด likelihood๋ฅผ ๊ทน๋Œ€ํ™” ์‹œํ‚ต๋‹ˆ๋‹ค.

L1(U)=ฮฃilogP(uiโˆฃuiโˆ’k,...,uiโˆ’1;ฮ˜)L1(U) = \Sigma _i log P(ui |uiโˆ’k, . . . , uiโˆ’1; ฮ˜)

k๋Š” context window์˜ ํฌ๊ธฐ์ด๋ฉฐ ์กฐ๊ฑด๋ถ€ ํ™•๋ฅ  P๋Š” ํŒŒ๋ผ๋ฏธํ„ฐ ฮ˜๋ฅผ ๊ฐ–๋Š” ์‹ ๊ฒฝ๋ง์œผ๋กœ ๋ชจ๋ธ๋ง๋ฉ๋‹ˆ๋‹ค. ๊ทธ๋ฆฌ๊ณ  stochastic gradient descent๋ฅผ ํ†ตํ•ด ํ•™์Šต์ด ์ด๋ฃจ์–ด์ง‘๋‹ˆ๋‹ค.

์šฐ๋ฆฌ๋Š” ๋ฉ€ํ‹ฐ ๋ ˆ์ด์–ด ํŠธ๋žœ์Šคํฌ๋จธ ๋””์ฝ”๋”๋ฅผ ๊ธฐ์กด์˜ ํŠธ๋žœ์Šคํฌ๋จธ์—์„œ ์•ฝ๊ฐ„์˜ ๋ณ€ํ˜•์„ ํ†ตํ•ด ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค. ์ด ๋ชจ๋ธ์€ multi-head self-attention๊ธฐ๋ฐ˜์ž…๋‹ˆ๋‹ค.

286

**Supervised fine-tunning**

์œ„์—์„œ ๋น„์ง€๋„ pre-training์„ ์ง„ํ–‰ํ•œ ๋‹ค์Œ ์šฐ๋ฆฌ๋Š” ํƒ€๊ฒŸ ํ…Œ์Šคํฌ์— ๋Œ€ํ•ด ์ง€๋„ํ•™์Šต์„ ์ง„ํ–‰ํ•ฉ๋‹ˆ๋‹ค. label dataset C๋ฅผ sequence input tokens x1,...,xmx1, ..., x^m์ด label yy๋กœ ๊ฐ€์ •ํ•˜์ž. ์ธํ’‹์€ pre-trained model์„ ํ†ต๊ณผํ•˜๋ฉฐ ๋งˆ์ง€๋ง‰ ํŠธ๋žœ์Šคํฌ๋จธ์˜ activation block์„ ๊ฑฐ์ณ P(yโˆฃx1,...,xm)=softmax(hlmWy).P(y|x ^1 , . . . , x^m) = softmax(h l^m Wy).์œผ๋กœ ๋‚˜์˜จ๋‹ค. ๊ทธ๋ฆฌ๊ณ  ์ด๋Š” loglikelihood๋ฅผ ์ตœ๋Œ€ํ™” ์‹œํ‚จ๋‹ค.L2(C)=ฮฃ(x,y)logP(yโˆฃx1,...,xm).L_2(C) = \Sigma (x,y) log P(y|x ^1 , . . . , x^m). ๊ฒŒ๋‹ค๊ฐ€ fine-tinong์— ๋ณด์กฐ ๋ชฉ์ ํ•จ์ˆ˜๋กœ ์–ธ์–ด ๋ชจ๋ธ์„ ์ถ”๊ฐ€ํ•˜๋Š” ๊ฒƒ์€ ์ง€๋„ํ•™์Šต์— ์ •๊ทœํ™”๋ฅผ ์ฆ์ง„์‹œ์ผœ์คŒ๊ณผ ์œตํ•ฉ์„ ๊ฐ€์†ํ™”์‹œํ‚ต๋‹ˆ๋‹ค.

L3(C)=L2(C)+ฮปโˆ—L1(C)L3(C) = L2(C) + ฮป โˆ— L1(C). ์ „์ฒด์ ์œผ๋กœ fine-tunning๊ฐ„ ์ถ”๊ฐ€๋กœ ์š”๊ตฌํ•˜๋Š” ํŒŒ๋ผ๋ฏธํ„ฐ๋Š” fine-tinning๊ฐ„ Wy์™€ ๊ตฌ๋ถ„ ํ† ํฐ์ด๋‹ค. ex)sos, eos

348

**Task-specific input transformations**

ํ…์ŠคํŠธ ๊ตฌ๋ถ„๊ฐ™์€ ๋ช‡๋ช‡ ํ…Œ์Šคํฌ์—์„œ ์šฐ๋ฆฌ๋Š” ์ง์ ‘ ๋ชจ๋ธ์„ fine-tunning์ด ๊ฐ€๋Šฅํ•ฉ๋‹ˆ๋‹ค. question answering, textual entailment๊ณผ ๊ฐ™์€ ๋‹ค๋ฅธ ํ…Œ์Šคํฌ์—์„œ๋Š” ์šฐ๋ฆฌ์˜ pretrained model์€ ์—ฐ์†์ ์ธ ํ…์ŠคํŠธ๋ฅผ ํ†ตํ•ด ํ•™์Šต๋˜์–ด์กŒ๊ธฐ ๋•Œ๋ฌธ์— ์•ฝ๊ฐ„์˜ ์ˆ˜์ •์ด ํ•„์š”ํ•ฉ๋‹ˆ๋‹ค. ์ด์™€ ๊ฐ™์€ ์ ‘๊ทผ์€ ๋งŽ์€ ์–‘์˜ ํ…Œ์Šคํฌ ๋ณ„ ์ˆ˜์ •์„ ๋‹ค์‹œ๊ธˆ ์š”ํ•˜๋ฉฐ ์ด๋Š” ์ „์ดํ•™์Šต์—์„œ ์ถ”๊ฐ€์ ์ธ ๋ชจ๋ธ ๋ณ€๊ฒฝ์„ ํ•„์š”๋กœ ํ•˜์ง€ ์•Š์Šต๋‹ˆ๋‹ค. ๋Œ€์‹ ์— ์šฐ๋ฆฌ๋Š” pretrained ๋ชจ๋ธ์ด ์ง„ํ–‰์‹œํ‚ฌ ์ˆ˜ ์žˆ๋„๋ก ๊ตฌ์กฐํ™”๋œ Input์„ sequence ํ˜•์‹์œผ๋กœ ๋ณ€ํ™˜ํ•ฉ๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ๋ณ€ํ™˜๋œ ์ธํ’‹์€ ํ…Œ์Šคํฌ ๋ณ„ ๋งŽ์€ ์ˆ˜์ •์„ ํšŒํ”ผํ•  ์ˆ˜ ์žˆ์Šต๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” ์•„๋ž˜์—์„œ ์ด๋Ÿฌํ•œ ๋ณ€ํ˜• ๋ฐฉ์‹์„ ๊ฐ„๊ฒฐํžˆ ์„ค๋ช…ํ•ฉ๋‹ˆ๋‹ค. ๋ชจ๋“  ๋ณ€ํ˜•์€ ๋žœ๋ค์ ์œผ๋กœ sos, eos ํ† ํฐ์„ ์ถ”๊ฐ€ํ•ฉ๋‹ˆ๋‹ค.

Textual entailment

premise pp์™€ hypothesis hh token ์‚ฌ์ด์— delimiter token ($)๋ฅผ ์‚ฌ์ด์— ๋‘๊ณ  ์ด์–ด ๋ถ™์—ฌ sequence๋ฅผ ๊ตฌ์„ฑํ•ฉ๋‹ˆ๋‹ค.

Similarity

delimiter token ($)๋ฅผ ์‚ฌ์ด์— ๋‘๊ณ  ์•ž๋ฌธ์žฅ ๋’ท๋ฌธ์žฅ ๊ทธ๋ฆฌ๊ณ  ๋’ท๋ฌธ์žฅ ์•ž๋ฌธ์žฅํ•ด์„œ ๋…๋ฆฝ์ ์ธ token sequences๋ฅผ ๊ตฌ์„ฑํ•ฉ๋‹ˆ๋‹ค.

Question Answering and Commonsense Reasoning

document zz, question qq ๊ทธ๋ฆฌ๊ณ  possible answers [aka_k]๊ฐ€ ์ฃผ์–ด์ง„๋‹ค๋ฉด zz, qq๋ฅผ ํ•ฉ์ณ context sequences๋ฅผ ์ƒ์„ฑํ•˜๊ณ  delimiter token์„ ์ถ”๊ฐ€ํ•˜๊ณ  ๊ฐ€๋Šฅํ•œ ๋‹ต๋ณ€์„ ์ญ‰ ๋‚˜์—ดํ•˜์—ฌ ์—ฌ๋Ÿฌ ๋…๋ฆฝ์ ์ธ sequences๋ฅผ ๊ตฌ์„ฑํ•ฉ๋‹ˆ๋‹ค.

Experiments

Setup

  • GPT๋Š” transfomer์˜ 12๊ฐœ์˜ decoder layer๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ masked self-attention heads๋กœ 768์ฐจ์›์„ ๊ฐ€์ง„๋‹ค.
  • position-wise feed-forward์—์„œ๋Š” 3072 hidden dimenstion์œผ๋กœ ์‚ฌ์šฉํ•œ๋‹ค.
  • Adam optimization์„ max learning rate 2.5e-4.๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค. LR์€ 200๋ฒˆ ์—…๋ฐ์ดํŠธํ• ๋•Œ ๊นŒ์ง€๋Š” ์ฆ๊ฐ€ํ•˜๋ฉฐ ๋‹ค์‹œ cosine scedule์„ ํ†ตํ•ด 0๊นŒ์ง€ ์ค„์–ด๋“ ๋‹ค.
  • ๋ ˆ์ด์–ด ๋…ธ๋ง๋ผ์ด์ œ์ด์…˜์ด ์ „๋ฐ˜์ ์œผ๋กœ ์‚ฌ์šฉ๋˜์–ด ์ดˆ๊ธฐ ๊ฐ€์ค‘์น˜ ์ดˆ๊ธฐํ™”๋Š” N(0, 0.02)๋Š” ์ถฉ๋ถ„ํ•˜๋‹ค.
  • ๊ทธ๋ฆฌ๊ณ  40000๊ฐœ์˜ ๋ณ‘ํ•ฉ์ด ๋œ BPE์ธ์ฝ”๋”ฉ์„ ์‚ฌ์šฉํ•˜๋ฉฐ residual, embedding, attention drop out์€ 0.1๋กœ ์„ค์ •ํ•œ๋‹ค.
  • ์ˆ˜์ •๋œ L2 regularization์„ ์‚ฌ์šฉํ•œ๋‹ค.
  • Gaussian Error Linear Unit์„ ํ™œ์„ฑํ™” ํ•จ์ˆ˜๋กœ ์‚ฌ์šฉํ•œ๋‹ค.
  • ๊ธฐ์กด๊ณผ ๋‹ค๋ฅด๊ฒŒ position embeddings๋Š” ํ•™์Šตํ•˜์—ฌ ์ง„ํ–‰ํ•œ๋‹ค.
  • ftfy library๋ฅผ ํ†ตํ•ด์„œ ๋ฌธ์žฅ ๋ถ€ํ˜ธ ๋ฐ ์—ฌ๋ฐฑ์„ ์ œ๊ฑฐํ•˜๋ฉฐ spaCy tokenizer๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค.
    Supercised fine-tunning

Natural Language Inference

NLI๋Š” textual entailment๋กœ ์•Œ๋ ค์ ธ ์žˆ์œผ๋ฉฐ ๋‘ ๋ฌธ์žฅ๊ฐ„ ๊ด€๊ณ„๋ฅผ ํŒŒ์•…ํ•˜๋Š” ๊ฒƒ์ด๋‹ค. ์ด ํ…Œ์Šคํฌ์—์„œ๋Š” lexical entailment, coreference, lexical โ€ฆ๋“ฑ ๋‹ค์–‘ํ•œ ํ˜„์ƒ์œผ๋กœ ์ธํ•ด ์–ด๋ ค์›€์„ ๊ฒช๊ณ  ์žˆ๋‹ค. ์šฐ๋ฆฌ๋Š” 5๊ฐ€์ง€ ๋ฐ์ดํ„ฐ ์…‹์— ๋Œ€ํ•ด์„œ ํ‰๊ฐ€๋ฅผ ์ง„ํ–‰ํ•œ๋‹ค. ์•„๋ž˜์— ํ‘œ์—์„œ ๋Œ€๋ถ€๋ถ„์˜ ๋ฐ์ดํ„ฐ์…‹์—์„œ ์„ฑ๋Šฅ ํ–ฅ์ƒ์„ ์ด๋ค„๋‚ธ ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ๋‹ค.

443

**`Question answering and commonsense reasoning`**

440

์šฐ๋ฆฌ๋Š” ์ค‘,๊ณ ๋“ฑํ•™๊ต ์‹œํ—˜์—์„œ ์ถ”์ถœํ•œ RACE dataset์„ ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค. ์ด ๋ฐ์ดํ„ฐ์…‹์€ ๋ณด๋‹ค ๋งŽ์€ ์ถ”๋ก  ๋ฌธ์ œ๊ฐ€ ์กด์žฌํ–ˆ์Šต๋‹ˆ๋‹ค. ๋‘ ๊ฐ€์ง€์˜ ๋‹ต๋ณ€ ์˜ต์…˜ ์ค‘ ํ•˜๋‚˜๋ฅผ ์„ ํƒํ•˜๋Š” ๊ณผ์ œ์ด๋ฉฐ ์šฐ๋ฆฌ์˜ ๋ชจ๋ธ์€ ๋งŽ์€ ์„ฑ๋Šฅ ํ–ฅ์ƒ์„ ์ด๋ค„๋ƒˆ์Šต๋‹ˆ๋‹ค.

Semantic Similarity

๋‘ ๋ฌธ์žฅ๊ฐ„์˜ ์˜๋ฏธ์  ์œ ์‚ฌ๋„๋ฅผ ์ถ”๋ก ํ•˜๋Š” ํ…Œ์Šคํฌ์ด๋‹ค. ๊ฐœ๋…์˜ ์žฌ๊ตฌ์„ฑ๊ณผ, ๋ถ€์ •์˜ ์ดํ•ด์™€ ์˜๋ฏธ์  ๋ชจํ˜ธํ•จ์„ ๋‹ค๋ฃจ๋Š”๋ฐ ๋ฌธ์ œ๊ฐ€ ๋†“์—ฌ์žˆ๋‹ค. ์šฐ๋ฆฌ๋Š” ์„ธ๊ฐ€์ง€์˜ ๋ฐ์ดํ„ฐ ์„ธ์œผ๋กœ ํ‰๊ฐ€๋ฅผ ํ–ˆ๊ณ  ๋‘๊ฐœ์˜ ๋ฐ์ดํ„ฐ ์…‹์—์„œ sota๋ฅผ ๋‹ฌ์„ฑํ•œ๋‹ค.

Classification

441

์šฐ๋ฆฌ๋Š” ๋‘๊ฐ€์ง€ classification์„ ์ง„ํ–‰ํ•œ๋‹ค. ํ•˜๋‚˜๋Š” ๋ฌธ์žฅ์ด ๋ฌธ๋ฒ•์ ์œผ๋กœ ์˜ณ์€์ง€์— ๋Œ€ํ•ด์„œ์™€ ํ•˜๋‚˜๋Š” binary classfication task์ด๋‹ค. ๋‘˜ ๋‹ค ๋งŽ์€ ์„ฑ๋Šฅ ํ–ฅ์ƒ์„ ์ด๋ค„๋ƒˆ๋‹ค.

์ „๋ฐ˜์ ์œผ๋กœ GPT๋Š” 12๊ฐœ์˜ ๋ฐ์ดํ„ฐ ์…‹ ์ค‘ 9๊ฐœ์—์„œ sota๋ฅผ ๋‹ฌ์„ฑํ•˜๊ฒŒ ๋œ๋‹ค.

Analysis

Impact of number of layers transferred

438

๋น„์ง€๋„ ํ•™์Šต pretrained์ด target task์— ์–ผ๋งˆ๋‚˜ ์˜ํ–ฅ์„ ์ฃผ๋Š”์ง€ ํ™•์ธํ•˜๊ธฐ ์œ„ํ•ด์„œ pretraining network์˜ layer ์ˆ˜์™€ ํ•™์Šต ์—…๋ฐ์ดํŠธ ์ •๋„๋ฅผ ๋ถ„์„ํ•ด๋ณธ๋‹ค. ๊ฒฐ๊ณผ์ ์œผ๋กœ layer๊ฐ€ ๋งŽ์„์ˆ˜๋ก, ํ•™์Šต์„ ๋งŽ์ด ํ• ์ˆ˜๋ก target task์˜ ๊ฒฐ๊ณผ๊ฐ€ ์ข‹์•„์ง€๋Š” ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ์—ˆ๋‹ค.

Zero-shot Behaviors

์–ด์งธ์„œ pretraining transformer๊ฐ€ ํšจ๊ณผ์ ์ธ์ง€ ์ดํ•ดํ•ด๋ณด๊ณ ์ž ํ•œ๋‹ค. ๊ฐ€์ •์€ ๊ธฐ๋ณธ์ ์ธ ์ƒ์„ฑ ๋ชจ๋ธ์€ ๋งŽ์€ ํ…Œ์Šคํฌ์—์„œ ์ˆ˜ํ–‰ํ•˜๊ธฐ ์œ„ํ•ด ๋ฐฐ์šฐ๊ณ  transforemr์˜ attention mechanism์€ LSTM๋ณด๋‹ค ์ „์ด ํ•™์Šต์—์„œ ๋”์šฑ ๊ตฌ์กฐ์ ์ด๋‹ค๋ผ๋Š” ๊ฒƒ์ด๋‹ค. ์šฐ๋ฆฌ๋Š” ์ง€๋„ finetunning์„ ์ œ์™ธํ•˜๊ณ  ์ˆ˜ํ–‰ํ•˜๋„๋ก ๋ชจ๋ธ์„ ๊ตฌ์ถ•ํ•œ๋‹ค. ์šฐ๋ฆฌ๋Š” pretrained๊ฐ€ ์—†์„ ๊ฒฝ์šฐ ์„ฑ๋Šฅ์ด ๋งŽ์ด ๋–จ์–ด์ง€๋Š” ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ์—ˆ์œผ๋ฉฐ LSTM์€ task๋ณ„ ์„ฑ๋Šฅ ํŽธ์ฐจ๊ฐ€ ๋งŽ์€ ๊ฒƒ์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ์—ˆ๋‹ค.

Ablation studies

์šฐ๋ฆฌ๋Š” ์„ธ๊ฐ€์ง€ ์—ฐ๊ตฌ์— ๋Œ€ํ•ด์„œ ์ง„ํ–‰์„ ํ•˜์˜€๋‹ค. LSTM๊ณผ Transformer์˜ ๋น„๊ต, ๋ณด์กฐ ๋ชฉ์ ํ•จ์ˆ˜์˜ ์œ ๋ฌด, pre-training์˜ ์œ ๋ฌด๋ฅผ ํ†ตํ•ด ๊ฒฐ๊ณผ๋ฅผ ๋น„๊ตํ•œ๋‹ค.

Conclusion

510

์šฐ๋ฆฌ๋Š” pre-training๊ดด fine-tunning์„ ํ†ตํ•œ ๊ฐ•๋ ฅํ•œ ์–ธ์–ด ๋ชจ๋ธ์„ ์ œ์‹œํ•œ๋‹ค. pre-training์„ ํ†ตํ•ด์„œ ๋‹ค์–‘ํ•œ ๋‹จ์–ด๋ญ‰์น˜์—์„œ ์ข‹์€ ์„ฑ๋Šฅ์„ ์–ป์„ ์ˆ˜ ์žˆ์—ˆ์œผ๋ฉฐ ์ „์ด ํ•™์Šต์„ ์„ฑ๊ณต์ ์œผ๋กœ ์ง„ํ–‰์‹œ์ผฐ๋‹ค. ๊ทธ๋ฆฌ๊ณ  ์ด๋Š” 12๊ฐ€์ง€์˜ ๋ฐ์ดํ„ฐ ์…‹ ์ค‘ 9๊ฐœ์—์„œ ์†Œํƒ€๋ฅผ ๋‹ฌ์„ฑํ•œ๋‹ค.

๐Ÿ”— ๊ด€๋ จ ๊ธ€

0๊ฐœ์˜ ๋Œ“๊ธ€