๐ ๋ณธ ๊ธ์ 2023.04 ์ ์์ฑํ paper review๋ฅผ ๋ค๋ฌ์ด ๋ฐํํ ์์นด์ด๋ธ ๊ธ์ ๋๋ค.
์์ฑ ๋น์ ์ปจํ ์คํธ: X:AI 4๊ธฐ Basic
์๋ณธ ๋ ผ๋ฌธ: https://s3-us-west-2.amazonaws.com/openai-assets/research-covers/language-unsupervised/language_understanding_paper.pdf
Improving Language Understanding by Generative Pre-Training
Natural language์ดํด๋ textual entailment, question answering, semantic similarity assessment, and document classification์ ๊ฐ์ ๋ค์ํ ์์ ์ผ๋ก ๊ตฌ์ฑ๋ฉ๋๋ค. ํ ์คํธ ๋ฐ์ดํฐ๋ ํ๋ถํ์ง๋ง ํน์ ์์ ์ ์ํ ๋ผ๋ฒจ์ ๋ถ์กฑํด์ ๋ชจ๋ธ์ ์ ์ ํ ํ๋ จํ๋ ๊ฒ์ ์ด๋ ต์ต๋๋ค. ์ฐ๋ฆฌ๋ ์ธ์ด ๋ชจ๋ธ์ generative pre-training๊ณผ ๊ฐ ํ ์คํฌ์ ๋ง์ถ discriminative fine-tuning์ ์ํด ์์ ๊ฐ์ ํ ์คํฌ์ ๋ง์ ๋ฐ์ ์ ๊ฐ์ ธ๋ค ์ค์ ๋ณด์ ๋๋ค. ์ด์ ๊ณผ๋ ๋ค๋ฅธ ์ ๊ทผ์ผ๋ก ๋ชจ๋ธ ๊ตฌ์กฐ์ ์ต์ํ์ ๋ณ๊ฒฝ์ ํตํด ๊ฐ ํ ์คํฌ์ ๋ง์ถ ์ข์ ์ฑ๋ฅ์ ๋ํ๋ด๊ธฐ ์ํ fine-tunning์ ์งํํฉ๋๋ค. ์ด๋ฅผ ํตํด์ 12๊ฐ์ task์ค 9๊ฐ์์ sota๋ฅผ ๋ฌ์ฑํ๊ฒ ๋๋ค.
์๋ณธ ํ ์คํธ๋ก๋ถํฐ ํจ๊ณผ์ ์ผ๋ก ํ์ตํ๋ ๋ฐฉ๋ฒ์ NLP์์ supervised learning์ ์์กด์ฑ์ ์ํ์ํค๋ ๊ฒ์ด๋ค. ๋๋ถ๋ถ์ ๋ฅ๋ฌ๋ ๋ฐฉ์์ ๋๊ฒ ๋ผ๋ฒจ ๋ฐ์ดํฐ๋ฅผ ํ์๋ก ํ์ง๋ง ์ด๋ ๋ผ๋ฒจ ๋ฐ์ดํฐ๊ฐ ๋ถ์กฑํ์ฌ ๋ง์ ํ ์คํฌ์์ ์ ์ฝ์ด ์๊น๋๋ค. ์ด๋ฌํ ์ํฉ์์ ์๊ฐ์ด ๋ง์ด ๋ค๋ฉฐ ๋น์ธ์ง๋ง ์ธ๋ผ๋ฒจ ๋ฐ์ดํฐ์์ ์ธ์ด ์ ๋ณด๋ฅผ ํ์ฉํ ์ ์๋ ๋ชจ๋ธ์ annotation์ ๋ชจ์ผ๊ธฐ ์ํด ์ ์ฉํ ๋์์ ์ ๊ณตํฉ๋๋ค. ์ด๋ฌํ ๊ฒฝ์ฐ supervision ํ์ต์ด ๊ฐ๋ฅํ์ง๋ง, unsupervised์์ ์ข์ representation์ ์๋นํ ์ฑ๋ฅ ํฅ์์ ๊ฐ์ ธ๋ค ์ค ๊ฒ์ ๋๋ค. ์์ ๋ํ ๊ทผ๊ฑฐ๋ก๋ NLPํ ์คํฌ์์ ๊ด๋ฒ์ํ pre-trained word embedding์ ์ฌ์ฉํ ๊ฒฝ์ฐ ์ฑ๋ฅ์ด ํฅ์ํ๋ค๋ ๊ฒ์ ๋๋ค.
unlabeled text์์ ๋ ๋ง์ word-level ์ ๋ณด๋ฅผ ํ์ฉํ๋ ๊ฒ์ ๋๊ฐ์ง์ ์ด์ ๋ก ์ธํด ๋ฌธ์ ๊ฐ ์์ต๋๋ค. ๋จผ์ ์ด๋ค ๋ชฉ์ ํจ์๊ฐ ํน์ task์ ๋ํ representation์ ์ ๋ง๋ค์ด๋ผ์ง ๋ถ๋ถ๋ช ํฉ๋๋ค. ์ต๊ทผ ์ฐ๊ตฌ์์ ๋ค์ํ ๋ชฉ์ ํจ์๊ฐ ์ฌ์ฉ๋ task์์ ์ข์ ์ฑ๋ฅ์ ๋ณด์์ต๋๋ค. ๋๋ฒ์งธ๋ก, ํ์ต๋ representation์ ํน์ task๋ก ๋ง์ถ๋ ๊ฒ์ ๋ํ ํจ๊ณผ์ ์ธ ๋ฐฉ๋ฒ์ด ์์ต๋๋ค. ํ์ฌ ๋ฐฉ๋ฒ์๋ ํน์ ํ ์คํฌ์ ๋ฐ๋ฅธ ๋ชจ๋ธ ๊ตฌ์กฐ ๋ณ๊ฒฝ, ๋ณต์กํ ํ์ต ๋ฐฉ์ ๊ทธ๋ฆฌ๊ณ ๋ณด์กฐ ๋ชฉ์ ํจ์๊ฐ ์์ต๋๋ค. ์ด๋ฌํ ์ ๋งคํ ๊ฒ๋ค์ ์ธ์ด ๋ชจ๋ธ์ ๋ํ ํจ๊ณผ์ ์ธ semi-supervised learning์ ๋ฐ์ ์ํค๊ธฐ ์ด๋ ต๊ฒ ํฉ๋๋ค.
์ด ๋ ผ๋ฌธ์์๋ ์ธ์ด ํ ์คํฌ์ ๋ํด unsupervised pre-traing ๊ณผ supervised fine-tunning์ ํ์ฉํ semi-supervised ๋ฐฉ์์ ์ ์ํฉ๋๋ค. ์ฐ๋ฆฌ์ ๋ชฉํ๋ ์์ ์ ์ฉ์ ํตํ ๋ฒ์ฉ์ ์ธ representation์ ํ์ตํ๋ ๊ฒ์ ๋๋ค. ์ฐ๋ฆฌ๋ ๋ง์ unlabeled text ๋ง๋ญ์น ๋ฐ์ดํฐ ์ธํธ์ annotated๊ฐ ์ง์ ๋ ๋ฐ์ดํฐ์ ์ด ์๋ค๊ณ ๊ฐ์ ํฉ๋๋ค. ๊ทธ๋ฆฌ๊ณ target task๊ฐ unlabeled ๋ง๋ญ์น์ ๋์ผํ ๋๋ฉ์ธ์ด ์๋์ด๋ ๋ฉ๋๋ค. ์ฐ๋ฆฌ๋ ๋๊ฐ์ง์ ํ์ต ๋ฐฉ์์ ์ด์ฉํ๋๋ฐ ๋จผ์ , ์ธ์ด ๋ชจ๋ธ ๋ชฉ์ ํจ์๋ฅผ unlabeled ๋ฐ์ดํฐ๊ฐ ์๋ก์ด ์ธ์ด ๋ชจ๋ธ ์ด๊ธฐ ๊ฐ์ค์น๋ฅผ ํ์ตํ๋๋ฐ ์ฌ์ฉํฉ๋๋ค. ์ฐ์์ ์ผ๋ก ์ด๋ฌํ ๊ฐ์ค์น๋ค์ supervised objective์ ์ฐ๊ด๋์ด target task์ ์ฌ์ฉ๋ฉ๋๋ค.
์ฐ๋ฆฌ๋ ๋ค์ํ ๊ธฐ๊ณ ๋ฒ์ญ, ๋ฌธ์ ์์ฑ, ๊ตฌ๋ฌธ ๋ถ์๊ณผ ๊ฐ์ ๋ค์ํ ํ ์คํฌ์์ ์ข์ ์ฑ๋ฅ์ ๋ํ๋ด๋ transformer๊ตฌ์กฐ๋ฅผ ์ฌ์ฉํฉ๋๋ค. transforemr๋ ๊ตฌ์กฐํ๋ ๋ฉ๋ชจ๋ฆฌ๋ฅผ ํตํด text์์ long-term dependencies๋ฅผ ํด๊ฒฐํฉ๋๋ค. ์ ์ดํ์ต์ ๊ฒฝ์ฐ, ํน์ ํ ์คํฌ์ ์ธํ์ ๋ฐ๋ฅธ ์คํ์ผ์ ํ์ฉํฉ๋๋ค. ์ด๋ fine-tune์ ์ต์ํ์ pretained model์ ๋ณํ๋ก ํจ๊ณผ์ ์ผ๋ก ๊ฐ๋ฅ๊ฒ ํฉ๋๋ค.
์ฐ๋ฆฌ๋ natural language inference, question answering, semantic similarity, and text classification๋ฅผ ํตํด ํ๊ฐ๋ฅผ ์งํํฉ๋๋ค. ์ฐ๋ฆฌ์ ๋ฐฉ์์ ํน์ ํ ์คํฌ์ ๋ง์ถฐ ํ์ตํ๋ ๋ฐฉ์๋ณด๋ค ๋ ์ข์ ์ฑ๋ฅ์ ๋ฐํํ์ต๋๋ค.
๋ํ, pre-trained model์์์ zero-shot์ ๋ถ์ํด๋ณธ ๊ฒฐ๊ณผ pre-trained model์ ๋ค๋ฅธ ํ ์คํฌ์ ์ ์ฉํ ์ธ์ด์ ์ง์์ ์ป๋๋ค๋ ๊ฒ์ ์ฆ๋ช ํ์ต๋๋ค.
Semi-supervised learning for NLP
์ฐ๋ฆฌ์ ์์ ์ semi-supervised learning of NLP์ ์ํฉ๋๋ค. ์ด๋ฌํ ๊ด์ ์ sequence labeling๊ณผ text classification์ ์ง๋ํ ๊ด์ฌ์ ์ด๋์์ต๋๋ค. ์ด๊ธฐ ์ฐ๊ตฌ์์๋ unlabel ๋ฐ์ดํฐ๋ฅผ work-leveel ์ด๋ phrase-level์ ํต๊ณ๋ฅผ ๊ณ์ฐํ๋๋ฐ ์ฌ์ฉ๋์ด upervised model์ feature๋ก ์ฌ์ฉ๋์์ต๋๋ค. ์ง๋ ๋ช๋ ๊ฐ ์ฐ๊ตฌ์๋ค์ unlabel ๋ง๋ญ์น๋ก ํ์ต๋์ด์ง ๋จ์ด ์๋ฒ ๋ฉ ๋ฐฉ์์ ์ฅ์ ์ ์ฆ๋ช ํ์์ง๋ง, ์ด๋ฐ ๋ฐฉ์์ ๋จ์ด ์ ๋ณด๋ฅผ ํ์ ํ๋๋ฐ ๊ทธ์น๋ฉฐ ์ฐ๋ฆฌ๋ ๋ ๋์ ๋จ๊ณ์ ์๋ฏธ๋ฅผ ํฌ์ฐฉํ๊ณ ์ ํฉ๋๋ค.
์ต๊ทผ ์ฐ๊ตฌ๋ unlabel ๋ฐ์ดํฐ์์ ๋จ์ด ์์ค์ ์๋ฏธ๋ณด๋ค ๋ ๋์ ์ฐจ์์ ์ ๋ณด๋ฅผ ํ์ฉํ๊ณ ์ ํ๊ณ ์์ต๋๋ค. ๋ฌธ๋งฅ ๋จ๊ณ๋ ๋ฌธ์ฅ ๋จ๊ณ ์๋ฒ ๋ฉ์ unlabel ๋ฐ์ดํฐ๋ฅผ ์ฌ์ฉํ์ฌ ํ์ตํ ์ ์์ผ๋ฉฐ ๋ค์ํ ํ ์คํฌ์์ ์ ์ ํ ๋ฒกํฐ ํํ์ผ๋ก ์ธ์ฝ๋ฉ๋ฉ๋๋ค.
Unsupervised pre-training
unsupervised pre-training์ ์ข์ ํ๋ผ๋ฏธํฐ ์ด๊ธฐ ์ง์ ์ ์ฐพ๋ semi-supervised learning์ ํน์ดํ ๊ฒฝ์ฐ์ ๋๋ค. ์ด๊ธฐ์๋ ์ด๋ฏธ์ง ๋ถ๋ฅ๋ ํ๊ท์์ ์ฌ์ฉ๋์์ต๋๋ค. ์ด์ด์ง ์ฐ๊ตฌ์์๋ pre-training์ด ๋ฅ๋ฌ๋์์ ์ ๊ทํ ์ญํ ์ ํด์ฃผ๋ ๊ฒ์ ๋ฐํ์ต๋๋ค. ์ต๊ทผ์๋, ๋ค์ํ ์ฐ๊ตฌ์์ ํ์ฉ๋๊ณ ์์ต๋๋ค.
์ฐ๋ฆฌ์ ๊ฐ์ฅ ์ ์ฌํ ์์ ์ pre-training network๋ฅผ ์ธ์ด ๋ชจ๋ธ์ ์ฌ์ฉํ์ฌ ํ์ต์ํจ ํ supervised ํ์ต์ ํตํด fine-tunning์ ์ํค๋ ๊ฒ์ ๋๋ค. ๊ทธ๋ฌ๋ ์ด๋ค์ LSTM models์ ์ฌ์ฉํ์๊ณ ์ด๋ ์งง์ ๊ธธ์ด๋ผ๋ ์ ์ฝ์ด ์์ต๋๋ค. ์ฐ๋ฆฌ๋ transformer๋ฅผ ์ฌ์ฉํ์ฌ ๋ ๊ธด ๊ธธ์ด๋ฅผ ์ฌ์ฉํ ์ ์์ต๋๋ค.
๋ ๋ค๋ฅธ ์ ๊ทผ์ pre-trained model์์ ๋์จ hidden representations๋ฅผ ๋ณด์กฐ ํผ์ณ๋ก์ ํ๊ฒ ํ ์คํฌ์ ๋ง์ถ ์ง๋ ํ์ต์ ์ฌ์ฉํ์ต๋๋ค. ์ด๋ ํ ์คํฌ์ ๋ง์ถฐ ๋ง์ ์์ ์๋ก์ด ํ๋ผ๋ฏธํฐ๊ฐ ํ์ํ์ง๋ง ์ฐ๋ฆฌ๋ ํ ์คํฌ์ ๋ฐ๋ผ ์ฝ๊ฐ์ ๋ณ๊ฒฝ๋ง์ ์๊ตฌํฉ๋๋ค.
Auxiliary training objectives
๋ณด์กฐ ๋ชฉ์ ํจ์๋ฅผ ๋น์ง๋ ํ์ต์ ์ถ๊ฐํ๋ ๊ฒ์ ๋ฐ์ง๋ ํ์ตํ์ต์ ๋ฐฉ์์ ๋๋ค. ์ด๊ธฐ์๋ ๋ค์ํ ๋ณด์กฐ ํ ์คํฌ๋ฅผ ์๋ฏธ์ ๋ผ๋ฒจ๋ง์ ๋ถ์ฌํ๊ธฐ ์ํด ์ฌ์ฉํ๋ค. ์ต๊ทผ์๋ ๋ณด์กฐ ์ธ์ด ๋ชฉ์ ํจ์๋ฅผ ์ง๋ ๋ชฉ์ ํจ์์ ์ถ๊ฐํ๊ณ ์ด๋ ๋ ์ข์ ์ฑ๋ฅ์ ๋ํ๋์ ๋ณด์์ต๋๋ค. GPT ๋ํ ์ด๋ฅผ ์ฌ์ฉํ์ง๋ง, ๋น์ง๋ ํ์ต์ ์ด๋ฏธ ํ๊ฒ ํ ์คํฌ์ ๊ด๋ จ๋์ด ์๋ ์ธ์ด์ ์ธก๋ฉด์ ํ์ตํฉ๋๋ค.
ํ์ต ๊ณผ์ ์ two-stage๋ก ์ด๋ฃจ์ด์ ธ ์๋ค. ๋จผ์ ์ ๋ง ๋ง์ ํ ์คํธ๋ฅผ ๋ฒ์ฉ์ ์ธ ์ธ์ด ๋ชจ๋ธ์ ํ์ตํ๋ ๊ฒ์ด๋ค. ๊ทธ ํ, ๋ผ๋ฒจ ๋ฐ์ดํฐ๋ฅผ ํตํด ํ ์คํฌ์ ๋ง์ถ ๋ชจ๋ธ์ ์ ์ฉ์์ผ fine-tunning์ ์งํํฉ๋๋ค.
Unsupervised pre-training
์ฃผ์ด์ง ํ์ต๋์ด์ง์ง ์์ ๋จ์ด ๋ฅผ ํ์ค์ ์ธ ์ธ์ด ๋ชจ๋ธ๋ง์ ํตํด likelihood๋ฅผ ๊ทน๋ํ ์ํต๋๋ค.
k๋ context window์ ํฌ๊ธฐ์ด๋ฉฐ ์กฐ๊ฑด๋ถ ํ๋ฅ P๋ ํ๋ผ๋ฏธํฐ ฮ๋ฅผ ๊ฐ๋ ์ ๊ฒฝ๋ง์ผ๋ก ๋ชจ๋ธ๋ง๋ฉ๋๋ค. ๊ทธ๋ฆฌ๊ณ stochastic gradient descent๋ฅผ ํตํด ํ์ต์ด ์ด๋ฃจ์ด์ง๋๋ค.
์ฐ๋ฆฌ๋ ๋ฉํฐ ๋ ์ด์ด ํธ๋์คํฌ๋จธ ๋์ฝ๋๋ฅผ ๊ธฐ์กด์ ํธ๋์คํฌ๋จธ์์ ์ฝ๊ฐ์ ๋ณํ์ ํตํด ์ฌ์ฉํฉ๋๋ค. ์ด ๋ชจ๋ธ์ multi-head self-attention๊ธฐ๋ฐ์ ๋๋ค.

์์์ ๋น์ง๋ pre-training์ ์งํํ ๋ค์ ์ฐ๋ฆฌ๋ ํ๊ฒ ํ ์คํฌ์ ๋ํด ์ง๋ํ์ต์ ์งํํฉ๋๋ค. label dataset C๋ฅผ sequence input tokens ์ด label ๋ก ๊ฐ์ ํ์. ์ธํ์ pre-trained model์ ํต๊ณผํ๋ฉฐ ๋ง์ง๋ง ํธ๋์คํฌ๋จธ์ activation block์ ๊ฑฐ์ณ ์ผ๋ก ๋์จ๋ค. ๊ทธ๋ฆฌ๊ณ ์ด๋ loglikelihood๋ฅผ ์ต๋ํ ์ํจ๋ค. ๊ฒ๋ค๊ฐ fine-tinong์ ๋ณด์กฐ ๋ชฉ์ ํจ์๋ก ์ธ์ด ๋ชจ๋ธ์ ์ถ๊ฐํ๋ ๊ฒ์ ์ง๋ํ์ต์ ์ ๊ทํ๋ฅผ ์ฆ์ง์์ผ์ค๊ณผ ์ตํฉ์ ๊ฐ์ํ์ํต๋๋ค.
. ์ ์ฒด์ ์ผ๋ก fine-tunning๊ฐ ์ถ๊ฐ๋ก ์๊ตฌํ๋ ํ๋ผ๋ฏธํฐ๋ fine-tinning๊ฐ Wy์ ๊ตฌ๋ถ ํ ํฐ์ด๋ค. ex)sos, eos

ํ ์คํธ ๊ตฌ๋ถ๊ฐ์ ๋ช๋ช ํ ์คํฌ์์ ์ฐ๋ฆฌ๋ ์ง์ ๋ชจ๋ธ์ fine-tunning์ด ๊ฐ๋ฅํฉ๋๋ค. question answering, textual entailment๊ณผ ๊ฐ์ ๋ค๋ฅธ ํ ์คํฌ์์๋ ์ฐ๋ฆฌ์ pretrained model์ ์ฐ์์ ์ธ ํ ์คํธ๋ฅผ ํตํด ํ์ต๋์ด์ก๊ธฐ ๋๋ฌธ์ ์ฝ๊ฐ์ ์์ ์ด ํ์ํฉ๋๋ค. ์ด์ ๊ฐ์ ์ ๊ทผ์ ๋ง์ ์์ ํ ์คํฌ ๋ณ ์์ ์ ๋ค์๊ธ ์ํ๋ฉฐ ์ด๋ ์ ์ดํ์ต์์ ์ถ๊ฐ์ ์ธ ๋ชจ๋ธ ๋ณ๊ฒฝ์ ํ์๋ก ํ์ง ์์ต๋๋ค. ๋์ ์ ์ฐ๋ฆฌ๋ pretrained ๋ชจ๋ธ์ด ์งํ์ํฌ ์ ์๋๋ก ๊ตฌ์กฐํ๋ Input์ sequence ํ์์ผ๋ก ๋ณํํฉ๋๋ค. ์ด๋ฌํ ๋ณํ๋ ์ธํ์ ํ ์คํฌ ๋ณ ๋ง์ ์์ ์ ํํผํ ์ ์์ต๋๋ค. ์ฐ๋ฆฌ๋ ์๋์์ ์ด๋ฌํ ๋ณํ ๋ฐฉ์์ ๊ฐ๊ฒฐํ ์ค๋ช ํฉ๋๋ค. ๋ชจ๋ ๋ณํ์ ๋๋ค์ ์ผ๋ก sos, eos ํ ํฐ์ ์ถ๊ฐํฉ๋๋ค.
Textual entailment
premise ์ hypothesis token ์ฌ์ด์ delimiter token ($)๋ฅผ ์ฌ์ด์ ๋๊ณ ์ด์ด ๋ถ์ฌ sequence๋ฅผ ๊ตฌ์ฑํฉ๋๋ค.
Similarity
delimiter token ($)๋ฅผ ์ฌ์ด์ ๋๊ณ ์๋ฌธ์ฅ ๋ท๋ฌธ์ฅ ๊ทธ๋ฆฌ๊ณ ๋ท๋ฌธ์ฅ ์๋ฌธ์ฅํด์ ๋ ๋ฆฝ์ ์ธ token sequences๋ฅผ ๊ตฌ์ฑํฉ๋๋ค.
Question Answering and Commonsense Reasoning
document , question ๊ทธ๋ฆฌ๊ณ possible answers []๊ฐ ์ฃผ์ด์ง๋ค๋ฉด , ๋ฅผ ํฉ์ณ context sequences๋ฅผ ์์ฑํ๊ณ delimiter token์ ์ถ๊ฐํ๊ณ ๊ฐ๋ฅํ ๋ต๋ณ์ ์ญ ๋์ดํ์ฌ ์ฌ๋ฌ ๋ ๋ฆฝ์ ์ธ sequences๋ฅผ ๊ตฌ์ฑํฉ๋๋ค.
Setup
Natural Language Inference
NLI๋ textual entailment๋ก ์๋ ค์ ธ ์์ผ๋ฉฐ ๋ ๋ฌธ์ฅ๊ฐ ๊ด๊ณ๋ฅผ ํ์ ํ๋ ๊ฒ์ด๋ค. ์ด ํ ์คํฌ์์๋ lexical entailment, coreference, lexical โฆ๋ฑ ๋ค์ํ ํ์์ผ๋ก ์ธํด ์ด๋ ค์์ ๊ฒช๊ณ ์๋ค. ์ฐ๋ฆฌ๋ 5๊ฐ์ง ๋ฐ์ดํฐ ์ ์ ๋ํด์ ํ๊ฐ๋ฅผ ์งํํ๋ค. ์๋์ ํ์์ ๋๋ถ๋ถ์ ๋ฐ์ดํฐ์ ์์ ์ฑ๋ฅ ํฅ์์ ์ด๋ค๋ธ ๊ฒ์ ํ์ธํ ์ ์๋ค.


Semantic Similarity
๋ ๋ฌธ์ฅ๊ฐ์ ์๋ฏธ์ ์ ์ฌ๋๋ฅผ ์ถ๋ก ํ๋ ํ ์คํฌ์ด๋ค. ๊ฐ๋ ์ ์ฌ๊ตฌ์ฑ๊ณผ, ๋ถ์ ์ ์ดํด์ ์๋ฏธ์ ๋ชจํธํจ์ ๋ค๋ฃจ๋๋ฐ ๋ฌธ์ ๊ฐ ๋์ฌ์๋ค. ์ฐ๋ฆฌ๋ ์ธ๊ฐ์ง์ ๋ฐ์ดํฐ ์ธ์ผ๋ก ํ๊ฐ๋ฅผ ํ๊ณ ๋๊ฐ์ ๋ฐ์ดํฐ ์ ์์ sota๋ฅผ ๋ฌ์ฑํ๋ค.
Classification

์ ๋ฐ์ ์ผ๋ก GPT๋ 12๊ฐ์ ๋ฐ์ดํฐ ์ ์ค 9๊ฐ์์ sota๋ฅผ ๋ฌ์ฑํ๊ฒ ๋๋ค.
Impact of number of layers transferred

Zero-shot Behaviors
์ด์งธ์ pretraining transformer๊ฐ ํจ๊ณผ์ ์ธ์ง ์ดํดํด๋ณด๊ณ ์ ํ๋ค. ๊ฐ์ ์ ๊ธฐ๋ณธ์ ์ธ ์์ฑ ๋ชจ๋ธ์ ๋ง์ ํ ์คํฌ์์ ์ํํ๊ธฐ ์ํด ๋ฐฐ์ฐ๊ณ transforemr์ attention mechanism์ LSTM๋ณด๋ค ์ ์ด ํ์ต์์ ๋์ฑ ๊ตฌ์กฐ์ ์ด๋ค๋ผ๋ ๊ฒ์ด๋ค. ์ฐ๋ฆฌ๋ ์ง๋ finetunning์ ์ ์ธํ๊ณ ์ํํ๋๋ก ๋ชจ๋ธ์ ๊ตฌ์ถํ๋ค. ์ฐ๋ฆฌ๋ pretrained๊ฐ ์์ ๊ฒฝ์ฐ ์ฑ๋ฅ์ด ๋ง์ด ๋จ์ด์ง๋ ๊ฒ์ ํ์ธํ ์ ์์์ผ๋ฉฐ LSTM์ task๋ณ ์ฑ๋ฅ ํธ์ฐจ๊ฐ ๋ง์ ๊ฒ์ ํ์ธํ ์ ์์๋ค.
Ablation studies
์ฐ๋ฆฌ๋ ์ธ๊ฐ์ง ์ฐ๊ตฌ์ ๋ํด์ ์งํ์ ํ์๋ค. LSTM๊ณผ Transformer์ ๋น๊ต, ๋ณด์กฐ ๋ชฉ์ ํจ์์ ์ ๋ฌด, pre-training์ ์ ๋ฌด๋ฅผ ํตํด ๊ฒฐ๊ณผ๋ฅผ ๋น๊ตํ๋ค.

๐ ๊ด๋ จ ๊ธ