[Paper Review] Transformer

msgoยท2026๋…„ 5์›” 25์ผ

๐Ÿ“Œ ๋ณธ ๊ธ€์€ 2023.03 ์— ์ž‘์„ฑํ•œ paper review๋ฅผ ๋‹ค๋“ฌ์–ด ๋ฐœํ–‰ํ•œ ์•„์นด์ด๋ธŒ ๊ธ€์ž…๋‹ˆ๋‹ค.
์ž‘์„ฑ ๋‹น์‹œ ์ปจํ…์ŠคํŠธ: X:AI 4๊ธฐ Basic
์›๋ณธ ๋…ผ๋ฌธ: https://arxiv.org/abs/1706.03762

Abstract

์šฐ์„ธํ•œ ์‹œํ€€์Šค ๋ฒˆ์—ญ์€ ๋ณต์žกํ•œ rrecurrent์ด๊ฑฐ๋‚˜ convolution ๋„คํŠธ์›Œํฌ์˜ ์ธ์ฝ”๋”์™€ ๋””์ฝ”๋”๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ํ•˜๊ณ  ์žˆ๋‹ค. ๊ฐ€์žฅ ์ข‹์€ ๋ชจ๋ธ์€ ์–ดํ…์…˜ ๋ฐฉ์‹์„ ํ†ตํ•œ ์ธ์ฝ”๋”์™€ ๋””์ฝ”๋”๋ฅผ ์—ฐ๊ฒฐํ•˜๋Š” ๋ชจ๋ธ์ด๋‹ค. ์šฐ๋ฆฌ๋Š” ์„ธ๋กœ์šด ๊ฐ„๋‹จํ•œ recurrence์™€ convolution๋ฐฉ์‹์„ ์ „์ ์œผ๋กœ ์ œ๊ฐ€ํ•˜๋ฉฐ self attention mechanism์˜ ๋ฐฉ์‹์„ ๊ฐ€์ง€๋Š” Transformer๋ฅผ ์ œ์•ˆํ•œ๋‹ค. ์šฐ๋ฆฌ๋Š” ์˜์–ด-๋…์ผ ๋ฒˆ์—ญ๊ณผ ์˜์–ด-ํ”„๋ž‘์Šค ๋ฒˆ์—ญ ํ…Œ์Šคํฌ์—์„œ ๊ฐ€์žฅ ์ข‹์€ ์„ฑ๋Šฅ์„ ๊ฐ€์กŒ์œผ๋ฉฐ ์ผ๋ฐ˜์ ์œผ๋กœ ๋‹ค๋ฅธ ํ…Œ์Šคํฌ์—์„œ๋„ ์ข‹์€ ์„ฑ๋Šฅ์„ ๋ณด์ž„์„ ํ™•์ธํ•  ์ˆ˜ ์žˆ์—ˆ๋‹ค.

Introduction

RNN๊ณผ LSTM ๊ทธ๋ฆฌ๊ณ  GRNN์€ ์‹œํ€€์Šค ๋ชจ๋ธ๋ง๊ณผ ๋ฒˆ์—ญ ๋ฌธ์ œ์—์„œ ์ข‹์€ ์„ฑ๋Šฅ์„ ๋‚ด๊ณ  ์žˆ๋‹ค. ๊ทธ๋ฆฌ๊ณ  reccurent์™€ encoder-decoder๋ฐฉ์‹์—์„œ ๋งŽ์€ ๋…ธ๋ ฅ๋“ค์ด ์ง„ํ–‰๋˜์–ด ์™”๋‹ค.

๋ฐ˜๋ณต์ ์ธ ๋ชจ๋ธ(recurrent)์€ ์ž…๋ ฅ ๋ฐ ์ถœ๋ ฅ ์ˆœ์„œ์— ๋”ฐ๋ผ ๊ณ„์‚ฐ๋œ๋‹ค. ์ˆœ์„œ๋ฅผ ๋”ฐ๋ผ๊ฐ€๋ฉฐ ๊ณ„์‚ฐํ•˜๋ฉฐ hidden states* *htht๋ฅผ ์ƒ์„ฑํ•˜๊ธฐ ์œ„ํ•ด hidden states htโˆ’1ht-1๊ณผ ํฌ์ง€์…˜๊ฐ’์„ ์ธํ’‹์œผ๋กœ ์‚ฌ์šฉํ•œ๋‹ค. ์ด๋Ÿฌํ•œ ์ƒ์†์ ์ธ ์‹œํ€€์…œ์€ ํ•™์Šต๊ณผ์ •์—์„œ ๋ณ‘๋ ฌ์„ ์ˆ˜ํ–‰ํ•˜์ง€ ๋ชปํ•˜๊ฒŒ ๋  ๋ฟ๋งŒ ์•„๋‹ˆ๋ผ ๊ธด ์‹œํ€€์Šค์—์„œ ๋ฉ”๋ชจ๋ฆฌ ์ œ์•ฝ์„ ๋ฐ›๊ฒŒ ๋œ๋‹ค. ์ด๋Ÿฌํ•œ ํšจ์œจ์„ฑ ๋ฌธ์ œ๋Š” ์—ฌ๋Ÿฌ ๊ธฐ๋ฒ•์„ ํ†ตํ•ด์„œ ํ•ด์†Œ๋˜์—ˆ์ง€๋งŒ, ์—ฌ์ „ํžˆ ๋ฌธ์ œ๋กœ ๋‚จ์•„์žˆ๋‹ค.

Attention์€ ๋‹ค์–‘ํ•œ ํ…Œ์Šคํฌ์—์„œ ์ธํ’‹๊ณผ ์•„์›ƒํ’‹์˜ ๊ธธ์ด๋ฅผ ๋ฌด์‹œํ•˜๋Š” ์‹œํ€€์Šค ๋ชจ๋ธ๋ง๊ณผ ๋ฒˆ์—ญ ๋ชจ๋ธ์˜ ๋ถ€๋ถ„์ด ๋˜์—ˆ๋‹ค. ๋ช‡๋ช‡ ๊ฒฝ์šฐ์—์„œ๋Š” ๋ฐ˜๋ณต ๋ชจ๋ธ์˜ ์ผ๋ถ€๋กœ ๊ฒฐํ•ฉ๋˜์–ด ์‚ฌ์šฉ๋˜์—ˆ๋‹ค.

์šฐ๋ฆฌ๋Š” attention๊ธฐ๋ฒ•์„ ํ†ตํ•ด ๋ฐ˜๋ณต๊ณผ ๋‹จ๊ธฐ ์˜์กด์„ฑ์„ ํ”ผํ•˜๋Š” Transformer๋ฅผ ์ œ์‹œํ•œ๋‹ค. Transformer๋Š” ๋ณ‘๋ ฌ์  ๊ทธ๋ฆฌ๊ณ  ์ ์€ ํ•™์Šต์œผ๋กœ ์ตœ๊ณ ์˜ ์„ฑ๋Šฅ์„ ๋„๋‹ฌํ•  ์ˆ˜ ์žˆ๋‹ค.

Background

์—ฐ์†์ ์ธ ๊ณ„์‚ฐ์„ ์ค„์ด๊ธฐ ์œ„ํ•ด ์ปจ๋ณผ๋ฃจ์…˜ ๋„คํŠธ์›Œํฌ๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ์ธํ’‹๊ณผ ์•„์›ƒํ’‹์— ๋Œ€ํ•ด ๋ณ‘๋ ฌ์ ์œผ๋กœ ํžˆ๋“  representation์„ ๊ณ„์‚ฐํ–ˆ์Šต๋‹ˆ๋‹ค. ์ด๋Ÿฌํ•œ ๋ชจ๋ธ์€ ์ธํ’‹๊ณผ ์•„์›ƒํ’‹์— ์œ„์น˜์— ๋”ฐ๋ผ ์—ฐ์‚ฐ๋Ÿ‰์„ ์ฆ๊ฐ€์‹œํ‚ต๋‹ˆ๋‹ค. ์ด๋Š” ๊ฑฐ๋ฆฌ์— ๋”ฐ๋ฅธ ์˜์กด์„ฑ์„ ๋” ์–ด๋ ต๊ฒŒ ๋งŒ๋“ค์—ˆ์Šต๋‹ˆ๋‹ค. Transformer์—์„œ๋Š” ์—ฐ์‚ฐ์„ ์ค„์˜€์ง€๋งŒ, averaging attention-weighted position์œผ๋กœ ์ธํ•ด ํšจ๊ณผ์ ์ธ ํ•ด์ƒ๋„๊ฐ€ ๊ฐ์†Œํ–ˆ๋ธ๋‹ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” ์ด๋ฅผ Multi-head attention์œผ๋กœ ๋Œ€์ฒดํ–ˆ์Šต๋‹ˆ๋‹ค.

intra-attention์ด๋ผ๊ณ ๋„ ๋ถˆ๋ฆฌ๋Š” Self-attention์€ ๋‹ค๋ฅธ ์œ„์น˜์— ์žˆ๋Š” ์‹œํ€€์Šค๋ผ๋ฆฌ์˜ ๊ด€๊ณ„๋ฅผ ํ‘œํ˜„ํ•˜๊ณ ์ž ํ•ฉ๋‹ˆ๋‹ค. Self-attention์€ ๊ธ€ ์ดํ•ด, ์š”์•ฝ๋“ฑ๋“ฑ ๋‹ค์–‘ํ•œ ํ…Œ์Šคํฌ์—์„œ ์„ฑ๊ณต์ ์ด์—ˆ์Šต๋‹ˆ๋‹ค. Transformer๋Š” RNN๊ณผ CNN์ด ์—†๋Š” ์ธํ’‹๊ณผ ์•„์›ƒํ’‹์˜ ๊ด€๊ณ„์— ๋Œ€ํ•ด ๊ณ„์‚ฐํ•˜๋Š” self-attention์— ์˜์กดํ•œ ์ฒซ๋ฒˆ์งธ ๋ชจ๋ธ์ž…๋‹ˆ๋‹ค.

Model Architecture

๊ฐ€์žฅ ์ข‹์€ ์–ธ์–ด ๋ชจ๋ธ์€ ์ธ์ฝ”๋”์™€ ๋””์ฝ”๋”์˜ ๊ตฌ์กฐ๋ฅผ ๊ฐ€์ง‘๋‹ˆ๋‹ค. ์ธ์ฝ”๋”์— x1,x2,x3x1, x2, x3 โ€ฆ์˜ ์ธํ’‹์„ ์‚ฌ์šฉํ•˜๋ฉด ์ธ์ฝ”๋”๊ฐ€ ์ด๋ฅผz1,z2,z3z1, z2, z3,โ€ฆ ๋กœ ํ‘œํ˜„ํ•˜๋ฉฐ ์ด๋Š” ๋””์ฝ”๋”์— ๋“ค์–ด๊ฐ€ output์ธ y1,y2,y3โ€ฆy1, y2, y3โ€ฆ๋ฅผ ์ƒ์„ฑํ•˜๊ฒŒ ๋ฉ๋‹ˆ๋‹ค. ๋ชจ๋“  ๋‹จ๊ณ„์—์„œ ๋ชจ๋ธ์€ ์ž๋™์ ์œผ๋กœ ํšŒ๊ท€ํ•˜๋ฉฐ, ๋‹ค์Œ ๊ฒƒ์„ ์ƒ์„ฑํ•  ๋•Œ ์ธํ’‹ ๋ฐ์ดํ„ฐ๋ฅผ ์ง‘์–ด๋„ฃ์Šต๋‹ˆ๋‹ค.

195

ํŠธ๋žœ์Šคํฌ๋จธ๋Š” ์œ„์™€ ๊ฐ™์€ ๊ตฌ์กฐ๋ฅผ ๊ฐ€์ง€๊ฒŒ ๋ฉ๋‹ˆ๋‹ค.

Encoder and Decoder Stacks

Encoder๋Š” 6๊ฐœ์˜ ๋ ˆ์ด์–ด ์Šคํƒ์œผ๋กœ ์ด๋ฃจ์–ด์ ธ์žˆ๋‹ค. ๊ฐ๊ฐ์˜ ๋ ˆ์ด์–ด๋Š” ๋‘๊ฐœ์˜ ์„œ๋ธŒ๋ ˆ์ด์–ด๋ฅผ ๊ฐ€์ง„๋‹ค. ์ฒซ ๋ฒˆ์งธ๋Š” multi-head self-attention mechanism์ด๊ณ , ๋‘ ๋ฒˆ์งธ๋Š” position wise fully connected feed-forward networkdlek. ์šฐ๋ฆฌ๋Š” ๋งค ๋ ˆ์ด์–ด์˜ residiual connection์„ ์ด์šฉํ–ˆ๊ณ  ๊ทธ ๋’ค๋กœ layer normalization์„ ์‚ฌ์šฉํ•œ๋‹ค. ๊ทธ๋Ÿฌ๋ฉด ๊ฐ๊ฐ์˜ ๋ ˆ์ด์–ด์˜ ์•„์›ƒํ’‹์€ LayerNorm(x+Sublayer(x))๊ฐ€ ๋œ๋‹ค. ์šฐ๋ฆฌ๋Š” residual connection์„ ์ด์šฉํ•˜๊ธฐ ์œ„ํ•ด์„œ ๋ชจ๋“  ๋ ˆ์ด์–ด์™€ ์ž„๋ฒ ๋”ฉ์˜ ์•„์›ƒํ’‹์€ 512๋กœ ์„ค์ •ํ•˜์˜€๋‹ค.

Decoder ๋˜ํ•œ 6๊ฐœ์˜ ์Šคํƒ์œผ๋กœ ์ด๋ฃจ์–ด์ง„๋‹ค. ๊ฒŒ๋‹ค๊ฐ€ ์ธ์ฝ”๋”์˜ ๋‘๊ฐœ์˜ ๋ ˆ์ด์–ด์— ๋””์ฝ”๋”๋Š” ์ธ์ฝ”๋”์˜ ๊ฒฐ๊ณผ๊ฐ’์— ๋Œ€ํ•˜์—ฌ multi-head attention์„ ์ˆ˜ํ–‰ํ•˜๋Š” 3๋ฒˆ์งธ ๋ ˆ์ด์–ด๋ฅผ ์‚ฝ์ž…ํ•˜์˜€๋‹ค. ์ธ์ฝ”๋”์™€ ์œ ์‚ฌํ•˜๊ฒŒ residual connection๊ณผ layer normalization์„ ๋งค ๋ ˆ์ด์–ด ์ดํ›„์— ์‹คํ–‰ํ•˜์˜€๋‹ค. ์šฐ๋ฆฌ๋Š” ๋˜ํ•œ self-attention์„ ์ˆ˜์ •ํ•˜์—ฌ ์ด์–ด์ง€๋Š” ํฌ์ง€์…˜์— ์˜ํ•˜์—ฌ ํฌ์ง€์…˜์ด ์ •ํ•ด์ง€๋Š” ๊ฒƒ์„ ์˜ˆ๋ฐฉํ•œ๋‹ค. ์ด ๋งˆ์Šคํ‚น์„ ํ†ตํ•ด์„œ ์ด์ „์˜ ์ •๋ณด์— ๋Œ€ํ•ด์„œ๋งŒ ์˜์กดํ•  ์ˆ˜ ์žˆ๊ฒŒ ๋œ๋‹ค. ( ๋ฏธ๋ž˜๋ฅผ ์˜ˆ์ธกํ•˜๊ธฐ ์œ„ํ•ด์„œ ๋ฏธ๋ž˜์˜ ์ •๋ณด๋ฅผ ๋ฐฐ์ œํ•˜๋Š” ๊ฒƒ. )

Attention

Attention์€ ๋ฒกํ„ฐ๋กœ ์ถœ๋ ฅ๋˜๋Š” query, key, value๋กœ ์ด๋ฃจ์–ด ์ง„๋‹ค. ์•„์›ƒํ’‹์€ query์™€ key๋กœ ๋ถ€ํ„ฐ ๋‚˜์˜ค๋Š” values์˜ ๊ฐ€์ค‘ํ•ฉ์œผ๋กœ ์ด๋ฃจ์–ด์ง„๋‹ค.

342

์™ผ์ชฝ์ด Scaled Dot-Product Attention์ด๋‹ค. ์ธํ’‹์˜ ๊ตฌ์กฐ๋Š” $dk$์˜ ์ฐจ์›์„ ๊ฐ€์ง€๋Š” query์™€ key์ด๋ฉฐ, value๋Š” $dv$์˜ ์ฐจ์›์„ ๊ฐ–๊ฒŒ ๋œ๋‹ค. ์šฐ๋ฆฌ๋Š” query์™€ ๋ชจ๋“  keys์— ๋Œ€ํ•ด์„œ ๋‚ด์ ์„ ์ง„ํ–‰ํ•˜๋ฉฐ, ๊ฐ๊ฐ $dk$๋กœ ๋‚˜๋ˆ„๊ฒŒ ๋œ๋‹ค. ๊ทธ๋ฆฌ๊ณ  softmax function์„ ์ ์šฉ์‹œ์ผœ value ๊ฐ’์„ ๊ตฌํ•œ๋‹ค. Attention์€ ๋‹ค์Œ๊ณผ ๊ฐ™์€ ์‹์œผ๋กœ ํ‘œํ˜„์ด ๊ฐ€๋Šฅํ•˜๋‹ค.

374

๋Œ€์ฒด๋กœ additive attention๊ณผ dot-product attention์ด ์‚ฌ์šฉ๋˜์–ด์ง„๋‹ค. Dot-product attention์€ ์šฐ๋ฆฌ์˜ ์•Œ๊ณ ๋ฆฌ์ฆ˜์ด๋ฉฐ scaling ์š”์ธ์ธ $1/โˆšdk$๋Š” ์ œ์™ธํ•˜๊ณ . additice attention์€ Feed-forward network๋ฅผ ์‚ฌ์šฉํ•ด์„œ ํ˜ธํ™˜์„ฑ์„ ๊ณ„์‚ฐํ•œ๋‹ค. ๋‘๊ฐ€์ง€์˜ attention์€ ๋น„์Šทํ•˜๊ณ  ์ด๋ก ์ ์œผ๋กœ ๋ณต์žกํ•˜๋‚˜ dot-product attention์€ ํ–‰๋ ฌ๊ณฑ์œผ๋กœ ํ‘œํ˜„์ด ๋˜๊ธฐ ๋•Œ๋ฌธ์— ํ›จ์”ฌ ๋น ๋ฅด๊ณ  ๊ณต๊ฐ„์ ์œผ๋กœ ํšจ์œจ์ ์ด๋‹ค.

Value ๊ฐ’์ด ์ž‘์„ ๋•Œ ๋‘๊ฐœ์˜ ๋ฉ”์นด๋‹ˆ์ฆ˜์€ ์œ ์‚ฌํ•˜๊ฒŒ ์ž‘๋™ํ•˜์ง€๋งŒ additive attention์€ ํฐ ๊ฐ’์„ ๊ฐ€์ง€๋Š” dkdk๊ฐ€ scaling์ด ๋˜์ง€ ์•Š์„ ๋•Œ ๋”์šฑ ํšจ๊ณผ์ ์ด๋‹ค. ์šฐ๋ฆฌ๋Š” ํฐ ๊ฐ’์˜ dkdk๊ฐ€ ๊ทœ๋ชจ์—์„œ dot product๊ฐ€ ์ปค์ง€๋ฉฐ softmax function์˜ ๊ฐ’์ด ๊ทน๋‹จ์ ์œผ๋กœ ๊ฐ€๋ฉฐ ๊ธฐ์šธ๊ธฐ ์†Œ์‹ค ๋ฌธ์ œ๋ฅผ ์ผ์œผํ‚จ๋‹ค๊ณ  ์˜์‹ฌํ–ˆ๊ณ  ์šฐ๋ฆฌ๋Š” ์ด๋ฅผ 1/โˆšdk1/โˆšdk๋กœ scalingํ•˜์—ฌ ๋Œ€์ฒ˜ํ•˜์˜€๋‹ค.

Single attention ๋Œ€์‹  ์šฐ๋ฆฌ๋Š” ๋งค๋ฒˆ์˜ h time๋งˆ๋‹ค ๋‹ค๋ฅธ query, key, value๊ฐ’์ด ๊ฐœ๋ณ„์ ์œผ๋กœ ์žˆ๋Š”๊ฒŒ ํšจ๊ณผ์ ์ด๋ž€๊ฒƒ์„ ์•Œ์•„๋ƒˆ๋‹ค. ์ด๋Š” ๋ณ‘๋ ฌ์ ์œผ๋กœ ์ˆ˜ํ–‰ํ•˜๋ฉฐ ๋™์ผํ•œ ์ฐจ์›์˜ value๊ฐ’์„ ๋‚ธ๋‹ค. ์ด๋ ‡๊ฒŒ ๋‚˜์˜จ ๊ฒฐ๊ณผ๊ฐ’์€ concat๋˜์–ด์ง€๋ฉฐ ๋‹ค์‹œ ๋‹ค๋ฅธ ๋ ˆ์ด์–ด๋กœ ๋“ค์–ด๊ฐ€๊ฒŒ ๋œ๋‹ค.

์—ฌ๊ธฐ์„œ ์šฐ๋ฆฌ๋Š” h=8์˜ 8๊ฐœ์˜ ๋ณ‘๋ ฌ์  ๋ ˆ์ด์–ด๋ฅผ ์‚ฌ์šฉํ–ˆ๋‹ค. ์šฐ๋ฆฌ๋Š” dk=dv=d(model)/h=64dk=dv=d(model)/h=64๋ฅผ ์‚ฌ์šฉํ•œ๋‹ค. ์ด ๋•Œ๋ฌธ์— ๊ฐ ํ—ค๋“œ์—์„œ ์ฐจ์›์ด ๊ฐ์†Œ๋˜๋ฉฐ ์ „์ฒด์ ์ธ ์—ฐ์‚ฐ๋Ÿ‰์€ single-head attention๊ณผ ์œ ์‚ฌํ•ด์ง„๋‹ค.

The Transformer uses multi-head attention in three diffrent ways

encoder-decoder attention layer์—์„œ query๋Š” ์ด์ „์˜ decoder layer์—์„œ ์˜ค๋ฉฐ key์™€ value๋Š” encoder๋กœ๋ถ€ํ„ฐ ์˜จ๋‹ค. ์ด๋Š” decoder์— ๋ชจ๋“  sequence์— ๋Œ€ํ•ด์„œ ์ˆ˜ํ–‰๋˜์–ด์ง„๋‹ค. ์ด๊ฒƒ์€ ์ „ํ˜•์ ์ธ encoder-decoder attention์„ ๋ชจ๋ฐฉํ•œ ๊ฒƒ์ด๋‹ค.

์ด๋Ÿฌํ•œ encoder๋Š” self-attention layer๋ฅผ ํฌํ•จํ•˜๋ฉฐ ๋ชจ๋“  key, value, query๋Š” ๊ฐ™์€ ์žฅ์†Œ์—์„œ ์˜จ๋‹ค. ์ด ๊ฒฝ์šฐ ์ด์ „ layer์˜ ์•„์›ƒํ’‹์„ ๋งํ•œ๋‹ค. ๊ฐ๊ฐ์˜ encoder์— ์œ„์น˜๋Š” ์ด์ „ encoder์˜ ๋ชจ๋“  ์œ„์น˜์— ๋Œ€ํ•ด ํ•™์Šตํ•˜๊ฒŒ ๋œ๋‹ค.

์œ ์‚ฌํ•˜๊ฒŒ decoder์— ์žˆ๋Š” self-attention layer๋Š” decoder์˜ ๋ชจ๋“  ์œ„์น˜์— ๋Œ€ํ•ด ํ•™์Šตํ• ๋ ค๋Š” ๊ฒฝํ–ฅ์ด ์žˆ๊ณ  ์šฐ๋ฆฌ๋Š” ์ด๋Ÿฌํ•œ ์ •๋ณด ํ๋ฆ„์„ ๋ฐฉ์ง€ํ•ด์•ผํ–ˆ๋‹ค. ๊ทธ๋ž˜์„œ ์šฐ๋ฆฌ๋Š” ๋งˆ์Šคํ‚น์ฒ˜๋ฆฌ๋ฅผ ํ•œ๋‹ค.

Position-wise Feed-Forward Networks

๋ชจ๋“  encoder์™€ decoder๋Š” feed-forward network๋ฅผ ์—ฐ๊ฒฐํ•œ๋‹ค. ์ด๋Š” ๋‘ ๊ฐœ์˜ linear layer์™€ ์‚ฌ์ด์— ReLU ํ™œ์„ฑํ™” ํ•จ์ˆ˜๊ฐ€ ํฌํ•จ ๋˜์–ด ์ง„๋‹ค. ์ธํ’‹๊ณผ ์•„์›ƒํ’‹์€ 512์ฐจ์›์ด๋ฉฐ ์ค‘๊ฐ„์— ์žˆ๋Š” hidden layer๋Š” 2048์ฐจ์›์„ ๊ฐ€์ง€๊ฒŒ ๋œ๋‹ค.

Embedding and Softmax

๋‹ค๋ฅธ ์‹œํ€€์Šค ๋ฒˆ์—ญ ๋ชจ๋ธ๊ณผ ์œ ์‚ฌํ•˜๊ฒŒ ์šฐ๋ฆฌ๋Š” ์ธํ’‹ ํ† ํฐ๊ณผ ์•„์›ƒํ’‹์œผ๋กœ ๋ณ€ํ™”ํ•˜๋Š” ํ•™์Šต๋œ ์ž„๋ฒ ๋”ฉ์„ ์‚ฌ์šฉํ•œ๋‹ค. ์šฐ๋ฆฌ๋Š” ๋˜ํ•œ ํ•™์Šต๋œ linear์™€ softmax funtion์„ ์‚ฌ์šฉํ•œ๋‹ค. ์šฐ๋ฆฌ ๋ชจ๋ธ์—์„œ ์šฐ๋ฆฌ๋Š” ๋‘๊ฐœ์˜ ์ž„๋ฒ ๋”ฉ ๋ ˆ์ด์–ด์™€ softmax transformation๊ฐ„ ๊ฐ™์€ weight๋ฅผ ๊ณต์œ ํ•œ๋‹ค.

Positional Encoding

์šฐ๋ฆฌ์˜ ๋ชจ๋ธ์€ ๋ฐ˜๋ณต๊ณผ ์ปจ๋ณผ๋ฃจ์…˜์ด ์—†๊ธฐ ๋•Œ๋ฌธ์— ๋ชจ๋ธ์ด sequence์˜ ์ˆœ์„œ๋ฅผ ์•Œ ์ˆ˜ ์žˆ๋„๋ก ์œ„์น˜์— ๋Œ€ํ•œ ์ •๋ณด๋ฅผ ์ฃผ์ž…ํ•ด์•ผํ•œ๋‹ค.

394

์šฐ๋ฆฌ๋Š” ์ด๋ฅผ ์œ„ํ•ด positional encoding๋ฅผ encoder์™€ decoder์— ๋”ํ•ด์ค€๋‹ค. positional encoding์€ $d(moddel)$๊ณผ ๊ฐ™์€ ์ฐจ์›์„ ๊ฐ–๊ฒŒ ๋˜๋ฉฐ ์ด ๋‘˜์€ ๋”ํ•ด์ง„๋‹ค. ์œ„ ์‹์—์„œ pos๋Š” ํ•ด๋‹น token์˜ sequence์ด๋ฉฐ i๋Š” ์ฐจ์›์„ ๋œปํ•œ๋‹ค. ์ด๋Ÿฌํ•œ position encoding์€ ๋ชจ๋“  ์œ„์น˜๋ฅผ ํ‘œํ˜„ํ•  ์ˆ˜ ์žˆ์œผ๋ฉฐ ์œ„์น˜์— ๋Œ€ํ•ด ์‰ฝ๊ฒŒ ํ•™์Šตํ•  ์ˆ˜ ์žˆ๊ฒŒ ํ•ด์ค€๋‹ค. ์‚ผ๊ฐํ•จ์ˆ˜๋ฅผ ์‚ฌ์šฉํ•˜์—ฌ ๊ธธ์ด๊ฐ€ ๊ธด sequence๋ฐ์ดํ„ฐ๋„ ํ•™์Šต์ด ๊ฐ€๋Šฅํ•˜๋‹ค.

Why Self-Attention

  1. layer ๋งˆ๋‹ค์˜ ์—ฐ์‚ฐ๋Ÿ‰ ๊ฐ์†Œ
    convolution, recurrent์—์„œ attentionํ•™์Šต ๋ฐฉ๋ฒ•์œผ๋กœ ์ „ํ™˜ํ•˜๋ฉฐ layer๋‚ด์—์„œ์˜ ์—ฐ์‚ฐ๋Ÿ‰์„ ๊ฐ์†Œ ์‹œํ‚ฌ ์ˆ˜ ์žˆ๋‹ค.

  2. ๋ณ‘๋ ฌ ์ˆ˜ํ–‰ ๊ฐ€๋Šฅ
    ์—ฐ์†์ ์œผ๋กœ ์ง„ํ–‰๋˜๋Š” ํ•™์Šต์ด ์•„๋‹Œ ๊ฐœ๋ณ„์ ์ธ ์—ฐ์‚ฐ์ด ๋”ฐ๋กœ ๊ฐ€๋Šฅํ•˜์—ฌ ๋ณ‘๋ ฌ ์ˆ˜ํ–‰์ด ๊ฐ€๋Šฅํ•˜๋‹ค.

  3. ์žฅ๊ธฐ ์˜์กด์„ฑ
    ๊ฐ๊ฐ์˜ ํ† ํฐ์ด ๋ชจ๋“  ํ† ํฐ๊ด€์˜ ๊ด€๊ณ„์— ๋Œ€ํ•ด์„œ ํ•™์Šต์„ ํ•˜๊ธฐ ๋•Œ๋ฌธ์— ์žฅ๊ธฐ ์˜์กด์„ฑ์„ ํ•ด๊ฒฐํ•œ๋‹ค.

Result

487

Transformer๋Š” ์„ฑ๋Šฅ์ ์œผ๋กœ ๊ฐ€์žฅ ์šฐ์ˆ˜ํ–ˆ์œผ๋ฉฐ ๊ธฐ์กด model๋ณด๋‹ค ์—ฐ์‚ฐ๋Ÿ‰์„ ๊ฐ์†Œ์‹œ์ผฐ๋‹ค. ์ด์ „ ๊ธฐ๋ณธ ๋ชจ๋ธ๋“ค์„ ์••๋„ํ–ˆ์„ ๋ฟ๋งŒ ์•„๋‹ˆ๋ผ ์•™์ƒ๋ธ”์„ ์ง„ํ–‰ํ•œ ๋ชจ๋ธ๋“ค ๋ณด๋‹ค ์„ฑ๋Šฅ์ด ์ข‹์•˜๋‹ค.

์šฐ๋ฆฌ๋Š” ๋งˆ์ง€๋ง‰์œผ๋กœ 5๊ฐœ์˜ checkpoint๋ฅผ ํ‰๊ท ์„ ๋‚ด์–ด ๊ธฐ๋ณธ model๋กœ ์‚ฌ์šฉํ•˜๋ฉฐ big model๋กœ๋Š” ๋งˆ์ง€๋ง‰ 20๊ฐœ์˜ checkpoint๋ฅผ ํ‰๊ท  ๋‚ด์–ด ์‚ฌ์šฉํ•œ๋‹ค. ๋˜ํ•œ output length๋Š” input length์˜ + 50๊ฐœ๋ฅผ ์ œํ•œ์œผ๋กœ ๋‘๋ฉฐ ๊ฐ€๋Šฅํ•˜๋‹ค๋ฉด ์ผ์ฐ ์ข…๋ฃŒํ•œ๋‹ค. ๋˜ํ•œ, beam์„ 4๋กœ ๋‘์–ด ์ง„ํ–‰ํ•œ๋‹ค.

347

transformer์˜ parameter๋ฅผ ์—ฌ๋Ÿฌ๊ฐ€์ง€๋กœ ๋ณ€ํ™˜ํ•˜๋ฉฐ ์‹คํ—˜์„ ํ•˜์˜€๋Š”๋ฐ head๊ฐ€ ๋ฌด์กฐ๊ฑด ์ ์œผ๋กœ ๋งŽ์•˜์„ ๋•Œ๋Š” ์ข‹์ง€ ์•Š์•˜๋‹ค. key์˜ ์ฐจ์›, dropout, positional encoding๋“ฑ์„ ๋ฐ”๊ฟ” ๊ฐ€๋ฉด ์‹คํ—˜ํ•˜์˜€๋‹ค. ## Conclusion

์šฐ๋ฆฌ๋Š” ์ฒ˜์Œ์œผ๋กœ ์™„์ „ํžˆ attention์— ๊ทผ๊ฑฐํ•œ sequence model์„ ๋ณด์—ฌ์ค€๋‹ค. reccurent layer๋ฅผ ๋Œ€์ฒดํ•˜์˜€๊ณ , encoder-decoder ๊ตฌ์กฐ๋ฅผ multi-headed self-attention๊ณผ ๊ฐ™์ด ์‚ฌ์šฉํ•˜์˜€๋‹ค. Transformer๋Š” ์ด์ „ ๊ตฌ์กฐ๋“ค๋ณด๋‹ค ๋” ๋น ๋ฅด๊ฒŒ ํ•™์Šต์ด ๊ฐ€๋Šฅํ–ˆ์œผ๋ฉฐ ๋” ๋†’์€ ์„ฑ๋Šฅ์„ ๋ณด์—ฌ์ฃผ์—ˆ๋‹ค.


๐Ÿ”— ๊ด€๋ จ ๊ธ€

0๊ฐœ์˜ ๋Œ“๊ธ€