[인공지능 프로그래밍 수업] NLP architecture

이은비·2023년 12월 15일

16) NLP architecture(transformer)
——————————preview————————————————————————————————
임베딩은 사람이 사용하는 언어(자연어)를 컴퓨터가 이해할 수 있는 언어 형태인 벡터로 변환한 결과 혹은 일련의 과정을 의미합니다.
임베딩의 역할은 단어 및 문장 간 관련성 계산
의미적, 문법적 정보의 함축과 같은 역할을 수행하며
방법에 따라 희소표현 기반 임베딩, 횟수 기반 임베딩, 예측 기반 임베딩, 횟수/예측 기반 임베딩이 있습니다.

트랜스포머 어텐션
어텐션은 주로 언어 번역에서 사용되기 때문에 인코더와 디코더 네트워크를 사용합니다.
즉, 입력에 대한 벡터 변환을 인코더에서 처리하고 모든 벡터를 디코더로 보냅니다.
이렇게 모든 벡터를 전달하는 이유는 시간이 흐를수록 초기 정보를 잃어버리는 기울기 소멸 문제를 해결하기 위해서 입니다.
하지만 이 때문에 행렬 크기가 굉장히 커지는 단점이 있는데 이를 해결하기 위해 소프트맥스 함수를 사용하여 가중합을 구하고 그 값을 디코더에 전달합니다.
하지만 이렇다 하더라도 정보는 많고 따라서 디코더는 부담일 수 밖에 없습니다. 따라서 디코더는 은닉 상태에 대해 중점적으로 집중해서 보아야 할 벡터를 소프트맥스 함수로 점수를 매긴 후 각각을 은닉 상태의 벡터들과 곱합니다, 그리고 이 은닉 상태를 모두 더해서 하나의 값으로 만듭니다,즉, 어텐션은 모든 벡터 중에서 꼭 살펴 볼 벡터들에 집중하겠다는 의미입니다.

BERT
검색 문장의 단어를 입력된 순서대로 하나씩 처리하는 것이 아니라 한 문장에서 모든 단어의 연관성을 이해하며 검색 문장을 처리하는 모델입니다.
———————————————————————————————————————————————
seq2seq모델에서는 하나의 문맥벡터가 소스문장의 모든 정보를 가지고 있어야 하므로 성능이 저하되는데 이에 대한 해결방안으로 단어 만들때마다 매번 소스 문장에서의 출력 전부를 입력으로 받으면 어떨까 하는 아이디어에서 고안된 것으로 최신 GPU는 많은 메모리와 빠른 병렬 처리를 지원하기 때문에 가능한데
RNN,CNN을 사용하지 않고 단어 순서 정보를 전달해야 되기 때문에 존재하는 것은 positional encoding.
Input embedding에서 positional encoding단계를 추가한 뒤 multi-head attention을 진행하고 이후에 몇단계를 건너뛰고 일을 수행하는 residual learning을 진행합니다.
encoder에서는 self-attention을 진행하고 encoder와 decoder에서는 encoder-decoder attention을 진행합니다.
그리고 attention 개념을 설명할때 필요한 개념이 K,Q,V와 같은 파라미터를 이용한 것인데 decoder의 쿼리 Q가 encoder의 다른 단어들 keys와 어떠한 가중치를 갖는지를 알아내는 것입니다.
———————————————————————————————————————————————
Attention Mechanism – Intuitions
seq2seq는 인코데에서 디코더로 보내는 작업을 진행하는 것으로 각각의 시간 단계에서, 디코더는 모든 인코딩된 소스 토큰들에 대한 액세스를 제공받습니다. 디코더의 각각의 시간 단계에서 입력 시퀀스의 워드들에 각각 다른 attention level을 줍니다.디코더는 특정 ℎ에는 더 높은 가중치를 주고 다른 것에는 더 낮은 가중치를 부여합니다. 즉, encoder와 얼마나 관련 깊은가를 두고 hidden states 중 누가 가장 관련이 깊은지를 알 수 있습니다.

Attention Mechanism – Formal Definition
Attention(Q, K, V) = Attention Value
여기서 각각 Q,K,V는 각각 Query,Key,Value를 의미하며 어떤 key가 가장 중요한가를 두고 그 값이 가장 크도록 softmax를 취합니다. 여기서 key는 hidden states이며 key 와 value가 같도록 하게 만들며 이때 주는 attention값은 제일 중요한게 가장 크게 나오도록 하는 것입니다. 그리고 score 내는 방식에 따라 다르게 표현 되는데 그것은 다음과 같습니다.

말하는 순서에 따라서 주로 연관성이 큽니다. 그러나 RNN은 한계가 있습니다.(아래 그림 참조)

The Transformer
RNN은 길게 할 수 없고 계산시간이 많이 걸립니다.그에 따라 RNN을 사용하지 않고 attention만 줌으로써 해결하는 방법을 고안한 것으로 transformer기반 translator를 만드는데 transformer layer를 쌓아서 제시합니다 transformer모델은 아래 그림처럼 생겼는데 층을 많이 쌓아도 충분히 동작하며 encoder->decoder로 되어 있는 구조로 되어있습니다.

Positional Encoding Layer
순차적인 계산이 되지 않으며 한번에 계산 가능합니다. 이는 병렬처리가 가능한 것이며 position에 대한 code는 sin cos을 통해 표현 합니다.길이 𝐿와 모델 치수 𝑑의 입력 순서가 있고 이 순서 내에서 𝑘번째 객체의 위치가 필요하다고 가정합니다. 그렇다면,
과 같고, 이때 position encoding이며 이때 인수로 들어가는 k는 lenght,embedding쪽 dimension은 2i,2i+1로 되어 있으며 짝수에 대해서는 sin, 홀수에 대해서는 cos으로 되어있습니다.
값들을 통해 위치 잘 알 수 있습니다.

Idea of Self-attention
encoder쪽 bi-direction, decoder쪽은 앞쪽단어랑 비교합니다. 완전히 반대쪽이어도 attention을 적용하며 입력 x weight로 되어있습니다.

Self-attention

각 단어끼리의 연관성을 보는 것으로 similarity는 determined 되어 있습니다. Query Q와 key K와의 내적을 통해 연관성을 알 수 있습니다.
또한 입력 벡터에 대한 분포를 얻기 위한 스케일링 및 소프트맥스를 취합니다.주의 벡터를 사용하여 입력에 대한 값(𝑉) 벡터에 대한 가중합을 계산합니다. 그리고 만약 query,key,value가 모두 같다면 이것은 self-attention입니다. Q와 K사이에서는 embedding 끼리의 inner product를 통해 단어 사이의 연관성을 알 수 있습니다. 오른쪽 matrix의 연관성을 보는 것에서는 Q의 첫번쨰 단어 중 key의 어떤 단어와 가장 연관이 깊었을까를 보여주는 것으로 볼 수 있습니다.
multi-headed attention은 여러 복사본을 병렬로 실행하고 다음 레이어의 출력을 연결합니다. embedding dimension 하나하나는 independent 하며 병렬처리 가능합니다.

FeedForward Layer
attention 내용을 기억하는 역할을 하며 이는 key value의 memory형태입니다.

Decoder Self-Attention and Masking
decoder에서는 1번쨰로 self-attention을 진행하고 2번째로는 encoder의 정보랑 비교하는 과정을 거칩니다. encoder쪽에서 padding mask를 진행하고,이러한 padding mask는 더 짧은 시퀀스는 0으로 패딩되는 동안 시퀀스의 길이는 잘리는 것 입니다. decoder에는 look-ahead mask를 진행합니다, 뒤를 쳐다보지않게 하기 위해서 Masked multi-head attention을 진행합니다.

참고) padding mask

look-ahead mask

Google BERT
인코더 부분을 이용한 것으로 트랜스포머 기반 모델은 텍스트를 병렬로 처리할 수 있기 때문에 양방향이라는 용어가 사용됩니다. 하지만 엄밀히 말하면 양방향이 아닙니다. 실제로는 한꺼번에 계산합니다. BERT는 여러 가지 NLP 작업을 수행하는 모델을 만드는 것이 목표이기 때문에 Transformer의 인코더 부분을 사용합니다. BERT의 출력은 텍스트 출력이 아니라 임베딩입니다.
BERT는 인코더의 출력을 사용하여 두 가지 혁신적인 훈련 기술인 MLM(Masked Language Model)과 NSP(Next Sentence Prediction)를 수행하는 훈련 계층과 함께 사용합니다.

Masked Language Model (MLM)
입력도 출력도 단어로 입력단어중 일부를 다른단어로 masking한 뒤, 이후 learning한 다음에 봤을 때도 정확하게 출력 될 수 있도록, 즉, 엉뚱한 단어가 있어도 제대로 된 값으로 출력 할 수 있도록 하는 것을 의미합니다.

Next Sentence Prediction (NSP)
BERT 훈련 과정에서 모델은 문장 쌍을 입력으로 받아 쌍의 두 번째 문장이 원본 문서의 후속 문장인지 예측하는 방법을 학습합니다.(T:50%, F:50%).
입력 시퀀스가 모델을 통과한 후 [CLS] 토큰의 출력은 간단한 분류 계층을 사용하여 2×1 모양의 벡터로 변환된 다음 소프트맥스로 확률을 계산합니다.

BERT Model Architecture
two model sizes for BERT,
BERT BASE – 12 encoder layers
BERT LARGE – 24 encoder layers
Input vector size is 512
outputs a vector of size hidden_size (768 in
BERT Base).

Applications for BERT
-SPAM filtering: BERT를 사용하는 가장 간단한 방법은
하나의 텍스트를 분류하는 것입니다.
-sentiment analysis:예를 들어 Input으로는 Movie/Product review. Output으로는 is the review positive or negative?
-Fact-checking

GPT (Generative Pre-trained Transformer)
GPT는 딥 러닝을 사용하여 인간과 같은 텍스트를 생성하는 자동 회귀 언어 모델입니다.
GPT의 "semi-supervised" 접근 방식은 다음과 같은 두 단계로 이루어졌습니다:
1st) 언어가 사용되는 비지도적 생성 "사전 훈련" 단계
모델링 목표는 초기 파라미터를 설정하는 데 사용되었습니다,
2nd) 그리고 이러한 매개변수가 목표 작업에 적용되는 감독된 차별적인 "미세 조정" 단계를 거쳤습니다.
이러한 특징들은 RNN은 안되도 GPT는 되는 것들을 만들어 냈는데 사이즈를 크게 키울 수 있고 다양한 종류에 대해서도 다룰 수 있다는 특징이 있습니다.

Transformers, BERT, and GPT-2
같은 형태의 transformer기반의 것들이며 앞단어로 뒷단어를 prediction. transformer는 encoder stack을 사용하여 입력을 모델링하고 디코더 스택을 사용하여 출력을 모델링합니다.(인코더 측의 입력 정보를 사용하여)
내용만 파악할 때는 encoder기반의 BERT를 사용하고,generator를 사용할 때는 GPT를 사용합니다.

profile
cs/ce 전공 재학생입니다.

0개의 댓글