[LangGraph Agent] LLM 의 발전과 현황

이승준·2025년 7월 13일

2025 Summer Coding

목록 보기
1/1

언어모델 의 역사

Statistic Language Model (SLM)

통계적 언어 모델은 조건부 확률의 연쇄 법칙을 활용해 문장을 생성한다. 어떤 시퀀스가 있을 때, 다음 단어로 특정 단어가 나올 확률을 계산하고, 가장 확률이 높은 단어들을 분석한다.위와 같이 빈도수를 기준으로 학습을 하면, 정말 방대한 양의 학습 데이터가 필요하다. 또한, 코퍼스 내에 특정 시퀀스가 없다면, 그 시퀀스에 대한 확률이 0이 되는 오류를 범하게 된다. 이처럼 충분한 데이터를 관측하지 못하여 언어를 정확히 모델링하지 못하는 문제를 희소 문제(sparsity problem) 라고 한다.

Neural LM

Sparsity Problem 을 해결하기 위해 NN 이 도입된 Neural Language Model 이 등장했다. Neural Language Model은 각 단어를 고정된 벡터(embedding vector) 로 바꾸고 이 벡터들을 입력으로 받아 다음 단어 분포를 출력하는 신경망을 학습한다. 이렇게 하면 관측되지 않은 단어 조합도 일반화할 수 있다.
하지만 위와 같은 방식에도 단점이 있는데, 입력 단어 수가 많아지면 각 단어마다 embedding 과 연결된 weight 들로 인해 파라미터 수가 급격하게 증가한다는 것이다. 또한 입력 시퀀스의 길이가 가변적인 NLP 에서 MLP 의 사용은 적합하지 않다는 문제도 있다.

RNN

Neural LM 의 문제를 개선하기 위해 같은 weight 들을 반복해서 사용하는 RNN 이 탄생했다. 하나의 가중치 행렬을 두고, input length 만큼 반복해 사용하는 것이다. RNN 계얼의 모델은 MLP 와 다르게 입력 데이터의 순서를 고려할 수 있고, 가변적인 길이의 입력 시퀀스들을 처리할 수 있다. 다만, 입력 시퀀스가 길어질수록 이전의 정보가 vanishing gradient 로 인해 소실되는 문제가 존재해, 이를 해결하기 위한 LSTM 이 등장하기도 했다.

Seq2Seq

LSTM 구조를 이용한 것으로, 언어모델의 가장 기본적인 형태를 갖춘다.
왼쪽의 Encoder 구조를 이용해 문장의 의미를 함축적으로 담은 Context Vector 가 생성되고, 이는 Decoder 의 입력으로 이용되어 알맞은 출력값을 생성하는 데 사용된다. 즉, Encoder 는 문장의 의미를 파악하는 역할을, Decoder 는 출력을 생성하는 역할을 하게 된다.

Transformer

이전까지의 모델들은 입력 시퀀스의 모든 단어들에 동일한 중요도를 부여했다. 하지만 자연어 문장의 의미 파악이 이루어질때는 분명 단어들의 중요도가 다르다. 이를 해결하기 위해 어떤 단어에 "집중"할지 계산하는 Attention Mechanism 이 등장한다.
각 단어의 중요도를 나타내는 Attention Score 를 계산하는 과정을 통해 의미 파악에 가장 중요한, 집중해서 분석해야 할 단어를 찝어내게 된다.
Attention 연산의 병렬 처리를 고려해 Scalability 를 개선한 구조가 오늘날 언어 모델의 기반이 되는 Transformer 구조다.

LLM

Transformer 의 등장과 하드웨어의 발전으로 인해 거대한 양의 파라미터를 가지는 언어모델인 LLM 이 등장하기 시작했다.

GPT (Generative Pretrained Transformer)

OpenAI 에서 개발한 Decoder 만을 활용해 여러 자연어 처리 태스크를 수행할 수 있도록 설계된 언어모델이다. 먼저 대규모 텍스트 데이터를 이용해 다음 토큰을 예측하는 작업을 우선 학습하고, 진행하려는 세부적은 태스크에 맞는 Fine-Tuning 을 진행하는 형식으로 학습된다. Decoder 를 이용한 Generation 에 특화된 모델이기 때문에 자연스러운 문장 생성과 여러 도메인에서 범용적인 생성 능력이 장점이다.

BERT (Bidirectional Encoder Representations from Transformers)

GPT 에 대항하기 위해 구글에서 개발한 언어모델이다. 문장을 양방향으로 이해하도록 사전학습한 뒤, 분류/질의응답 등 이해 작업에 활용된다. GPT 와는 다르게 Generation 태스크보다는 NLU (Natural Language Understanding) 에 특화되어 있다.

ChatOpenAI Parameters

파라미터범위/기본조정 효과
model"gpt-4o", "gpt-4-turbo"성능·비용 트레이드오프
temperature0 – 2 (0.7)창의성 ↔ 일관성
max_tokens≤ context응답 길이 제어
presence_penalty–2 ~ 2새로운 주제 유도
frequency_penalty–2 ~ 2반복 억제
tools / tool_choice함수 호출RAG, 액션 트리거
streamTrue/False토큰 실시간 전달
profile
ML Engineer @ ABLY

0개의 댓글