LLM이 이상하다면?

tjdxordlsmsa·2026년 4월 24일

LLM은 가끔 그럴듯한 거짓말을 아주 자신 있게 말하는 순간이 있는데, 그것을 Hallucination이라고 한다. Hallucination(환각)이란 사실이 아닌 내용을, 마치 사실인 것처럼 생성하는 현상(존재하지 않는 논문을 인용하거나 없는 사건이나 사실을 만들어냄)이다.
Hallucination이 생기는 이유는 LLM은 본질적으로 다음에 올 단어를 예측하는 모델이기 때문이다. LLM은 사실을 검증하는 것이 아니라 확률적으로 자연스러운 문장을 만드는 데 집중한다. 즉, 진실보다 '그럴듯함'을 확률적으로 선택할수도 있는 것이다.
Hallucination은 사용자 입장에서 신뢰성이 붕괴하는 것도 문제이지만, 고위험 분야에서는 특히 치명적일 수 있다. 의료 분야(오진 가능성), 법률 분야(존재하지 않는 판례 인용), 금융 분야(틀린 투자 정보) 등에서 Hallucination은 직접적인 피해를 발생시킬 수 있기 때문이다.
모델이 생성한 정보를 사람이 다시 검증하는 과정을 거쳐야 한다면, 시간과 비용이 증가하기 때문에 자동화 이점이 크게 줄어들게 된다. 그래서 LLM 서비스들은 Hallucination을 극복하기 위해 모델에 여러 전략들을 도입하였는데, 대표적으로는 RAG, Instruction Tuning & RLHF, Domain Fine-Tuning 등이 있다.

1. RAG (Retrieval-Augmented Generation)

RAG(검색증강)란 LLM이 자체 기억에만 의존해서 답하는 것이 아니라, 외부 문서/DB/API에서 관련 정보를 먼저 찾아본 뒤 그 정보를 참고해서 답변을 생성하는 방식이다. 기본 LLM은 학습된 파라미터 안에 들어있는 지식으로 답변하기 때문에, 모델 학습 이후에 생긴 최신 정보는 모르거나 부정확할 수 있고, 학습한 적 없는 정보들은 답할 수 없어 Hallucination이 발생하는 경우가 많았다. 그렇다고 해서 새로운 지식을 반영하기 위해 매번 LLM을 재학습시키기엔 비용이 너무 크기 때문에 RAG가 등장하였다. RAG 시스템은 다음과 같이 구성되어 있다.

문서 수집 ➡️ 문서 분할 Chunking ➡️ Embedding 변환
➡️ Vector DB 저장 ➡️ Query Embedding ➡️ 유사도 검색
✅ LLM 답변 생성

RAG는 보통 문서가 많고, 정보가 자주 바뀌며, 답변 근거가 중요한 태스크에 잘 맞는다. 대표적인 예시는 사내 문서 검색 챗봇, 논문 QA 시스템, 법률 판례 검색 등이 있다.

2. Instruction Tuning & RLHF

Instruction Tuning 과 RLHF는 '말을 잘하는 모델'에서 '사람이 원하는 방식으로 도와주는 모델'로 길들이는 것이다. Instruction Tuning은 질문-답변 쌍으로 데이터를 제공하고 모델에게 다양한 지시문과 그에 대한 모범 답변을 학습시키는 과정(SFT: Supervised Fine-Tuning)이다. 이를 통해서 모델의 지시 이해 능력과 출력 형식 제어 능력, Zero-shot 성능을 향상시킬 수 있으며 훨씬 사용자 친화적으로 응답할 수 있도록 할 수 있다. 그러나 Instruction Tuning은 답변 품질의 미묘한 차이를 학습하기 어렵고, 사람의 선호를 반영하기 어렵다는 문제가 있다.
이를 보완하기 위해 RLHF(Reinforcement Learning from Human Feedback: 인간 피드백 기반 강화학습)을 진행한다. RLHF는 사람이 더 좋아하는 답변을 모델이 더 자주 만들도록 학습시키는 과정으로, 모델이 단순히 정답을 따라 하는 것을 넘어서 사람의 선호를 학습하도록 하는 것이다. RLHF의 과정은 다음과 같다.

Base LLM ➡️ Instruction Tuning ➡️ SFT Model ➡️ Reward Model(prompt, answer) ➡️ Score

RLHF는 모델이 보상 높은 방향으로 업데이트하되, 한 번에 너무 많이 바뀌지 않도록 제어하기 위한 알고리즘(PPO)을 많이 쓴다. PPO(Proximal Policy Optimization)는 Reward Model의 허점을 이용해서 사람이 보기에는 별로인데 reward만 높은 답변을 만드는 것(reward hacking)을 막고 기존 SFT 모델과 너무 멀어지지 않도록 제약(KL Penalty)을 둔다.
RLHF를 통해 모델은 더 읽기 쉽고, 사람 입장에서 더욱 만족스러운 답변을 생성할 수 있다. 그러나, RLHF는 비용이 크고, 평가자 편향에 따라 특정 스타일에 치우칠 수 있으며, 아까도 언급한 Reward Hacking 문제가 발생할 수 있다.
최근에는 Reward Model과 PPO를 따로 쓰지 않고, 선호 데이터로 모델을 직접 학습시키는 DPO(Direct Preference Optimization)도 많이 사용되고 있다.

profile

0개의 댓글