LLM과 임베딩의 차이, LLM은 임베딩을 쓰지 않나?

Soogyung Gwon·2026년 5월 23일

구름을잡아라

목록 보기
61/76

1. 임베딩(embedding)이란?

임베딩은 텍스트를 숫자 벡터로 바꾸는 것으로 의미가 비슷한 단어는 벡터 공간에서도 가까워 진다.

2. LLM(Large Language Model)이란?

LLM은 대규모 언어 모델이다.

예)
OpenAI 의 GPT
Google의 Gemini
Meta의 Llama

LLM의 목적은:
다음 단어 예측, 문장 생성, 요약, 번역, 질의응답 등

3. LLM은 임베딩을 사용 하지 않는가?

아니다, LLM 내부에서도 임베딩은 반드시 사용한다.

텍스트
-> 토크나이저
-> 토큰 ID
-> 임베딩 벡터
-> Transformer
-> 출력

4. 임베딩 모델을 따로 쓰는 이유

LLM 내부에도 임베딩이 있지만 검색용 임베딩은 보통 별도의 모델을 사용한다.
이유는 목적이 다르기 때문에.

LLM 목표 vs 임베딩 모델의 목표

종류목적
LLM자연스러운 텍스트 생성
임베딩 모델의미를 잘 압축해서 벡터화

5. 왜 검색(RAG)에서는 임베딩 모델을 쓸까?

질문 -> 비슷한 문서 검색 -> LLM에게 전달
하는 과정이 필요하다.

여기서 비슷한 문서를 잘 찾기위해:

  • Sentence-BERT
  • BGE
  • E5
  • OpenAI embedding model

와 같은 임베딩 전용 모델을 사용하는 것이다.

6. LLM 자체 임베딩을 쓰면 안 되나?

쓸 수는 있지만 일반적으로 검색 품질이나 속도, 벡터 일관성의 측면에서 성능이 떨어지기 때문엔 임베딩 모델을 사용하는 것이 좋다.

LLM 자체 임베딩을 사용하는 경우에는

  • hidden state
  • CLS token
  • mean pooling

등으로 벡터를 뽑기도 한다.

profile
오랜시간 망설였던 코딩을 다시 해보려고 노력하고 있는 사람

0개의 댓글