
.txt 문서 기반으로 유저가 자연어 질문을 하면문장이나 단어를 수치 벡터로 바꾸는 것
"파이썬은 무엇인가요?" → [0.12, -0.83, 0.57, ...]"나는 고양이를 좋아해" vs "나는 개를 좋아해"는 구조는 비슷하지만| 구분 | 설명 |
|---|---|
| LLM | 자연스러운 문장 생성 담당 |
| RAG | 외부 정보 검색 및 제공 담당 |
| 관계 | RAG는 LLM의 도우미, 전처리 구조이지 상위 개념은 아님 |
Code: https://github.com/mybeang/sandbox/blob/main/python_projects/ai_study/step1/step1.py
❓ 벡터화는 왜 필요한가?
→ 문장을 AI가 이해할 수 있는 수치로 바꿔서 비교하기 위해
❓ 모든 문장을 벡터화하면 너무 많지 않나?
→ 맞다. 그래서 문단 단위로 나눠서 관리, 검색 엔진으로 최적화
❓ 그럼 결국 LLM만 쓰면 되는 거 아냐?
→ LLM은 지식을 만들어내는 도구
→ 하지만 최신 지식을 반영하려면 RAG로 문서를 먼저 찾아줘야 함
❓ 최근 데이터 기반 LLM은 이 흐름의 확장인가?
→ 그렇다. 문서를 넘어서 DB, 코드, API까지 LLM이 처리하는 방향으로 발전 중