ChatGPT와 멀티모달 AI

이원준·2026년 4월 17일

NLP

목록 보기
9/9

1. GPT-3란 무엇인가?

📌 GPT-3 한 줄 정의

GPT-3는 인터넷에 있는 방대한 텍스트를 읽고, 다음에 올 단어를 예측하는 방식으로 학습한 초거대 언어 모델입니다.

🔢 GPT-3 스펙 요약

항목내용
구조Transformer Decoder 96개 적층
학습 데이터3,000억(300B) 토큰의 텍스트
파라미터 수1,750억 개 (175B) — GPT-2의 약 116배
최대 토큰 길이2,048
학습 비용Tesla V100 Cloud 기준 1회 약 $4.6M (약 60억 원)
Fine-tuning불필요 — 별도 fine-tuning 없이 사용

🧠 GPT-3가 특별한 이유

GPT-3를 이전 모델과 구분짓는 가장 큰 특징은 규모(Scale) 입니다.

파라미터를 GPT-2의 15억 개에서 GPT-3의 1,750억 개로 무려 100배 이상 늘렸을 때, 단순히 성능이 좋아진 것을 넘어 새로운 능력이 창발(Emergence) 했습니다. 코드 작성, 번역, 수학 풀이 등 별도로 학습시키지 않은 task도 스스로 해낼 수 있게 된 것입니다.

📌 비유: 초등학교 수준의 책만 읽은 아이와, 수백만 권의 책을 독파한 사람의 차이입니다. 후자는 따로 배우지 않아도 처음 보는 문제를 유추로 풀 수 있습니다.


GPT-3가 생성한 가짜 뉴스 기사를 사람이 구분하는 데 성공한 비율은 단 52%였습니다. 동전 던지기 수준으로, 사실상 인간이 구분하지 못했다는 뜻입니다.


2. GPT의 Auto-regressive 생성 구조

📌 Auto-regressive란?

GPT가 텍스트를 생성하는 방식은 Auto-regressive(자기회귀) 방식입니다.

핵심 원리: 앞서 생성한 단어들을 다시 입력으로 삼아, 다음 단어를 예측하는 과정을 반복합니다.

🔄 단계별 생성 과정

아래처럼 "오늘 나는 카페에서 ___을 마셨다"를 생성하는 과정을 생각해 보세요.

Step 1: [오늘] → 모델 → "나는" 예측
Step 2: [오늘 나는] → 모델 → "카페에서" 예측
Step 3: [오늘 나는 카페에서] → 모델 → "커피를" 예측
Step 4: [오늘 나는 카페에서 커피를] → 모델 → "마셨다" 예측

매 스텝마다 이전에 생성된 모든 토큰을 함께 입력으로 넣고, 다음 하나의 토큰을 생성합니다. 이 과정이 반복되면서 문장이 완성됩니다.

🆚 BERT vs GPT의 Attention 구조 차이

모델Attention 방식특징
BERTBidirectional (양방향)앞뒤 문맥을 동시에 참조 → 이해에 강함
GPTMasked Self-Attention (단방향)현재 및 이전 토큰만 참조 → 생성에 강함

GPT는 Masked Self-Attention을 사용하기 때문에, 아직 생성하지 않은 미래 토큰을 "엿볼" 수 없습니다. 이것이 GPT가 단방향으로 작동하는 이유입니다.


3. GPT-3의 Few-shot Learning

GPT-3의 가장 혁신적인 특징 중 하나는 별도의 재학습 없이 몇 가지 예시만 보고 새로운 task를 수행하는 능력입니다.

📚 학습 패러다임 비교

학습 방식설명예시
지도학습 (Supervised)많은 레이블 데이터로 학습고양이 사진 1만 장으로 고양이 분류기 학습
Zero-shot Learning예시 없이 설명만으로 수행"다음 리뷰의 감성을 분류해줘: 맛있었어요"
One-shot Learning예시 1개만 주고 수행예시 1쌍을 보여준 뒤 새 task 수행
Few-shot Learning예시 몇 개만 주고 수행예시 2~10쌍을 보여준 뒤 새 task 수행

🌟 Few-shot 예시 (이메일 분류)

GPT-3에게 다음과 같이 예시를 주면, 별도 학습 없이 새로운 이메일도 분류할 수 있습니다.

예시 1:
이메일: "내일 회의 일정 확인 부탁드립니다."
카테고리: 업무

예시 2:
이메일: "이번 달 전기요금 청구서를 보내드립니다."
카테고리: 청구서

분류해줘:
이메일: "오늘 저녁 같이 밥 먹을 수 있어?"
카테고리: ???

→ GPT-3 출력: 개인

예시 2개만 보고도 새로운 이메일을 올바르게 분류합니다. 이것이 Few-shot Learning의 핵심입니다.


4. GPT-3 활용 사례

GPT-3는 단순한 텍스트 생성을 넘어 다양한 분야에 활용됩니다.

💻 SQL 코드 자동 생성

자연어 질문을 SQL 쿼리로 자동 변환합니다.

사용자 입력: "2024년에 가입한 회원 중 구매 금액이 100만 원 이상인 사람 목록을 보여줘"

GPT-3 출력:
SELECT *
FROM members
WHERE YEAR(join_date) = 2024
  AND total_purchase >= 1000000;

💬 Q&A (질의응답)

학습하지 않은 주제에 대해서도 맥락에 맞는 답변을 생성합니다.

📖 문장 이해 및 정보 추출

긴 문서를 읽고 핵심 정보를 추출하거나 표 형태로 정리합니다.

입력 문서:
"제주도에서 재배되는 감귤은 껍질이 얇고 당도가 높습니다.
 한라봉은 꼭지가 볼록하고 과육이 풍부하며 향이 진합니다.
 천혜향은 새콤달콤한 맛이 특징이며 과즙이 많습니다."

GPT-3 출력:
| 과일   | 특징                      |
|--------|---------------------------|
| 감귤   | 껍질 얇음, 높은 당도       |
| 한라봉 | 볼록한 꼭지, 진한 향       |
| 천혜향 | 새콤달콤, 풍부한 과즙      |

🎵 기타 창의적 활용

  • 앱·검색엔진·악보 자동 생성
  • 사업 아이디어 제안
  • 자동 프로그래밍 (Auto-programming)

5. Codex & AlphaCode — AI가 코드를 짜다

🔷 Codex (OpenAI, 2021)

항목내용
발표2021년 7월 (OpenAI)
기반GPT 언어 모델
파라미터3억 개 (300M)
학습 데이터GitHub 공개 코드 (159GB)
주요 제품GitHub Copilot (VS Code 확장 플러그인)

📌 비유: Codex는 수억 줄의 코드를 읽고 패턴을 익힌 "코드 자동완성 AI 비서"입니다. 함수 이름과 주석만 써도 본문을 자동으로 완성해 줍니다.


🔷 AlphaCode (DeepMind, 2022)

항목내용
발표2022년 2월 (DeepMind)
구조Transformer 기반 언어 모델
학습 데이터GitHub 공개 코드 (159GB)
성과Codeforces 프로그래밍 대회 상위 50% 달성

AlphaCode는 단순한 코드 자동완성을 넘어, 알고리즘 문제 풀이까지 가능한 수준으로 발전했습니다.


6. ChatGPT — GPT-3를 대화형으로 진화시키다

🆚 ChatGPT vs GPT-3 비교

항목ChatGPTGPT-3
발표2022년 11월2020년 6월
매개변수1억 1,700만 개 (117M)1,750억 개 (175B)
Fine-tuning 방법인간 피드백 강화학습 (RLHF)없음 (Zero-shot)
학습 데이터대화형 데이터일반 문서, 서적, 기사 등
주요 특징안전하고 자연스러운 대화범용 텍스트 생성

GPT-3보다 파라미터 수가 훨씬 적지만, RLHF 덕분에 훨씬 더 자연스럽고 안전한 대화가 가능합니다.


🔧 ChatGPT Fine-tuning 3단계 (RLHF)

ChatGPT는 일반 GPT-3와 달리 인간의 피드백으로 강화학습한 것이 핵심입니다.

[GPT-3 기반 모델]
        ↓
  1단계: SFT (지도 Fine-tuning)
        ↓
  2단계: Reward Model 학습
        ↓
  3단계: 강화학습 (PPO)
        ↓
[ChatGPT]

1단계: Supervised Fine-Tuning (SFT)

  • GPT-3를 초기 모델로 사용합니다
  • 40명의 전문 라벨러가 다양한 프롬프트에 대해 이상적인 답변을 직접 작성합니다
  • 이 데이터로 GPT-3를 지도학습 방식으로 fine-tuning합니다

📌 비유: AI에게 "이런 질문엔 이런 식으로 대답하면 돼"라고 정답지를 주면서 가르치는 단계입니다.

2단계: Reward Model (보상 모델) 학습

  • 1단계에서 fine-tuning된 SFT 모델이 여러 답변을 생성합니다
  • 라벨러들이 각 답변의 품질에 순위(ranking)를 매깁니다
  • 이 순위 데이터로 "어떤 답변이 더 좋은가"를 학습하는 보상 모델을 만듭니다

📌 비유: AI의 답변 여러 개를 놓고 "이게 제일 낫고, 이건 별로야"라고 채점표를 만드는 단계입니다.

3단계: 강화학습으로 최종 모델 생성

  • SFT 모델을 강화학습 에이전트로 사용합니다
  • 생성한 답변을 Reward Model에 넣어 점수를 받습니다
  • 점수가 높아지는 방향으로 모델 파라미터를 업데이트합니다 (PPO 알고리즘)

📌 비유: 시험을 보고 → 채점 받고 → 틀린 부분을 고치는 과정을 수천만 번 반복하는 단계입니다. 이것이 바로 RLHF(Reinforcement Learning from Human Feedback) 입니다.


7. 언어 생성 모델의 Decoding 전략

GPT 같은 언어 모델이 다음 단어를 고를 때, 어떤 방법으로 선택하느냐에 따라 결과가 달라집니다. 이를 Decoding 전략이라고 합니다.

전략 1: Greedy 전략

매 스텝마다 확률이 가장 높은 단어 하나만 선택합니다.

입력: "오늘 저녁 메뉴로"
확률 분포: 치킨(0.45) > 피자(0.30) > 파스타(0.15) > 기타(0.10)
→ 항상 "치킨" 선택
  • 장점: 빠르고 결과가 일관됩니다
  • 단점: 항상 같은 결과, 창의성이 없습니다. 초반 실수가 전체 문장을 망칠 수 있습니다

전략 2: Sampling 전략

확률 분포에 따라 랜덤으로 단어를 선택합니다. 확률이 높을수록 선택될 가능성이 높지만, 낮은 확률의 단어도 선택될 수 있습니다.

입력: "오늘 저녁 메뉴로"
확률 분포: 치킨(0.45), 피자(0.30), 파스타(0.15), 기타(0.10)
→ 실행할 때마다 다른 결과 가능: "피자", "치킨", "파스타" ...
  • 장점: 다양하고 창의적인 결과를 생성합니다
  • 단점: 결과가 매번 달라지고, 가끔 엉뚱한 단어가 나올 수 있습니다

전략 3: Beam Search 전략

매 스텝마다 상위 b개의 후보 시퀀스를 유지하면서 가장 좋은 전체 문장을 탐색합니다.

b=2 (빔 크기 2) 예시:
Step 1: 후보 유지 → "치킨을", "피자를"
Step 2: 각각에서 2개 확장
         → "치킨을 먹고 싶다", "치킨을 시켰다"
         → "피자를 주문했다", "피자를 좋아한다"
Step 3: 전체 확률이 가장 높은 시퀀스 최종 선택

📌 비유: 길을 찾을 때 한 길만 가보는 게 아니라, 2~3개의 길을 동시에 탐색하다가 목적지에 가장 가깝게 도달하는 경로를 선택하는 것과 같습니다.

  • 장점: Greedy보다 훨씬 좋은 문장 품질을 냅니다
  • 단점: 계산 비용이 크고, 여전히 다양성이 부족할 수 있습니다

8. Hallucination — AI가 거짓말을 하는 이유

🌀 Hallucination(환각) 현상이란?

AI 언어 모델이 사실이 아닌 내용을 사실처럼 자신 있게 생성하는 현상입니다.

사용자: "세종대왕의 어머니 이름이 뭐야?"
AI 답변: "세종대왕의 어머니는 '소헌왕후 심씨'입니다."
(실제로는 세종의 어머니는 원경왕후 민씨이며, 소헌왕후는 세종의 아내입니다.)

이처럼 AI는 틀린 정보를 아무런 의심 없이, 오히려 자신 있는 말투로 전달합니다.

❓ 왜 발생할까요?

언어 모델은 "사실을 기억하는 데이터베이스"가 아니라, "다음에 올 확률이 높은 단어를 생성하는 모델" 입니다. 문맥상 그럴듯한 단어를 생성하다 보니, 사실과 다른 내용도 자연스럽게 만들어냅니다.

구글 CEO 선다 피차이의 말: "AI 챗봇에 발생하는 환각 현상은 여전한 AI의 걸림돌입니다. 발생 이유는 아무도 모릅니다. 그래서 명확한 해결책도 없습니다."

⚠️ 실제 주의사항

상황주의점
법률·의학 정보 질문AI 답변을 맹신하지 말고 전문가에게 확인하세요
역사적 사실출처를 직접 검색해서 교차 검증하세요
최신 뉴스학습 데이터 이후 사건은 모르거나 잘못 말할 수 있습니다
숫자·통계AI가 자신 있게 말해도 실제 수치와 다를 수 있습니다

9. Vision Transformer (ViT)

📌 ViT란?

Vision Transformer는 이미지를 Transformer 구조로 처리하는 모델입니다. NLP에서 강력했던 Transformer를 이미지 분야에 그대로 적용한 것이 핵심입니다.

📌 비유: 책을 읽는 방법으로 그림을 이해하는 것과 같습니다. 그림을 여러 조각으로 나누고, 각 조각을 "단어"처럼 취급하여 Transformer로 처리합니다.

🔄 ViT의 5단계 작동 방식

[원본 이미지]
      ↓
1단계: Image Patching (이미지 조각내기)
      ↓
2단계: Embedding (각 조각을 벡터로 변환)
      ↓
3단계: Position Encoding (위치 정보 추가)
      ↓
4단계: Transformer Encoder (관계 학습)
      ↓
5단계: Classification Head (분류 결과 출력)

Step 1. Image Patching — 이미지를 조각내기

이미지를 고정 크기의 정사각형 패치(patch) 로 나눕니다.

예시: 480×480 크기의 고양이 사진을 30×30 패치로 나누면
→ 총 (480/30) × (480/30) = 16 × 16 = 256개의 패치 생성

각 패치는 NLP에서의 "단어(토큰)" 와 동일한 역할을 합니다.


Step 2. Embedding — 숫자 벡터로 변환

각 패치를 1D 벡터로 펼친 뒤, 선형 레이어(Linear Projection) 를 통과시켜 고정 크기의 임베딩 벡터로 변환합니다.

30×30×3(RGB) 패치 → 2700차원 벡터 → 선형 변환 → 768차원 임베딩 벡터

Step 3. Position Encoding — 위치 정보 추가

Transformer는 순서를 자동으로 인식하지 못합니다. 패치가 이미지의 어느 위치에 있는지 알려주기 위해 위치 인코딩을 더합니다.

1번 패치 (좌상단) + 위치 벡터(1)
2번 패치 (우상단) + 위치 벡터(2)
...

Step 4. Transformer Encoder — 관계 학습

위치 정보가 담긴 임베딩 벡터들을 Transformer Encoder에 입력합니다. Self-attention을 통해 각 패치가 다른 패치들과의 관계를 학습합니다.

📌 비유: 고양이의 귀 조각이 "근처에 눈 조각과 콧수염 조각이 있으니, 이건 고양이 얼굴이겠구나"를 스스로 파악하는 과정입니다.


Step 5. Classification Head — 최종 분류

Transformer의 출력을 MLP(다층 퍼셉트론) 레이어에 통과시켜 최종 분류 결과를 출력합니다.


10. CLIP — 이미지와 텍스트를 연결하다

📌 CLIP이란?

CLIP(Contrastive Language-Image Pre-training) 은 OpenAI가 개발한 모델로, 이미지와 텍스트를 같은 임베딩 공간에 배치하여 서로 연결하는 방법을 학습합니다.

핵심 아이디어: "진돗개 사진"과 "진돗개" 텍스트는 의미가 같으니, 두 벡터가 가깝게 위치해야 한다.

📊 학습 데이터

데이터셋규모
MS-COCO, Visual Genome고품질 100,000개
YFCC100M (필터링 후)고품질 1,500만 개
인터넷 수집 (이미지+텍스트 pair)4억 개

텍스트 쿼리는 위키피디아에 100번 이상 등장하는 단어 50만 개로 구성했습니다.


🎯 CLIP의 학습 원리 — Contrastive Learning (대조학습)

핵심: 올바른 이미지-텍스트 쌍은 가깝게, 잘못된 쌍은 멀게 학습합니다.

배치 예시 (N=3):
이미지 1: 🐕 진돗개 사진    텍스트 1: "진돗개"
이미지 2: 🌸 벚꽃 사진     텍스트 2: "벚꽃이 만개한 공원"
이미지 3: ⛰️ 설악산 사진   텍스트 3: "가을 단풍 산"

NxN 행렬을 구성하면:

텍스트1텍스트2텍스트3
이미지1✅ Positive❌ Negative❌ Negative
이미지2❌ Negative✅ Positive❌ Negative
이미지3❌ Negative❌ Negative✅ Positive
  • 대각선 (Positive pair): 코사인 유사도를 최대화합니다
  • 비대각선 (Negative pair): 코사인 유사도를 최소화합니다

🔍 CLIP의 Zero-shot 분류

CLIP은 fine-tuning 없이 zero-shot으로 이미지 분류가 가능합니다.

분류할 클래스: 진돗개, 시바이누, 골든리트리버

Prompt engineering:
→ "A photo of a 진돗개"
→ "A photo of a 시바이누"
→ "A photo of a 골든리트리버"

쿼리 이미지 → Image Encoder → 이미지 벡터
세 텍스트 → Text Encoder → 텍스트 벡터 3개

→ 이미지 벡터와 가장 유사도가 높은 텍스트 벡터의 클래스가 정답!

"진돗개 사진"을 단 한 번도 학습하지 않아도, "A photo of a 진돗개" 텍스트 벡터와의 유사도가 가장 높게 나오면 분류 성공!

✍️ Prompt Engineering 기법

단순히 레이블명을 쓰는 것보다 문장으로 감싸면 성능이 올라갑니다.

방법예시
기본진돗개
기본 PromptA photo of a 진돗개
맥락 추가A photo of a 진돗개, a type of dog
앙상블A photo of a big 진돗개 + A photo of a small 진돗개

⚙️ CLIP 학습 스펙

항목내용
Image EncoderResNet-50 계열 or Vision Transformer (ViT)
Text EncoderTransformer (GPT-2 기반)
Mini-batch 크기32,768 (매우 큼)
학습 규모V100 GPU 592개 × 18일 소요

11. DALL-E — 텍스트로 이미지를 만들다

📌 DALL-E 시리즈 소개

버전발표특징
DALL-E2020년 9월GPT-3 기반, 텍스트 → 이미지 생성
DALL-E 22021년 10월CLIP 활용, 더 높은 품질
DALL-E 32023년 9월완전한 멀티모달 모델

DALL-E는 단순히 기존 이미지를 검색하는 것이 아니라, 완전히 새로운 이미지를 생성합니다. 존재하지 않는 개념도 그려낼 수 있습니다.

DALL-E 프롬프트 예시:
- "우주복을 입고 피아노를 치는 고양이"
- "빈센트 반 고흐 화풍으로 그린 서울 야경"
- "수박 모양의 스마트폰 케이스"

🏗️ DALL-E 2의 구조

DALL-E 2는 크게 두 부분으로 나뉩니다.

[텍스트 프롬프트 입력]
       ↓
--- CLIP Embedding Process ---
Text Encoder (CLIP)
  ↓ CLIP Text Embedding

Image Encoder (CLIP) ← 학습 시 이미지-텍스트 pair 정렬에 사용

--- Text-to-Image Generation Process ---
       ↓
  Prior 모델
  (텍스트 임베딩 → 이미지 임베딩으로 변환)
       ↓
  Image Decoder
  (이미지 임베딩 → 실제 이미지 확률적 생성)
       ↓
[최종 이미지 출력]

각 구성 요소 역할

구성 요소역할
Text Encoder (CLIP)텍스트를 의미 공간의 벡터로 변환합니다
Prior 모델텍스트 임베딩을 이미지 임베딩 공간으로 매핑합니다
Image Decoder이미지 임베딩을 실제 픽셀 이미지로 생성합니다 (확률적)

Prior 모델이 핵심입니다. "파란 하늘"이라는 텍스트 벡터를 "실제 파란 하늘처럼 보이는 이미지" 벡터로 변환하는 다리 역할을 합니다.


12. 멀티모달 AI란?

📌 정의

멀티모달 AI(Multimodal AI) 는 텍스트, 이미지, 오디오, 비디오 등 다양한 형태의 데이터를 동시에 처리하고 이해하는 인공지능 기술입니다.

📌 비유: 사람이 정보를 받아들이는 방식과 같습니다. 우리는 눈(시각)으로 보고, 귀(청각)로 듣고, 동시에 텍스트를 읽으면서 종합적으로 이해합니다. 멀티모달 AI도 마찬가지입니다.

단일 모달 AI: 텍스트만 → 텍스트 출력
멀티모달 AI: 텍스트 + 이미지 + 음성 → 통합 이해 → 텍스트/이미지/음성 출력

💡 멀티모달 AI 활용 예시

입력처리출력
음식 사진이미지 인식 + 영양 정보 DB"이 음식은 약 520kcal로 탄수화물이 높습니다"
강의 영상 + 음성영상 분석 + 음성 인식자동 자막 + 강의 요약
손으로 그린 스케치이미지 이해 + 생성완성된 디자인 이미지
"이 사진에서 개를 찾아줘"텍스트 이해 + 이미지 분석이미지 내 개 위치 표시

🎥 VATT — Video, Audio, Text Transformer

VATT(Vision, Audio, Text Transformer) 는 동영상, 오디오, 텍스트 세 가지 모달리티를 동시에 처리하는 멀티모달 모델입니다.

입력 처리 방식

모달리티입력 형태변환 방식
Video3D RGB Voxel (비디오 프레임)Linear Projection → 임베딩
Audio1D 파형 (Waveform)Linear Projection → 임베딩
Text1-hot word vectorLinear Projection → 임베딩

세 모달리티의 임베딩 벡터는 공통 임베딩 공간으로 투영된 뒤, 대조학습(Contrastive Learning) 으로 서로 연관된 데이터끼리 가깝게 배치되도록 학습합니다.

📌 비유: 뉴스 영상, 아나운서 목소리, 뉴스 자막이 같은 내용을 담고 있으면, 세 가지의 벡터가 서로 가까운 공간에 위치하도록 학습합니다.


13. LLM (Large Language Model) 개요

📌 LLM이란?

LLM(대규모 언어 모델) 은 수천억 개의 파라미터를 가진 초거대 언어 모델로, 사전학습(Pre-training)과 미세조정(Fine-tuning)을 통해 다양한 자연어 처리 작업을 수행합니다.

🌟 LLM의 핵심 특징 4가지

특징설명
방대한 지식수천억 단어의 텍스트 학습으로 다양한 언어 패턴 습득
범용 Task 수행질문응답, 번역, 요약, 코드 생성 등 단일 모델로 처리
Few/Zero-shot Learning예시가 없거나 적어도 새로운 task 수행 가능
멀티모달텍스트 외 이미지, 음성, 동영상 등 다양한 입력 처리

14. 최신 LLM 모델 비교

모델발표개발사주요 특징활용 분야
GPT-4o2024OpenAI텍스트·이미지·음성 다중 모달 지원, 빠른 응답AI 챗봇 (ChatGPT)
Claude 32024Anthropic안전성 강화, 강력한 추론·논리적 사고AI 윤리·법률 도구, 교육·연구 보조
Gemini 1.52024Google멀티모달 처리, 1백만 토큰 이상의 컨텍스트 지원복잡한 대화형 AI, 다국어 번역
Llama 32024Meta오픈소스 LLM경량화 AI 모델 연구
o12025OpenAI강화학습 기반 고급 추론 능력학술 논문 분석, 연구 가설 제안
DeepSeek2025DeepSeek오픈소스(MIT), MoE 구조, 저비용 고효율개선 저비용 고효율 추구

💡 모델 선택 가이드

💬 자연스러운 대화 + 빠른 응답이 중요하다면 → GPT-4o
🔒 안전성 + 논리적 분석이 필요하다면 → Claude 3
📄 매우 긴 문서 처리가 필요하다면 → Gemini 1.5 (100만 토큰 지원)
🔓 직접 커스터마이징하고 싶다면 → Llama 3 / DeepSeek (오픈소스)
🔬 복잡한 수학·과학 추론이 필요하다면 → o1

15. LLM API와 LangChain

🔌 LLM API란?

API(Application Programming Interface) 는 내가 만든 애플리케이션에서 LLM의 기능을 간편하게 불러다 쓸 수 있는 인터페이스입니다.

📌 비유: 레스토랑에서 음식을 직접 만들 줄 몰라도 메뉴를 주문하면 음식이 나오듯, 복잡한 AI 모델을 직접 구축하지 않아도 API를 호출하면 결과를 받을 수 있습니다.

주요 LLM API 제공 업체

업체제품특징
OpenAIGPT-4, GPT-4o가장 널리 사용되는 범용 AI API
AnthropicClaude 3안전성과 긴 컨텍스트에 강점
Google DeepMindGeminiGoogle 서비스 연동에 유리

API 활용 시 고려사항

  • 요금 구조: 토큰(입력+출력) 수에 따라 과금됩니다
  • 요청 제한(Rate Limit): 분당·일당 요청 횟수 제한이 있습니다
  • 보안 및 개인정보: API로 보내는 데이터가 외부 서버를 통하므로 민감 정보 주의가 필요합니다

🔗 LangChain — LLM 앱 개발 프레임워크

LangChain은 LLM을 활용한 애플리케이션 개발을 쉽게 해주는 파이썬/자바스크립트 프레임워크입니다.

📌 비유: 웹 개발에서 React나 Django 같은 프레임워크처럼, LangChain은 LLM 앱 개발의 뼈대를 제공합니다. 처음부터 모든 것을 짜지 않아도 됩니다.

LangChain의 주요 기능

기능설명
자연어 처리LLM 호출, 프롬프트 관리
데이터 연결외부 문서·데이터베이스 연동
메모리 관리대화 히스토리 관리
API 통합다양한 외부 서비스 연결

장점과 단점

장점단점
복잡한 앱을 모듈화하여 개발 가능과도한 추상화로 개발 효율 저하 가능
다양한 외부 데이터·API 통합 인터페이스추가 연산 부담으로 성능 저하 가능
오픈소스, 활발한 커뮤니티초보자에게 학습 곡선이 높음
지속적인 업데이트잦은 버전 변경으로 업그레이드 부담

🗺️ 전체 흐름 한눈에

[GPT-3] ─── 언어 이해 + 생성의 기초
    │
    ├── [ChatGPT] ─── RLHF로 대화에 특화
    │
    ├── [Codex/AlphaCode] ─── 코드 생성에 특화
    │
    └── [GPT-4o] ─── 멀티모달로 진화

[Vision Transformer (ViT)] ─── 이미지를 언어처럼 처리
    │
    ├── [CLIP] ─── 이미지 ↔ 텍스트 연결
    │     └── [DALL-E 2] ─── 텍스트 → 이미지 생성
    │
    └── [VATT] ─── 영상 + 오디오 + 텍스트 통합

[LLM 시대] ─── GPT-4o, Claude 3, Gemini, Llama, DeepSeek
    │
    └── [LangChain / LLM API] ─── 실전 앱 개발 도구

16. 핵심 개념 정리

용어의미
GPTTransformer Decoder 기반의 단방향 텍스트 생성 모델
Auto-regressive이전 출력을 다음 입력으로 사용하는 순차적 생성 방식
Few-shot Learning몇 가지 예시만 보고 새로운 task를 수행하는 능력
RLHF인간의 피드백으로 보상 모델을 만들어 강화학습하는 방식
HallucinationAI가 사실이 아닌 내용을 사실처럼 생성하는 현상
Greedy Decoding매 스텝 확률 최고 단어를 선택하는 단순한 전략
Beam Search여러 후보 시퀀스를 유지하며 최적 문장을 탐색하는 전략
ViT이미지를 패치로 나눠 Transformer로 처리하는 이미지 모델
CLIP이미지와 텍스트를 같은 임베딩 공간에 배치하는 멀티모달 모델
Contrastive Learning유사한 데이터는 가깝게, 다른 데이터는 멀게 학습하는 방식
DALL-E텍스트 프롬프트로 새로운 이미지를 생성하는 모델
Multimodal AI텍스트·이미지·음성 등 다양한 입력을 동시에 처리하는 AI
LLM수천억 파라미터를 가진 초거대 언어 모델
LangChainLLM 기반 앱 개발을 지원하는 오픈소스 프레임워크
Prompt EngineeringAI의 출력 품질을 높이기 위해 입력 문장을 설계하는 기술


🎯 마무리 퀴즈

Q1. GPT와 BERT의 Attention 구조 차이가 텍스트 생성/이해 능력에 미치는 영향은?

정답: GPT는 Masked Self-Attention으로 이전 토큰만 참조하는 단방향 구조라 다음 단어 예측(생성)에 최적화되어 있습니다. BERT는 양방향 Attention으로 앞뒤 문맥을 동시에 보기 때문에 문장 이해(분류, 질의응답)에 강합니다. 즉, GPT는 생성, BERT는 이해에 특화된 구조입니다.


Q2. ChatGPT가 GPT-3보다 파라미터가 훨씬 적음에도 더 자연스러운 대화가 가능한 이유는?

정답: ChatGPT는 RLHF(인간 피드백 강화학습)로 fine-tuning되었기 때문입니다. ① 사람이 직접 이상적인 답변을 작성하여 SFT 모델을 만들고, ② 답변 품질에 순위를 매겨 Reward Model을 학습하고, ③ 강화학습으로 보상이 높은 방향으로 모델을 개선했습니다. 파라미터 수보다 '어떻게 학습하느냐'가 대화 품질을 결정합니다.


Q3. CLIP이 별도의 fine-tuning 없이 zero-shot 이미지 분류가 가능한 이유는?

정답: CLIP은 4억 개의 이미지-텍스트 쌍으로 Contrastive Learning을 수행하여, 이미지와 텍스트를 같은 임베딩 공간에 배치했습니다. 분류 시 클래스 레이블을 "A photo of a {label}" 형태의 텍스트로 변환하여 텍스트 벡터를 만들고, 쿼리 이미지의 벡터와 코사인 유사도를 비교합니다. 가장 유사한 텍스트 벡터의 클래스가 곧 예측 결과가 되므로, 별도 학습 없이도 분류가 가능합니다.


Q4. AI 언어 모델에서 Hallucination(환각) 현상이 발생하는 근본적인 이유는?

정답: 언어 모델은 사실을 저장하는 데이터베이스가 아니라, '문맥상 다음에 올 확률이 높은 단어'를 생성하는 모델이기 때문입니다. 모델은 정확한 사실보다 그럴듯하게 들리는 단어 시퀀스를 선택하도록 학습되어 있어, 사실과 다른 내용도 자신 있는 말투로 생성할 수 있습니다. 이것이 Greedy/Sampling 등 어떤 Decoding 전략을 써도 완전히 해결되지 않는 이유입니다.


0개의 댓글