#Day59 AI 활용

D0-$ANG ₩0N·2026년 1월 25일
post-thumbnail

0.수업내용중 전달사항

프로젝트 주제 선정에 대한 전반적 방향

이번 프로젝트에서 가장 중요한 것은 주제를 빨리 정하는 것보다, 잘 정하는 것이다.
이미 존재하는 예제를 그대로 구현하는 수준에서 그치면, 단순한 CV(Computer Vision) 실습이나 튜토리얼 재현에 불과해져 취업용 포트폴리오로서의 가치가 낮아진다.

  • 단순 구현 X
  • 기존 예제를 어떻게 응용하고 확장할 것인지가 핵심
  • “구현 가능성”과 “차별성”을 함께 고려해야 함

제시된 주요 프로젝트 주제 2가지

이미지 기반 캡차(CAPTCHA) 서비스

  • ImageNet 등을 활용한 이미지 분류 기반 캡차
  • 단순한 “로봇이 아닙니다” 수준은 의미 없음
  • 난이도 조절, 단계별 문항, 새로운 분류 체계 등 추가 아이디어 필요
  • 기존에 공개된 예제는 이미 구글링으로 다 확인 가능 → 그대로 쓰면 감점

영화 데이터 기반 추천 서비스

  • 영화 데이터셋을 활용한 연관 영화 추천
  • 단순한 장르/선호도 추천은 너무 쉬움
  • 사용자 행동 패턴 분석 + 영화 특성 데이터의 비교가 핵심
  • 실제로 존재하지 않는 데이터(액션 강도, 분위기 등)는 시뮬레이션 방식으로 접근 가능

프로젝트 명과 기능 구성에 대한 핵심 포인트

  • 프로젝트 명은 제시된 주제를 포함하되, 플러스 알파를 반드시 붙여야 함
  • 예시:
    • “ImageNet 기반 이미지 캡차 서비스 구축”
    • “Movie 데이터 기반 연관 영화 추천 서비스 구축”
  • 단, 한 프로젝트 안에 두 개의 기능(예: 추천 + 캡차)을 함께 넣어도 문제 없음
  • 프로젝트 명 ≠ 구현 가능한 기능의 한계

한계

영화 추천 프로젝트의 현실적 한계

  • 모든 영화 데이터를 수집하는 것은 불가능
  • 100개 영화 샘플링조차 쉽지 않음
  • 따라서:
    • 텍스트 기반 정보 추출
    • 시뮬레이션 데이터 활용
    • 비교 데이터 구조 설계가 중요

이미지 캡차 프로젝트의 장점

  • 정형화된 데이터셋 활용 가능
  • 상대적으로 빠른 결과물 도출 가능
  • 대신 기획과 응용 아이디어가 핵심 차별점

AI 프로젝트 공통 핵심 개념

모든 프로젝트에 공통으로 적용되는 개념:

  • 데이터 수집 및 구축
  • 전처리 (정형 / 비정형 데이터)
  • 학습 데이터와 비교 데이터의 매칭
  • 매칭률 향상을 위한 전략
  • 결과 검증 및 개선

단순히 모델을 쓰는 것이 아니라,
왜 이 모델을 쓰는지 / 어떤 데이터를 비교하는지를 설명할 수 있어야 함.


1. 자연어 처리(NLP)와 관련된 핵심 키워드 정리

면접 대비 및 개념 이해용으로 반드시 알아야 할 키워드:

  • NLU / NLG
  • 토큰화, 임베딩
  • 코퍼스
  • 형태소 분석
  • 품사 태깅
  • 구문 분석 (구구조 / 의존구조)
  • 의미 분석
  • 중의성 해소
  • 확률, 확률분포
  • 기대값, 분산
  • 엔트로피 (불확실성의 크기)
  • MLE / MAP

※ 모든 수식을 외울 필요는 없지만, 의미와 쓰임은 설명 가능해야 함


2. 엔트로피 핵심 개념 요약

모델이 얼마나 불확실한지(헷갈리는지)를 수치로 표현한 개념


AI에서 엔트로피(Entropy) 한 번에 이해하기

AI에서 말하는 엔트로피(Entropy) 는 한 문장으로 요약하면 다음과 같다.

모델이 현재 얼마나 불확실하고 헷갈리고 있는지를 수치로 표현한 개념이다.

이 문서는 정보이론에서 시작해 AI, 그리고 GPT 같은 언어모델까지 이어지는 엔트로피 개념을 Velog용으로 간결하게 정리한 요약본이다.


1. 엔트로피의 출발점: 정보이론

엔트로피는 정보이론의 창시자 클로드 섀넌이 정의한 개념이다.
핵심 질문은 단순하다.

어떤 사건의 결과를 예측하기 얼마나 어려운가?

결과를 예측하기 어려울수록 엔트로피는 높고,
결과가 거의 확실할수록 엔트로피는 낮다.

공정한 동전 던지기는 앞과 뒤가 반반이기 때문에 예측이 어렵고 엔트로피가 높다.
앞면이 99% 나오는 동전은 결과가 거의 정해져 있어 엔트로피가 낮다.

즉, 불확실성의 정도가 엔트로피다.


2. AI에서 엔트로피가 중요한 이유

AI 모델은 항상 하나의 정답을 바로 내놓는 것이 아니라,
각 선택지에 대한 확률 분포를 만든다.

엔트로피는 이 확률 분포를 보고 다음을 판단한다.

모델이 지금 이 판단을 얼마나 확신하고 있는가?

확률이 한 클래스에 몰려 있으면 엔트로피는 낮고,
여러 클래스에 비슷하게 퍼져 있으면 엔트로피는 높다.


3. 엔트로피 수식의 의미 (직관 중심)

엔트로피는 수식으로 정의되지만, 수식을 외울 필요는 없다.

중요한 해석은 두 가지다.

확률이 고르게 퍼질수록 엔트로피는 증가한다.
확률이 특정 결과에 집중될수록 엔트로피는 감소한다.

즉, 엔트로피는 확률 분포의 “흐트러짐 정도”를 나타낸다.


4. 엔트로피 상태 비교

엔트로피가 낮은 경우는 모델이 거의 확신하는 상황이다.
하나의 선택지가 압도적인 확률을 가질 때 발생한다.

엔트로피가 높은 경우는 모델이 헷갈리는 상황이다.
여러 선택지의 확률이 비슷하게 나뉘어 있을 때 발생한다.

이 경우 모델의 판단 리스크는 커진다.


5. GPT 같은 언어모델에서의 엔트로피

언어모델은 문장을 한 번에 생성하지 않는다.
매 순간 다음 단어에 대한 확률 분포를 계산한다.

다음에 올 단어 후보들의 확률이 비슷하면 엔트로피가 높다.
특정 단어가 거의 확실하면 엔트로피가 낮다.

그래서 어떤 문장은 다양한 방향으로 이어질 수 있고,
어떤 문장은 거의 정해진 표현으로 이어진다.


6. Temperature와 엔트로피의 관계

Temperature는 확률 분포의 퍼짐 정도를 조절하는 값이다.

Temperature가 높아질수록 확률 분포가 고르게 퍼지고 엔트로피가 증가한다.
Temperature가 낮아질수록 확률 분포가 한쪽으로 몰리고 엔트로피가 감소한다.

정리하면 다음과 같다.

낮은 Temperature: 보수적이고 결정적인 출력
높은 Temperature: 창의적이고 랜덤한 출력


7. Cross Entropy Loss와의 연결

딥러닝 학습에서 자주 사용하는 손실 함수가 Cross Entropy Loss다.

이는 정답 분포와 모델 예측 분포가 얼마나 다른지를 측정한다.

예측이 틀릴수록 크로스 엔트로피는 커지고,
예측이 정확할수록 작아진다.

결국 모델 학습의 목표는
정답에 대한 불확실성, 즉 엔트로피를 줄이는 것이다.


8. 실무에서 엔트로피가 쓰이는 이유

엔트로피는 단순한 이론 개념이 아니라 실무에서 매우 중요하다.

첫째, 불확실성 감지
엔트로피가 높은 결과는 사람이 직접 검토해야 할 신호가 된다.
의료, 자율주행 같은 분야에서 필수적이다.

둘째, Active Learning
엔트로피가 높은 데이터만 골라서 추가 학습에 사용한다.

셋째, 이상 탐지
평소보다 엔트로피가 급격히 높아지면 비정상 상황일 가능성이 있다.


9. 한 문장 요약

AI에서 엔트로피는
모델이 현재 얼마나 헷갈리고 있는지를 수치로 표현한 지표다.



10. 개인 과제 및 권장 사항

15번: 면접 대비용 정리

  • AI / ML / NLP 키워드를 질문-답변 형식으로 정리
  • 용어 사전식 정리 X
  • “왜 이 개념이 필요한가” 중심

16번: 개인 실습 폴더

  • 개인 실험용 코드 정리
  • React + Python 연동 예제
  • 이미지 / 텍스트 처리 응용 실습

profile
Change Up

0개의 댓글