교육4주차(1)

Taixi·2024년 9월 7일

생성형 AI 교육

목록 보기
9/35
post-thumbnail

이상탐지(Anomaly Detections)


  • 밀도 추정기법(Density Estimation)
  • 단점:
    • 적절한 확률 분포를 찾는것이 어렵다.
    • 다 차원 데이터에서는 잘 동작하기 어렵다
  • 가우시안분포

추천시스템(Recommeder System)


  • 유저의 선호도 및 과거 행동을 바탕으로 개인에 맞는 관심사를 제공하는 분야
  • 종류
    Content-based Filtering : 해당 아이템의 도메인을 활용한 것으로 유저가 관심있는 아이템의 속성을 분석하여 새로운 아이템을 추천해주는 것
    Collaborative Filtering: 유저-아이템의 관계(User-Item interaction)로부터 도출되는 추천 시스템

교차 검증(Cross Validation)

  • Train 과 Test 으로 구성이 되어 있음
  • Train set을 다시 Validation과 Train으로 나누지 않으면 모델 검증을 위해 Test을 사용해야하며 고정된 Test셋을 가지고 모델 성능을 확인하고 파라미터를 수정할 경우, Test set에 과적합이 올수가 있음

장점과 단점


장점

  • 모든 데이터 셋을 평가에 활용 할 수 있음
  • 모든 데이터 셋을 훈련에 활용 할 수 있음

단점

  • 모델 평가와 훈련에 시간이 오래 걸림

Cross Validation 기법 종류
- K-Fold Cross Validation(k-겹 교차 검증)
- Stratified k-fold cross validation(계층별 k-겹 교차검증)
- Hold-Out Cross Validation(홀드 아웃 교차 검증)
- Leave-p-Out Cross Validation
- Leave-One-Out Cross Validation

✏️가중치 업데이트에는 영향을 미치지않지만 학습과정에서 참조하며, 성능에는 활용

from sklearn.tree import DecisionTreeClassifier
from sklearn.model_selection import cross_val_score , cross_validate
from sklearn.datasets import load_iris
import numpy as np

iris_data = load_iris()
dt_clf = DecisionTreeClassifier(random_state=156)

data = iris_data.data
label = iris_data.target

# 성능 지표는 정확도(accuracy) , 교차 검증 세트는 3개 
scores = cross_val_score(dt_clf , data , label , scoring='accuracy',cv=3)
print('교차 검증별 정확도:',np.round(scores, 4))
print('평균 검증 정확도:', np.round(np.mean(scores), 4))

자료참고

https://brunch.co.kr/@linecard/541
https://velog.io/@vvakki_/추천-시스템Recommendation-System-개요
https://blog.naver.com/ckdgus1433/221599517834
https://huidea.tistory.com/30

profile
개발자를 위한 첫시작

0개의 댓글