ai용어 정의

장원녕·2023년 6월 22일

회귀 : 두 변수 사이의 상관관계를 분석하는 방법

k- 최근접 이웃 회귀 : 이웃한 샘플들의 타깃값을 평균화하여 수치로 나타낸 것.

결정계수 : 예측한 임의의 수치

mean_absolute_error : 타깃과 예측의 절댓값 오차를 편균하여 반환한 값 => 예측이 어느정도 벗어났는지 확인

과대적합 : 훈련세트가 점수가 테스트세트 점수보다 높을때

과소적합 : 테스트세트 점수보다 훈련세트 점수가 낮을때 , 테스트세트와 훈련세트 모두 점수가 낮을때

KNregressor : 최근접 이웃 회귀 모델을 만드는 사이킷런 클래스

머신러닝 모델을 주기적으로 훈련하는 이유 : 시간과 환경이 바뀌면서 데이터도 바뀌기 때문에 주기적으로 새로운 데이터로 모델을 다시 훈련해야한다.

선형 회귀 : 데이터의 상관관계를 직선의 방정식으로 표현.
LinearRegression : 사이킷런의 선형회귀 클래스
intercept 매개변수를 false로 지정하면 절편 학습x
coef => 기울기
선형 회귀 모델이 찾은 방정식의 계수 : 모델 파라미터

다항회귀 : 다항식을 사용하여 특성과 타깃 사이의 관계를 나타낸 회귀.

다항회귀 모델을 훈련할 수 있는 클래스 => LinearRegression

다중회귀 : 여러 개의 특성을 사용한 선형 회귀

특성 2개면 => 평면 학습, 3개이상이면 3차원 공간이상을 그릴수 없음

특성공학 : 기존의 특성을 사용해 새로운 특성을 뽑아내는 작업

변환기 : 특성을 만들거나 전처리하는 클래스 => fit,transform

PolynomialFeatures

규제 하는 이유 : 특성이 너무 과도(샘플 개수 오버)하면 과대적합이 발생하므로

하이퍼파라미터 : 머신러닝 알고리즘이 학습하지 않는 파라미터
ex) 릿지와 라쏘의 규제강도 alpha 파라미터
alpha값이 커지면 규제가 세진다.
규제 종류 : 릿지, 라쏘

  • 릿지 : 계수를 제곱한 값을 기준으로 규제를 적용
  • 라쏘 : 계수의 절댓값을 기준으로 규제를 적용 , 0으로 만들수있음

특성을 표준화하는 클래스 : standardScaler

다중 분류 : 타깃 데이터에 2개 이상의 클래스가 포함된 문제

predict_proba : 클래스별 확률값을 반환

로지스틱 회귀 : 선형 방정식을 사용한 분류 알고리즘

시그모이드 함수 : 출력을 0과 1사이의 값으로 압축하며 이진 분류를 위해 사용.
소프트맥스 함수 : 다중 분류에서 여러 선형 방정식의 출력 결과를 정규화, 합이 1이되도록 함.
LogisticRegression : 로지스틱 회귀를 위한 클래스
decision_function : 모델이 학습한 선형방정식의 출력을 반환

확률적 경사 하강법 : 훈련 세트에서 랜덤을 하나의 샘플을 고르는 것.
에포크 : 훈련 세트를 한 번 모두 사용하는 과정
미니배치 경사 하강법 : 여러 개의 샘플을 사용해 경사 하강법을 수행하는 방식
배치 경사 하강법 : 모든 샘플을 사용해 경사 하강법을 수행하는 방식
다중 분류에서는 크로스엔트로피 손실 함수를 사용, 회귀 문제에는 평균 제곱 오차 손실 함수를 사용
SGDClassifier : 확률적 경사 하강법을 사용한 분류 모델

비지도 학습 : 타깃이 없을때 사용하는 머신 러닝 알고리즘
히스토그램 : 구간별로 값이 발생한 빈도를 그래프로 표시한 것

군집 : 비슷한 샘플끼리 하나의 그룹으로 모으는 대표적인 비지도 학습 작업

군집 알고리즘으로 샘플을 모은 샘플 그룹을 클러스터라 부름.

k-평균 알고리즘은 처음에 랜덤하게 클러스터 중심을 정하고 클러스터를 만듬.그다음 클러스터 중심으로 이동하고 다시 클러스터를 만드는 식으로 반복 최적의 클러스터를 구성하는 알고리즘

클러스터 중심 : k-평균 알고리즘이 만든 클러스터에 속한 샘플의 특성 평균값. 센트로이드라고 부름.

엘보우 방법 : 이너셔 => 클러스터 중심과 샘플 사이 거리의 제곱 합

profile
희망찬 개발자

0개의 댓글