인공지능 및 기계학습 개론 1 - 3주차 1. Optimal Classification

jy.Hyun·2024년 7월 31일

기계학습 개론1

목록 보기
6/8

edwith에 올라와있는 문인철 교수님의 인공지능 및 기계학습 개론1을 공부하여 정리한 내용입니다.

Classification or Regression(Supervised Learning)

Supervised Learning로 많이하는 작업들은 Hit or Miss, Ranking, Types, Value prediction이 있다.
그 중 Hit or Miss, Ranking, Types 경우 Classification 방법론에 속하고 Value prediction 경우 Regression에 속한다.
이번 주차에는 Classification에 대해서 배운다.

Optimal Classification

Classification은 X에 대한 어떤 값을 받아들여 Y가 무슨 값(ex) True for False) 나타내는 Task를 말한다.

윗 사진처럼 X1X_1일 때는 초록색 y를 X2X_2일 때는 빨간색 y를 출력 해주어야 한다.
즉, 어떤 input X에 대해서 Target Class가 될 확률을 계산해줘야 한다.
이러한 Task를 잘하기 위해서는 우리는 Bayes classifier를 정의할 것이다.

f=argminfP(f(X)Y)f^{*}=a r g m i n_{f} P ( f ( X ) \neq Y )

f(X)f(X)는 지난 시간에 배운 것처럼 정확하지 않은 y이니 y^\hat{y}라고 하면 이 식은 y^\hat{y}과 y가 같지 않을 확률 최소화하는 f를 찾아내어 그것을 ff^{*}라고 부르겠다고 하는 것이다.
즉, ff^{*}는 optimized function이다.

f(x)=argmaxY=yP(Y=yX=x)f^{*} ( x )=a r g m a x_{Y=y} P ( Y=y \mid X=x )

Y=yY = y일 확률을 최대화하는 문제로 생각해볼 수도 있다.

Bayes Risk


Decision Boundary(XmX_m) 기준으로 급격하게 변하여 확률의 차이를 크게 내줄 수 있을 수록 좋다. 예를 들어 이미지에 실선의 경우가 점선의 경우보다 좋은 Classifier가 된다.

사진과 같이 밑 부분의 넓이를 error의 영역이라고 생각할 수 있다. 이 영역을 Bayes Risk라고 부른다.
그리고 이러한 Bayes Risk를 줄이는 형태로 만들어진 것이 Optimal Classifier가 된다.

P(Y=yX=x)=P(X=xY=y)P(Y=y)P(X=x)P ( Y=y \mid X=x )={\frac{P ( X=x \mid Y=y ) P ( Y=y )} {P ( X=x )}}

이러한 함수는 Bayes Risk를 줄이는 방향으로 만들어 주어야 한다. 이러한 방법 중 하나를 Logisitc Function을 쓰는 것인데 다음 주차에 배워볼 것이다.

Learning the Optimal Classifier

f(x)=argmaxY=yP(Y=yX=x)f^{*} ( x )=a r g m a x_{Y=y} P ( Y=y \mid X=x )

이러한 함수에서 우리가 Bayes therom을 활용하여 Prior 정보를 활용할 수 있는 형태로 바꾸면

이러한 모양으로 나타낼 수 있다.
이 식을 활용하기 위해서는 우리가 Prior 정보를 알아낼 필요가 있다. 어떻게 하면 Prior 정보를 알아낼 수 있을까?
1주차에 배웠던 MLEMAP를 사용하면 된다.

또한 하나의 Class만 모아서 Class Conditional Density를 만들 수 있다.
여기서 문제가 생기는데 만약 X가 여러 개의 Variable를 가진 경우, 그 Variables끼리의 interation에 의한 Combination를 모두 고려해주기에는 너무 많다.
이러한 문제점을 해결하기 위해 Variable간에 interaction을 무시하겠다는 것이 Naive Bayes Classifier이다. 그리고 다음 강의에서 이 내용을 배워볼 것이다.

0개의 댓글