이번 주간은 머신러닝 프로젝트를 수행하는 주간이다.

이번 프로젝트는 kaggle playground 에 참여하는 프로젝트이다

머신러닝 모델을 만들어 수집된 나이, 키, 몸무게, 성별 등의 데이터를 학습해 비만도를 예측하도록 하는것이 목적이다

원본 데이터는 약 2100개 정도의 인터넷 설문조사를 통해 수집된 데이터이며, 이번 대회에서는 원본 데이터를 학습시킨 딥러닝 모델을 사용해 train과 test를 합산해 약 30000개의 데이터를 생성하였다.

만들어진 데이터는 이런 느낌이다.

가족중에 과체중인 사람이 있는지, 간식을 자주 먹는지, 흡연 여부나 음주 여부에 대한 데이터나 이용하는 교통수단에 대한 내용도 있다.

각 타겟값 별 분포이다.

이정도면 거의 균등하다고 볼 수 있을 것 같다.
다만 비만도 3이 좀 많은 편이다.

이번 데이터는 대회용 데이터여서 그런지 결측치는 확인되지 않았다

그래서 우선적으로 lgbm에 optuna를 적용해 학습을 진행해보았다

파라미터 튜닝 부분

k-fold cross validation 부분

학습 로그

결과 확인

최대한 정확도를 높여서 의미있는 결과를 가져가고 싶다

0개의 댓글