네이버 AI 부스트캠프 4기 P-stage : Classification 7

nask·2022년 11월 8일

CV 기초대회 9강 - Ensemble

  • 여러 모델을 사용하므로 성능보다 처리 속도가 중요한 현업에서는 자주 쓰이지 않음(성능 vs 효율의 trade-off)

  • 성능이 중요한 task나 competition에서는 중요

  • 싱글 모델보다 더 나은 성능을 위해 서로 다른 여러 학습 모델을 사용하는 것

boosting

  • 모델이 High Bias인 경우 사용

  • sequential한 weak learner들을 여러 개 결합하여 예측 혹은 분류 성능을 높이는 알고리즘
    (https://hyunlee103.tistory.com/25)

bagging

  • Boostrap AGGregatING

  • 붓스트랩 샘플링을 이용해 주어진 하나의 데이터로 학습된 예측 모형보다 더 좋은 모형을 만들 수 있는 앙상블 기법
    (https://zephyrus1111.tistory.com/245)

random forest

Model Averaging(Voting)

  • Hard voting은 단순하지만 가장 높은 값만 제외하고 나머지 데이터를 버리게 됨

Stratifies K-Fold Cross Validation


(https://velog.io/@hhhong/Cross-validation)

  • Split시에 Class 분포까지 고려한 k-fold cross validation

TTA(Test Time Augmentation)

  • 테스트 이미지를 Augmentation 후 여러 장의 사진을 동시에 이용해서(앙상블) 결과를 예측

  • 일반화 성능 개선

Hyper parameter tuning

  • 노력, 시간 대비 성능 개선은 적음

Optuna

파라미터 범위를 주고 그 범위 안에서 trial만큼 시행

0개의 댓글