멘토님은 여러 챌린지 참여를 통해 실력에 대한 객관적 지표를 얻을 수 있으셨다고 한다.
취업을 위해 미리 준비할 것:
코테
대회 관련 조언
데이터셋 보기 → 베이스라인 → visualization → 앙상블
먼저 변인통제를 통해 크게크게 변화를 주고 관찰한 후 마지막에 하이퍼파라미터 조절, 앙상블 등 하기.
생각보다 데이터셋이 굉장히 중요하다. voice recognition task에서 다 비등했는데 뒷부분에 잡음이 많음을 파악하고 뒷 부분을 잘라낸 팀이 baseline 코드만으로도 압도적인 1등을 했다.
+) domain understanding 중요
팀의 목적: 성적 vs 공부
→ 우리 팀은 공부에 더 초점을 두기로 했다. 세 개 정도의 대회가 있는데 그 중 하나 정도는 성적에 신경 써도 좋지만, 나머지는 공부에 초점을 두는 게 좋다고 조언을 들었다고 한다.
데이터셋 distribution 불균형 → Focal Loss 이용해보기
오랜만에 운동을 해서 뿌듯했다.
Data 전처리
챌린지를 위한 인사이트를 얻을 수 있어 메모하며 들었다.
도메인을 파악하는 것이 중요하다.
Data Generation
Data Generator와 Model의 성능이 비슷해야 한다. 아니라면 한쪽이 병목현상을 일으킨다.
어제 운동의 여파로 여기저기 아프다 ... 이정도 운동에 ㅋㅋㅋ 앞으로 좀 꾸준히 해야겠다.
깃허브 리드미 수정에 갑자기 꽂혀 2시간 정도 알아보며 수정했다.
결과물 👉 https://github.com/hyunseo-k
심플한 게 좋은 것 같다가도 이것저것 적고싶기도 하고.. 리드미를 어떻게 적어야 가장 좋을지 아직도 잘 모르겠다 😓
일단 지금은 뱃지를 많이 이용해 심플하게 작성했다.
참고:
https://bitly.ws/35Baw
https://bitly.ws/35Bbg
곧 링크드인도 재정비해야겠다. 몰캠 이후로 정리를 안했다.
서버 세팅 후 baseline 코드를 돌려보았다. Accuracy가 20%가 나온다!
먼저 최대한 데이터 관련 사항들을 적용해보고 F1 score가 좀 올라간 뒤 모델 작업을 시작해야겠다고 생각했다.
강의 들으면서 우리 프로젝트에 적용해야겠다고 메모한 것
앙상블은 무조건 써야한다고 한다.
VOD 다시 보면서 따라해봐야겠다.
그래서 내일 할 일은,
챌린지 관련 인사이트 나누기
깃허브 얘기
답지 않게 여유로운 금요일..
왜 Augmentation 추가할수록 성능이 안좋은가 ..? 방법이 잘못돼서겠지 ..
Stratified K-Fold CV도전하기로 했다.
이번주는 처음 대회 진행하다보니 좀 막막한 부분들이 있었다. 막혔을 때 나아가려는 힘을 길러야겠다고 생각했다.