Trouble Shooting 1 : 저장공간 부족

조훈·2025년 6월 14일

1. 문제상황 파악

  • AIHUB 자율주차용 데이터셋의 전체 용량은 2.6TB이고 그 중 병원 데이터셋만 500GB가 넘어간다.
  • 로컬 저장소의 용량 부족으로 인한 해결 방안 모색

2. 해결 방안

a ) 외부 저장소에 데이터셋을 업로드 후 연동하여 학습

  • 데이터셋 업로드 → 연동된 외부저장소에서 데이터 다운로드 → 학습의 단계를 거치기에 많은 시간 소요
  • 성능자체의 저하는 없을 것으로 예상

b ) Fine Tuning : 사전학습된 가중치를 시작점으로 하되 전체 또는 일부 네트워크를 새로 추가 학습된 데이터에 맞게 미세조정

  • 1차 학습 (train_image 600장 / validation_image 70장) 이후 추가 데이터 (train 500 / validation 50 )을 학습 시

    1 ) 전체 데이터를 재학습 : 1차 학습으로 나온 best.pt를 model로 사용해 전체 데이터 (600+500 / 70+50) 을 학습
    - 장점 : 기존 성능 유지 + 추가 데이터 학습
    - 단점 : 학습 속도 느림

    2 ) 추가 데이터만 학습 : 1차 학습의 백본을 freeze하고 추가데이터 (500/50)만 best.pt에 추가 학습
    - 장점 : 속도 빠름
    - 단점 : 성능 저하 가능성 있음

    • (1)의 방법은 결국 용량문제를 해결하지 못함 → (2)의 방법 채택

    • 성능 저하가 일어나는지 테스트 하기 위해
      1. 백본층을 freeze하고 추가 학습
      2. 백본층을 freeze하지 않은 채로 추가학습

      두번 다 실행 후 비교분석 + 추가로 epochs 수도 조절해 가며 최적화된 방식 채택

      결론적으로 성능 저하가 일어나지 않는 혹은 적은 쪽의 방식을 채택하여 전체 데이터를 파인튜닝 할 계획


3. 결과 분석

Hyperparameter 별 학습 결과 비교

  • 조건 1 : train_image 600장 / validation_image 70장으로 1차 학습한 초기 모델에 2차 데이터 Fine-Tuning
  • 조건 2 : 2차 데이터는 train 352장 / val 40장 으로 구성
  • 조건 3 : Hyperparameter 중 freeze, epochs를 조정하며 결과를 비교

1 ) Freeze = 10, Epochs = 100


2 ) Freeze = 0, Epochs = 100


3 ) Freeze = 10, Epochs = 30


4 ) 결과 비교 분석

실험명EpochsFreezemAP50↑mAP50-95↑안정성종합 평가
freeze_10_epoch_10010010높음높음높음최적 성능 모델
non_freeze_epoch_100100X (전부 학습)보통낮음불안정과적합 가능성 있음
freeze_10_epoch_303010보통낮음빠른 상승학습 부족 가능성
  • Freeze = 10 / Epochs = 100 기준 Freeze는 있는 편이, Epochs는 큰 편이 성능이 좋은 편

    → Freeze를 5, 20 등으로 조절해가며 성능 파악
    → Epochs를 키워가며 성능 파악

결과적으로 최적의 Hyperparameter를 찾고 나머지 데이터도 학습하여 모델 완성

0개의 댓글