Trouble Shooting 2 : Class Imbalance (2)

조훈·2025년 6월 17일

1. 오버 샘플링

< 중요도에 비해 데이터량이 적은 Class의 데이터 증강 >

Over Sampling 하고자 하는 Class가 포함된 이미지를 증강 (Flip, Rotate 등) + 그에 매칭하는 라벨 생성

  • albumentations 패키지를 이용해 데이터량이 적고 의미 있는 Class를 오버샘플링

  • 이미지 하나에 ParkingArea 뿐만 아니라 이미 충분한 데이터가 있는 Wall이나 Pillar같은 것이 섞여있어서 결과적으로 데이터 불균형 해소가 되지 않음

  • ParkingArea만 크롭해서 증강하는 방법도 있긴한데 너무 번거롭고 의미있는 결과가 나올지도 애매


2. 언더샘플링

< 중요도는 낮지만 데이터량이 너무 많은 Class의 데이터 병합 or 감축 >

Under Sampling 하고자 하는 Class가 포함된 이미지를 삭제

  • (극소수 + 오류 높음 + 중요도 낮음) 클래스는 삭제
    (예: Tool Bar)

  • (소수 + 오류 높은편 + 유사의미) 클래스는 서로 병합
    (예: disabled icon + women icon + compact car icon = special parking icon)

  • 그 외 중요도에 비해 성능이 아쉬운 클래스
    (예: driving area, non-driving area, parking line, parking area, non-parking area)

    -> 옵션 1 : 데이터 부족 가능성 -> 소수 클래스 기준 데이터 증강
    -> 옵션 2 : 다른 모델 사용, 하이퍼파라미터 조정


3. Class 선별 → 의미 있는 데이터 중 학습하기에 충분한 양이 있는 Class

['Disabled Icon',' Women Icon', 'Compact Car Icon', 'No Parking Sign', 'Traffic Cone', 'Fire Extinguisher', 'Undefined Object', 'Two-wheeled Vehicle', 'Vehicle', 'Wheelchair', 'Stroller', 'Shopping Cart', 'Human']

0개의 댓글